Podsumowanie wyników audytu uprzedzeń systemu wykrywania plagiatów HackerRank dla lokalnego prawa 144 w Nowym Jorku

Last updated: December 12, 2024

List od Głównego Audytora

Od: Shea Brown
           Główny Audytor
           BABL AI Inc.
           sheabrown@babl.ai

Do: Interviewstreet Incorporation (HackerRank)
      PO Box 1660
      211 Hope Street
      Mountain View, Kalifornia 94041

Re: Opinia Audytowa na temat Systemu Wykrywania Plagiatów HackerRank

22.07.2024

Przeprowadziliśmy niezależny audyt twierdzeń dotyczących testowania uprzedzeń i powiązanych dowodów dokumentacyjnych HackerRank (zwanej dalej „Firmą”) na dzień 22.07.2024, przedstawionych BABL AI w związku z Systemem Wykrywania Plagiatów Firmy (zwanym dalej „systemem”) zgodnie z kryteriami i metodologią audytu określoną w tym raporcie. Celem tego audytu jest:

  1. Określenie, czy metody, kontrole i procedury testowania uprzedzeń przeprowadzone przez Firmę spełniają kryteria audytu (zobacz Wyniki)

  2. Uzyskanie rozsądnego zapewnienia czy oświadczenia składane przez Firmę, w tym podsumowanie wyników testowania uprzedzeń przedstawione w tym raporcie, są wolne od istotnych błędów, czy to z powodu oszustwa, czy błędu.

Należy zauważyć, że kryteria przedstawione w tym raporcie zostały skonstruowane specjalnie w celu spełnienia wymagań „audytu uprzedzeń” określonych w lokalnym prawie NYC nr 144 z 2021 roku. System był audytowany tak, jakby był automatycznym narzędziem do podejmowania decyzji o zatrudnieniu (AEDT) zgodnie z lokalnym prawem NYC nr 144 z 2021 roku, ale nie dokonujemy żadnego rozstrzygnięcia, czy system jest, w rzeczywistości, AEDT na podstawie tego prawa.

Obowiązki Firmy

Obowiązkiem przedstawicieli Firmy jest zapewnienie, że testowanie uprzedzeń i powiązane procedury są zgodne z kryteriami opisanymi w tym raporcie. Przedstawiciele Firmy są odpowiedzialni za zapewnienie, że złożone dokumenty są rzetelnie przedstawione i wolne od fałszerstw, zapewnienie wszelkich zasobów i personelu potrzebnych do skutecznego i efektywnego przeprowadzenia audytu oraz zapewnienie dostępu do materiałów dowodowych na żądanie audytorów.

Obowiązki BABL AI

Obowiązkiem głównego audytora jest wyrażenie opinii na temat twierdzeń firmy związanych z testowaniem uprzedzeń systemu. W świetle obecnego braku powszechnie akceptowanych standardów audytu algorytmów i systemów autonomicznych, nasze badanie zostało przeprowadzone zgodnie z normami i odniesieniami normatywnymi opisanymi w tym raporcie.

Te standardy wymagają, abyśmy planowali i przeprowadzali procedury audytowe w celu uzyskania rozsądnej pewności, czy powyższe twierdzenia 1) spełniają kryteria audytu i 2) są wolne od istotnych błędów, czy to z powodu błędu, czy oszustwa. W ramach naszego zaangażowania przeprowadziliśmy między innymi następujące procedury:

  • Inspekcja złożonych dokumentów i dokumentacji zewnętrznej

  • Przeprowadzanie wywiadów z pracownikami firmy w celu zrozumienia procesu

    określania różnicowego wpływu i wyników oceny ryzyka

  • Obserwacja wybranych procedur analitycznych stosowanych w testowaniu uprzedzeń firmy

  • Inspekcja wybranych próbek danych z testowania uprzedzeń

  • Zapytanie personelu odpowiedzialnego za zarządzanie i nadzór nad testowaniem uprzedzeń oraz

    oceną ryzyka

Uważamy, że przeprowadzone procedury stanowią rozsądną podstawę do naszej opinii.

Niezależność

Nasza rola jako niezależnego audytora jest zgodna z definicjami Niezależności ForHumanity i Sarbanes-Oxley. Opłaty związane z tym kontraktem dotyczą świadczenia usługi oceny zgodności. Płatność opłat nie jest powiązana z wydaną decyzją. Nasza decyzja opiera się wyłącznie na kryteriach przedstawionych poniżej.

Opinia

Naszym zdaniem, na podstawie przeprowadzonych procedur i zebranych dowodów w celu uzyskania zapewnienia, testy uprzedzeń i wyniki przedstawione przez firmę, na dzień 22.07.2024, są przygotowane, we wszystkich istotnych aspektach, zgodnie z kryteriami opisanymi poniżej.

Z poważaniem,

Shea Brown, Ph.D.
Główny audytor, BABL AI Inc.

Podkreślenie istotnej kwestii

Podkreślamy kilka kwestii związanych z zestawem danych pozyskanym przez HackerRank do testowania wpływu dyskryminacji: 1) etykiety demograficzne zgłoszone przez siebie nie były dostępne dla systemu, więc etykiety płci i rasy/pochodzenia etnicznego zostały wywnioskowane, 2) użycie wywnioskowanych etykiet demograficznych oznacza, że dane prawdopodobnie będą uważane za „Dane testowe” zgodnie z § 5-3001, oraz 3) ilość i jakość zestawu danych do testów (zobacz Wyniki) były ograniczone ze względu na brak danych historycznych. W związku z tym wnioski wyciągnięte z kwantyfikacji wpływu dyskryminacji są obciążone ograniczeniami wynikającymi z zestawu danych i powinny być interpretowane w świetle tego ograniczenia. Nasza opinia nie ulega zmianie w odniesieniu do tej kwestii.

1 Decyzja ta należy do uznania Departamentu Ochrony Konsumentów i Pracowników NYC. 4

Opis systemu

BABL AI został zaangażowany do audytu testowania systemu wykrywania plagiatów HackerRank.

Od HackerRank: „System wykrywania plagiatów wykorzystuje sygnały generowane przez użytkownika w zaawansowanym algorytmie uczenia maszynowego do wykrywania podejrzanego zachowania podczas oceny. Poprzez zrozumienie iteracji kodu dokonanych przez kandydata, model może przewidzieć, czy miał on dużą pomoc zewnętrzną.

Ważne jest, aby zauważyć,... [że HackerRank] podjął następujące działania, aby zapobiec potencjalnej stronniczości wynikającej z PII lub nawyków kodowania czy trudności pytań:

  • Brak informacji o rasie, płci lub PII w trakcie treningu lub w czasie inferencji.

  • Nie używa się danych o szybkości pisania w modelu, ponieważ uważamy, że szybkość pisania jest bardziej jak

    osobisty nawyk, a nie wskaźnik plagiatu.

  • Funkcje są normalizowane względem tego samego pytania, aby zminimalizować stronniczość wynikającą z różnych trudności pytań.

  • Decyzje z udziałem człowieka w pętli: system wykrywania plagiatów ML nigdy nie automatycznie odrzuci kandydatów z prognozy modelu. Zamiast tego, dostarczamy szczegółowy raport podejrzanych prób... Nasi klienci mogą przejrzeć szczegółowy raport i samodzielnie sprawdzić odtwarzanie kodu, aby zdecydować, czy przesunąć kandydata dalej.”

Podsumowanie audytu

Tło

Lokale prawo Nowego Jorku nr 144 z 2021 roku wymaga corocznych „audytów uprzedzeń” dla zautomatyzowanych narzędzi decyzyjnych zatrudnienia (AEDT), które w znacznym stopniu wspomagają lub zastępują decyzje w zakresie zatrudnienia lub awansu. Konkretnie, prawo stanowi, że (1) audyt uprzedzeń musi „ocenić [AEDT] rozbieżny wpływ” na określone osoby, (2) audyt musi być przeprowadzony przez „niezależnego audytora ... nie wcześniej niż rok przed użyciem”, oraz (3) „podsumowanie wyników ostatniego audytu uprzedzeń ... [musi być] udostępnione publicznie na stronie internetowej pracodawcy lub agencji zatrudnienia.” Audyt opisany w tym dokumencie został przeprowadzony wyłącznie w celu spełnienia wymogu prawa dotyczącego audytu uprzedzeń i nie obejmuje innych wymagań, takich jak powiadomienia kandydatów. Niniejszy raport nie podejmuje żadnej decyzji, czy system objęty tym audytem jest, w rzeczywistości, narzędziem automatycznego decydowania o zatrudnieniu, zgodnie z definicją w lokalnym prawie NYC nr 144, czy nie.

Obowiązki audytora

Obowiązkiem audytorów BABL AI jest:

  1. Uzyskanie rozsądnego zapewnienia czy oświadczenia składane przez audytowanego są wolne od istotnych błędów, czy to z powodu oszustwa, czy błędu,

  2. Ustalenie, czy oświadczenia składane przez audytowanego dostarczają wystarczających dowodów na to, że kryteria audytu (patrz Wyniki) zostały spełnione, oraz

  3. Wydanie raportu audytora z opinią.

W ramach audytu zgodnie z dobrymi praktykami audytorskimi, BABL AI korzysta z profesjonalnego osądu i utrzymuje profesjonalny sceptycyzm przez cały audyt. Konkretnie, audytorzy BABL AI identyfikują i oceniają ryzyko istotnych błędów w dokumentach dostarczonych przez audytowanego, wykonują procedury audytowe odpowiadające tym ryzykom oraz uzyskują dowody audytowe, które są wystarczające i odpowiednie, aby stanowić podstawę naszej opinii, zgodnie z Standardem Audytu 1105 Publicznego Nadzoru Kontrolnego (PCAOB) dotyczącego Dowodów Audytowych,2 gdzie to ma zastosowanie. Ponadto, ten raport audytowy przestrzega wytycznych Międzynarodowego Standardu na temat Zaangażowań w zakresie Zapewnienia (ISAE) 3000 dotyczących Raportu o Zapewnieniu, tam gdzie to ma zastosowanie.3

BABL AI jest również odpowiedzialny za utrzymanie niezależności i obiektywizmu audytorów, aby zapewnić integralność opinii i certyfikacji. BABL AI jako organizacja, oraz wszyscy pracownicy i audytorzy kontraktowi, przestrzegają ścisłej niezależności, zgodnie z ustawą Sarbanes–Oxley z 20024 roku oraz Kodeksem Etyki ForHumanity.5 Ponadto, główni audytorzy BABL AI są Certyfikowanymi Audytorami ForHumanity w ramach audytu uprzedzeń AEDT NYC.6 Więcej szczegółów na temat naszej metodologii i procesu można znaleźć w Załączniku – Metodologia Audytu.

2 https://pcaobus.org/oversight/standards/auditing-standards/details/AS1105
3 https://www.iaasb.org/publications/international-standard-assurance-engagements-isae-3000 -revised-assurance-engagements-other-audits-or-0

Zakres i cel

Sekcja audytu
Cel audytu
Kwestionowanie wpływu dyskryminacyjnego
Zapewnienie, że audytor przeprowadził wystarczające testy swojego modelu, aby „ocenić wpływ narzędzia na osoby dowolnej kategorii składnika 1”, tj. rasę i płeć – jako minimalny wymóg audytu uprzedzeń zgodnie z lokalnym prawem 144 z 2021 roku.
Zarządzanie
Zapewnienie, że istnieje skuteczne zarządzanie wewnętrzne, które posiada, zarządza i monitoruje ryzyko związane z uprzedzeniami i sprawiedliwością.
Ocena ryzyka
Zapewnienie, że ryzyko modelu, które potencjalnie przyczynia się do uprzedzeń, zostało dokładnie zidentyfikowane, potwierdzone i ocenione.


Poza zakresem

  1. Audyt nie zapewnił wystarczających testów wpływu narzędzia na jakąkolwiek inną chronioną klasę oprócz rasy/pochodzenia etnicznego i płci

  2. Audyt nie potwierdził, że system jest „wolny od uprzedzeń”

  3. Audyt nie jest przeznaczony do celów zgodności z żadnym innym prawem niż NYC Local Law No. 144

Wnioski

Nasze opinie na temat audytu uprzedzeń systemu wykrywania plagiatów Systemu Wykrywania Plagiatów przez HackerRank są następujące:

Sekcja audytu
Opinia
Kwestionowanie wpływu rozbieżnego
ZALICZONE
Zarządzanie
ZALICZONE
Ocena ryzyka
ZALICZONE
Ogólnie
ZALICZONE

Wyniki

Uwaga: Informacje ujawnione w ramach każdego kryterium nie są dowodami dokumentalnymi.

Kryteria audytu
Opinia

Q.A. Elementy: System, który ma być testowany pod kątem rozbieżnego wpływu, musi zostać zdefiniowany.

  • Q.A.1. Gdy system składa się z więcej niż jednego zautomatyzowanego komponentu, dowody muszą wykazać odpowiednie zdefiniowanie systemu.
ZALICZONE

Komponenty lub ich kombinacje, które zostały przetestowane: N/D

Q.B. Zbiór danych testowych: Zbiór danych, na którym określono rozbieżny wpływ, musi zostać zdefiniowany i scharakteryzowany.

  • Q.B.1. Dowody muszą wykazać uzasadnienie, dlaczego wybrany zbiór danych był odpowiedni do testowania rozbieżnego wpływu.
  • Q.B.2. Gdy użyto danych testowych zgodnie z § 5-300, dowody muszą wykazać
    • a. uzasadnienie braku użycia danych historycznych,
    • b. że dane historyczne nie są wystarczające do przeprowadzenia statystycznie istotnego testu rozbieżnego wpływu,
      oraz
    • c. metodologię, według której dane testowe zostały zebrane
  • Q.B.3. Gdy test rozbieżnego wpływu nie został ukończony przez BABL, dowody muszą wykazać
    • a. że najnowsze testy zostały przeprowadzone mniej niż rok przed datą rozpoczęcia tego audytu, lub po dużej aktualizacji systemu, chyba że aktualizacja miała miejsce ponad rok przed datą rozpoczęcia tego audytu, w takim przypadku dowody muszą wykazać
    • b. uzasadnienie, dlaczego taki test był nadal odpowiedni.
  • Q.B.4. Dowody muszą wykazać, że dane użyte w testowaniu były sprzed mniej niż roku od daty rozpoczęcia testu rozbieżnego wpływu.
ZALICZONE

Przeprowadzone testy przez: HackerRank
Data ostatnich testów: 05/10/2023
Okres danych: Lis 2022 – Lut 2023

Uzasadnienie użycia danych testowych: Od HackerRank: „Ze względu na umowę o ochronie danych z naszymi klientami, biblioteki open source są wybierane do szacowania rasy i płci na podstawie imienia, ponieważ nie jest wymagana wymiana danych z innym dostawcą.”

Q.C. Różnorodność wpływu PCV: PCV, które można zmierzyć za pomocą zestawu danych testowych, będą zdefiniowane.

  • Q.C.1. Dowody będą identyfikować PCV, które można było zmierzyć pod względem różnorodności wpływu.
  • Q.C.2. Dowody będą pokazywać, że PCV, które można zmierzyć, obejmują co najmniej: rasę i płeć.
  • Q.C.3. Dowody będą ujawniać metodę, którą zastosowano do zbierania danych PCV.
  • Q.C.4. Dowody będą identyfikować i ujawniać PCV, które nie zostały zmierzone pod względem różnorodności wpływu.
  • Q.C.5. Gdy dane PCV zostały wywnioskowane, dowody będą
    • a. identyfikować metodę, którą wywnioskowano dane PCV, i

    • b. pokazywać uzasadnienie, dlaczego wybrana metoda wywnioskowania PCV była odpowiednia.

ZALICZONE

PCV, dla których kwantyfikowano wpływ rozbieżny:

1. Płeć
2. Rasa/pochodzenie etniczne

PCV, dla których nie kwantyfikowano wpływu rozbieżnego:

  1. Wiek

  2. Status imigracyjny lub obywatelski

  3. Status niepełnosprawności

  4. Status małżeński i partnerstwa

  5. Pochodzenie narodowe

  6. Udogodnienia związane z ciążą i laktacją

  7. Religia/wyznanie

  8. Orientacja seksualna

  9. Stan weterana lub aktywnego członka służby wojskowej

Q.D. Pozytywny vs. negatywny wynik: Gdy stosowana była metoda wskaźnika selekcji, pozytywne i negatywne wyniki modelu powinny być jasno zdefiniowane.

Q.D.1. Dowody powinny wykazać uzasadnienie, dlaczego wybrana definicja pozytywnego wyniku była odpowiednia.

Q.D.2. Gdy stosowane jest progowanie, dowody powinny wykazać uzasadnienie, dlaczego poziom/poziomy progowania do określenia pozytywnych vs. negatywnych wyników były/wynosiły odpowiednie.

Q.D.3.  Dowody powinny zidentyfikować i ujawnić

  • a. wszystkie ustawienia konfigurowalne przez użytkownika,
  • b. czy każde ustawienie wpływa na pozytywne wyniki, i dla wszystkich ustawień, które wpływają na wyniki,
  • c. ich zakresy konfigurowalności przez użytkownika,
  • d. ich wartości domyślne, i
  • e. uzasadnienie, dlaczego takie wartości domyślne były odpowiednie.

Q.D.4.  Dowody powinny ujawnić ustawienia konfigurowalne przez użytkownika i kombinacje ustawień, na których testowano wpływ rozbieżny.

ZALICZONE

Pozytywny wynik: brak oznaczenia przez system

Ustawienia konfigurowalne przez użytkownika, które mogą wpływać na pozytywny wynik: N/D

Ustawienia, na których testowano wpływ rozbieżny: N/D

Wskaźnik wyboru Q.E. lub wskaźnik ocen: Zostanie zdefiniowana miara odpowiadająca wskaźnikowi wyboru lub wskaźnikowi ocen.

Q.E.1. Gdy użyto metody wskaźnika wyboru, dowody powinny wykazać, że wskaźnik wyboru grupy został zdefiniowany jako stosunek pozytywnych wyników do wszystkich wyników dla tej grupy.

Q.E.2. Gdy użyto metody wskaźnika ocen, dowody powinny wykazać, że wskaźnik ocen grupy został zdefiniowany jako wskaźnik, z jakim ta grupa otrzymuje wynik od AEDT powyżej mediany wyniku próbki

ZALICZONE

Sposób kwantyfikacji różnego wpływu: wskaźnik wyboru zdefiniowany jako odsetek kandydatów w grupie demograficznej, którzy nie są oznaczani przez system

Q.F. Grupy faworyzowane, niefaworyzowane: Grupy faworyzowane i niefaworyzowane będą definiowane dla wszystkich PCV.

Q.F.1. Dowody będą wykazywać, że grupy faworyzowane i niefaworyzowane zostały zdefiniowane zgodnie z wskaźnikami wyboru lub punktacji uporządkowanymi według PCV.

Q.F.2. Dowody będą wykazywać, że grupy dotyczące rasy i pochodzenia etnicznego spełniają § 60-3.4 B w wytycznych EEO.

Q.F.3. Gdy grupy dotyczące rasy i pochodzenia etnicznego nie spełniają wytycznych EEO, dowody będą wykazywać uzasadnienie, dlaczego nie użyto grupowania EEO, oraz odpowiedniość wszelkich zastępczych grupowań.

Q.F.4. Dowody będą wykazywać, że grupy dotyczące płci zawierają co najmniej „Mężczyzna” i „Kobieta”.

Q.F.5. Dowody będą wykazywać grupy intersectional, zawierające wszystkie permutacje kombinacji płci i rasy/pochodzenia etnicznego.

Q.F.6. Gdy rasa/pochodzenie etniczne i płeć nie są znane dla próbki kandydatów ocenianych przez AEDT, dowody będą ujawniać jej rozmiar próbki.

ZDAJĘ

Q.G. Współczynnik wpływu: Współczynniki wpływu będą ujawniane dla wszystkich grup niekorzystnych, dla wszystkich PCV.

Q.G.1. Gdy współczynnik wpływu dla grupy niekorzystnej jest poniżej 0,8, dowody powinny wykazać uzasadnienie, dlaczego grupa niekorzystna jest uprzywilejowana.

Q.G.2. Dowody powinny pokazać wyniki analizy niepewności (np. błąd standardowy dla średniej) lub propagacji błędów współczynników wpływu w formie błędów lub błędów na osiach.

Q.G.3. Gdy dane PCV zostały wywnioskowane, dowody powinny wykazać, że systematyczne błędy wynikające z wywnioskowania PCV zostały odpowiednio uwzględnione w obliczeniach współczynnika wpływu.

Q.G.4. Gdy grupa płciowa, rasowa/etniczna lub intersekcjonalna została wykluczona z obliczeń współczynnika wpływu ze względu na jej rozmiar poniżej 2% całkowitej próbki każdej analizy, dowody powinny wykazać

  1. uzasadnienie wykluczenia takiej grupy

  2. rozmiar próbki takiej grupy, oraz

  3. wskaźnik wyboru lub wskaźnik scoringu takiej grupy

ZALICZONE

Bezintersekcjonalne, płeć, sortowane według współczynnika wpływu

 

N kandydatów

Wskaźnik wyboru

Współczynnik wpływu

Mężczyzna

3,732

0.798

1.000

Kobieta

2,112

0.784

0.982

Bezintersekcjonalne, rasowo-etniczne, sortowane według współczynnika wpływu

 

N kandydatów

Wskaźnik wyboru

Współczynnik wpływu

Hispanic lub Latynoski

1,127

0.860

1.000

Azjatycki

1,184

0.835

0.971

Biały

1,797

0.774

0.900

Czarnoskóry lub Afroamerykanin

1,070

0.762

0.866

Rdzenni Amerykanie lub Native American Native

3

0.667

N/D

Intersekcje

 
 
 
N kandydatów
Współczynnik selekcji
Współczynnik wpływu8
Hispanic or Latino
Mężczyzna
790
0.857
0.995
Kobieta
287
0.861
1.000







Non-Hispanic or Latino



Mężczyzna
Biały
711
0.839
0.974
Azjatycki
924
0.774
0.899
Czarny lub Afroamerykanin

807

0.756

0.878
Rdzenna Amerykańska lub Native Alaskan

2

0.500

N/D



Kobieta
Azjatycka
697
0.772
0.897
Biała
389
0.833
0.967
Czarna lub Afroamerykanka

807

0.756

0.878
Rdzenna Amerykanka lub Native Alaskan

1

1.000

N/D

 

Uwaga: Dane o tych kandydatach nie zostały uwzględnione w powyższych obliczeniach:

  1. 123 kandydatów z nieznaną kategorią płci
  2. 1053 kandydatów z nieznaną kategorią rasy/etniczności, oraz
  3. 1176 kandydatów z co najmniej nieznaną płcią lub nieznaną rasą/etnicznością

7 N/D odnosi się do grupy demograficznej stanowiącej mniej niż 2% ogólnej liczby N aplikacji w tabeli

Q.H. Istotność statystyczna: Gdy użyto metody wskaźnika selekcji, obliczenia istotności statystycznej muszą spełniać wytyczne UGESP.

Q.H.1. Dowody muszą wykazać, że istotność statystyczna została obliczona za pomocą dwustronnego testu Z dla prób niezależnych z próbkami 30 lub więcej, oraz za pomocą testu Fishera dla prób mniejszych niż 30.

ZALICZONE

Zarządzanie

Kryteria audytu
Opinia

G.A. Odpowiedzialna strona za ryzyko wpływu rozbieżnego: Audytowany powinien mieć stronę odpowiedzialną za ryzyko związane z rozbieżnym wpływem.

  • G.A.1. Dowody powinny wykazywać, że odpowiedzialna strona jest komisją, ale mogą również wykazywać, że odpowiedzialna strona jest pojedynczą osobą.
  • G.A.2. Dowody wyraźnie powinny wykazywać, że ryzyko związane z rozbieżnym wpływem jest własnością i zarządzaniem przez odpowiedzialną stronę.
ZALICZONE

Odpowiedzialna strona: Komisja ds. Automatycznych Narzędzi Decyzyjnych
Informacje kontaktowe: rohan.raman@hackerrank.com
Rola w organizacji audytowanej: Grupa/komisja ds. zarządzania

G.B. Zdefiniowane obowiązki odpowiedzialnej strony: Obowiązki strony odpowiedzialnej za ryzyko rozbieżnego wpływu muszą być jasno określone.

  • G.B.1. Dowody powinny wykazywać, że takie obowiązki dotyczą własności, zarządzania i monitorowania ryzyka rozbieżnego wpływu.
  • G.B.2. Dowody powinny wykazywać, że odpowiedzialna strona ma wpływ na zmiany produktu zgodnie z skutecznym wyzwaniem w Federalnym Przewodniku po Zarządzaniu Ryzykiem Modelu.
ZALICZONE

G.C. Dokumentacja dotycząca wykonywanych obowiązków: Audytowany musi dostarczyć dowody, że zdefiniowane obowiązki strony odpowiedzialnej za ryzyko rozbieżnego wpływu są realizowane.

  • G.C.1. Dowody powinny wykazywać, że zdefiniowane obowiązki zostały wykonane przed datą rozpoczęcia tego audytu.
ZALICZONE

Ocena Ryzyka

Kryteria audytu
Opinia

Wykonanie R.A.: Audytor powinien mieć ukończoną ocenę ryzyka modelu.

  • R.A.1. Dowody powinny wykazać, że ocena ryzyka lub analiza równoważna została ukończona nie wcześniej niż rok przed datą wydania tego audytu.
ZALICZONE

Dowody ukończenia oceny ryzyka: Dokumenty oceny ryzyka (arkusz kalkulacyjny oceny ryzyka i notatki narracyjne), oraz ustne zeznania uczestników oceny ryzyka.

R.B. Identyfikacja ryzyk: Ocena ryzyka powinna wykazać identyfikację istotnych ryzyk związanych z uprzedzeniami.

  • R.B.1. Dowody powinny wykazać identyfikację ryzyk związanych z różnymi uprzedzeniami na wszystkich etapach cyklu życia AI, zgodnie z Standardem NIST do identyfikacji i zarządzania uprzedzeniami w sztucznej inteligencji.
  • R.B.2. Dowody powinny wykazać świadomość stron potencjalnie dotkniętych decyzjami podejmowanymi na wszystkich etapach cyklu życia AI.
ZALICZONE

R.C. Ocena ryzyk: Ocena ryzyka powinna wykazać odpowiednią ocenę istotnych ryzyk.

  • R.C.1. Dowody powinny wykazać, że zidentyfikowane ryzyka są oceniane z perspektywy wielu zainteresowanych stron zewnętrznych i wewnętrznych, z uzasadnieniem zakresu i mechanizmu, w jaki ryzyka te wpływają na te strony.
  • R.C.2. Dowody powinny wykazać, że zidentyfikowane ryzyka są oceniane w wystarczająco rygorystyczny sposób, przy użyciu schematu oceny ilościowej i/lub jakościowej, oraz na wielu wymiarach, takich jak, ale nie ograniczając się do, prawdopodobieństwa szkody i nasilenia szkody.
  • R.C.3. Dowody powinny wykazać uzasadnienie dla podanej oceny ryzyka.
ZALICZONE

Dodatek

Metodologia audytu

Proces audytu

Ramy audytu AI BABL to Proces audytu, zdefiniowany jako „bezstronny proces weryfikacji i oceny przeprowadzany przez niezależnego audytora w celu ustalenia, czy istnieją wystarczające dowody, aby uzasadnić ocenę, że ryzyko AI zostało zapobiegnięte, wykryte, złagodzone lub w inny sposób zarządzane.” Proces audytu jest wzorowany na praktyce audytu finansowego jako współpraca zewnętrzna audyt, i odróżnia się od innych powszechnie stosowanych form oceny algorytmów, takich jak oceny pierwszej lub drugiej strony, oraz zapewnienie jakości.8 Ramami audytu obejmują trzy fazy:

  1. Zakres – Audytor przeprowadza wstępne badanie algorytmu audytowanego, aby uzyskać pełne zrozumienie i skontekstualizować dowody dokumentacyjne

  2. Ocena i weryfikacja – Audytowany składa dokumentację zawierającą dowody potwierdzające spełnienie kryteriów audytu, które audytorzy oceniają i weryfikują.

  3. Certyfikacja – Jeśli audytowany spełnia kryteria audytu, audytor sporządza raport audytora i certyfikuje algorytm audytowanego.

Ocena i weryfikacja

Procedura dla wszystkich audytorów AI BABL przeprowadzających audyt procesu opiera się na wytycznych określonych w Standardzie audytu dowodów audytowych Publicznej Rady Nadzoru nad Rachunkowością (PCAOB), tam gdzie ma to zastosowanie. W szczególności, audytorzy:

  1. Pobierają roszczenia i oświadczenia audytowe z dokumentacji złożonej przez audytowanego, które albo wspierają, albo zaprzeczają kryteriom i podkryteriom,

  2. Ocenić roszczenia i oświadczenia w odniesieniu do spełnienia kryteriów i podkryteriów, na podstawie wystarczalności i adekwatności dowodów, oraz

  3. Zweryfikować, czy roszczenia i oświadczenia złożone przez audytowanego są wolne od istotnych błędów, czy to z powodu oszustwa, czy błędu.9

8 Carrier, R., & Brown, S. (2021). Taxonomia: Audyt AI, Zapewnienie jakości i Ocena. ForHumanity.

https://forhumanity.center/blog/taxonomy-ai-audit-assurance-assessment/

9 „Rozsądne zapewnienie” to wysoki poziom pewności, ale nie gwarancja, że audyt przeprowadzony zgodnie z dobrą praktyką audytową zawsze wykryje istotne błędy, gdy one istnieją. Błędy mogą wynikać z oszustwa lub błędu i są uważane za istotne, jeśli, indywidualnie lub łącznie, można się racjonalnie spodziewać, że wpłyną na decyzje interesariuszy podejmowane na podstawie tych oświadczeń.

Dodatkowo, ocena i weryfikacja roszczeń i oświadczeń mogą obejmować żądanie dodatkowych dokumentów potwierdzających, a także przeprowadzanie wywiadów z osobami odpowiedzialnymi za zarządzanie algorytmem, innymi odpowiednimi pracownikami organizacji audytowanej lub innymi osobami trzecimi wymienionymi w złożonej dokumentacji.

Na końcu audytorzy wydają opinię audytową opartą na:

  1. wystarczalności i adekwatności dowodów audytowych, oraz

  2. ryzyku istotnego błędu w dowodach audytowych.

Terminologia i definicje

Termin
Skrot
Definicja

automatyczne narzędzie do podejmowania decyzji o zatrudnieniu

AEDT

„dowolny proces obliczeniowy, oparty na uczeniu maszynowym, modelowaniu statystycznym, analizie danych lub sztucznej inteligencji, który wydaje uproszczone wyniki, w tym wynik, klasyfikację lub rekomendację, które są używane do znacznego wspomagania lub zastępowania decyzji dyskrecjonarnych przy podejmowaniu decyzji o zatrudnieniu, które mają wpływ na osoby fizyczne.” – patrz § 20-870 Kodeksu i § 5-300 zasady przyjętej dla pełnej definicji

grupa niepożądana

 

dowolna grupa płciowa lub rasowo-etniczna nieposiadająca najwyższego wskaźnika wyboru lub średniego wyniku

niekorzystny wpływ lub wpływ niekorzystny

 

„wskaźnik wyboru dla dowolnej rasy, płci lub grupy etnicznej, który jest mniejszy niż cztery piąte (⁄) (lub 80%) wskaźnika dla grupy z najwyższym wskaźnikiem, będzie ogólnie uważany przez federalne agencje egzekwujące prawo za dowód niekorzystnego wpływu” – patrz § 60-3.4.D UGESP (1978) dla pełnej definicji

propagacja błędów

 

obliczenie lub wyliczenie niepewności zmiennej, które zależy od niepewności innej zmiennej

grupa uprzywilejowana

 

grupa płciowa lub rasowo-etniczna mająca wyższy wskaźnik wyboru lub średni wynik w porównaniu do innych grup

wskaźnik wpływu

 

„either (1) the selection rate for a category divided by the selection rate of the most selected category or (2) the scoring rate for a category divided by the scoring rate for the highest scoring category. ” – see § 5-300 of the adopted rule for full definition

wskaźnik punktacji

 

„wskaźnik, w którym osoby w kategorii otrzymują wynik powyżej mediany próbki, gdzie wynik został obliczony przez AEDT”

uzasadnienie

 

przekonujący powód, który wyjaśnia kwestię i ma moc normatywną, w odróżnieniu od wyłącznie wyjaśniającej

 

podstawa wskaźnika wyboru, korzystny wynik dla kandydata z użycia modelu, takiego jak zostanie wybranym do dalszego etapu rekrutacji lub przypisanie klasyfikacji przez model

zmienne kategorii chronionej

PCV

zdefiniowane na podstawie jurysdykcji, równoważne z klasą chronioną, obejmujące między innymi: rasę/etniczność, wiek, płeć, religię, zdolność lub niepełnosprawność, orientację seksualną, kolor, pochodzenie narodowe, klasę społeczno-ekonomiczną

ocena ryzyka

 

ocena ryzyka, że użycie algorytmu negatywnie wpłynie na prawa i interesy interesariuszy, z odpowiednią identyfikacją sytuacji w kontekście i/lub cechami algorytmu, które powodują lub przyczyniają się do tych negatywnych skutków9

współczynnik wyboru

 

„wskaźnik, w którym osoby w kategorii są albo wybrane do dalszego etapu rekrutacji, albo przypisane do klasyfikacji przez AEDT” – patrz § 5-300 zasady przyjętej dla pełnej definicji

zestaw testowy

 

zestaw danych używany do testowania lub kwantyfikacji niekorzystnego wpływu

analiza niepewności

 

obliczenie lub wyliczenie niepewności zmiennej, które wyprowadza błędy lub błędy na paskach błędów

10 Hasan, A., Brown, S., Davidovic, J., Lange, B., & Regan, M. (2022). Stronniczość algorytmiczna i ryzyko Oceny: Lekcje z praktyki. Społeczeństwo cyfrowe, 1(1). https://doi.org/10.1007/s44206-022-00017-z