Samenvatting van de Bias Audit-resultaten van het HackerRank's Plagiaatdetectiesysteem voor de lokale wet 144 van New York City
Last updated: December 12, 2024
Brief van de Hoofdauditor
Van: Shea Brown
Hoofdauditor
BABL AI Inc.
sheabrown@babl.ai
Aan: Interviewstreet Incorporation (HackerRank)
Postbus 1660
211 Hope Street
Mountain View, Californië 94041
Onderwerp: Auditrapport over HackerRank’s Plagiaatdetectiesysteem
22-07-2024
Wij hebben de beweringen over bias-testen en het bijbehorende documentatiemateriaal van HackerRank (de "Vennootschap") onafhankelijk geaudit op 22-07-2024, gepresenteerd aan BABL AI in verband met het Plagiaatdetectiesysteem van de Vennootschap (het “systeem”) in overeenstemming met de criteria en auditmethodologie zoals uiteengezet in dit rapport. De doelen van deze audit zijn:
Bepalen of de methodologieën, controles en procedures voor bias-testen die door de Vennootschap worden uitgevoerd, voldoen aan de auditcriteria (zie Bevindingen)
Verkrijgen van redelijke zekerheid of de door de Vennootschap gemaakte verklaringen, inclusief de samenvatting van bias-testresultaten die in dit rapport worden gepresenteerd, vrij zijn van materiële onjuistheden, hetzij door fraude of fout.
Houd er rekening mee dat de criteria die in dit rapport worden gepresenteerd, specifiek zijn opgesteld om te voldoen aan de vereisten van een “bias-audit” zoals uiteengezet in NYC Lokale Wet nr. 144 van 2021. Het systeem is geaudit alsof het een geautomatiseerd besluitvormingsinstrument voor werkgelegenheid (AEDT) is onder NYC Lokale Wet nr. 144 van 2021, maar wij doen geen uitspraak of het systeem in feite een AEDT is onder deze wet.
Verantwoordelijkheden van het bedrijf
Het is de verantwoordelijkheid van de vertegenwoordigers van het bedrijf om ervoor te zorgen dat bias-testen en gerelateerde procedures voldoen aan de criteria die in dit rapport worden beschreven. De vertegenwoordigers van het bedrijf zijn verantwoordelijk voor het zorgen dat de ingediende documenten eerlijk worden gepresenteerd en vrij zijn van misrepresentaties, het verstrekken van alle benodigde middelen en personeel om een effectief en efficiënt auditproces te waarborgen, en het verstrekken van toegang tot bewijsmateriaal zoals gevraagd door de auditors.BABL AI Verantwoordelijkheden
Het is de verantwoordelijkheid van de hoofdauditor om een mening te geven over de beweringen van het bedrijf met betrekking tot de bias-test van het systeem. In het licht van het huidige ontbreken van algemeen aanvaarde normen voor het auditen van algoritmen en autonome systemen, is ons onderzoek uitgevoerd in overeenstemming met de normen en normatieve referenties die in dit rapport worden beschreven.
Die normen vereisen dat wij auditprocedures plannen en uitvoeren om redelijke zekerheid te verkrijgen of de hierboven genoemde beweringen 1) voldoen aan de auditcriteria en 2) vrij zijn van materiële onjuistheden, hetzij door fout of fraude. Binnen de scope van onze opdracht hebben wij onder andere de volgende procedures uitgevoerd:
Inspectie van ingediende documenten en externe documentatie
Interviewen van bedrijfsmedewerkers om inzicht te krijgen in het proces voor
het bepalen van de disparate impact en risicobeoordelingsresultaten
Observatie van geselecteerde analytische procedures die worden gebruikt in de bias-test van het bedrijf
Inspectie van de geselecteerde monsters van de bias-testgegevens
Vragen aan personeel dat verantwoordelijk is voor governance en toezicht op de bias-test en
risicobeoordeling
Wij geloven dat de uitgevoerde procedures een redelijke basis bieden voor onze mening.
Onafhankelijkheid
Onze rol als onafhankelijke auditor voldoet aan de definities van ForHumanity en Sarbanes-Oxley van Onafhankelijkheid. Vergoedingen die verband houden met dit contract zijn voor het leveren van de dienst om naleving te beoordelen. De betaling van vergoedingen staat los van de genomen beslissing. Onze beslissing is uitsluitend gebaseerd op de hieronder gepresenteerde criteria.
Meningsuiting
Volgens onze mening, op basis van de uitgevoerde procedures en het ontvangen bewijs om zekerheid te verkrijgen, is de bias-test en de resultaten die door het bedrijf worden gepresenteerd, per 22/07/2024, opgesteld, in alle materiële opzichten, in overeenstemming met de hieronder beschreven criteria.
Met vriendelijke groet,
Shea Brown, Ph.D.
Hoofdauditor, BABL AI Inc.
Emphasis of Matter
We benadrukken verschillende zaken met betrekking tot de dataset die door HackerRank is verkregen om te testen op ongelijksoortige impact: 1) zelf-gerapporteerde demografische labels waren niet beschikbaar voor het systeem, dus geslacht en ras/etniciteit labels werden afgeleid, 2) het gebruik van afgeleide demografische labels betekent dat de gegevens waarschijnlijk als “Testgegevens” worden beschouwd onder § 5-3001, en 3) de hoeveelheid en kwaliteit van de testdataset (zie Findings) waren beperkt vanwege het ontbreken van historische gegevens. Bijgevolg zijn de conclusies die worden getrokken uit de kwantificatie van de ongelijksoortige impact onderhevig aan de beperkingen die voortvloeien uit de dataset en moeten ze in het licht hiervan worden geïnterpreteerd. Onze mening wordt niet gewijzigd met betrekking tot deze zaak.
1 Dit is naar het oordeel van het NYC Department of Consumer and Worker Protection. 4
Systeem Beschrijving
BABL AI werd ingeschakeld om de test van HackerRank op het Plagiaatdetectiesysteem te auditen.
Van HackerRank: “Het plagiaatdetectiesysteem gebruikt door gebruikers gegenereerde signalen in een geavanceerd machine-learning algoritme om verdachte gedragingen tijdens een beoordeling te markeren. Door code-iteraties gemaakt door de kandidaat te begrijpen, kan het model voorspellen of ze grote externe hulp hadden.
Het is belangrijk op te merken,... [dat HackerRank] de volgende inspanningen heeft geleverd om potentiële bias te voorkomen die verband houdt met PII of programmeergewoonten of vraagmoeilijkheid:
Geen ras-, geslachts- of PII-informatie in de training of op het moment van inferentie.
Geen typsnelheidgegevens worden in het model gebruikt aangezien we typsnelheid meer beschouwen als een
persoonlijke gewoonte in plaats van plagiaatindicatoren.
Kenmerken worden genormaliseerd met betrekking tot dezelfde vraag om de bias van verschillende moeilijkheidsgraden van vragen te minimaliseren.
Mens-in-de-lus besluitvorming: ML-codeerplagiaat [systeem] zal nooit automatisch kandidaten uit de voorspelling verwijderen. In plaats daarvan bieden we een uitgebreid rapport van de verdachte pogingen... Onze klanten kunnen het gedetailleerde rapport bekijken en de code-herhaling zelf controleren om te beslissen of een kandidaat moet worden doorgegeven.”
Samenvatting van de audit
Achtergrond
De lokale wet van New York City No. 144 van 2021 vereist jaarlijkse “bias audits” voor geautomatiseerde arbeidsbeslissingshulpmiddelen (AEDT's) die worden gebruikt om beslissingen bij het aannemen of promotie aanzienlijk te ondersteunen of te vervangen. Specifiek stelt de wet dat (1) de bias audit “de [AEDT’s’] ongelijke impact” op bepaalde personen moet beoordelen, (2) de audit moet worden uitgevoerd door een “onafhankelijke auditor ... niet meer dan een jaar vóór het gebruik”, en (3) een “samenvatting van de resultaten van de meest recente bias audit ... [moet] openbaar beschikbaar worden gesteld op de website van de werkgever of arbeidsbureau.” De audit beschreven in dit document is uitgevoerd om te voldoen aan de wettelijke vereiste voor een bias audit en bevat geen andere vereisten zoals kandidaatmeldingen. Dit rapport maakt geen enkele bepaling of het systeem dat onder deze audit valt, inderdaad een geautomatiseerd arbeidsbeslissingshulpmiddel is zoals gedefinieerd onder NYC Local Law 144, of niet.
Verantwoordelijkheden van de auditor
Het is de verantwoordelijkheid van BABL AI-auditors om:
Redelijk zeker te stellen of de verklaringen die door de geauditeerde worden gedaan vrij zijn van materiële misverstanden, hetzij door fraude of fout,
Bepalen of de verklaringen door de geauditeerde voldoende bewijs bieden dat aan de auditcriteria (zie Vondsten) is voldaan, en
Een auditorrapport uitbrengen dat een mening bevat.
Als onderdeel van een audit volgens goede auditpraktijken oefent BABL AI professioneel oordeel uit en behoudt het professionele scepsis gedurende de hele audit. Specifiek identificeren en beoordelen BABL AI-auditors de risico’s van materiële misverstanden in door de geauditeerde verstrekte documenten, voeren auditprocedures uit die op die risico’s reageren, en verkrijgen auditbewijs dat voldoende en geschikt is om een basis te bieden voor onze mening, volgens de Auditing Standard 1105 van de Public Company Accounting Oversight Board (PCAOB) over Audit Evidence,2 waar van toepassing. Daarnaast volgt dit auditrapport de richtlijnen van de International Standard on Assurance Engagements (ISAE) 3000 over Assurance Report, waar van toepassing.3
BABL AI is ook verantwoordelijk voor het handhaven van de onafhankelijkheid en objectiviteit van auditors om de integriteit van de gegeven mening en certificering te waarborgen. BABL AI als organisatie, en alle medewerkers en contractauditors, houden zich strikt aan de onafhankelijkheid zoals vastgelegd in de Sarbanes–Oxley Act van 20024 en de Code of Ethics van ForHumanity.5 Daarnaast zijn BABL AI Lead Auditors gecertificeerde auditors van ForHumanity onder NYC AEDT Bias Audit.6 Voor meer details over onze methodologie en proces, zie Bijlage – Audit Methodologie.
2 https://pcaobus.org/oversight/standards/auditing-standards/details/AS1105
3 https://www.iaasb.org/publications/international-standard-assurance-engagements-isae-3000 -revised-assurance-engagements-other-audits-or-0
Reikwijdte & Doelstelling
Uit Scope
De audit heeft niet voldoende testen van de dispariteit van het hulpmiddel op enige andere beschermde klasse dan ras/etniciteit en geslacht verzekerd
De audit heeft niet gecertificeerd dat het systeem “bias-vrij” is
De audit is niet bedoeld voor nalevingsdoeleinden voor enige wetgeving anders dan de NYC Lokale Wet Nr. 144
Conclusies
Onze meningen over de bias-audit van Plagiaatdetectiesysteem door HackerRank zijn als volgt:
Bevindingen
Opmerking: De onder elk criterium verstrekte informatie is geen documentair bewijs.
Kwantisatie van Disparate Impact
Q.A. Componenten: Het systeem dat getest moet worden op disparate impact wordt gedefinieerd.
- Q.A.1. Waar het systeem uit meer dan één geautomatiseerde component bestaat, moet bewijs een juiste definitie van het systeem tonen.
Componenten of combinaties van componenten die getest zijn: N.v.t.
Q.B. Testdataset: Het dataset waarop de disparate impact werd gekwantificeerd, wordt gedefinieerd en gekarakteriseerd.
- Q.B.1. Bewijs moet een rechtvaardiging tonen waarom het geselecteerde dataset geschikt was voor het testen op disparate impact.
- Q.B.2. Waar testgegevens zoals gedefinieerd in § 5-300 werden gebruikt, moet bewijs tonen
- a. rechtvaardiging voor het niet gebruiken van historische gegevens,
- b. dat historische gegevens niet voldoende zijn om een statistisch significant disparate impact-test uit te voeren,
en - c. de methodologie waarmee testgegevens zijn verzameld
- Q.B.3. Waar disparate impact-test niet werd voltooid door BABL, moet bewijs tonen
- a. dat de meest recente test minder dan een jaar voor de startdatum van deze audit is uitgevoerd, of na een grote update van het systeem, tenzij de update meer dan een jaar voor de startdatum van deze audit was, in welk geval, moet bewijs tonen
- b. rechtvaardiging waarom dergelijke testing nog steeds geschikt was.
- Q.B.4. Bewijs moet tonen dat de gegevens die in de test werden gebruikt, binnen een jaar na de startdatum van de disparate impact-test liggen.
Test uitgevoerd door: HackerRank
Datum van de laatste test: 05/10/2023
Periode van gegevens: Nov 2022 – Feb 2023
Rechtvaardiging voor het gebruik van testgegevens: Van HackerRank: “Gezien het gegevensbeschermingscontract met onze klanten, worden open source bibliotheken geselecteerd voor naam tot ras en naam tot geslacht schatting omdat geen gegevensoverdracht naar een andere leverancier vereist is.”
Q.C. Disparate-impact kwantificeerbare PCV's: PCV's die kunnen worden gekwantificeerd met behulp van de testdataset, worden gedefinieerd.
- Q.C.1. Bewijs moet PCV's identificeren die kwantificeerbaar waren met betrekking tot disparate impact.
- Q.C.2. Bewijs moet aantonen dat de te kwantificeren PCV's ten minste omvatten: ras, en geslacht.
- Q.C.3. Bewijs moet de methode onthullen waarmee de PCV-gegevens zijn verzameld.
- Q.C.4. Bewijs moet PCV's identificeren en onthullen die niet kwantificeerbaar waren met betrekking tot disparate impact.
- Q.C.5. Waar PCV-gegevens zijn afgeleid, moet bewijs
a. de methode identificeren waarmee de PCV-gegevens zijn afgeleid, en
b. rechtvaardiging tonen waarom de geselecteerde methode voor PCV-afleiding geschikt was.
PCV's waarvoor differentiële impact werd gekwantificeerd:
1. Geslacht
2. Ras/etniciteit
PCV's waarvoor differentiële impact niet werd gekwantificeerd:
Leeftijd
Immigratie- of burgerschapsstatus
Gehandicaptestatus
Burgerlijke staat en partnerschapstatus
Herkomst
Zwangerschaps- en lactatievoorzieningen
Religie/gelofte
Heteroseksuele oriëntatie
Veteranen- of actieve militaire dienststatus
Q.D. Positief vs. negatief resultaat: Waar de selectiepercentagemethode werd gebruikt, moeten positieve en negatieve uitkomsten van het model duidelijk worden gedefinieerd.
Q.D.1. Bewijs moet een rechtvaardiging tonen waarom de gekozen definitie van positief resultaat passend was.
Q.D.2. Waar drempelwaardes worden gebruikt, moet bewijs een rechtvaardiging tonen waarom het niveau/niveaus van de drempel om positieve versus negatieve uitkomsten te bepalen passend waren.
Q.D.3. Bewijs moet identificeren en openbaar maken
- a. alle door de gebruiker configureerbare instellingen,
- b. of elke instelling invloed heeft op positieve uitkomsten, en voor alle instellingen die uitkomsten beïnvloeden,
- c. hun mate van door de gebruiker configureerbaarheid,
- d. hun standaardwaarden, en
- e. rechtvaardiging waarom dergelijke standaardwaarden passend waren.
Q.D.4. Bewijs moet de door de gebruiker configureerbare instellingen en combinaties van instellingen openbaar maken waarop differentiële impact werd getest.
Positief resultaat: niet worden gemarkeerd door het systeem
Door de gebruiker configureerbare instellingen die het positieve resultaat kunnen beïnvloeden: N.v.t.
Instellingen waarop de ongelijke impact werd getest: N.v.t.
Q.E. Selectiepercentage of scoringspercentage: Er wordt een maatstaf gedefinieerd die overeenkomt met het selectiepercentage of scoringspercentage.
Q.E.1. Waar de selectiepercentage-methode werd gebruikt, moet bewijs aantonen dat het selectiepercentage van een groep werd gedefinieerd als de verhouding van positief resultaat tot alle resultaten voor die groep.
Q.E.2. Waar de scoringspercentage-methode werd gebruikt, moet bewijs aantonen dat het scoringspercentage van een groep werd gedefinieerd als de snelheid waarmee die groep een score ontvangt van de AEDT boven de mediaanscore van de steekproef
Methode voor het kwantificeren van uiteenlopende impact: selectiepercentage gedefinieerd als het percentage waarbij kandidaten in een demografische groep niet door het systeem worden gemarkeerd
Q.F. Bevoorrechte, benadeelde groepen: Bevoorrechte en benadeelde groepen worden gedefinieerd, voor alle PCV's.
Q.F.1. Bewijs moet aantonen dat bevoorrechte en benadeelde groepen zijn gedefinieerd op basis van selectiepercentages of scoringspercentages gerangschikt volgens PCV.
Q.F.2. Bewijs moet aantonen dat de groepen met betrekking tot ras en etniciteit voldoen aan § 60-3.4 B in de EEO-richtlijnen.
Q.F.3. Waar de groepen met betrekking tot ras en etniciteit niet voldoen aan de EEO-richtlijnen, moet bewijs een rechtvaardiging tonen waarom EEO-groepering niet is gebruikt, en de geschiktheid van eventuele vervangende groeperingen.
Q.F.4. Bewijs moet aantonen dat de groepen met betrekking tot geslacht ten minste “Man” en “Vrouw” bevatten.
Q.F.5. Bewijs moet intersectionele groepen tonen die alle permutaties van geslacht en ras/etniciteit combinaties bevatten.
Q.F.6. Waar ras/etniciteiten en geslachten niet bekend zijn voor een steekproef van kandidaten beoordeeld door de AEDT, moet bewijs de steekproefgrootte bekendmaken.
Q.G. Impact ratio: Impact ratios worden bekendgemaakt voor alle benadeelde groepen, voor alle PCV's.
Q.G.1. Waar een impact ratio voor een benadeelde groep onder de 0,8 ligt, moet bewijs een rechtvaardiging tonen waarom de benadeelde groep benadeeld wordt.
Q.G.2. Bewijs moet resultaten tonen van onzekerheidsanalyse (bijvoorbeeld standaardfout voor het gemiddelde) of foutpropagatie van impact ratios in de vorm van fouten of foutbalken.
Q.G.3. Waar gegevens van PCV zijn afgeleid, moet bewijs tonen dat systematische fouten door PCV-afleiding correct zijn doorgevoerd in de impact ratio-berekeningen.
Q.G.4. Waar een geslacht, ras/etniciteit, of intersectionele groep werd uitgesloten van de impact ratio-berekening vanwege de omvang die onder de 2% van de totale steekproefgrootte van elke analyse ligt, moet bewijs tonen
rechtvaardiging voor de uitsluiting van een dergelijke groep
de steekproefgrootte van een dergelijke groep, en
de selectie- of scoringsratio van een dergelijke groep
Niet-intersectioneel, Geslacht, gesorteerd op Impact ratio
N sollicitanten
Selectiepercentage
Impact ratio
Man
3.732
0.798
1.000
Vrouw
2.112
0.784
0.982
Niet-intersectioneel, Ras/etniciteit, gesorteerd op Impact ratio
N sollicitanten
Selectiepercentage
Impact ratio
Hispanic of Latino
1.127
0.860
1.000
Aziatisch
1.184
0.835
0.971
Wit
1.797
0.774
0.900
Zwart of Afro-Amerikaans
1.070
0.762
0.866
3
0.667
N.v.t.
Intersectionals
Niet-Hispanic of Latino
Man
807
0.756
0.878
2
0.500
N.v.t.
Vrouw
807
0.756
0.878
1
1.000
N.v.t.
Opmerking: Gegevens over deze sollicitanten zijn niet opgenomen in de bovenstaande berekeningen:
- 123 sollicitanten met een onbekende geslachtscategorie
- 1053 sollicitanten met een onbekende ras/etniciteitcategorie, en
- 1176 sollicitanten met ten minste een onbekend geslacht of een onbekende ras/etniciteit
7 N.v.t. verwijst naar de demografische groep die minder dan 2% van het totale N-aantal sollicitaties in de tabel vertegenwoordigt
Q.H. Statistische significantie: Waar de selectiepercentage-methode werd gebruikt, moet de statistische significantieberekening voldoen aan UGESP richtlijnen.
Q.H.1. Bewijs moet aantonen dat statistische significantie werd berekend met behulp van de Twee Onafhankelijke-Sample Binomiale Z-Test voor steekproefgroottes van 30 of meer, en met de Fisher’s Exact Test voor steekproefgroottes van minder dan 30.
Governance
G.A. Verantwoordelijke partij voor risico's van verschillende impact: De geauditeerde moet een partij hebben die verantwoordelijk is voor risico's gerelateerd aan verschillende impact.
- G.A.1. Bewijs moet aantonen dat de verantwoordelijke partij een commissie is, maar kan ook aantonen dat de verantwoordelijke partij een enkel individu is.
- G.A.2. Bewijs moet duidelijk aantonen dat risico's gerelateerd aan verschillende impact eigendom zijn en worden beheerd door de verantwoordelijke partij.
Verantwoordelijke partij: Commissie voor Geautomatiseerde Besluitvormingstools
Contactinformatie: rohan.raman@hackerrank.com
Rol in de organisatie van de geauditeerde: Governancegroep/-commissie
G.B. Gedefinieerde taken van de verantwoordelijke partij: De taken van de partij die verantwoordelijk is voor risico's van verschillende impact moeten duidelijk worden gedefinieerd.
- G.B.1. Bewijs moet aantonen dat dergelijke taken betrekking hebben op het eigendom, beheer en monitoring van risico's van verschillende impact.
- G.B.2. Bewijs moet aantonen dat de verantwoordelijke partij invloed heeft op productwijzigingen volgens effectieve uitdaging in Federal Guidance on Model Risk Management.
G.C. Documentatie met betrekking tot uitgevoerde taken: De geauditeerde moet bewijs leveren dat de gedefinieerde taken van de partij die verantwoordelijk is voor risico's van verschillende impact worden uitgevoerd.
- G.C.1. Bewijs moet aantonen dat de gedefinieerde taken vóór de startdatum van deze audit zijn uitgevoerd.
Risicobeoordeling
R.A. Voltooiing: De geauditeerde moet een risicobeoordeling van het model hebben voltooid.
- R.A.1. Bewijs moet aantonen dat een risicobeoordeling of een gelijkwaardige analyse is voltooid minder dan een jaar voor de uitgiftedatum van deze audit.
Bewijs van voltooiing van risicobeoordeling: Risicobeoordelingsdocumenten (risicobeoordelingsspreadsheet en narratieve notities), en mondelinge getuigenissen van deelnemers aan de risicobeoordeling.
R.B. Identificatie van risico's: Risicobeoordeling moet de identificatie van relevante risico's met betrekking tot bias tonen.
- R.B.1. Bewijs moet aantonen dat risico's met betrekking tot verschillende biases zijn geïdentificeerd in alle fasen van de AI-levenscyclus zoals vermeld in NIST-standaard voor het identificeren en beheren van bias in kunstmatige intelligentie.
- R.B.2. Bewijs moet bewustzijn tonen van de partijen die mogelijk worden beïnvloed door de beslissingen die in alle fasen van de AI-levenscyclus worden genomen.
R.C. Evaluatie van risico's: Risicobeoordeling moet een passende evaluatie van relevante risico's aantonen.
- R.C.1. Bewijs moet aantonen dat de geïdentificeerde risico's worden beoordeeld vanuit het perspectief van meerdere betrokken externe en interne belanghebbenden, met rechtvaardigingen voor de omvang en het mechanisme waarmee dergelijke risico's deze belanghebbenden beïnvloeden.
- R.C.2. Bewijs moet aantonen dat de geïdentificeerde risico's op een voldoende rigoureuze manier worden beoordeeld, met behulp van een kwantitatief en/of kwalitatief evaluatieschema, en over meerdere dimensies, zoals maar niet beperkt tot de waarschijnlijkheid van schade en de ernst van schade.
- R.C.3. Bewijs moet rechtvaardiging tonen voor de gegeven evaluatie van risico's.
Bijlage
Auditmethodologie
Het Procesaudit
Het BABL AI-auditkader is het Procesaudit, gedefinieerd als “een onpartijdig verificatie- en evaluatieproces uitgevoerd door een onafhankelijke auditor om te bepalen of er voldoende bewijs bestaat om de beoordeling te rechtvaardigen dat AI-risico's zijn voorkomen, gedetecteerd, verminderd of anderszins beheerd.” Een procesaudit is gemodelleerd naar de financiële auditpraktijk als een coöperatieve derde partij audit, en onderscheidt zich van andere veelgebruikte vormen van beoordeling van algoritmen, zoals eerste- of tweede partij beoordelingen, en zekerheid.8 Het auditkader bevat drie fasen:
Scope – De auditor voert een voorlopige enquête uit naar het algoritme van de geauditeerde om een volledig begrip te krijgen en de documentatie te contextualiseren
Evaluatie & Verificatie – De geauditeerde dient documentatie in met bewijs dat voldoet aan de auditcriteria, die door de auditors worden geëvalueerd en geverifieerd.
Certificering – Als wordt vastgesteld dat de geauditeerde aan de auditcriteria voldoet, stelt de auditor het rapport op en certificeert het algoritme van de geauditeerde.
Evaluatie & Verificatie
De procedure voor alle BABL AI-auditors bij het uitvoeren van een procesaudit volgt de richtlijnen zoals uiteengezet in de Auditing Standard 1105 van de Public Company Accounting Oversight Board (PCAOB) over Audit Evidence, waar van toepassing. Specifiek, de auditors:
Verkrijg auditclaims en verklaringen van de ingediende documentatie van de geauditeerde die ofwel de criteria en sub-criteria ondersteunen of tegenspreken,
Beoordeel de claims en verklaringen met betrekking tot het voldoen aan de criteria en sub-criteria, op basis van de volledigheid en geschiktheid van het bewijs, en
Verifieer dat de claims en verklaringen gemaakt door de geauditeerde vrij zijn van materiële onjuistheden, hetzij door fraude of fout.9
8 Carrier, R., & Brown, S. (2021). Taxonomie: AI Audit, Assurance & Assessment. ForHumanity.
https://forhumanity.center/blog/taxonomy-ai-audit-assurance-assessment/
9 “Redelijke zekerheid” is een hoog niveau van zekerheid, maar geen garantie dat een audit uitgevoerd volgens goede auditpraktijken altijd een materiële onjuistheid detecteert wanneer deze bestaat. Onjuistheden kunnen ontstaan door fraude of fout en worden als materieel beschouwd als ze, afzonderlijk of in samenhang, redelijkerwijs de beslissingen van belanghebbenden die op deze verklaringen zijn gebaseerd, kunnen beïnvloeden.
Bovendien kan evaluatie en verificatie van claims en verklaringen het vragen om aanvullende ondersteunende documentatie, en/of het interviewen van degenen die verantwoordelijk zijn voor het beheer van het algoritme, andere relevante medewerkers van de organisatie die wordt gecontroleerd, of andere derden die in de ingediende documentatie worden genoemd.
Aan het einde komen de auditors tot een auditadvies op basis van:
De toereikendheid en geschiktheid van het auditbewijs, en
Het risico op materiële onjuistheid van het auditbewijs.
Terminologieën & Definities
geautomatiseerd besluitvormingshulpmiddel voor werkgelegenheid
AEDT
“elke computationele proces, afgeleid van machine learning, statistische modellering, data-analyse of kunstmatige intelligentie, dat vereenvoudigde output geeft, inclusief een score, classificatie of aanbeveling, die wordt gebruikt om aanzienlijk te helpen of te vervangen bij discretionaire besluitvorming voor het nemen van arbeidsbesluiten die natuurlijke personen beïnvloeden.” – zie § 20-870 van de Code en § 5-300 van de geïntegreerde regel voor volledige definitie
onbevredigde groep
elke geslachts- of ras/etniciteitsgroep die niet de hoogste selectiepercentage of gemiddelde score heeft
disproportionele impact of negatieve impact
“een selectiepercentage voor een ras-, geslachts- of etniciteitsgroep dat minder is dan vier vijfde (⁄) (of 80%) van het percentage voor de groep met het hoogste percentage, wordt over het algemeen door de federale handhavingsinstanties beschouwd als bewijs van negatieve impact” – zie § 60-3.4.D van UGESP (1978) voor volledige definitie
foutpropagatie
berekening of berekening van de onzekerheid van een variabele die afhankelijk is van de onzekerheid van een andere variabele
bevoorrechte groep
de geslachts- of ras/etniciteitsgroep met de hogere selectiepercentage of gemiddelde score in vergelijking met de andere groepen
impactverhouding
“ofwel (1) het selectiepercentage voor een categorie gedeeld door het selectiepercentage van de meest geselecteerde categorie of (2) het scoringspercentage voor een categorie gedeeld door het scoringspercentage voor de hoogste scorende categorie. ” – zie § 5-300 van de geïntegreerde regel voor volledige definitie
scoringspercentage
“het percentage waarbij individuen in een categorie een score ontvangen boven de mediaanscore van de steekproef, waarbij de score is berekend door een AEDT”
rechtvaardiging
een overtuigende reden die het probleem verduidelijkt en normatieve kracht heeft, in tegenstelling tot louter verklarende kracht
positief resultaat
de basis voor selectiepercentage, het gunstige resultaat voor een kandidaat door het gebruik van het model, zoals worden geselecteerd om door te gaan in het wervingsproces of een classificatie toegewezen door een model
beschermde categorievariabelen
per jurisdictie gedefinieerd, gelijkwaardig aan beschermde klasse, inclusief maar niet beperkt tot: ras/etniciteit, leeftijd, geslacht, religie, vermogen of handicap, seksuele geaardheid, kleur, land van herkomst, sociaaleconomische klasse
risicobeoordeling
een beoordeling van het risico dat het gebruik van het algoritme de rechten en belangen van belanghebbenden negatief beïnvloedt, met een bijbehorende identificatie van situaties in de context en/of kenmerken van het algoritme die deze negatieve invloeden veroorzaken of eraan bijdragen9
selectiepercentage
“het percentage waarbij individuen in een categorie worden geselecteerd om door te gaan in het wervingsproces of een classificatie krijgen door een AEDT” – zie § 5-300 van de geïntegreerde regel voor volledige definitie
testdataset
de dataset die wordt gebruikt om disproportionele impact te testen of te kwantificeren
onzekerheidsanalyse
berekening of berekening om de onzekerheid van een variabele te kwantificeren, met fouten of foutbalken
10 Hasan, A., Brown, S., Davidovic, J., Lange, B., & Regan, M. (2022). Algorithmische Bias en Risico Beoordelingen: Lessen uit de praktijk. Digital Society, 1(1). https://doi.org/10.1007/s44206-022-00017-z