סיכום תוצאות ביקורת ההטיה של מערכת זיהוי ההעתקות של HackerRank לחוק המקומי 144 של ניו יורק
Last updated: December 12, 2024
מכתב מהמבקר הראשי
מ: שיאה בראון
מבקר ראשי
BABL AI Inc.
sheabrown@babl.ai
אל: Interviewstreet Incorporation (HackerRank)
ת.ד. 1660
211 Hope Street
Mountain View, קליפורניה 94041
נושא: דעת ביקורת על מערכת זיהוי ההעתקות של HackerRank
22/07/2024
ביצענו ביקורת עצמאית על ההצהרות בנוגע לבדיקת הטיה והראיות התיעודיות הקשורות של HackerRank (ה"חברה") בתאריך 22/07/2024, שהוגשו ל-BABL AI ביחס למערכת זיהוי ההעתקות של החברה (ה"מערכת") בהתאם לקריטריונים ומתודולוגיית הביקורת שנקבעו בדוח זה. מטרות ביקורת זו הן:
קביעת האם שיטות בדיקת ההטיה, הבקרות, והנהלים שבוצעו על ידי החברה עומדים בקריטריוני הביקורת (ראה
השגת ביטחון סביר אם ההצהרות שנעשו על ידי החברה, כולל סיכום תוצאות בדיקת ההטיה שהוצג בדוח זה, חופשיות מטעויות מהותיות, בין אם עקב הונאה או טעות.
יש לשים לב כי הקריטריונים שהוצגו בדוח זה נבנו במיוחד כדי לטפל בדרישות של "ביקורת הטיה" המוגדרת בחוק המקומי של ניו יורק מס' 144 לשנת 2021. המערכת נבדקה כאילו היא כלי קבלת החלטות תעסוקתיות אוטומטי (AEDT) לפי חוק זה, אך איננו קובעים אם המערכת היא, למעשה, כלי כזה על פי חוק זה.
אחריות החברה
אחריות נציגי החברה להבטיח כי בדיקת ההטיה והנהלים הקשורים עומדים בקריטריונים שהוגדרו בדוח זה. נציגי החברה אחראים להבטיח שהמסמכים שהוגשו מוצגים באופן הוגן וללא הצגות שווא, לספק את כל המשאבים והאנשים הדרושים להבטחת תהליך ביקורת יעיל ואפקטיבי, ולספק גישה לחומר ראייתי כפי שיידרש על ידי הביקורתיים.אחריות BABL AI
זו אחריותו של המבקר הראשי להביע דעה על ההצהרות של החברה הקשורות לבדיקת הטיה של המערכת. לאור ההעדר הנוכחי של תקנים מקובלים לביקורת על אלגוריתמים ומערכות אוטונומיות, הבדיקה שלנו בוצעה בהתאם לתקנים ולהפניות נורמטיביות המפורטות בדוח זה.
תקנים אלה דורשים שנתכנן ונבצע הליכי ביקורת כדי לקבל ביטחון סביר אם ההצהרות שהוזכרו לעיל 1) עומדות בקריטריוני הביקורת ו-2) חופשיות מטעויות מהותיות, בין אם בטעות או בהונאה. במסגרת ההתחייבות שלנו, ביצענו בין היתר את ההליכים הבאים:
בדיקת מסמכים שהוגשו ומסמכים חיצוניים
ראיונות עם עובדי החברה כדי להבין את תהליך קביעת ההשפעה המפוצלת ותוצאות הערכת הסיכון
תצפית על הליכי ניתוח שנבחרו המשמשים בבדיקת ההטיה של החברה
בדיקת דגימות נבחרות של נתוני בדיקת ההטיה
בירור עם הצוות האחראי על ממשל, פיקוח ובדיקת הסיכון של בדיקת ההטיה
אנו מאמינים שההליכים שבוצעו מספקים בסיס סביר לדעה שלנו.
עצמאות
תפקידנו כבודק עצמאי תואם את ההגדרות של ForHumanity ו-Sarbanes-Oxley לעצמאות. התשלום הקשור בחוזה זה הוא עבור שירות להערכת עמידה. תשלום התשלומים אינו קשור להחלטה שניתנה. החלטתנו מבוססת אך ורק על הקריטריונים המפורטים להלן.
דעה
לדעתנו, בהתבסס על ההליכים שבוצעו והראיות שהתקבלו כדי לקבל ביטחון, בדיקת ההטיה והתוצאות שהוצגו על ידי החברה, נכון ל-22/07/2024, הוכנו, בכל ההיבטים המהותיים, בהתאם לקריטריונים המפורטים להלן.
בברכה,
שיאה בראון, ד"ר
מבקר ראשי, BABL AI Inc.
הדגשה של נושא
אנו מדגישים מספר נושאים הקשורים למערכת הנתונים שמקורם ב-HackerRank לבדיקת השפעה מפלה: 1) תוויות דמוגרפיות שהוגדרו על ידי המשתמש לא היו זמינות למערכת, ולכן תוויות מין וגזע/אתניות הוסקו, 2) השימוש בתוויות דמוגרפיות שהוסקו אומר שהנתונים סביר להניח שייחשבו כ“נתוני מבחן” לפי § 5-3001, ו-3) כמות ואיכות מערך הנתונים לבדיקות (ראו ממצאים) היו מוגבלים בשל חוסר בנתונים היסטוריים. כתוצאה מכך, המסקנות המופקות מכימות ההשפעה המפלה כפופות למגבלות הנובעות מערך הנתונים ויש לפרש אותן לאור מגבלה זו. דעתנו אינה משתנה ביחס לנושא זה.
1 זה לפי שיקול דעתו של מחלקת הצרכנים והעובדים של ניו יורק. 4
תיאור המערכת
BABL AI הועסק כדי לבדוק את בדיקות מערכת זיהוי ההונאה של HackerRank.
מ-HackerRank: “מערכת זיהוי ההונאה משתמשת באותות שנוצרו על ידי המשתמשים בתוך אלגוריתם למידת מכונה מתקדם כדי לסמן התנהגות חשודה במהלך הערכה. על ידי הבנת חזרות קוד שנעשו על ידי המועמד, המודל יכול לנבא אם היו לו עזרה חיצונית משמעותית.
חשוב לציין,... [ש-HackerRank] עשה את המאמצים הבאים כדי למנוע הטיה פוטנציאלית מ-PII או הרגלי קידוד או הטיות הקשורות לקושי בשאלות:
אין מידע על גזע, מין או PII באימון או בזמן ההסקה.
נתוני מהירות הקלדה אינם משמשים במודל מכיוון שאנו רואים במהירות ההקלדה יותר כהרגל אישי במקום סימני הונאה.
התכונות מוּנחות ביחס לאותה שאלה כדי למזער את ההטיה מ-קושי שונה של שאלות.
קבלת החלטות על ידי אדם במעגל: מערכת קידוד ההונאה בלמידת מכונה לעולם לא תסיר אוטומטית מועמדים מהתחזית של המודל. במקום זאת, אנו מספקים דוח מקיף של הניסיונות החשודים... הלקוחות שלנו יכולים לעיין בדוח המפורט ולבדוק את ההקלטה של הקוד בעצמם כדי להחליט אם להמשיך עם מועמד.”
סיכום ביקורת
רקע
חוק מקומי של ניו יורק מס' 144 לשנת 2021 מחייב ביקורות "הטיה" שנתיות לכלי קבלת החלטות תעסוקתיות אוטומטיים (AEDTs) המשמשים לסייע באופן משמעותי או להחליף החלטות בגיוס או קידום. באופן ספציפי, החוק קובע כי (1) ביקורת ההטיה must "להעריך את ההשפעה המפלה של [AEDTs]" על אנשים מסוימים, (2) הביקורת must להתבצע על ידי "מבקר עצמאי ... לא יותר משנה לפני השימוש", ו-(3) "סיכום תוצאות הביקורת ההטיה האחרונה ... [must להיות] זמין לציבור באתר האינטרנט של המעסיק או סוכנות העבודה." הביקורת המתוארת במסמך זה בוצעה כדי לעמוד בדרישת החוק לביקורת הטיה בלבד, ואינה כוללת דרישות אחרות כגון הודעות למועמדים. דוח זה אינו קובע אם המערכת שבבדיקה זו היא, למעשה, כלי קבלת החלטות תעסוקתיות אוטומטי כהגדרתו בחוק המקומי של ניו יורק מס' 144, או לא.
אחריות המבקר
אחריות מבקרי BABL AI היא:
לקבל ביטחון סביר אם ההצהרות שנעשו על ידי הנבדק חופשיות מטעויות מהותיות, בין אם עקב הונאה או טעות,
לקבוע האם ההצהרות שנעשו על ידי הנבדק מספקות ראיות מספקות לכך שהקריטריונים של הביקורת (ראה ממצאים) הושגו, ו-
להוציא דוח מבקר שכולל דעה.
כחלק מביקורת בהתאם לפרקטיקה טובה של ביקורת, BABL AI מפעילה שיקול דעת מקצועי ושומרת על ספקנות מקצועית לאורך כל הביקורת. באופן ספציפי, מבקרי BABL AI מזהים ומעריכים את סיכוני הטעות המהותית במסמכים שנמסרו על ידי הנבדק, מבצעים הליכי ביקורת התואמים לסיכונים אלה, ומקבלים ראיות ביקורת שהן מספקות ומתאימות כדי לספק בסיס לדעה שלנו, לפי תקן הביקורת של מועצת הפיקוח על חשבונאות חברות ציבוריות (PCAOB) 1105 על ראיות ביקורת,2 כאשר רלוונטי. בנוסף, דוח ביקורת זה עוקב אחר קווי ההנחיה של תקן הבטחת מידע בינלאומי (ISAE) 3000 על דוחות הבטחה, כאשר רלוונטי.3
BABL AI גם אחראית לשמירת עצמאות ואובייקטיביות של המבקרים כדי להבטיח את שלמות הדעה והאישור שניתן. BABL AI כארגון, וכל המבקרים העובדים והקונטרקטים, דוגלים בעצמאות קפדנית כפי שמוגדרת בחוק סרביינס-אוקסלי (Sarbanes–Oxley Act) לשנת 20024 ותקנון האתיקה של ForHumanity.5 בנוסף, מבקרי ה-Lead של BABL AI הם מבקרי ForHumanity מוסמכים תחת ביקורת הטיית AEDT של NYC.6 לפרטים נוספים על המתודולוגיה והתהליך שלנו, ראו נספח – מתודולוגיית ביקורת.
2 https://pcaobus.org/oversight/standards/auditing-standards/details/AS1105
3 https://www.iaasb.org/publications/international-standard-assurance-engagements-isae-3000 -revised-assurance-engagements-other-audits-or-0
היקף ומטרה
מחוץ להיקף
הביקורת לא הבטיחה בדיקות מספקות של ההשפעה הנפרדת של הכלי על כל קבוצה מוגנת אחרת מעבר לגזע/אתניות ומין
הביקורת לא אישרה שהמערכת היא “חפה מהטיות”
הביקורת אינה מיועדת למטרות עמידה בדרישות חוקיות אחרות מלבד חוק מקומי של ניו יורק מס' 144
מסקנות
דעותינו לבדיקת הטיה של מערכת זיהוי גניבה אקדמית על ידי HackerRank הן כדלקמן:
ממצאים
הערה: המידע המפורסם תחת כל קריטריון אינו הוכחה תיעודית.
כימות השפעה שונה
רכיבי Q.A.: יש להגדיר את המערכת לבדיקה להשפעה שונה.
- Q.A.1. כאשר המערכת כוללת יותר מרכיב אוטומטי אחד, יש להציג הוכחה להגדרת המערכת כראוי.
רכיבים או שילובים של רכיבים שנבדקו: לא זמין
Q.B. מערך הנתונים לבדיקה: יש להגדיר ולתאר את מערך הנתונים שבו כימות ההשפעה השונה בוצע.
- Q.B.1. יש להציג הוכחה לנימוק מדוע מערך הנתונים שנבחר היה מתאים לבדיקה של השפעה שונה.
- Q.B.2. כאשר נעשה שימוש בנתוני בדיקה כפי שהוגדר ב־§ 5-300, יש להציג הוכחה ל
- א. נימוק לכך שלא נעשה שימוש בנתונים היסטוריים,
- ב. שהנתונים ההיסטוריים אינם מספיקים לביצוע בדיקת השפעה שונה סטטיסטית משמעותית,
ו - ג. המתודולוגיה בה נאספו נתוני הבדיקה
- Q.B.3. כאשר לא הושלמה בדיקת ההשפעה השונה על ידי BABL, יש להציג הוכחה ל
- א. שהבדיקה האחרונה בוצעה פחות משנה לפני תאריך התחלת הביקורת או לאחר עדכון משמעותי במערכת, אלא אם העדכון היה יותר משנה לפני תאריך התחלת הביקורת, ואז יש להציג הוכחה ל
- ב. נימוק מדוע בדיקה כזו עדיין הייתה מתאימה.
- Q.B.4. הוכחה שתוצאות הבדיקה היו בתוך שנה מתאריך התחלת בדיקת ההשפעה השונה.
ביצוע בדיקה על ידי: HackerRank
תאריך הבדיקה האחרונה: 05/10/2023
טווח הזמן של הנתונים: נובמבר 2022 – פברואר 2023
הצדקה לשימוש בנתוני בדיקה: מ-HackerRank: “בהתחשב בחוזה ההגנה על נתונים עם הלקוחות שלנו, ספריות קוד פתוח נבחרות להערכת שם לגזע ולמין מכיוון שאין צורך בהעברת נתונים לספק אחר.”
Q.C. מדדי השפעה נפרדת שניתן לכימות: PCVs שניתן לכמת באמצעות מערך הנתונים לבדיקה יוגדרו.
- Q.C.1. הראיות יזהו PCVs שניתן לכמת ביחס להשפעה נפרדת.
- Q.C.2. הראיות יראו כי ה-PCVs שניתן לכמת כוללים לפחות: גזע ומין.
- Q.C.3. הראיות יגילו את השיטה בה נאספו נתוני ה-PCV.
- Q.C.4. הראיות יזהו ויגלו PCVs שלא כומתו ביחס להשפעה נפרדת.
- Q.C.5. כאשר נתוני ה-PCV הושגו בהסקה, הראיות יוכיחו
א. לזהות את השיטה בה הושגו נתוני ה-PCV,
ב. להציג הצדקה לכך ששיטת ההסקה שנבחרה ל-PCV הייתה מתאימה.
PCVs שלגביהם כימות ההשפעה השולית הייתה:
1. מגדר
2. גזע/אתניות
PCVs שלגביהם לא כומתה ההשפעה השולית:
גיל
סטטוס הגירה או אזרחות
סטטוס נכות
סטטוס נישואין ושותפות
מוצא לאומי
התאמות להיריון והנקה
דת/אמונה
נטייה מינית
סטטוס של חייל משוחרר או חייל פעיל בשירות צבאי
תוצאה חיובית לעומת שלילית: כאשר שיטת שיעור הבחירה שומשה, תוצאות חיוביות ושליליות של המודל יוגדרו בבירור.
Q.D.1. הראיות יציגו הסבר מדוע ההגדרה שנבחרה לתוצאה חיובית הייתה מתאימה.
Q.D.2. כאשר נעשה שימוש בסף, הראיות יציגו הסבר מדוע רמת/רמות הסף לקביעת תוצאות חיוביות לעומת שליליות היו/היו מתאימות.
Q.D.3. הראיות יזהו ויגלו
- א. כל ההגדרות שניתן להגדיר על ידי המשתמש,
- ב. האם כל הגדרה משפיעה על תוצאות חיוביות, ולגבי כל ההגדרות שמשפיעות על תוצאות,
- ג. היקף היכולת של המשתמש לשנותן,
- ד. הערכים המוגדרים כברירת מחדל, ו
- ה. ההסבר מדוע ערכים ברירת מחדל כאלה היו/היו מתאימים.
Q.D.4. הראיות יחשפו את ההגדרות שניתן להגדיר על ידי המשתמש ואת השילובים של הגדרות שבהם נבדקה ההשפעה השולית.
תוצאה חיובית: לא מסומן על ידי המערכת
הגדרות שניתן להגדיר על ידי המשתמש שיכולות להשפיע על תוצאה חיובית: N/A
הגדרות שנבדקה על ההשפעה השונה: N/A
שיעור הבחירה או שיעור הדירוג של Q.E.: יש להגדיר מדד התואם לשיעור הבחירה או שיעור הדירוג.
Q.E.1. כאשר שיטת שיעור הבחירה שומשה, יש להציג ראיות שהשיעור של קבוצה מוגדר כיחס התוצאה החיובית לכל התוצאות של אותה קבוצה.
Q.E.2. כאשר שיטת שיעור הדירוג שומשה, יש להציג ראיות שהשיעור של קבוצה מוגדר כקצב שבו הקבוצה מקבלת ניקוד מה-AEDT מעל לניקוד הממוצע של המדגם
שיטת כימות השפעה מפלה: שיעור הבחירה המוגדר כקצב שבו מועמדים מקבוצה דמוגרפית אינם מסומנים על ידי המערכת
Q.F. קבוצות מועדפות, לא מועדפות: הקבוצות המועדפות והלא מועדפות יוגדרו, לכל ה-PCV.
Q.F.1. הראיות יראו כי הקבוצות המועדפות והלא מועדפות הוגדרו על פי שיעורי בחירה או דירוגי ניקוד ממוינים לפי PCV.
Q.F.2. הראיות יראו כי הקבוצות הקשורות לגזע ולאתניות עומדות ב-§ 60-3.4 ב הנחיות ה-EEO.
Q.F.3. כאשר הקבוצות הקשורות לגזע ולאתניות אינן עומדות בהנחיות ה-EEO, הראיות יציגו הצדקה לכך שלא נעשה שימוש בקבוצות EEO, והמתאימות של כל החלפות הקבוצות.
Q.F.4. הראיות יראו כי הקבוצות הקשורות למגדר כוללות לפחות "זכר" ו"נקבה".
Q.F.5. הראיות יציגו קבוצות אינטרсекציונליות הכוללות את כל ההרכבים של מגדר וקבוצות גזע/אתניות.
Q.F.6. כאשר גזעים/אתניות ומגדרים אינם ידועים לדוגמה של מועמדים שנבדקו על ידי ה-AEDT, הראיות יחשפו את גודל המדגם שלהן.
יחס השפעה Q.G.: יחסי השפעה ייחשפו לכל הקבוצות המופלות, לכל ה-PCVs.
Q.G.1. כאשר יחס ההשפעה לקבוצה מופלית נמוך מ-0.8, יש להציג הוכחות שמסבירות מדוע הקבוצה המופלית מקופחת.
Q.G.2. הוכחות יראו תוצאות של ניתוח אי ודאות (למשל, שגיאה סטנדרטית לממוצע) או הפצת שגיאות של יחס ההשפעה בצורת שגיאות או קווי שגיאה.
Q.G.3. כאשר נתוני ה-PCV הושגו בהסקה, הוכחות יראו כי שגיאות שיטתיות הנובעות מהסקת ה-PCV הועברו כראוי בחישובי יחס ההשפעה.
Q.G.4. כאשר קבוצה מגדר, גזע/אתניות, או חוצה קבוצות הושמטה מחישוב יחס ההשפעה בשל גודלה שנמצא מתחת ל-2% מסך המדגם של כל ניתוח, הוכחות יראו
הצדקה להחרגת קבוצה כזו
גודל המדגם של קבוצה כזו, ו
שיעור הבחירה או ניקוד של קבוצה כזו
לא חוצה קבוצות, מגדר, ממויין לפי יחס השפעה
מבקשים
שיעור הבחירה
יחס השפעה
זכר
3,732
0.798
1.000
נקבה
2,112
0.784
0.982
לא חוצה קבוצות, גזע/אתניות, ממויין לפי יחס השפעה
N מבקשים
שיעור הבחירה
יחס השפעה
היספני או לָטיני
1,127
0.860
1.000
אסייתי
1,184
0.835
0.971
לבן
1,797
0.774
0.900
שחור או אפריקאי אמריקאי
1,070
0.762
0.866
3
0.667
N/A
חלקים
לא היספני או לָטִינוֹ
זכר
807
0.756
0.878
2
0.500
N/A
נקבה
807
0.756
0.878
1
1.000
N/A
הערה: הנתונים על מבקשים אלה לא נכללו בחישובים שלמעלה:
- 123 מבקשים עם קטגוריית מין לא ידועה
- 1053 מבקשים עם קטגוריית גזע/אתניות לא ידועה, ו
- 1176 מבקשים עם לפחות מין לא ידוע או גזע/אתניות לא ידועה
7 N/A מתייחס לקבוצה דמוגרפית המייצגת פחות מ-2% מסך ה-N של הבקשות בטבלה
Q.H. משמעות סטטיסטית: כאשר שיטת שיעור הבחירה שומשה, חישוב המשמעות הסטטיסטית יעמוד בסטנדרטים של UGESP הנחיות.
Q.H.1. הוכחות יראו כי המשמעות הסטטיסטית חושבה באמצעות מבחן Z דו-מדגם בינומי לשני מדגמים עצמאיים בגודל של 30 או יותר, ובשימוש במבחן פישר המדויק למדגמים קטנים מ-30.
ממשל
G.A. אחראי על סיכוני השפעה נפרדת: הבדיקה תכלול הוכחה לכך שהגורם האחראי הוא ועדה, אך ייתכן גם שהגורם האחראי הוא אדם יחיד.
- G.A.1. ההוכחות יראו כי הגורם האחראי הוא ועדה, אך ייתכן גם שהגורם האחראי הוא אדם יחיד.
- G.A.2. ההוכחות יראו בבירור כי הסיכונים הקשורים להשפעה נפרדת הם בבעלות ובניהול של הגורם האחראי.
הגורם האחראי: הוועדה על כלים אוטומטיים לקבלת החלטות
פרטי קשר: rohan.raman@hackerrank.com
תפקיד בארגון הנבדק: קבוצת/ועדת ממשל
G.B. תפקידים מוגדרים של הגורם האחראי: התפקידים של הגורם האחראי לסיכוני השפעה נפרדת יוגדרו בבירור.
- G.B.1. ההוכחות יראו כי תפקידים אלה נוגעים לבעלות, ניהול ומעקב אחר סיכוני השפעה נפרדת.
- G.B.2. ההוכחות יראו כי הגורם האחראי יש לו השפעה על שינויים במוצר לפי אתגר יעיל ב-הנחיות הפדרל בנוגע לניהול סיכוני מודל.
G.C. תיעוד הנוגע לתפקידים שבוצעו: הבדיקה תספק הוכחות לכך שהתפקידים שהוגדרו של הגורם האחראי לסיכוני השפעה נפרדת בוצעו.
- G.C.1. ההוכחות יראו כי התפקידים שהוגדרו בוצעו לפני תאריך התחלת הביקורת.
הערכת סיכון
השלמת הערכת סיכון: הבדיקה תוודא שהמבוקר השלים הערכת סיכון של המודל.
- R.A.1. הראיות יציגו שהושלמה הערכת סיכון או ניתוח שווה ערך פחות משנה לפני תאריך הוצאת הביקורת.
הוכחות להשלמת הערכת סיכון: מסמכי הערכת סיכון (גיליון אקסל להערכת סיכון והערות נרטיביות), ועדות בעל פה מ משתתפי הערכת הסיכון.
R.B. זיהוי סיכונים: הערכת הסיכון תציג זיהוי של סיכונים רלוונטיים הקשורים להטיה.
- R.B.1. הראיות יציגו זיהוי של סיכונים הקשורים להטיות שונות בכל שלבי מחזור החיים של ה-AI כפי שמפורט בתקן NIST לזיהוי וניהול הטיות ב-AI.
- R.B.2. הראיות יציגו מודעות של הצדדים הפוטנציאליים המושפעים מההחלטות שנעשו בכל שלבי מחזור החיים של ה-AI.
R.C. הערכת סיכונים: הערכת סיכון תציג הערכה מתאימה של סיכונים רלוונטיים.
- R.C.1. הראיות יציגו שהסיכונים שזוהו מוערכים מנקודת מבט של מספר בעלי עניין חיצוניים ופנימיים מושפעים, עם נימוקים להיקף ולמנגנון שבו סיכונים אלה משפיעים על בעלי העניין.
- R.C.2. הראיות יציגו שהסיכונים שזוהו מוערכים באופן מחמיר מספיק, באמצעות שיטה כמותית ו/או איכותית, ובכמה ממדים, כגון אך לא מוגבל לסבירות נזק וחומרת הנזק.
- R.C.3. הראיות יציגו נימוק להערכת הסיכונים שניתנה.
נספח
שיטת בדיקה
בדיקת תהליך
מסגרת הביקורת של BABL AI היא ה בדיקת תהליך, המוגדרת כ”תהליך אימות והערכה אובייקטיבי המבוצע על ידי מבקר עצמאי כדי לקבוע האם קיימים מספיק ראיות כדי להצדיק את השיפוט כי סיכוני ה-AI נמנעים, זוהו, הומתו או מנוהלים בדרך אחרת.” בדיקת תהליך מודלת על פרקטיקת ביקורת פיננסית כ- ביקורת שותפה של צד שלישי ומובחנת מצורות הערכה אחרות של אלגוריתמים, כגון הערכות צד ראשון או שני, ואחריות.8 מסגרת הביקורת כוללת שלושה שלבים:
הגדרת היקף – המבקר מבצע סקר מקדים של האלגוריתם של הנבדק כדי לקבל הבנה מלאה ולהקשר את הראיות התיעודיות
הערכה ואימות – הנבדק מגיש תיעוד המכיל ראיות המראות את עמידת הקריטריונים של הביקורת שהמבקרים מעריכים ואומדים.
אישור – אם נקבע שהנבדק עובר את קריטריוני הביקורת, המבקר מכין את דוח המבקר ומאשר את האלגוריתם של הנבדק.
הערכה ואימות
התהליך לכל מבקרי ה-AI של BABL בביצוע בדיקת תהליך עוקב אחר ההנחיות שנקבעו בסטנדרט הביקורת 1105 של ה- Public Company Accounting Oversight Board (PCAOB) על ראיות ביקורת, ככל שהן חלות. במיוחד, המבקרים:
קבלת טענות והצהרות ביקורת מתוך התיעוד שהוגש על ידי הנבדק, אשר תומכות או סותרות את הקריטריונים והתת-קריטריונים,
הערכת הטענות וההצהרות ביחס לעמידה בקריטריונים ובתת-קריטריונים, בהתבסס על השלמות ו- המתאימות של הראיות, ו-
אימות שהטענות וההצהרות שנאמרו על ידי הנבדק חופשיות מטעויות מהותיות, בין אם עקב הונאה או טעות.9
8 Carrier, R., & Brown, S. (2021). Taxonomy: AI Audit, Assurance & Assessment. ForHumanity.
https://forhumanity.center/blog/taxonomy-ai-audit-assurance-assessment/
9 “הבטחה סבירה” היא רמת ביטחון גבוהה אך אינה ערובה לכך שביקורת המתבצעת בהתאם לפרקטיקה טובה תמיד תזהה טעות מהותית כאשר היא קיימת. טעויות יכולות להיגרם מרמאות או טעות ונחשבות למהותיות אם, בנפרד או בסך הכל, ניתן לצפות בהשפעה על החלטות בעלי העניין שנלקחות על בסיס ההצהרות הללו.
בנוסף, הערכה ואימות של טענות והצהרות עשויות לכלול בקשה להוכחות תיעודיות תומכות נוספות, ו/או ראיונות עם האחראים על ניהול האלגוריתם, עובדים רלוונטיים אחרים בארגון הנבדק, או צדדים שלישיים אחרים המוזכרים בתיעוד שהוגש.
בסיום, המבקרים מגיעים לדעה ביקורתית המבוססת על:
השלימות והמתאימות של הראיות הביקורתיות, ו
סיכון להטעיה מהותית של הראיות הביקורתיות.
מונחים והגדרות
כלי קבלת החלטות תעסוקתיות אוטומטי
AEDT
“כל תהליך חישובי, הנובע מלמידת מכונה, מודלים סטטיסטיים, ניתוח נתונים, או בינה מלאכותית, שמוציא תוצאה מפושטת, כולל ניקוד, סיווג, או המלצה, שנעשה לשימוש בסיוע או להחלפה של קבלת החלטות שיקול דעתיות לקבלת החלטות תעסוקתיות המשפיעות על אנשים טבעיים.” – ראה סעיף 20-870 בקוד ו- סעיף 5-300 בכללים המאושרים חוק להגדרה מלאה
קבוצה לא מועדפת
כל קבוצה מגדרית או אתנית שאינה בעלת שיעור הבחירה או הציון הממוצע הגבוה ביותר
השפעה שונה או השפעה שלילית
“שיעור בחירה לכל קבוצה, המהווה פחות משבעה חמישיות (⁄) (או 80%) מהשיעור של הקבוצה עם השיעור הגבוה ביותר, ייחשב על ידי סוכנויות האכיפה הפדרליות כעדות להשפעה שלילית” – ראה סעיף 60-3.4.D ב- UGESP (1978) להגדרה מלאה
הפצת שגיאות
חישוב או חישוב של אי הוודאות של משתנה התלוי באי הוודאות של משתנה אחר
קבוצה מועדפת
הקבוצה המגדרית או האתנית שיש לה שיעור בחירה או ציון ממוצע גבוה יותר בהשוואה לקבוצות האחרות
יחס השפעה
“או (1) שיעור הבחירה לקטגוריה חלקי שיעור הבחירה של הקטגוריה שנבחרה ביותר, או (2) שיעור הציון לקטגוריה חלקי שיעור הציון של הקטגוריה עם הציון הגבוה ביותר.” – ראה סעיף 5-300 ב- הכלל המאושר ל ההגדרה המלאה
שיעור הציון
“השיעור שבו אנשים בקטגוריה מקבלים ציון מעל הממוצע של המדגם, כאשר הציון חושב על ידי AEDT”
הצדקה
סיבה משכנעת שמבהירה את הבעיה ונושאת כוח נורמטיבי, בניגוד לכוח הסבר בלבד
תוצאה חיובית
הבסיס לשיעור הבחירה, התוצאה המועדפת למועמד משימוש במודל, כגון קבלת החלטה להמשיך בתהליך הגיוס או קבלת סיווג על ידי מודל
משתני קטגוריה מוגנים
מוגדר לפי תחום שיפוט, שווה לקטגוריה מוגנת, כולל אך לא מוגבל ל: גזע/אתניות, גיל, מין, דת, יכולת או נכות, נטייה מינית, צבע, ארץ מוצא, מעמד סוציו-אקונומי
הערכת סיכון
הערכת הסיכון שהשימוש באלגוריתם ישפיע לרעה על זכויות ואינטרסים של בעלי העניין, עם זיהוי תואם של מצבים בהקשר ו/או תכונות של האלגוריתם שמובילים או תורמים להשפעות שליליות אלה9
שיעור בחירה
“השיעור שבו אנשים בקטגוריה נבחרים להמשיך בתהליך הגיוס או מקבלים סיווג על ידי AEDT” – ראה סעיף 5-300 ב- הכלל המאושר להגדרה המלאה
קבוצת בדיקה
המערכת הנתונה לבדיקה או לכימות השפעה שונה
ניתוח אי וודאות
חישוב או חישוב לכימות אי הוודאות של משתנה, המוציא שגיאות או קווי שגיאה
10 חסן, א., בראון, ס., דוידוביץ, ג., לאנג, ב., & ריגן, מ. (2022). הטיות אלגוריתמיות וסיכון הערכות: לקחים מהפרקטיקה. החברה הדיגיטלית, 1(1). https://doi.org/10.1007/s44206-022-00017-z