黑客競賽的剽竊檢測系統對紐約市地方法案144的偏見審核結果摘要

Last updated: December 12, 2024

來自首席審核員的信

寄件人: Shea Brown
           首席審核員
           BABL AI Inc.
           sheabrown@babl.ai

收件人: Interviewstreet Incorporation (HackerRank)
      PO Box 1660
      211 Hope Street
      Mountain View, California 94041

關於: 對HackerRank抄襲檢測系統的審核意見

2024/07/22

我們已於2024/07/22獨立審核了HackerRank(以下稱“公司”)的偏見測試聲明及相關文件證據,這些資料已提交給BABL AI,與公司之抄襲檢測系統(以下稱“系統”)相關,並符合本報告中所列的標準和審核方法。本次審核的目標是:

  1. 確定公司所執行的偏見測試 方法、控制措施和程序是否符合審核標準(見 調查結果

  2. 獲得合理保證 公司所作聲明,包括本報告中呈現的偏見測試結果摘要,是否不存在重大錯誤陳述,無論是由於欺詐或錯誤。

請注意,本報告中所列的標準是專門為滿足紐約市地方法第144號2021年“偏見審核”要求而制定的。系統被審核時,假設它是一個自動化就業決策工具(AEDT),根據紐約市地方法第144號2021年,但我們不對該系統是否實際屬於此法律下的AEDT作出任何判斷。

公司責任

公司代表有責任確保偏見測試及相關程序符合本報告中列出的標準。公司代表負責確保提交的文件公正呈現且不含誤導,提供所有必要的資源和人員以確保審核過程的有效性和效率,並根據審核員的要求提供證據材料的存取權。

BABL AI 職責

由首席審計師表達對公司關於系統偏見測試的聲明的意見是其責任。在目前缺乏普遍接受的算法和自主系統審計標準的情況下,我們的檢查是根據本報告中概述的標準和規範參考進行的。

這些標準要求我們規劃並執行審計程序,以合理確信上述聲明是否 1) 符合審計標準,2) 無重大錯誤或欺詐的誤報。在我們的委託範圍內,我們執行了包括但不限於以下程序:

  • 檢查提交的文件和外部文件

  • 訪談公司員工,以了解用於

    確定差異影響和風險評估結果的流程

  • 觀察公司偏見測試中使用的選定分析程序

  • 檢查偏見測試數據的抽樣樣本

  • 詢問負責偏見測試和

    風險評估的治理和監督人員

我們相信所執行的程序為我們的意見提供了合理的依據。

獨立性

我們作為獨立審計師的角色符合ForHumanity和薩班斯-奧克斯利(Sarbanes-Oxley)對獨立性的定義。與本合同相關的費用是為了提供合規性評估服務。費用的支付與所作決定無關。我們的決定完全基於以下提出的標準。

意見

根據我們執行的程序和獲得的證據以獲得保證,我們認為公司於2024年7月22日所呈現的偏見測試及結果,已在所有重大方面按照以下標準準備。

誠摯地,

Shea Brown, Ph.D.
首席審計師,BABL AI Inc.

重點事項

我們強調與 HackerRank 提供的資料集相關的幾個事項,以測試差異影響:1) 系統未提供自我申報的人口統計標籤,因此性別和種族/族裔標籤是推斷得出的,2) 使用推斷的人口統計標籤意味著資料可能被視為根據 § 5-3001 的“測試資料”,以及 3) 測試資料的數量和品質(見 調查結果)因缺乏歷史資料而受到限制。因此,從差異影響量化得出的結論受到資料集限制的影響,應在此限制下解讀。我們對此事項的意見不作修改。

1 這由紐約市消費者與工人保護局自行決定。 4

系統描述

BABL AI 受聘審核 HackerRank 的剽竊偵測系統測試。

來自 HackerRank:“剽竊偵測系統利用用戶產生的信號進入先進的機器學習算法,以標記在評估過程中可疑的行為。通過了解候選人所做的程式碼迭代,模型可以預測他們是否獲得了重大外部幫助。

值得注意的是,... [HackerRank] 為防止可能的偏見,採取了以下措施,與個人身份資訊(PII)、程式習慣或題目難度相關的偏見:

  • 在訓練或推理時不包含種族、性別或個人身份資訊。

  • 模型中不使用打字速度數據,因為我們認為打字速度更像是

    個人習慣,而非剽竊指標。

  • 特徵在相同題目下進行正規化,以最小化來自不同題目難度的偏見。

  • 人類在決策中的參與:機器學習程式碼剽竊系統永遠不會自動將候選人從模型預測中剔除。相反,我們提供一份詳細的可疑行為報告,讓客戶自行審查並檢查程式碼重播,以決定是否讓候選人繼續。

審核摘要

背景

紐約市地方法第144號(2021年)要求每年對用於大幅協助或取代招聘或晉升決策的自動化就業決策工具(AEDTs)進行“偏見審核”。具體而言,該法律規定:(1) 偏見審核必須“評估 [AEDTs] 對特定人群的差異影響”,(2) 審核必須由“獨立審核員……不超過一年前進行”,以及 (3) “最近一次偏見審核的結果摘要……必須在雇主或就業機構的網站上公開”。本文檔中概述的審核僅為滿足法律對偏見審核的要求,並不包括其他要求,如候選人通知。本報告不對該系統是否為根據紐約市地方法144號定義的自動化就業決策工具作出任何判斷。

審核員責任

BABL AI 審核員的責任包括:

  1. 獲得合理保證 關於被審核方所作聲明是否不存在重大錯誤陳述,無論是由於欺詐或錯誤,

  2. 確定所作聲明 是否提供足夠證據證明審核標準(見 發現)已被滿足,並

  3. 發布審核報告 其中包含意見。

作為符合良好審計實踐的審計的一部分,BABL AI 行使專業判斷並在整個審計過程中保持專業懷疑。具體而言,BABL AI 審核員識別並評估被審核方提供的文件中重大錯誤陳述的風險,執行對應這些風險的審計程序,並獲取充分且適當的審計證據,以作為我們意見的基礎,根據公共公司會計監督委員會(PCAOB)對審計證據的審計標準 1105,2 在適用時。此外,本審計報告遵循國際保證業務標準(ISAE)3000 有關保證報告的指南(如適用)。3

BABL AI 亦負責維持審核員的獨立性和客觀性,以確保所提供意見和認證的完整性。BABL AI 作為一個組織,以及所有員工和合同審核員,遵守由薩班斯–奧克斯利法案(2002年)所規範的嚴格獨立性,以及 ForHumanity 的道德準則。5 此外,BABL AI 的首席審核員是 NYC AEDT 偏見審核的 ForHumanity 認證審核員。6 有關我們的方法論和流程的更多詳情,請參閱附錄 – 審核方法論。

2 https://pcaobus.org/oversight/standards/auditing-standards/details/AS1105
3 https://www.iaasb.org/publications/international-standard-assurance-engagements-isae-3000 -revised-assurance-engagements-other-audits-or-0

範圍與目標

審核部分
審核目標
差異影響量化
確保被審核方已對其模型進行充分測試,以“評估工具對任何組件1類別人員的差異影響”,即種族和性別,作為根據2021年地方法案144的偏見審核的最低要求。
治理
確保存在有效的內部治理,以擁有、管理和監控與偏見和公平性相關的風險。
風險評估
確保已嚴格識別、承認並評估可能導致偏見的模型風險。


範圍外

  1. 審核未能確保對除種族/族裔和性別之外的任何其他受保護類別的工具差異影響進行充分測試

  2. 審核未能證明系統是“無偏見”

  3. 此審核不適用於除紐約市地方法案第144號之外的任何立法的合規目的

結論

我們對 抄襲檢測系統 HackerRank 進行偏見審核的意見如下:

審核部分
意見
差異影響量化
通過
治理
通過
風險評估
通過
整體
通過

調查結果

注意: 在每個標準下披露的信息並非文件證據。

差異影響量化

審核標準
意見

Q.A. 組件: 待測系統的差異影響將被定義。

  • Q.A.1. 如果系統包含多個自動化組件,證據應顯示系統的適當定義。
通過

測試的組件或組件組合: N/A

Q.B. 測試數據集: 將定義並描述用於量化差異影響的數據集。

  • Q.B.1. 證據應顯示選擇的數據集適合用於差異影響測試的理由。
  • Q.B.2. 如果使用§ 5-300中定義的測試數據,證據應顯示
    • a. 不使用歷史數據的理由,
    • b. 歷史數據不足以進行具有統計意義的差異影響測試,
      以及
    • c. 收集測試數據的方法
  • Q.B.3. 如果差異影響測試未由BABL完成,證據應顯示
    • a. 最近的測試是在本次審核開始前少於一年進行的,或在系統重大更新後進行,除非該更新距離審核開始日期超過一年,這種情況下,證據應顯示
    • b. 為何此類測試仍然適用的理由。
  • Q.B.4. 證據應顯示用於測試的數據是在差異影響測試開始日期前一年內。
通過

測試由: HackerRank
上次測試日期: 05/10/2023
資料的時間範圍: 2022年11月 – 2023年2月

使用測試資料的理由: 來自 HackerRank:“鑑於我們與客戶之間的資料保護合約,選擇開源庫進行姓名到種族和姓名到性別的估算,因為不需要將資料傳輸到其他供應商。”

Q.C. 不平等影響可量化的PCVs: 應定義可用測試資料集量化的PCVs。

  • Q.C.1. 證據應識別在不平等影響方面可量化的PCVs。
  • Q.C.2. 證據應顯示可量化的PCVs至少包括:種族和性別。
  • Q.C.3. 證據應披露收集PCV資料的方法。
  • Q.C.4. 證據應識別並披露未在不平等影響方面量化的PCVs。
  • Q.C.5. 若PCV資料是推斷得出,證據應
    • a. 識別推斷PCV資料的方法,

    • b. 顯示選擇的PCV推斷方法的合理性。

通過

量化不平等影響的PCV:

1. 性別
2. 種族/族裔

未量化不平等影響的PCV:

  1. 年齡

  2. 移民或公民身份

  3. 殘疾狀況

  4. 婚姻狀況和伴侶關係狀況

  5. 國籍

  6. 懷孕和哺乳照顧

  7. 宗教/信仰

  8. 性取向

  9. 退伍軍人或現役軍人身份

Q.D. 正向與負向結果: 當使用選擇率方法時,模型的正向和負向結果應明確定義。

Q.D.1. 證據應顯示為何所選擇的正向結果定義是適當的。

Q.D.2. 當使用閾值時,證據應顯示為何用於判定正向與負向結果的閾值/閾值水平是適當的。

Q.D.3. 證據應識別並披露

  • a. 所有用戶可配置的設置,
  • b. 每個設置是否影響正向結果, 以及所有影響結果的設置,
  • c. 它們的用戶可配置範圍,
  • d. 它們的預設值,和
  • e. 為何這些預設值是適當的的理由。

Q.D.4. 證據應披露用戶可配置的設置和測試不平等影響的設置組合。

通過

正面結果: 未被系統標記

用戶可配置的設置,可能影響正面結果: N/A

測試差異影響的設置: N/A

Q.E. 選擇率或評分率: 將定義一個與選擇率或評分率相對應的指標。

Q.E.1. 使用選擇率方法時,證據應顯示某一組的選擇率被定義為該組正面結果與所有結果的比率。

Q.E.2. 使用評分率方法時,證據應顯示某一組的評分率被定義為該組獲得的評分高於樣本中位數的比率

通過

量化差異影響的方法: 選擇率定義為在某個人口群中未被系統標記的候選人比例

Q.F. 優待與不優待群體: 所有PCV都應定義優待和不優待群體。

Q.F.1. 證據應顯示優待和不優待群體是根據PCV排序的選擇率或評分率來定義的。

Q.F.2. 證據應顯示涉及種族和族裔的群體符合 § 60-3.4 B 在EEO指南中.

Q.F.3. 如果涉及種族和族裔的群體不符合EEO指南,證據應顯示為何未使用EEO分組的理由,以及任何替代分組的適當性。

Q.F.4. 證據應顯示涉及性別的群體至少包含“男性”和“女性”。

Q.F.5. 證據應顯示包含所有性別和種族/族裔組合排列的交叉群體。

Q.F.6. 如果對AEDT評估的候選人樣本中未知道種族/族裔和性別,證據應披露其樣本大小。

通過

Q.G. 影響比率: 所有不利群體的影響比率都應披露,適用於所有PCV。

Q.G.1. 當不利群體的影響比率低於0.8時,應提供證據證明該不利群體處於劣勢的理由。

Q.G.2. 證據應顯示不確定性分析的結果(例如,平均值的標準誤差)或影響比率的誤差傳播,以誤差或誤差條的形式。

Q.G.3. 當PCV數據是推斷得出時,證據應顯示由於PCV推斷而產生的系統性誤差已在影響比率計算中正確傳播。

Q.G.4. 當由於其規模低於每個分析總樣本的2%,而被排除在影響比率計算之外的性別、種族/族裔或交叉群體,證據應顯示

  1. 排除該群體的理由

  2. 該群體的樣本大小,及

  3. 該群體的選擇率或評分率

通過

非交叉性別,按影響比率排序

 

N申請人數

選擇率

影響比率

男性

3,732

0.798

1.000

女性

2,112

0.784

0.982

非交叉性別,按種族/族裔排序

 

N申請人數

選擇率

影響比率

西班牙裔或拉丁裔

1,127

0.860

1.000

亞洲

1,184

0.835

0.971

白人

1,797

0.774

0.900

非裔美國人或非洲裔

1,070

0.762

0.866

土著美國人或阿拉斯加原住民

3

0.667

N/A

交叉性

 
 
 
N 申請人數
選擇率
影響比率8
西班牙裔或拉丁裔
男性
790
0.857
0.995
女性
287
0.861
1.000







非西班牙裔或拉丁裔



男性
白人
711
0.839
0.974
亞洲人
924
0.774
0.899
黑人或非裔美國人

807

0.756

0.878
美國原住民或阿拉斯加原住民

2

0.500

N/A



女性
亞洲人
697
0.772
0.897
白人
389
0.833
0.967
黑人或非裔美國人

807

0.756

0.878
美國原住民或阿拉斯加原住民

1

1.000

N/A

 

注意: 上述計算未包含這些申請人的數據:

  1. 性別未知的申請人123人
  2. 種族/族裔未知的申請人1053人,並且
  3. 至少具有未知性別或未知種族/族裔的申請人1176人

7 N/A 指代表少於總N申請數2%的族群

Q.H. 統計顯著性: 當使用選擇率方法時,統計顯著性計算應符合 UGESP 指導方針.

Q.H.1. 證據應顯示,對於樣本大小30或以上,使用雙獨立樣本二項Z檢驗進行統計顯著性計算,對於樣本大小少於30,則使用費雪精確檢驗。

通過

治理

審核標準
意見

G.A. 負責方對於差異影響風險: 被審核方應有一個負責差異影響相關風險的負責方。

  • G.A.1. 證據應顯示負責方是一個委員會,但也可以顯示負責方是一個個人。
  • G.A.2. 證據應清楚顯示與差異影響相關的風險由負責方擁有並管理。
通過

負責方: 自動決策工具委員會
聯絡資訊: rohan.raman@hackerrank.com
在被審核組織中的角色: 治理團隊/委員會

G.B. 負責方的明確職責: 負責差異影響風險的方的職責應明確定義。

  • G.B.1. 證據應顯示這些職責涉及差異影響風險的擁有、管理和監控。
  • G.B.2. 證據應顯示負責方對產品變更具有影響力,符合有效挑戰的《聯邦模型風險管理指南》。
通過

G.C. 與職責相關的文件: 被審核方應提供證據,證明負責差異影響風險的方的職責已被履行。

  • G.C.1. 證據應顯示在本次審核開始日期之前已履行這些職責。
通過

風險評估

審核標準
意見

R.A. 完成: 被審核方應已完成模型的風險評估。

  • R.A.1. 證據應顯示在本次審核發佈日期前不到一年的時間內完成了風險評估或等同分析。
通過

風險評估完成證據: 風險評估文件(風險評估電子表格和敘述性筆記),以及來自風險評估參與者的口頭證詞。

R.B. 風險識別: 風險評估應顯示相關偏見的風險識別。

  • R.B.1. 證據應顯示在所有階段的AI生命週期中,與偏見相關的風險識別,並列出在 NIST 識別與管理人工智慧偏見標準 中所列。
  • R.B.2. 證據應顯示對於可能受到決策影響的各方的認識,涵蓋所有階段的AI生命週期。
通過

R.C. 風險評估: 風險評估應展示對相關風險的適當評估。

  • R.C.1. 證據應顯示所識別的風險是從多個受影響的外部和內部利益相關者的角度進行評估的,並提供這些風險影響這些利益相關者的範圍和機制的理由。
  • R.C.2. 證據應顯示所識別的風險以足夠嚴謹的方式進行評估,使用定量和/或定性評估方案,並涵蓋多個層面,例如但不限於危害的可能性和嚴重性。
  • R.C.3. 證據應提供對所提供風險評估的合理性說明。
通過

附錄

審計方法論

流程審計

BABL AI 審計框架是的 流程審計,定義為“由獨立審計員進行的公正驗證和評估過程,以確定是否存在足夠的證據來判斷 AI 風險已被預防、檢測、緩解或以其他方式管理。”流程審計模仿財務審計實踐,作為一個 合作第三方 審計,並且與其他常用的算法評估形式(如第一方或第二方評估,以及保證)區分開來。8 審計框架包含三個階段:

  1. 範圍界定 – 審計員對被審計方的算法進行初步調查,以全面了解並將文件證據置於背景中

  2. 評估與驗證 – 被審計方提交包含證明滿足審計標準的證據的文件,審計員對其進行評估和驗證。

  3. 認證 – 如果被審計方被判定符合審計標準,審計員將起草審計報告並認證被審計方的算法。

評估與驗證

所有 BABL AI 審計員進行流程審計的程序遵循在適用情況下由公共公司會計監督委員會(PCAOB)制定的審計證據審計標準 1105。具體而言,審計員:

  1. 獲取審計申索和聲明 來自被審計方提交的文件,這些文件支持或反駁標準和子標準,

  2. 評估申索和聲明 關於滿足標準和子標準,基於證據的 充分性 適當性 ,以及

  3. 驗證被審計方所作的申索和聲明 是否不存在重大錯誤,無論是由於欺詐還是錯誤。 9

8 Carrier, R., & Brown, S. (2021). Taxonomy: AI Audit, Assurance & Assessment. ForHumanity.

https://forhumanity.center/blog/taxonomy-ai-audit-assurance-assessment/

9 “合理保證”是一個高水平的保證,但並不保證按照良好的審計實踐進行的審計總能在存在重大錯誤時檢測到。錯誤可能由欺詐或錯誤引起,並且如果單獨或合計起來,合理預期會影響利益相關者根據這些聲明做出的決策,則被視為重大。

此外,對索賠和聲明的評估與驗證可能涉及請求額外的支持性文件證據,和/或訪談負責算法治理的相關人員、受審組織的其他相關員工或提交的文件中提及的其他第三方。

最後,審計員根據以下內容得出審計意見:

  1. 審計證據的 充分性 適當性 ,以及

  2. 審計證據的重大錯報風險。

術語與定義

術語
縮寫
定義

自動就業決策工具

AEDT

“任何基於機器學習、統計建模、數據分析或人工智能的計算過程,產生簡化輸出,包括分數、分類或建議,用於大幅協助或取代自主決策,進行影響自然人的就業決策。” – 參見 § 20-870 的規定和 § 5-300 的 採用規則 以獲得完整定義

不利群體

 

任何性別或種族/族裔群體,其選擇率或平均分數不是最高的

差別影響或不利影響

 

“任何種族、性別或族裔群體的選擇率低於最高群體的四分之五(⁄)(或80%),通常會被聯邦執法機關視為不利影響的證據” – 參見 § 60-3.4.D 的 UGESP (1978) 以獲得完整定義

誤差傳播

 

依賴另一變數不確定性計算或計算的變數不確定性

受偏好群體

 

具有較高選擇率或平均分數的性別或種族/族裔群體,與其他群體相比

影響比率

 

“(1) 某類別的選擇率除以最高選擇率的比率,或 (2) 某類別的得分率除以最高得分類別的得分率。” – 參見 § 5-300 的 採用規則 以獲得完整定義

得分率

 

“某類別中個體獲得高於樣本中位數分數的比率,該分數由 AEDT 計算”

正當理由

 

一個令人信服的理由,闡明問題並具有規範力量,而非僅僅是解釋力

正面結果

 

基於選擇率的依據,模型使用後候選人獲得的有利結果,例如被選中進入下一階段或被模型分配分類

受保護類別變數

PCV

根據管轄區定義,等同於受保護類別,包括但不限於:種族/族裔、年齡、性別、宗教、能力或殘疾、性取向、膚色、國籍、社會經濟階層

風險評估

 

對算法使用可能對利益相關者的權利和利益產生負面影響的風險進行評估,並相應識別出引起或促成這些負面影響的情境和/或算法特徵9

選擇率

 

“在某類別中被選中進入下一階段或被分配分類的比率” – 參見 § 5-300 的 採用規則 以獲得完整定義

測試數據集

 

用於測試或量化差別影響的數據集

不確定性分析

 

用於量化變數不確定性的計算或計算,輸出誤差或誤差條

10 Hasan, A., Brown, S., Davidovic, J., Lange, B., & Regan, M. (2022). 演算法偏見與風險 評估:實踐中的教訓。數位社會,1(1)。https://doi.org/10.1007/s44206-022-00017-z