黑客排名抄袭检测系统对纽约市地方法案144的偏见审计结果总结

Last updated: December 12, 2024

来自首席审计员的信

发件人: Shea Brown
         首席审计员
         BABL AI Inc.
         sheabrown@babl.ai

收件人: Interviewstreet Incorporation (HackerRank)
    邮政信箱 1660
    211 Hope Street
    Mountain View, California 94041

主题: 关于HackerRank抄袭检测系统的审计意见

2024/07/22

我们已在2024/07/22对HackerRank(“公司”)的偏见测试断言及相关文件证据进行了独立审计,内容涉及公司关于抄袭检测系统(“系统”)的陈述,依据本报告中制定的标准和审计方法。此次审计的目标是:

  1. 确定公司所采用的偏见测试 方法、控制措施和程序是否符合审计标准(见 发现

  2. 获得合理保证 关于公司所作陈述的真实性,包括本报告中呈现的偏见测试结果摘要,是否不存在重大误报,无论是由于欺诈还是错误。

请注意,本报告中提出的标准是专门为满足纽约市2021年地方法第144号中“偏见审计”要求而制定的。系统的审计是将其视为一款自动化就业决策工具(AEDT),依据2021年纽约市地方法第144号,但我们不对该系统是否实际上属于此类工具作任何判断。

公司责任

公司代表有责任确保偏见测试及相关程序符合本报告中列明的标准。公司代表负责确保提交的文件公正呈现且无虚假陈述,提供所有必要的资源和人员以确保审计过程的有效性和效率,并根据 审计员 的要求提供证据材料的访问权限。

BABL AI 职责

首席审计员有责任对公司关于系统偏差测试的断言表达意见。在目前缺乏普遍接受的算法和自主系统审计标准的情况下,我们的审查是按照本报告中概述的标准和规范性参考进行的。

这些标准要求我们规划和执行审计程序,以合理保证上述断言是否 1) 满足审计标准,2) 不存在重大错报,无论是由于错误还是舞弊。在我们的委托范围内,我们执行了包括但不限于以下程序:

  • 提交文件和外部文件的检查

  • 采访公司员工以了解用于

    确定差异影响和风险评估结果的流程

  • 观察公司偏差测试中使用的选定分析程序

  • 对偏差测试数据的抽样样本进行检查

  • 询问负责偏差测试和风险评估治理和监督的人员

    人员

我们相信所执行的程序为我们的意见提供了合理的依据。

独立性

我们作为独立审计员的角色符合ForHumanity和萨班斯-奥克斯利(Sarbanes-Oxley)对独立性的定义。与本合同相关的费用是为了提供合规性评估服务。费用的支付与所作决定无关。我们的决定完全基于以下提出的标准。

意见

根据我们执行的程序和获得的证据以获得保证,我们认为公司截至2024年7月22日提供的偏差测试及结果,已在所有重大方面按照以下标准准备。

此致,

Shea Brown, Ph.D.
首席审计员,BABL AI Inc.

重点事项

我们强调与 HackerRank 提供的数据集相关的几个事项,以测试差异影响:1)系统未提供自我声明的人口统计标签,因此性别和种族/族裔标签是推断的,2)使用推断的人口统计标签意味着数据可能被视为《§ 5-3001》下的“测试数据”,以及 3)测试数据集的数量和质量(见发现)由于缺乏历史数据而受到限制。因此,从差异影响量化得出的结论受到数据集限制的影响,应结合这一限制进行解读。我们对此事项的意见不变。

1 这是由纽约市消费者与工人保护局自行决定的。4

系统描述

BABL AI 被聘请对 HackerRank 的抄袭检测系统进行审计。

来自 HackerRank:“抄袭检测系统使用用户生成的信号输入到一个先进的机器学习算法中,以标记在评估过程中可疑的行为。通过理解候选人所做的代码迭代,模型可以预测他们是否得到了重大外部帮助。”

值得注意的是,... [HackerRank] 为防止潜在偏见,采取了以下措施,涉及个人身份信息(PII)、编码习惯或题目难度相关偏见:

  • 在训练或推断时没有使用种族、性别或个人身份信息。

  • 模型中不使用打字速度数据,因为我们认为打字速度更像是

    个人习惯,而非抄袭指标。

  • 特征在相同题目中进行归一化,以最小化不同题目难度带来的偏差。

  • 人机决策:机器学习编码抄袭系统永远不会自动将候选人从模型预测中剔除。相反,我们提供一份详细的可疑尝试报告,我们的客户可以自行审查详细报告并检查代码重放,以决定是否将候选人推进。

审计摘要

背景

纽约市地方法第144号(2021年)要求每年对自动就业决策工具(AEDTs)进行“偏见审计”,这些工具被用来实质性协助或取代招聘或晋升中的决策。具体而言,法律规定:(1) 偏见审计必须“评估 [AEDTs] 对特定人员的差异影响”,(2) 审计必须由“独立审计员……不超过一年前进行”,以及 (3) “最近一次偏见审计的结果摘要……必须在雇主或就业机构的网站上公开”。本文档中概述的审计仅为满足法律对偏见审计的要求,不包括其他要求,如候选人通知。本报告不对该系统是否为根据纽约市地方法144号定义的自动就业决策工具作出任何判断。

审计员职责

BABL AI审计员的职责包括:

  1. 获得合理保证 关于被审计方所作陈述是否不存在重大错报,无论是由于欺诈还是错误,

  2. 确定陈述 是否提供了充分的证据证明审计标准(见 发现)已被满足,

  3. 发布审计报告 其中包含意见。

作为符合良好审计实践的审计的一部分,BABL AI行使专业判断并在整个审计过程中保持专业怀疑。具体而言,BABL AI审计员识别并评估被审计方提供的文件中重大错报的风险,执行响应这些风险的审计程序,并获取充分且适当的审计证据,为我们的意见提供基础,依据公众公司会计监督委员会(PCAOB)关于审计证据的审计标准1105,2 (如适用)。此外,本审计报告遵循国际保证业务标准(ISAE)3000关于保证报告的指南(如适用)。3

BABL AI还负责维护审计员的独立性和客观性,以确保所提供的意见和认证的完整性。BABL AI作为一个组织,以及所有员工和合同审计员,遵守由萨班斯–奥克斯利法案(2002年)和ForHumanity的道德准则所规定的严格独立性。5 此外,BABL AI的首席审计员是根据纽约市AEDT偏见审计认证的ForHumanity认证审计员。6 有关我们方法和流程的更多细节,请参阅附录——审计方法论。

2 https://pcaobus.org/oversight/standards/auditing-standards/details/AS1105
3 https://www.iaasb.org/publications/international-standard-assurance-engagements-isae-3000 -revised-assurance-engagements-other-audits-or-0

范围与目标

审计部分
审计目标
差异影响量化
确保被审计方对其模型进行了充分的测试,以“评估工具对任何组成类别的人员的差异影响”,即种族和性别——这是根据2021年地方法案144进行偏见审计的最低要求。
治理
确保存在有效的内部治理体系,拥有、管理和监控与偏见和公平性相关的风险。
风险评估
确保已严格识别、承认和评估可能导致偏见的模型风险。


不在范围内

  1. 审计未确保对工具在除种族/族裔和性别之外的任何其他受保护类别的差异影响进行了充分测试

  2. 审计未证明系统是“无偏”的

  3. 审计不用于遵守除纽约市地方法第144号以外的任何立法的目的

结论

我们对 抄袭检测系统 HackerRank 的偏见审计的意见如下:

审计部分
意见
差异影响量化
通过
治理
通过
风险评估
通过
总体
通过

发现

注意: 每个标准下披露的信息不构成书面证据。

差异影响量化

审计标准
意见

Q.A. 组件: 待测试的系统差异影响应被定义。

  • Q.A.1. 当系统由多个自动化组件组成时,应提供系统的适当定义的证据。
通过

被测试的组件或组件组合: 不适用

Q.B. 测试数据集: 应定义和描述用于量化差异影响的数据集。

  • Q.B.1. 证据应显示为何所选数据集适合进行差异影响测试的理由。
  • Q.B.2. 当使用第 5-300 条定义的测试数据时,证据应显示
    • a. 不使用历史数据的理由,
    • b. 历史数据不足以进行统计显著的差异影响测试,
      以及
    • c. 收集测试数据的方法
  • Q.B.3. 当差异影响测试未由 BABL 完成时,证据应显示
    • a. 最近的测试在本次审计开始日期前不到一年内进行,或在系统重大更新之后,除非该更新距审计开始日期超过一年,在这种情况下,证据应显示
    • b. 为什么此类测试仍然适用的理由。
  • Q.B.4. 证据应显示用于测试的数据在差异影响测试开始日期前一年内。
通过

测试由: HackerRank
上次测试日期: 2023/10/05
数据时间范围: 2022年11月 – 2023年2月

使用测试数据的理由: 来自 HackerRank:“鉴于我们与客户之间的数据保护合同,选择开源库进行姓名到种族和姓名到性别的估算,因为不需要将数据传输到其他供应商。”

Q.C. 不平等影响可量化的PCV: 应定义可以使用测试数据集量化的PCV。

  • Q.C.1. 证据应识别在不平等影响方面可量化的PCV。
  • Q.C.2. 证据应显示可量化的PCV至少包括:种族和性别。
  • Q.C.3. 证据应披露收集PCV数据的方法。
  • Q.C.4. 证据应识别并披露未在不平等影响方面量化的PCV。
  • Q.C.5. 如果PCV数据是推断得出的,证据应
    • a. 识别推断PCV数据的方法,

    • b. 说明为何所选的推断方法是合适的。

通过

量化不平等影响的PCV:

1. 性别
2. 种族/民族

未量化不平等影响的PCV:

  1. 年龄

  2. 移民或公民身份

  3. 残疾状态

  4. 婚姻状况和伴侣关系状况

  5. 民族出身

  6. 孕期和哺乳期 accommodations

  7. 宗教/信仰

  8. 性取向

  9. 退伍军人或现役军人身份

Q.D. 正面与负面结果: 当使用选择率方法时,模型的正面和负面结果应明确界定。

Q.D.1. 证据应显示为何所选的正面结果定义是合适的。

Q.D.2. 当使用阈值时,证据应显示为何确定正面与负面结果的阈值/阈值水平是合适的。

Q.D.3. 证据应识别并披露

  • a. 所有用户可配置的设置,
  • b. 每个设置是否影响正面结果, 以及所有影响结果的设置,
  • c. 它们的用户配置范围,
  • d. 它们的默认值,和
  • e. 为什么这些默认值是合适的的理由。

Q.D.4. 证据应披露用户可配置的设置和测试不平等影响的设置组合。

通过

积极结果: 未被系统标记

用户可配置设置可能影响积极结果: 不适用

测试差异影响的设置: 不适用

Q.E. 选择率或评分率: 应定义一个与选择率或评分率相对应的指标。

Q.E.1. 使用选择率方法时,应提供证据显示某一组的选择率被定义为该组正面结果与所有结果的比率。

Q.E.2. 使用评分率方法时,应提供证据显示某一组的评分率被定义为该组获得的评分高于样本中位数的比例

通过

量化差异影响的方法选择率定义为在某一人口群体中未被系统标记的候选人的比率

Q.F. 偏好和不偏好的群体偏好和不偏好的群体应为所有PCV定义。

Q.F.1. 证据应显示偏好和不偏好的群体是根据由PCV排序的选择率或评分率定义的。

Q.F.2. 证据应显示涉及种族和民族的群体满足 § 60-3.4 B 在EEO指南中.

Q.F.3. 如果涉及种族和民族的群体不符合EEO指南,应提供证据说明未使用EEO分组的理由,以及任何替代分组的适当性。

Q.F.4. 证据应显示涉及性别的群体至少包含“男性”和“女性”。

Q.F.5. 证据应显示包含所有性别和种族/民族组合排列的交叉群体。

Q.F.6. 如果对由AEDT评估的候选人样本的种族/民族和性别未知,证据应披露其样本大小。

通过

Q.G. 影响比: 所有不利群体的影响比都应披露,适用于所有PCV。

Q.G.1. 当不利群体的影响比低于0.8时,应提供证据说明为何该不利群体处于不利地位。

Q.G.2. 证据应显示不确定性分析的结果(例如,均值的标准误差)或影响比的误差传播,以误差或误差条的形式。

Q.G.3. 当PCV数据是推断得出时,证据应显示由于PCV推断引起的系统误差已在影响比计算中正确传播。

Q.G.4. 当由于其规模低于每个分析总样本的2%,性别、种族/族裔或交叉群体被排除在影响比计算之外时,证据应显示

  1. 排除该群体的理由

  2. 该群体的样本量,及

  3. 该群体的选择率或评分率

通过

非交叉、性别、按影响比排序

 

N申请人

选择率

影响比

男性

3,732

0.798

1.000

女性

2,112

0.784

0.982

非交叉、种族/族裔、按影响比排序

 

N申请人

选择率

影响比

西班牙裔或拉丁裔

1,127

0.860

1.000

亚洲

1,184

0.835

0.971

白人

1,797

0.774

0.900

黑人或非洲裔美国人

1,070

0.762

0.866

土著美国人或阿拉斯加原住民

3

0.667

N/A

交叉性

 
 
 
N 申请人
录取率
影响比8
西班牙裔或拉丁裔
男性
790
0.857
0.995
女性
287
0.861
1.000







非西班牙裔或拉丁裔



男性
白人
711
0.839
0.974
亚洲人
924
0.774
0.899
黑人或非裔美国人

807

0.756

0.878
美洲原住民或阿拉斯加原住民

2

0.500

N/A



女性
亚洲人
697
0.772
0.897
白人
389
0.833
0.967
黑人或非裔美国人

807

0.756

0.878
美洲原住民或阿拉斯加原住民

1

1.000

N/A

 

注意: 上述计算未包括这些申请人的数据:

  1. 性别类别未知的申请人123名
  2. 种族/族裔类别未知的申请人1053名,和
  3. 至少具有未知性别或未知种族/族裔的申请人1176名

7 N/A 指代表在表中总申请数中少于2%的族群

Q.H. 统计显著性: 当使用选择率方法时,统计显著性计算应符合 UGESP 指导方针.

Q.H.1. 证据应显示,统计显著性是使用样本量为30或以上的双独立样本二项Z检验,以及样本量少于30时使用费舍尔精确检验计算得出。

通过

治理

审计标准
意见

G.A. 对于差异影响风险的责任方: 被审计方应有责任方对差异影响相关的风险负责。

  • G.A.1. 证据应显示责任方是一个委员会,但也可以显示责任方是单个个人。
  • G.A.2. 证据应清楚显示与差异影响相关的风险由责任方拥有和管理。
通过

责任方: 自动决策工具委员会
联系方式: rohan.raman@hackerrank.com
在被审计组织中的角色: 治理小组/委员会

G.B. 责任方的定义职责: 责任方在差异影响风险方面的职责应明确界定。

  • G.B.1. 证据应显示这些职责涉及差异影响风险的所有权、管理和监控。
  • G.B.2. 证据应显示责任方对产品变更具有影响力,符合《联邦模型风险管理指南》的有效挑战。
通过

G.C. 与职责执行相关的文件: 被审计方应提供证据,证明责任方的定义职责已被执行。

  • G.C.1. 证据应显示在本次审计开始日期之前已执行了定义的职责。
通过

风险评估

审计标准
意见

R.A. 完成情况: 被审计方应已完成模型的风险评估。

  • R.A.1. 证据应显示在本次审计发出日期前不到一年的时间内完成了风险评估或等效分析。
通过

风险评估完成的证据: 风险评估文件(风险评估电子表格和叙述性笔记)以及风险评估参与者的口头证词。

R.B. 风险识别: 风险评估应显示相关偏差相关风险的识别。

  • R.B.1. 证据应显示在AI生命周期的所有阶段中,识别出与偏差相关的各种风险,详见 NIST 标准:识别和管理人工智能中的偏差
  • R.B.2. 证据应显示对可能受到决策影响的相关方的认识,涵盖AI生命周期的所有阶段。
通过

R.C. 风险评估: 风险评估应展示对相关风险的适当评估。

  • R.C.1. 证据应显示所识别的风险从多个受影响的外部和内部利益相关者的角度进行评估,并提供关于这些风险影响这些利益相关者的程度和机制的理由。
  • R.C.2. 证据应显示所识别的风险以足够严格的方式进行评估,使用定量和/或定性评估方案,并涵盖多个维度,例如但不限于危害的可能性和严重性。
  • R.C.3. 证据应显示对所提供风险评估的合理性说明。
通过

附录

审计方法论

流程审计

BABL AI 审计框架是 流程审计,定义为“由独立审计员进行的公正验证和评估过程,以确定是否存在足够的证据支持判断,即 AI 风险已被预防、检测、缓解或以其他方式管理。” 流程审计的模型借鉴了财务审计实践,作为一种 合作第三方 审计,与其他常用的算法评估形式(如第一方或第二方评估以及保证)不同。8 审计框架包含三个阶段:

  1. 范围界定 – 审计员对被审计方的算法进行初步调查,以全面理解并为文档证据提供背景

  2. 评估与验证 – 被审计方提交包含证明满足审计标准的证据的文件,审计员对其进行评估和验证。

  3. 认证 – 如果被审计方被判定符合审计标准,审计员将起草审计报告并对被审计方的算法进行认证。

评估与验证

所有 BABL AI 审计员进行流程审计的程序遵循在适用情况下由公众公司会计监督委员会(PCAOB)制定的审计证据审计标准 1105。具体而言,审计员:

  1. 获取审计声明和陈述 ——来自被审计方提交的文件,支持或反驳标准和子标准,

  2. 评估声明和陈述 ——关于满足标准和子标准的情况,基于 充分性 适当性 的证据,进行评估。

  3. 验证被审计方所作声明和陈述 ——确保其不存在重大错报,无论是由于欺诈还是错误。9

8 Carrier, R., & Brown, S. (2021). Taxonomy: AI Audit, Assurance & Assessment. ForHumanity.

https://forhumanity.center/blog/taxonomy-ai-audit-assurance-assessment/

9 “合理保证”是一种较高水平的保证,但并不保证按照良好的审计实践进行的审计总能发现存在的重大错报。错报可能由欺诈或错误引起,若单独或合计可能合理影响利益相关者基于这些陈述做出的决策,则被视为重大。

此外,评估和验证声明和陈述可能涉及请求额外的支持性文件证据,和/或采访负责算法治理的人员、被审计组织的其他相关员工,或提交的文件中提到的其他第三方。

最终,审计员根据以下内容得出审计意见:

  1. 审计证据的 充分性 适当性 ,以及

  2. 审计证据的重大错报风险。

术语与定义

术语
缩写
定义

自动就业决策工具

AEDT

“任何基于机器学习、统计建模、数据分析或人工智能的计算过程,输出简化结果,包括分数、分类或建议,用于实质性协助或取代自主决策,以做出影响自然人的就业决策。” – 详见《法规》第20-870条和《采纳规则》第5-300条的完整定义

不利群体

 

任何性别或种族/族裔群体,其选择率或平均分不最高

差异影响或不利影响

 

“任何种族、性别或族裔群体的选择率低于最高群体的四分之五(⁄)(或80%),通常会被联邦执法机构视为不利影响的证据” – 详见《UGESP》第60-3.4.D条的完整定义

误差传播

 

依赖于另一个变量不确定性的变量的计算或计算过程

偏好群体

 

具有较高选择率或平均分的性别或种族/族裔群体,相较于其他群体

影响比

 

“(1) 某类别的选择率除以最高选择类别的选择率,或 (2) 某类别的得分率除以最高得分类别的得分率。” – 详见《采纳规则》第5-300条的完整定义

得分率

 

“某类别中个体获得高于样本中位数得分的比例,其中得分由 AEDT 计算得出”

正当理由

 

阐明问题并具有规范性力量的令人信服的理由,而非仅仅是解释性力量

积极结果

 

基于模型使用的选择率、候选人被选中继续招聘流程或被模型分配的分类的有利结果

受保护类别变量

PCV

根据管辖区定义,等同于受保护类别,包括但不限于:种族/族裔、年龄、性别、宗教、能力或残疾、性取向、肤色、原籍国、社会经济阶层

风险评估

 

对算法使用可能对利益相关者的权利和利益产生负面影响的风险进行评估,并相应识别引起或促成这些负面影响的情境和/或算法特征9

选择率

 

“在某类别中被选中继续招聘流程或被分配分类的比例” – 详见《采纳规则》第5-300条的完整定义

测试数据集

 

用于测试或量化差异影响的数据集

不确定性分析

 

用于量化变量不确定性的计算或计算,输出误差或误差条

10 Hasan, A., Brown, S., Davidovic, J., Lange, B., & Regan, M. (2022). 算法偏见与风险 评估:实践中的教训。数字社会,1(1)。 https://doi.org/10.1007/s44206-022-00017-z