ハッカージャンクの盗作検出システムの偏見監査結果の概要 ニューヨーク市の地方法144のため
Last updated: December 12, 2024
リード監査人からの手紙
差出人: シェア・ブラウン
リード監査人
BABL AI Inc.
sheabrown@babl.ai
宛先: Interviewstreet Incorporation (HackerRank)
PO Box 1660
211 Hope Street
マウンテンビュー, カリフォルニア 94041
件名: HackerRankの剽窃検出システムに関する監査意見
2024/07/22
私たちは、2024年7月22日現在のHackerRank(以下「会社」)の偏見テストの主張と関連する書類証拠を独立して監査し、これをBABL AIに提示しました。これは、会社の剽窃検出システム(以下「システム」)に関して、本報告書に記載された基準と監査方法論に従って行われました。この監査の目的は次のとおりです:
偏見テストの方法論、コントロール、および会社によって実施された手順が監査基準を満たしているかどうかを判断する(調査結果を参照)
合理的な保証を得るために、会社によって行われた声明、及びこの報告書に示された偏見テスト結果の要約が、詐欺または誤謬による重要な虚偽表示から自由であるかどうかを確認する。
この報告書に示された基準は、NYC地方法第144号2021年に概説された「偏見監査」の要件に特に対応するように構築されています。システムは、NYC地方法第144号2021年の下で自動化された雇用決定ツール(AEDT)として監査されましたが、私たちはこのシステムが実際にこの法律の下でAEDTであるかどうかの判断を行っていません。
会社の責任
会社の代表者は、偏見テストおよび関連手順がこの報告書に記載された基準を遵守していることを確実にする責任があります。会社の代表者は、提出された書類が公正に提示されており、虚偽の記載がないことを保証し、効果的かつ効率的な監査プロセスを確保するために必要なすべてのリソースと人員を提供し、監査人からの要求に応じて証拠資料へのアクセスを提供する責任があります。BABL AIの責任
リード監査人の責任は、システムのバイアステストに関する会社の主張について意見を表明することです。現在のアルゴリズムや自律システムの監査に関する一般的に受け入れられている基準が存在しないことを踏まえ、当社の調査は本報告書に記載された基準および規範的参照に従って実施されました。
これらの基準は、私たちが監査手続きを計画し、実施して、上記の主張が1) 監査基準を満たしているか、2) 誤りや不正による重要な虚偽表示がないかについて合理的な保証を得ることを要求します。私たちの関与の範囲内で、以下の手続きを含むいくつかの手順を実施しました:
提出された文書および外部文書の検査
会社の従業員へのインタビューを通じて、
差別的影響とリスク評価結果の決定プロセスの理解を深める
会社のバイアステストに使用される選択された分析手法の観察
バイアステストデータの選択されたサンプルの検査
ガバナンスと監視、リスク評価を担当する人員への問い合わせ
私たちは、実施した手続きが私たちの意見の合理的な根拠を提供していると信じています。
独立性
私たちの独立した監査人としての役割は、ForHumanityおよびサーベンス・オックスリーの独立性の定義に準拠しています。この契約に関連する料金は、コンプライアンス評価のサービス提供のためのものであり、支払いは決定に関係ありません。私たちの決定は、以下に示す基準のみに基づいています。
意見
私たちの意見は、実施した手続きと得られた証拠に基づき、2024年7月22日時点で会社が提示したバイアステストと結果は、以下の基準に従って、すべての重要な点で適切に準備されていると考えます。
敬具、
シェア・ブラウン、Ph.D.
リード監査人、BABL AI Inc.
重要な事項の強調
私たちは、HackerRankによって提供されたデータセットに関連するいくつかの事項を強調します:1)自己申告の人口統計ラベルはシステムで利用できなかったため、性別と人種/民族性のラベルは推測されました。2)推測された人口統計ラベルの使用は、データが「テストデータ」と見なされる可能性があることを意味します。§ 5-3001の下で、3)テストデータセットの量と質(調査結果参照)は、過去のデータの不足により制限されていました。その結果、差別的影響の定量化から導き出された結論は、データセットに起因する制限の影響を受けており、この制約を考慮して解釈されるべきです。私たちの意見は、この事項に関して修正されていません。
1 これはNYC消費者・労働者保護局の裁量によるものです。4
システムの説明
BABL AIは、HackerRankの剽窃検出システムの監査を行うために関与しました。
HackerRankから:「剽窃検出システムは、ユーザー生成の信号を高度な機械学習アルゴリズムに入力し、評価中に疑わしい行動をフラグ付けします。候補者が行ったコードの反復を理解することで、モデルは彼らが外部からの大きな助けを受けたかどうかを予測できます。
重要なのは、... [HackerRankが]バイアスの可能性を防ぐために以下の努力をしたことです:PIIやコーディング習慣、質問の難易度に関連するバイアス:
トレーニング時または推論時に人種、性別、PII情報は使用されません。
タイピング速度のデータはモデルに使用されません。なぜなら、タイピング速度は剽窃の指標というよりは
個人的な習慣に近いと考えられるからです。
特徴は、異なる質問の難易度によるバイアスを最小限に抑えるために、同じ質問に関して正規化されています。
人間が関与する意思決定:MLコーディング剽窃[システム]は、候補者を自動的に除外しません。代わりに、疑わしい試みの詳細なレポートを提供します... お客様は詳細なレポートを確認し、コードのリプレイを自分でチェックして、候補者を進めるかどうかを決定できます。」
監査概要
背景
ニューヨーク市の地方法第144号(2021年)は、自動化された雇用決定ツール(AEDT)を使用した採用や昇進において、実質的に支援または置き換えるための毎年の「偏見監査」を義務付けています。具体的には、法律は次のことを規定しています:(1) 偏見監査は「特定の人々に対する[AEDT]の格差影響」を評価しなければならない、(2) 監査は「独立した監査人 ... 1年以内に使用前に」実施されなければならない、そして (3) 「最新の偏見監査の結果の概要 ... [は]雇用者または雇用機関のウェブサイトで公開されなければならない」。この文書で概説されている監査は、偏見監査の要件を満たすためだけに実施されており、候補者への通知など他の要件は含まれていません。この報告書は、この監査対象のシステムが、実際にニューヨーク市地方法144号で定義される自動化された雇用決定ツールであるかどうかについての判断を下すものではありません。
監査人の責任
BABL AIの監査人の責任は次のとおりです:
合理的な保証を得る監査対象者の述べた内容に重大な虚偽記載がないことを、詐欺または誤りによるものも含めて確認すること
監査基準を満たす証拠を提供しているかどうかを判断する監査対象者の述べた内容が、監査基準(所見)を満たしていることを示す十分な証拠を提供しているかどうかを判断します。
監査人の報告書を発行意見を含めること。
良好な監査慣行に従った監査の一環として、BABL AIは専門的判断を行い、監査全体を通じて専門的懐疑心を維持します。具体的には、BABL AIの監査人は、監査対象者から提供された文書における重要な虚偽記載のリスクを特定・評価し、そのリスクに対応した監査手続きを実施し、意見の根拠となる十分かつ適切な監査証拠を収集します。これは、Public Company Accounting Oversight Board(PCAOB)の監査基準1105「監査証拠」に従います。必要に応じて、国際保証業務基準(ISAE)3000の保証報告に関するガイドラインも適用されます。
BABL AIはまた、意見と認証の誠実性を確保するために、監査人の独立性と客観性を維持する責任も負います。BABL AIは、組織として、すべての従業員および契約監査人が、サーベンス・オックスリー法(2002年)およびForHumanityの倫理規範によって規定された厳格な独立性を遵守しています。さらに、BABL AIのリード監査人は、NYC AEDT偏見監査のためのForHumanity認定監査人です。詳細な方法論とプロセスについては、「付録 – 監査方法論」を参照してください。
2 https://pcaobus.org/oversight/standards/auditing-standards/details/AS1105
3 https://www.iaasb.org/publications/international-standard-assurance-engagements-isae-3000 -revised-assurance-engagements-other-audits-or-0
範囲と目的
範囲外
監査は、人種/民族性や性別以外の保護されたクラスに対するツールの差別的影響の十分なテストを保証しませんでした
監査は、「偏見のない」システムであることを証明しませんでした
この監査は、他の法律の遵守目的ではなく、NYCローカル法第144号
結論
私たちの意見は、 剽窃検出システム のバイアス監査について HackerRank によるものです:
調査結果
注意: 各基準の下で開示される情報は証拠書類ではありません。
不均衡影響の定量化
Q.A.の構成要素: 不均衡影響のテスト対象となるシステムは定義されている必要があります。
- Q.A.1. システムが複数の自動化されたコンポーネントで構成されている場合、適切なシステムの定義を示す証拠が必要です。
テストされたコンポーネントまたはコンポーネントの組み合わせ: N/A
Q.B. テストデータセット: 不均衡影響を定量化したデータセットは定義され、特徴付けられる必要があります。
- Q.B.1. 選択されたデータセットが不均衡影響のテストに適している理由を示す証拠が必要です。
- Q.B.2. § 5-300で定義されたテストデータが使用された場合、証拠は次を示す必要があります
- a. 歴史的データを使用しない理由の正当化、
- b. 歴史的データが統計的に有意な不均衡影響のテストを行うのに十分でないこと、
および - c. テストデータが収集された方法論
- Q.B.3. BABLによる不均衡影響のテストが完了していない場合、証拠は次を示す必要があります
- a. 最も最近のテストがこの監査の開始日から1年未満前に実施されたか、またはシステムの大規模な更新後に行われたこと。ただし、更新がこの監査の開始日から1年以上前の場合は、証拠は次を示す必要があります
- b. そのようなテストが依然として適切であった理由の正当化。
- Q.B.4. 証拠は、テストに使用されたデータが不均衡影響のテスト開始日から1年以内であったことを示す必要があります。
Testing conducted by: HackerRank
Date of last testing: 05/10/2023
Time span of data: 2022年11月 – 2023年2月
Justification for the use of Test Data: HackerRankから:「お客様とのデータ保護契約により、名前の人種および性別推定にはオープンソースライブラリを選択しています。これは、他のベンダーへのデータ転送が不要なためです。」
Q.C. 差別的影響の定量的PCV: テストデータセットを使用して定量化できるPCVを定義します。
- Q.C.1. 証拠は、差別的影響に関して定量化可能だったPCVを特定する必要があります。
- Q.C.2. 証拠は、少なくとも人種と性別を含む、定量化可能なPCVを示す必要があります。
- Q.C.3. 証拠は、PCVデータが収集された方法を開示する必要があります。
- Q.C.4. 証拠は、差別的影響に関して定量化されなかったPCVを特定し、開示する必要があります。
- Q.C.5. PCVデータが推定された場合、証拠は
a. PCVデータが推定された方法を特定し、
b. 選択されたPCV推定方法が適切であった理由の正当性を示す必要があります。
差別的影響が定量化されたPCV:
1. 性別
2. 人種/民族
差別的影響が定量化されていないPCV:
年齢
移民または市民権の状況
障害の状態
婚姻状況およびパートナーシップの状況
出身国
妊娠および授乳に関する配慮
宗教/信条
性的指向
退役軍人または現役軍人のステータス
Q.D. 正の結果 vs. 負の結果: 選択率法が使用された場合、モデルの正の結果と負の結果は明確に定義されるべきです。
Q.D.1. 証拠は、正の結果の定義が適切であった理由の正当化を示す必要があります。
Q.D.2. 閾値設定が使用されている場合、証拠は、正の結果と負の結果を決定する閾値のレベル/レベルが適切であった理由の正当化を示す必要があります。
Q.D.3. 証拠は次を特定し、開示する必要があります:
- a. ユーザー設定可能なすべての設定、
- b. 各設定が正の結果に影響を与えるかどうか、 およびすべての結果に影響を与える設定については
- c. それらのユーザー設定可能性の範囲、
- d. それらのデフォルト値、そして
- e. そのようなデフォルト値が適切であった理由の正当化。
Q.D.4. 証拠は、差別的影響がテストされたユーザー設定と設定の組み合わせを開示する必要があります。
肯定的な結果: システムによるフラグ付けがされていない
肯定的な結果に影響を与えることができるユーザー設定: N/A
差別的影響がテストされた設定: N/A
Q.E. 選択率またはスコアリング率: 選択率またはスコアリング率に対応する指標を定義する必要があります。
Q.E.1. 選択率の方法が使用された場合、そのグループの選択率は、そのグループの肯定的な結果の割合として定義されることを証明する必要があります。
Q.E.2. スコアリング率の方法が使用された場合、そのグループのスコアリング率は、そのグループがAEDTから受け取るスコアがサンプルの中央値を超える割合として定義されることを証明する必要があります。
差別的影響を定量化する方法: 選択率は、特定の人口集団の候補者がシステムによってフラグ付けされない割合として定義される
Q.F. 優遇・非優遇グループ: 優遇および非優遇グループは、すべてのPCVに対して定義されるものとする。
Q.F.1. 証拠は、優遇および非優遇グループが、PCVによって順序付けられた選択率またはスコアリング率に従って定義されたことを示す必要がある。
Q.F.2. 証拠は、人種と民族に関するグループが § 60-3.4 B EEOガイドライン. を満たしていることを示す必要がある
Q.F.3. 人種と民族に関するグループがEEOガイドラインを満たさない場合、証拠はEEOグループ化が使用されなかった理由の正当化と、代替グループ化の適切性を示す必要がある。
Q.F.4. 証拠は、性別に関するグループが少なくとも「男性」と「女性」を含むことを示す必要がある。
Q.F.5. 証拠は、性別と人種/民族のすべての組み合わせを含む交差グループを示す必要がある。
Q.F.6. 人種/民族と性別が不明な候補者のサンプルについては、証拠はそのサンプルサイズを開示する必要がある。
Q.G. 影響比率: すべての不利益を被るグループ、すべてのPCVについて影響比率を開示するものとする。
Q.G.1. 不利益を被るグループの影響比率が0.8未満の場合、そのグループが不利益を被っている理由の証拠を示すこと。
Q.G.2. 証拠は、影響比率の不確実性分析の結果(例:平均の標準誤差)または誤差伝播の結果を誤差や誤差棒の形で示すものとする。
Q.G.3. PCV推定値が推定された場合、証拠は、PCV推定による体系的誤差が適切に影響比率の計算に伝播されたことを示すものとする。
Q.G.4. 性別、人種/民族、または交差グループが、その規模が各分析の総サンプルの2%未満であるために影響比率の計算から除外された場合、証拠は次のことを示すものとする。
そのグループの除外の正当性
そのグループのサンプルサイズ、そして
そのグループの選択率またはスコアリング率
交差しない性別、影響比率順
N 応募者
選択率
影響比率
男性
3,732
0.798
1.000
女性
2,112
0.784
0.982
交差しない人種/民族、影響比率順
N 応募者
選択率
影響比率
ヒスパニックまたはラテン系
1,127
0.860
1.000
アジア
1,184
0.835
0.971
白人
1,797
0.774
0.900
黒人またはアフリカ系アメリカ人
1,070
0.762
0.866
3
0.667
N/A
インターセクショナル
非ヒスパニックまたはラテン系
男性
807
0.756
0.878
2
0.500
N/A
女性
807
0.756
0.878
1
1.000
N/A
注意: これらの応募者に関するデータは、上記の計算には含まれていません:
- 性別不明の応募者123人
- 人種/民族不明の応募者1053人、そして
- 少なくとも性別または人種/民族不明の応募者1176人
7 N/Aは、表の総N応募者の2%未満を占める人口グループを指します
Q.H. 統計的有意性: 選択率の方法が使用された場合、統計的有意性の計算は UGESP ガイドラインを満たす必要があります。
Q.H.1. 証拠は、サンプルサイズが30以上の場合は二独立サンプル二項Z検定、30未満の場合はフィッシャーの正確確率検定を使用して統計的有意性が計算されたことを示す必要があります。
ガバナンス
G.A. 不均衡な影響リスクに対する責任者: 監査対象者は、不均衡な影響に関連するリスクに責任を持つ者を持つ必要があります。
- G.A.1. 証拠は、責任者が委員会であることを示す必要がありますが、責任者が個人であることも示すことができます。
- G.A.2. 証拠は、不均衡な影響に関連するリスクが責任者によって所有および管理されていることを明確に示す必要があります。
責任者: 自動意思決定ツール委員会
連絡先情報: rohan.raman@hackerrank.com
監査対象者組織内の役割: ガバナンスグループ/委員会
G.B. 責任者の定義された義務: 不均衡な影響リスクに対する責任者の義務は明確に定義される必要があります。
- G.B.1. 証拠は、その義務が不均衡な影響リスクの所有、管理、および監視に関係していることを示す必要があります。
- G.B.2. 証拠は、責任者が効果的な挑戦により製品の変更に影響を与えることができることを示す必要があります。
G.C. 義務の履行に関する文書: 監査対象者は、不均衡な影響リスクに対する責任者の定義された義務が履行されている証拠を提供する必要があります。
- G.C.1. 証拠は、定義された義務がこの監査の開始日以前に履行されたことを示す必要があります。
リスク評価
R.A. 完了: 監査対象者はモデルのリスク評価を完了している必要があります。
- R.A.1. 証拠は、リスク評価または同等の分析がこの監査の発行日から1年以内に完了したことを示す必要があります。
リスク評価完了の証拠: リスク評価ドキュメント(リスク評価スプレッドシートと記述ノート)、およびリスク評価参加者からの口頭証言。
R.B. リスクの特定: リスク評価は、偏見に関連する関連リスクの特定を示す必要があります。
- R.B.1. 証拠は、NIST標準の「人工知能における偏見の特定と管理」に記載されているすべての段階にわたるさまざまな偏見に関連するリスクの特定を示す必要があります。
- R.B.2. 証拠は、意思決定に影響を与える可能性のある当事者が潜在的に影響を受けることを認識していることを示す必要があります。
R.C. リスクの評価: リスク評価は、関連リスクの適切な評価を示す必要があります。
- R.C.1. 証拠は、特定されたリスクが複数の影響を受ける外部および内部のステークホルダーの観点から評価されていることを示す必要があります。これには、これらのリスクがこれらのステークホルダーにどのように影響するかの正当化も含まれます。
- R.C.2. 証拠は、リスクが十分に厳格な方法で評価されていることを示す必要があります。これには、定量的および/または定性的な評価スキームを使用し、 harmの可能性や severityなど複数の次元に沿って評価することが含まれます。
- R.C.3. 証拠は、提供されたリスク評価の正当化を示す必要があります。
付録
監査方法論
プロセス監査
BABL AI監査フレームワークは プロセス監査であり、「独立した監査人によって行われる公平な検証および評価プロセスであり、AIリスクが防止、検出、軽減、またはその他の方法で管理されていると判断するのに十分な証拠が存在するかどうかを判断するものです。」と定義されています。プロセス監査は、財務監査の実践をモデルにしており、 協力的な第三者 監査であり、アルゴリズムの評価に一般的に使用される他の形式(第一者または第二者の評価、保証など)とは区別されます。8 監査フレームワークは3つのフェーズで構成されています:
スコーピング – 監査人は、監査対象のアルゴリズムの予備調査を行い、文書証拠を文脈化するために完全な理解を得る。
評価 & 検証 – 監査対象は、監査基準を満たす証拠を含む文書を提出し、監査人がそれを評価・検証します。
認証 – 監査対象が監査基準を満たすと判断された場合、監査人は監査報告書を作成し、監査対象のアルゴリズムを認証します。
評価 & 検証
すべてのBABL AI監査人がプロセス監査を実施する手順は、適用される場合、公開会社会計監督委員会(PCAOB)の監査証拠に関する監査基準1105に定められたガイドラインに従います。具体的には、監査人は:
監査請求と陳述の取得 – 監査対象の提出した文書から、基準およびサブ基準を支持または矛盾する証拠を取得します。
請求と陳述の評価 – 証拠の十分性と適切性に基づき、基準およびサブ基準を満たすかどうかについて請求と陳述を評価します。
請求と陳述の検証 – 監査対象が行った請求と陳述が、詐欺または誤りによる重要な誤記載から自由であることを検証します。9
8 Carrier, R., & Brown, S. (2021). Taxonomy: AI Audit, Assurance & Assessment. ForHumanity.
https://forhumanity.center/blog/taxonomy-ai-audit-assurance-assessment/
9 「合理的保証」とは高い保証レベルを意味しますが、良好な監査実践に従って実施された監査が、存在する重要な誤記載を常に検出する保証ではありません。誤記載は詐欺または誤りから生じる可能性があり、個別または総合的に、これらの陳述に基づいて行動するステークホルダーの意思決定に合理的に影響を与えると考えられる場合、重要と見なされます。
さらに、請求や陳述の評価と検証には、追加の証拠書類の要求や、アルゴリズムのガバナンスに責任を持つ者、監査対象組織のその他の関係者、または提出された書類に記載された第三者へのインタビューが含まれる場合があります。
最終的に、監査人は次のに基づいて監査意見を形成します:
監査証拠の 十分性 と 適切性 について、そして
監査証拠の重要な虚偽表示のリスク。
用語と定義
自動雇用決定ツール
AEDT
「機械学習、統計モデリング、データ分析、または人工知能に由来し、スコア、分類、推奨などの簡略化された出力を発行し、雇用決定において裁量的意思決定を大幅に支援または置き換えるために使用される計算プロセス。」 – 全定義については§ 20-870のコードおよび§ 5-300の 採用規則 を参照
嫌悪グループ
最も高い選択率または平均スコアを持たない性別または人種/民族グループ
不利益影響または逆効果
「最も高いレートのグループの4分の5(⁄)未満(または80%)のレートを持ついかなる人種、性別、または民族グループの選択率は、連邦執行機関によって逆効果の証拠とみなされることが一般的です」 – 全定義については§ 60-3.4.Dの UGESP (1978) を参照
誤差伝播
他の変数の不確実性に依存する変数の不確実性の計算または計算
優遇グループ
他のグループと比較して高い選択率または平均スコアを持つ性別または人種/民族グループ
影響比率
「(1) 最も選択されたカテゴリーの選択率で割ったカテゴリーの選択率、または (2) 最も高いスコアのカテゴリーのスコアリング率で割ったカテゴリーのスコアリング率。」 – 全定義については§ 5-300の 採用規則を参照
スコアリング率
「カテゴリー内の個人が中央値以上のスコアを受け取る割合であり、そのスコアはAEDTによって計算されたものです」
正当化
問題を明らかにし、規範的な力を持つ説得力のある理由、単なる説明力ではない理由
肯定的な結果
選択率の根拠、モデルの使用による候補者の好ましい結果、例えば採用プロセスの次の段階に進むために選ばれることや、モデルによって分類されること
保護されたカテゴリー変数
管轄区域ごとに定義され、保護されたクラスに相当し、人種/民族、年齢、性別、宗教、能力または障害、性的指向、色、出身国、社会経済的階級などを含むがこれらに限定されない
リスク評価
アルゴリズムの使用がステークホルダーの権利と利益に悪影響を及ぼすリスクの評価であり、そのリスクを引き起こすまたは寄与する状況や特徴を特定することを含む 9
選択率
「カテゴリー内の個人が採用プロセスの次の段階に進むために選ばれるか、AEDTによって分類される割合」 – 全定義については§ 5-300の 採用規則 を参照
テストデータセット
逆差別影響をテストまたは定量化するために使用されるデータセット
不確実性分析
変数の不確実性を定量化するための計算または計算で、誤差や誤差範囲を出力する
10 Hasan, A., Brown, S., Davidovic, J., Lange, B., & Regan, M. (2022). アルゴリズムの偏見とリスク 評価:実践からの教訓。デジタル社会、1(1)。 https://doi.org/10.1007/s44206-022-00017-z