해커랭크의 표절 감지 시스템에 대한 뉴욕시의 지방법 144의 편향 감사 결과 요약

Last updated: December 12, 2024

수석 감사자의 편지

보낸 사람: Shea Brown
           수석 감사자
           BABL AI Inc.
           sheabrown@babl.ai

받는 사람: Interviewstreet Incorporation (HackerRank)
      우편함 1660
      211 Hope Street
      Mountain View, California 94041

제목: HackerRank의 표절 감지 시스템에 대한 감사 의견

2024년 7월 22일

우리는 2024년 7월 22일 기준으로 HackerRank("회사")의 편향 테스트 주장 및 관련 문서 증거를 독립적으로 감사하였으며, 이 보고서에 명시된 기준과 감사 방법론에 따라 회사의 표절 감지 시스템("시스템")과 관련하여 BABL AI에 제시된 내용을 검증하였습니다. 이 감사의 목표는:

  1. 회사에서 수행한 편향 테스트 방법론, 통제 및 절차가 감사 기준을 충족하는지 여부를 판단하는 것 ( 발견 사항 참조)

  2. 회사의 진술, 특히 이 보고서에 제시된 편향 테스트 결과 요약이 중대한 허위 진술 없이, 사기 또는 오류로 인한 것이 아닌지에 대한 합리적인 확신을 얻는 것.

이 보고서에 제시된 기준은 NYC 지방법 제144호(2021년)에 명시된 “편향 감사” 요구 사항을 구체적으로 다루기 위해 구성된 것임을 유의하시기 바랍니다. 시스템은 NYC 지방법 제144호(2021년)에 따른 자동화된 고용 결정 도구(AEDT)로 간주하여 감사하였으나, 이 법에 따라 시스템이 실제로 AEDT인지 여부에 대한 판단은 하지 않습니다.

회사 책임

회사의 담당자는 편향 테스트 및 관련 절차가 이 보고서에 명시된 기준을 준수하는지 확인할 책임이 있습니다. 회사 담당자는 제출된 문서가 공정하게 제시되고 허위 진술이 없음을 보장하며, 효과적이고 효율적인 감사 과정을 위해 필요한 모든 자원과 인력을 제공하고, 요청 시 증거 자료에 대한 접근을 제공할 책임이 있습니다. 감사인에게.

BABL AI 책임

리드 감사인의 책임은 시스템의 편향 테스트와 관련된 회사의 주장에 대해 의견을 표명하는 것입니다. 현재 알고리즘 및 자율 시스템의 감사에 대한 일반적으로 인정된 기준이 부재한 상황에서, 본 검토는 본 보고서에 명시된 기준과 규범적 참고 문헌에 따라 수행되었습니다.

이 기준들은 우리가 감사 기준에 부합하는지 여부와 중대한 왜곡이 없는지 여부를 합리적인 확신을 얻기 위해 감사 절차를 계획하고 수행할 것을 요구합니다. 우리의 업무 범위 내에서, 우리는 다음과 같은 절차를 수행하였습니다:

  • 제출된 문서 및 외부 문서의 검토

  • 회사 직원 인터뷰를 통해

    차별적 영향 및 위험 평가 결과를 결정하는 과정 이해

  • 회사 편향 테스트에 사용된 선택된 분석 절차의 관찰

  • 편향 테스트 데이터의 선택된 샘플 검토

  • 편향 테스트 및 위험 평가의 거버넌스와 감독 책임이 있는 인력에 대한 문의

우리는 수행된 절차가 우리의 의견에 대한 합리적인 근거를 제공한다고 믿습니다.

독립성

우리의 독립 감사인 역할은 ForHumanity와 Sarbanes-Oxley의 독립성 정의에 부합합니다. 이 계약과 관련된 수수료는 준수 평가 서비스를 제공하는 것에 대한 것입니다. 수수료 지불은 결정과 무관하며, 우리의 결정은 아래 제시된 기준에만 근거합니다.

의견

우리의 의견은 수행된 절차와 확보된 증거를 바탕으로, 2024년 7월 22일 기준으로 회사가 제시한 편향 테스트 및 결과가 아래에 명시된 기준에 따라 준비되었음을 의미하며, 모든 중요한 측면에서 적합하다고 판단됩니다.

진심으로,

Shea Brown, Ph.D.
리드 감사인, BABL AI Inc.

중요 사항 강조

우리는 HackerRank에서 제공한 데이터셋과 관련된 여러 사항을 강조합니다: 1) 시스템에 대해 자가 선언한 인구통계학적 라벨이 제공되지 않아 성별과 인종/민족 라벨이 추론되었으며, 2) 추론된 인구통계학적 라벨의 사용은 데이터가 § 5-3001에 따라 “테스트 데이터”로 간주될 가능성이 높음을 의미하며, 3) 테스트 데이터셋의 양과 품질(발견사항 참조)은 과거 데이터의 부족으로 제한적이었습니다. 따라서, 차별 영향력 정량화에서 도출된 결론은 데이터셋의 한계에 영향을 받으며, 이러한 제약을 고려하여 해석되어야 합니다. 우리의 의견은 이 사항에 대해 수정되지 않았습니다.

1 이것은 NYC 소비자 및 노동자 보호부의 재량에 달려 있습니다.4

시스템 설명

BABL AI는 HackerRank의 표절 탐지 시스템에 대한 감사를 위해 참여하였습니다.

HackerRank에서: “표절 탐지 시스템은 사용자 생성 신호를 고급 머신러닝 알고리즘에 활용하여 평가 중 의심스러운 행동을 표시합니다. 후보자가 만든 코드 반복을 이해함으로써, 모델은 그들이 외부의 큰 도움을 받았는지 예측할 수 있습니다.

중요한 점은,... [HackerRank가] 편향 가능성을 방지하기 위해 다음과 같은 노력을 기울였다는 것입니다:

  • 훈련 또는 추론 시 인종, 성별 또는 PII 정보가 사용되지 않습니다.

  • 타이핑 속도 데이터는 모델에 사용되지 않으며, 이는 타이핑 속도가 표절 지표보다는

    개인 습관에 더 가깝다고 간주하기 때문입니다.

  • 특징은 질문의 난이도 차이를 최소화하기 위해 동일 질문에 대해 정규화됩니다.

  • 인간이 개입하는 의사결정: 머신러닝 표절 시스템은 후보자를 자동으로 배제하지 않습니다. 대신, 의심스러운 시도에 대한 포괄적인 보고서를 제공합니다... 고객은 상세 보고서를 검토하고 코드 재생을 직접 확인하여 후보자를 진행시킬지 결정할 수 있습니다.”

감사 요약

배경

뉴욕시 지방법 제144호(2021년)는 채용 또는 승진 결정에 실질적으로 도움을 주거나 대체하는 자동화된 고용 결정 도구(AEDT)에 대해 매년 “편향 감사”를 요구합니다. 구체적으로, 법은 (1) 편향 감사가 특정 인물에 대한 “차별적 영향”을 “평가”해야 하며, (2) 감사는 “독립된 감사인 ... 사용일로부터 1년 이내”에 수행되어야 하며, (3) “가장 최근 편향 감사 결과의 요약 ... 고용주 또는 고용 기관의 웹사이트에 공개되어야 한다”고 명시하고 있습니다. 이 문서에 설명된 감사는 법적 요구 사항인 편향 감사만을 충족하기 위해 수행되었으며, 후보자 통지와 같은 기타 요구 사항은 포함하지 않습니다. 이 보고서는 이 감사 대상 시스템이, 사실상, NYC 지방법 144호에 정의된 자동화된 고용 결정 도구인지 여부에 대해 어떤 판단도 내리지 않습니다.

감사인 책임

BABL AI 감사인의 책임은 다음과 같습니다:

  1. 합리적인 확신을 얻기 위해 감사 대상자가 진술한 내용이 중대한 왜곡 없이 사실임을 확인하는 것, 사기 또는 오류로 인한 것인지 여부,

  2. 감사 대상자가 제공한 진술이 감사 기준(참조: 발견사항)이 충족되었음을 충분히 입증하는 증거를 제공하는지 여부,

  3. 감사인의 보고서 를 발행하는 것, 여기에는 의견이 포함됩니다.

감사 관행에 따라 감사의 일환으로, BABL AI는 전문적 판단을 행사하고 감사 전반에 걸쳐 전문적 회의주의를 유지합니다. 특히, BABL AI 감사인은 제공된 문서에서 중대한 왜곡의 위험을 식별하고 평가하며, 이러한 위험에 대응하는 감사 절차를 수행하고, 우리의 의견에 근거가 되는 충분하고 적절한 감사 증거를 확보합니다. 이는 공개회사회계감독위원회(PCAOB)의 감사 증거에 관한 표준 1105호에 따릅니다. 또한, 이 감사 보고서는 적용 가능한 경우 국제 신뢰성 검증 표준(ISAE) 3000의 신뢰성 보고서 지침을 따릅니다.

BABL AI는 또한 감사인의 독립성과 객관성을 유지하여 의견과 인증의 무결성을 보장할 책임이 있습니다. BABL AI는 조직으로서, 그리고 모든 직원 및 계약 감사인은 사바레인–옥슬리 법(Sarbanes–Oxley Act of 2002)과 ForHumanity의 윤리 강령에 따라 엄격한 독립성을 준수합니다. 또한, BABL AI의 수석 감사인은 NYC AEDT 편향 감사 하에 ForHumanity 인증 감사인입니다. 자세한 방법론과 절차는 부록 – 감사 방법론을 참조하십시오.

2 https://pcaobus.org/oversight/standards/auditing-standards/details/AS1105
3 https://www.iaasb.org/publications/international-standard-assurance-engagements-isae-3000 -revised-assurance-engagements-other-audits-or-0

범위 및 목표

감사 섹션
감사 목표
불평등 영향 정량화
모델이 “도구의 불평등 영향을 인종 및 성별과 같은 구성 요소 1 범주에 대해 평가”하기 위해 충분한 테스트를 수행했는지 확인하기 위해 — 즉, 인종과 성별 — 2021년 지방법 144에 따른 편향 감사의 최소 요구 사항입니다.
거버넌스
편향과 공정성에 관련된 위험을 소유, 관리, 모니터링하는 효과적인 내부 거버넌스가 존재하는지 확인하기 위해.
위험 평가
모델의 위험이 편향에 기여할 가능성이 있는지 엄격하게 식별, 인정, 평가되었는지 확인하기 위해.


범위 외

  1. 감사는 인종/민족 및 성별을 넘어 다른 보호받는 계층에 대한 도구의 불평등 영향에 대한 충분한 테스트를 보장하지 않았습니다.

  2. 감사는 시스템이 “편향이 없다”는 것을 인증하지 않았습니다.

  3. 감사는 다른 법률에 대한 준수 목적으로 의도된 것이 아니며, NYC 지방법 제144호

결론

표절 탐지 시스템 의 편향 감사에 대한 우리의 의견은 다음과 같습니다:

감사 섹션
의견
불평등 영향 정량화
통과
거버넌스
통과
위험 평가
통과
전반적
통과

발견 사항

참고: 각 기준에 따라 공개된 정보는 문서 증거가 아닙니다.

불평등 영향 정량화

감사 기준
의견

Q.A. 구성요소: 불평등 영향을 테스트할 시스템이 정의되어야 합니다.

  • Q.A.1. 시스템이 둘 이상의 자동화된 구성요소로 구성된 경우, 적절한 시스템 정의를 보여주는 증거가 필요합니다.
통과

테스트된 구성요소 또는 구성요소 조합: N/A

Q.B. 테스트 데이터셋: 불평등 영향이 정량화된 데이터셋이 정의되고 특성화되어야 합니다.

  • Q.B.1. 증거는 선택된 데이터셋이 불평등 영향 테스트에 적합한 이유를 보여줘야 합니다.
  • Q.B.2. § 5-300에서 정의된 테스트 데이터가 사용된 경우, 증거는
    • a. 역사적 데이터를 사용하지 않은 정당성을 보여줘야 하며,
    • b. 역사적 데이터가 통계적으로 유의미한 불평등 영향 테스트를 수행하는 데 충분하지 않음을 보여줘야 하며,
      그리고
    • c. 테스트 데이터가 수집된 방법론을 보여줘야 합니다.
  • Q.B.3. 불평등 영향 테스트가 BABL에 의해 완료되지 않은 경우, 증거는
    • a. 가장 최근 테스트가 이 감사 시작일보다 1년 미만 전에 수행되었거나, 시스템의 주요 업데이트 이후에 수행되었음을 보여줘야 하며, 업데이트가 감사 시작일보다 1년 이상 전에 이루어진 경우, 증거는
    • b. 그러한 테스트가 여전히 적절했음을 정당화하는 이유를 보여줘야 합니다.
  • Q.B.4. 증거는 테스트에 사용된 데이터가 불평등 영향 테스트 시작일로부터 1년 이내였음을 보여줘야 합니다.
통과

테스트 수행자: HackerRank
최종 테스트 날짜: 05/10/2023
데이터 기간: 2022년 11월 – 2023년 2월

테스트 데이터 사용에 대한 정당성: HackerRank에서: “고객과의 데이터 보호 계약에 따라, 이름과 인종, 이름과 성별 추정에 오픈 소스 라이브러리를 선택하며, 이는 다른 공급자에게 데이터 전송이 필요하지 않기 때문입니다.”

Q.C. 차별적 영향 정량 가능 PCV: 테스트 데이터셋을 사용하여 정량화할 수 있는 PCV를 정의해야 합니다.

  • Q.C.1. 증거는 차별적 영향과 관련하여 정량화 가능한 PCV를 식별해야 합니다.
  • Q.C.2. 증거는 정량화할 수 있는 PCV에 적어도 인종과 성별이 포함됨을 보여야 합니다.
  • Q.C.3. 증거는 PCV 데이터가 수집된 방법을 공개해야 합니다.
  • Q.C.4. 증거는 차별적 영향과 관련하여 정량화되지 않은 PCV를 식별하고 공개해야 합니다.
  • Q.C.5. PCV 데이터가 추론된 경우, 증거는
    • a. PCV 데이터가 추론된 방법을 식별하고,

    • b. 선택된 PCV 추론 방법이 적절했음을 정당화하는 이유를 보여야 합니다.

합격

차별적 영향이 정량화된 PCV:

1. 성별
2. 인종/민족

차별적 영향이 정량화되지 않은 PCV:

  1. 나이

  2. 이민 또는 시민권 상태

  3. 장애 상태

  4. 혼인 및 파트너십 상태

  5. 국적

  6. 임신 및 수유 편의 제공

  7. 종교/신조

  8. 성적 지향

  9. 참전 군인 또는 현역 군인 신분

Q.D. 긍정적 결과 vs. 부정적 결과: 선택률 방법이 사용된 경우, 모델의 긍정적 및 부정적 결과를 명확하게 정의해야 합니다.

Q.D.1. 증거는 긍정적 결과의 정의가 적절했음을 정당화하는 근거를 보여야 합니다.

Q.D.2. 임계값이 사용된 경우, 증거는 긍정적 결과와 부정적 결과를 결정하는 임계값 수준/수준이 적절했음을 정당화하는 근거를 보여야 합니다.

Q.D.3.  증거는 다음을 식별하고 공개해야 합니다.

  • a. 모든 사용자 설정 가능 항목,
  • b. 각 설정이 긍정적 결과에 영향을 미치는지 여부, 그리고 결과에 영향을 미치는 모든 설정에 대해,
  • c. 사용자 설정 가능 범위,
  • d. 기본값, 그리고
  • e. 이러한 기본값이 적절했음을 정당화하는 근거.

Q.D.4.  증거는 차별적 영향이 테스트된 사용자 설정 및 설정 조합을 공개해야 합니다.

통과

긍정적 결과: 시스템에 의해 플래그가 지정되지 않음

긍정적 결과에 영향을 줄 수 있는 사용자 설정: N/A

불평등 영향을 테스트한 설정: N/A

Q.E. 선택률 또는 점수 부여율: 선택률 또는 점수 부여율에 해당하는 지표가 정의되어야 합니다.

Q.E.1. 선택률 방법이 사용된 경우, 증거는 그룹의 선택률이 해당 그룹의 긍정적 결과를 전체 결과로 나눈 비율로 정의된다는 것을 보여줘야 합니다.

Q.E.2. 점수 부여율 방법이 사용된 경우, 증거는 그룹의 점수 부여율이 그 그룹이 AEDT로부터 받은 점수가 샘플의 중앙값 이상인 비율로 정의된다는 것을 보여줘야 합니다.

통과

차별적 영향력 정량화 방법: 선택률은 인구 집단 내 후보자가 시스템에 의해 표시되지 않는 비율로 정의됩니다

Q.F. 우대, 비우대 그룹: 우대 및 비우대 그룹은 모든 PCV에 대해 정의되어야 합니다.

Q.F.1. 증거는 우대 및 비우대 그룹이 PCV에 의해 정렬된 선택률 또는 점수율에 따라 정의되었음을 보여야 합니다.

Q.F.2. 증거는 인종 및 민족과 관련된 그룹이 § 60-3.4 B EEO 지침. 를 충족하는지 보여야 합니다.

Q.F.3. 인종 및 민족과 관련된 그룹이 EEO 지침을 충족하지 않는 경우, 증거는 EEO 그룹화가 사용되지 않은 이유에 대한 정당성을 보여야 하며, 대체 그룹화의 적합성을 보여야 합니다.

Q.F.4. 증거는 성별과 관련된 그룹이 최소한 “남성”과 “여성”을 포함하는지 보여야 합니다.

Q.F.5. 증거는 성별과 인종/민족 그룹 조합의 모든 순열을 포함하는 교차 그룹을 보여야 합니다.

Q.F.6. AEDT로 평가된 후보자 샘플에 대해 인종/민족과 성별이 알려지지 않은 경우, 증거는 샘플 크기를 공개해야 합니다.

통과

Q.G. 영향 비율: 모든 불리한 그룹에 대해 영향 비율이 공개되어야 합니다. 모든 PCV에 대해.

Q.G.1. 불리한 그룹의 영향 비율이 0.8 미만인 경우, 그 그룹이 불리한 이유에 대한 정당성을 보여주는 증거가 필요합니다.

Q.G.2. 증거는 영향 비율의 불확실성 분석 결과(예: 평균의 표준 오차) 또는 오차 전파를 오차 또는 오차 막대의 형태로 보여주어야 합니다.

Q.G.3. PCV 데이터가 추론된 경우, 증거는 PCV 추론으로 인한 체계적 오차가 영향 비율 계산에 적절히 전파되었음을 보여주어야 합니다.

Q.G.4. 성별, 인종/민족 또는 교차 그룹이 그 크기가 전체 샘플 크기의 2% 미만인 경우, 영향 비율 계산에서 제외된 경우, 증거는

  1. 그 그룹 제외에 대한 정당성

  2. 그 그룹의 샘플 크기, 그리고

  3. 그 그룹의 선택률 또는 점수화율

통과

비교차적, 성별, 영향 비율별 정렬

 

N 지원자

선발률

영향 비율

남성

3,732

0.798

1.000

여성

2,112

0.784

0.982

비교차적, 인종/민족, 영향 비율별 정렬

 

N 지원자

선발률

영향 비율

히스패닉 또는 라티노

1,127

0.860

1.000

아시아

1,184

0.835

0.971

백인

1,797

0.774

0.900

흑인 또는 아프리카계 미국인

1,070

0.762

0.866

원주민 또는 알래스카 원주민

3

0.667

N/A

교차성

 
 
 
N 지원자
선발률
영향 비율8
히스패닉 또는 라티노
남성
790
0.857
0.995
여성
287
0.861
1.000







비히스패닉 또는 라티노



남성
백인
711
0.839
0.974
아시아인
924
0.774
0.899
흑인 또는 아프리카계 미국인

807

0.756

0.878
원주민 또는 알래스카 원주민

2

0.500

N/A



여성
아시아인
697
0.772
0.897
백인
389
0.833
0.967
흑인 또는 아프리카계 미국인

807

0.756

0.878
원주민 또는 알래스카 원주민

1

1.000

N/A

 

참고: 이 지원자에 대한 데이터는 위 계산에 포함되지 않았습니다:

  1. 성별이 알려지지 않은 지원자 123명
  2. 인종/민족이 알려지지 않은 지원자 1053명, 그리고
  3. 적어도 성별 또는 인종/민족이 알려지지 않은 지원자 1176명

7 N/A는 전체 N 지원자 수의 2% 미만을 차지하는 인구 통계 그룹을 의미합니다

Q.H. 통계적 유의성: 선발률 방법이 사용된 경우, 통계적 유의성 계산은 UGESP 지침을 충족해야 합니다.

Q.H.1. 증거는 표본 크기가 30 이상인 경우 두 독립 표본 이항 Z-검정을 사용하여 통계적 유의성을 계산했음을 보여야 하며, 30 미만인 경우 Fisher의 정확 검정을 사용해야 합니다.

합격

거버넌스

감사 기준
의견

G.A. 불평등 영향 위험에 대한 책임 당사자: 감사 대상자는 불평등 영향과 관련된 위험에 대해 책임이 있는 당사자를 두어야 한다.

  • G.A.1. 증거는 책임 당사자가 위원회임을 보여주어야 하며, 또한 책임 당사자가 단일 개인임을 보여줄 수도 있다.
  • G.A.2. 증거는 불평등 영향과 관련된 위험이 책임 당사자에 의해 소유되고 관리되고 있음을 명확히 보여주어야 한다.
통과

책임 당사자: 자동화 결정 도구 위원회
연락처 정보: rohan.raman@hackerrank.com
감사 대상 조직 내 역할: 거버넌스 그룹/위원회

G.B. 책임 당사자의 정의된 업무: 책임 당사자가 수행하는 업무는 명확히 정의되어야 한다.

  • G.B.1. 증거는 이러한 업무가 불평등 영향 위험의 소유권, 관리, 모니터링과 관련되어 있음을 보여주어야 한다.
  • G.B.2. 증거는 책임 당사자가 효과적인 도전의 일환으로 제품 변경에 영향을 미칠 수 있음을 보여주어야 한다 연방 가이드라인에 따른 모델 위험 관리.
통과

G.C. 수행된 업무에 관한 문서화: 감사 대상자는 책임 당사자가 수행하는 정의된 업무에 대한 증거를 제공해야 한다.

  • G.C.1. 증거는 정의된 업무가 이 감사 시작일 이전에 수행되었음을 보여주어야 한다.
통과

위험 평가

감사 기준
의견

R.A. 완료: 감사 대상자는 모델에 대한 위험 평가를 완료해야 합니다.

  • R.A.1. 증거는 이 감사 발행일보다 1년 미만 전에 완료된 위험 평가 또는 동등한 분석이 있음을 보여야 합니다.
통과

위험 평가 완료 증거: 위험 평가 문서(위험 평가 스프레드시트 및 내러티브 노트), 그리고 위험 평가 참여자의 구두 증언.

R.B. 위험 식별: 위험 평가는 편향과 관련된 관련 위험의 식별을 보여야 합니다.

  • R.B.1. 증거는 NIST 표준인 인공지능의 편향 식별 및 관리 표준에 나열된 모든 단계에서 다양한 편향과 관련된 위험의 식별을 보여야 합니다.
  • R.B.2. 증거는 의사 결정에 영향을 미치는 잠재적 영향을 받는 당사자들이 인식하고 있음을 보여야 합니다.
통과

R.C. 위험 평가: 위험 평가는 관련 위험에 대한 적절한 평가를 보여야 합니다.

  • R.C.1. 증거는 식별된 위험이 여러 이해관계자(내부 및 외부 모두)의 관점에서 평가되었음을 보여야 하며, 이러한 위험이 이해관계자에게 영향을 미치는 정도와 메커니즘에 대한 정당성을 포함해야 합니다.
  • R.C.2. 증거는 식별된 위험이 정량적 및/또는 정성적 평가 방식을 사용하여 충분히 엄격하게 평가되었음을 보여야 하며, 해로움의 가능성과 심각도 등 여러 차원에서 평가되어야 합니다.
  • R.C.3. 증거는 제공된 위험 평가에 대한 정당성을 보여야 합니다.
통과

부록

감사 방법론

프로세스 감사

BABL AI 감사 프레임워크는 프로세스 감사로, “독립된 감사인이 수행하는 공정한 검증 및 평가 과정으로, AI 위험이 방지, 탐지, 완화 또는 기타 방식으로 관리되었다는 판단을 내릴 수 있는 충분한 증거가 존재하는지 여부를 결정하는 것”으로 정의됩니다. 프로세스 감사는 재무 감사 관행을 모델로 하며, 협력적 제3자 감사이며, 알고리즘 평가의 다른 일반적인 형태인 1자 또는 2자 평가, 보증과 구별됩니다.8 감사 프레임워크는 세 단계로 구성됩니다:

  1. 범위 설정 – 감사인은 감사 대상자의 알고리즘에 대한 예비 조사를 수행하여 문서 증거를 맥락화하기 위한 전체 이해를 얻습니다.

  2. 평가 및 검증 – 감사 대상자는 감사 기준 충족을 보여주는 증거를 포함하는 문서를 제출하며, 감사인은 이를 평가하고 검증합니다.

  3. 인증 – 감사 대상자가 감사 기준을 통과하는 것으로 판단되면, 감사인은 감사 보고서를 작성하고 감사 대상자의 알고리즘을 인증합니다.

평가 및 검증

모든 BABL AI 감사인의 프로세스 감사 수행 절차는 해당하는 경우 공개회사 회계감독위원회(PCAOB)의 감사 증거에 관한 감사 표준 1105에 명시된 지침을 따릅니다. 구체적으로, 감사인은:

  1. 감사 주장 및 진술 확보 – 감사 대상자가 제출한 문서에서 기준 및 하위 기준을 지지하거나 모순되는 증거를 확보합니다.

  2. 주장 및 진술 평가 – 증거의 충분성과 적합성을 바탕으로, 기준 및 하위 기준 충족 여부에 대해 평가합니다.

  3. 감사 대상자가 제기한 주장 및 진술이 중대한 왜곡 없이 사실임을 검증합니다. 이는 사기 또는 오류로 인한 것일 수 있으며, 개별적 또는 집합적으로 이해관계자의 의사 결정에 영향을 미칠 수 있다고 간주됩니다.9

8 Carrier, R., & Brown, S. (2021). Taxonomy: AI Audit, Assurance & Assessment. ForHumanity.

https://forhumanity.center/blog/taxonomy-ai-audit-assurance-assessment/

9 “합리적 보증”은 높은 수준의 보증이지만, 좋은 감사 관행에 따라 수행된 감사가 존재하는 중대한 왜곡을 항상 발견한다는 보장은 아닙니다. 왜곡은 사기 또는 오류에서 발생할 수 있으며, 개별적 또는 집합적으로 이해관계자의 의사 결정에 영향을 미칠 수 있다고 합리적으로 기대되는 경우에 중요하다고 간주됩니다.

또한, 주장 및 진술의 평가와 검증에는 추가 지원 문서 증거 요청, 또는 알고리즘의 거버넌스 책임자, 감사 대상 조직의 기타 관련 직원 또는 제출된 문서에 참조된 기타 제3자와의 인터뷰가 포함될 수 있습니다.

최종적으로, 감사인은 다음을 기반으로 감사 의견에 도달합니다:

  1. 감사 증거의 충분성 적합성 에 대한 평가, 그리고

  2. 감사 증거의 중대한 왜곡 위험.

용어 및 정의

용어
약어
정의

자동화된 고용 결정 도구

AEDT

“기계 학습, 통계 모델링, 데이터 분석 또는 인공지능에서 파생된 계산 프로세스로서, 점수, 분류 또는 추천을 포함한 단순화된 출력을 발행하며, 이는 고용 결정에 실질적으로 도움을 주거나 대체하는 데 사용됩니다.” – 전체 정의는 § 20-870 코드 및 § 5-300 채택 규칙 참조

불리한 그룹

 

가장 높은 선택률 또는 평균 점수를 갖지 않는 성별 또는 인종/민족 그룹

불균형 영향 또는 부정적 영향

 

“어떤 인종, 성별 또는 민족 그룹의 선택률이 가장 높은 그룹의 80% 미만인 경우, 연방 집행 기관은 이를 부정적 영향의 증거로 간주할 수 있습니다” – 전체 정의는 § 60-3.4.D UGESP (1978) 참조

오차 전파

 

다른 변수의 불확실성에 의존하는 변수의 불확실성 계산 또는 계산

선호 그룹

 

다른 그룹에 비해 더 높은 선택률 또는 평균 점수를 갖는 성별 또는 인종/민족 그룹

영향 비율

 

“(1) 가장 높은 선택률을 가진 범주의 선택률을 그 범주의 선택률로 나눈 것 또는 (2) 가장 높은 점수 범주의 점수율을 그 범주의 점수율로 나눈 것” – 전체 정의는 § 5-300 채택 규칙 참조

점수율

 

“개별이 샘플의 중앙값 이상 점수를 받은 비율, 이 점수는 AEDT에 의해 계산됨”

정당화

 

이슈를 밝히고 규범적 힘을 갖는 설득력 있는 이유, 단순한 설명력을 넘어서

긍정적 결과

 

모델 사용으로 인한 선택률의 근거, 후보자가 채용 과정에서 계속 진행되거나 분류가 할당되는 것과 같은 유리한 결과

보호 대상 범주 변수

PCV

관할 구역별로 정의되며, 보호 대상 범주와 동등하며, 인종/민족, 연령, 성별, 종교, 능력 또는 장애, 성적 지향, 피부색, 출신 국가, 사회경제적 계층 등을 포함하되 이에 국한되지 않음

위험 평가

 

알고리즘 사용이 이해관계자의 권리와 이익에 부정적 영향을 미칠 위험에 대한 평가로서, 이로 인해 발생하거나 기여하는 상황 및/또는 알고리즘의 특징을 식별하는 것9

선택률

 

“개별이 채용 과정에서 계속 진행되거나 분류가 할당되는 비율” – 전체 정의는 § 5-300 채택 규칙 참조

테스트 데이터셋

 

불균형 영향을 테스트하거나 정량화하는 데 사용되는 데이터셋

불확실성 분석

 

변수의 불확실성을 정량화하기 위한 계산 또는 계산으로, 오류 또는 오차 막대를 출력함

10 Hasan, A., Brown, S., Davidovic, J., Lange, B., & Regan, M. (2022). 알고리즘 편향과 위험 평가: 실천에서의 교훈. 디지털 사회, 1(1). https://doi.org/10.1007/s44206-022-00017-z