TL;DR

  • 고정 평가 예산과 1,024개 시뮬레이션 세계에서 드문 실패를 다룬 실험은 집중 위험 조건에서 분산 할당이 잘못된 선택을 더 자주 하면서도 평균 효용 손실을 줄였고, 확산 위험 조건에서는 두 지표 모두 악화됨.
  • 집중 위험 조건에서 분산 할당은 잘못된 선택 비율을 44.4%에서 52.6%로 높였지만 평균 효용 손실을 27.8% 줄임.
  • 확산 위험 조건에서는 분산 할당이 잘못된 선택 횟수와 평균 효용 손실 모두에서 균등 할당보다 나쁜 결과를 보임.
  • 평가 파이프라인은 최적이 아닌 에이전트를 선택하는 빈도와 그 선택으로 잃는 기대 효용을 함께 측정해야 함.
  • 결과는 합성 실험에 한정되며, 배포 안전성이나 적응형 평가의 일반적 우위를 입증하지 않음.

결과

  • 동일한 예산, 태스크, 1,024개 시뮬레이션 세계에서 정책별 세계당 25,600회 추출을 수행한 결과임.
  • 집중 위험 조건에서 균등 전체 예산 정책은 455/1,024회 잘못 선택하고 평균 효용 0.0268을 잃었으며, 분산 할당은 539/1,024회 잘못 선택하고 평균 효용 0.0193을 잃음.
  • 확산 위험 조건에서 균등 전체 예산 정책은 541/1,024회 잘못 선택하고 평균 효용 0.0208을 잃었으며, 분산 할당은 602/1,024회 잘못 선택하고 평균 효용 0.0229를 잃음.
  • 선택 정확도와 의사결정 비용은 평가자를 서로 다르게 순위 매길 수 있음. 집중 위험 조건에서 분산 할당은 진짜 최적 에이전트를 선택하는 빈도가 낮았지만, 평균적으로 실수 비용은 더 작았음.
  • 평가 파이프라인은 차선 에이전트를 선택하는 빈도와 해당 선택으로 잃는 기대 효용을 모두 측정해야 함. 정확도는 근소한 차이와 비용이 큰 실수를 동일하게 취급하고, 후회(regret)는 효용 격차를 반영하지만 치명적 위험 한도를 강제하지 않음.
  • 이 합성 결과는 두 지표를 함께 보고할 근거가 되지만, 배포 안전성이나 적응형 평가의 일반적 우위를 입증하지는 않음.

실행 방법

  • 요구 환경은 Python 3.13과 CPU이며, 모델 API, 자격 증명, 비공개 데이터는 필요하지 않음.
  • 저장소는 https://github.com/itsloganmann/rare-failure-eval.git에서 내려받고, 가상 환경을 만든 뒤 requirements.txt의 의존성을 설치해 run_experiment.py를 스모크 모드로 실행하는 절차임.
  • outputs/smoke/REPORT.md에서 스모크 실행 결과를 확인하고, 실행마다 새 출력 디렉터리를 사용해야 함. 공개된 결과는 스모크 모드가 아니라 전체 실행에서 나온 결과임.
  • 테스트, 전체 재현, 독립 검증 절차는 다음과 같음.
  • pytest -q로 테스트 실행
  • run_experiment.py --mode primary --approved-primary로 기본 전체 실행
  • run_experiment.py --verify와 independent_audit.py로 결과 검증
  • make_figures.py로 요약 파일에서 그림 생성
  • 기본 실행 승인 플래그는 실행을 허용하는 장치이며, 동료 심사를 받았다는 증거가 아님.
  • 재표집 없이 배포된 실행을 검증하려면 results.jsonl.gz를 압축 해제해 출력 디렉터리에 두고, run_experiment.py --verify와 independent_audit.py를 실행하는 절차임.
  • 매니페스트는 고정된 연구 코드와 출력의 해시를 기록함. 별도의 산술 감사는 저장된 충분 통계량으로 가중 추정치, 순위, 동률, 선택 오류, 후회를 재구성함.

구성

  • 합성 에이전트 4개, 태스크 8개, 위험 설정 3개, 예산 2개, 표본 추출 정책 4개로 구성됨.
  • 효용은 고정 태스크 가중치를 적용한 보상 - 800 * 실패이며, 후회는 진짜 최적 에이전트의 기대 효용에서 선택된 에이전트의 기대 효용을 뺀 값임.
  • 정책별 할당 방식은 다음과 같음.
  • 균등, 전체 예산: 모든 추출을 균형 추정에 투입
  • 균등, 파일럿 매칭: 파일럿 뒤에 독립적인 균형 추정을 수행
  • 분산 할당: 셀마다 네 번 추출하는 파일럿으로 고정된 네이만 할당을 정하고, 균등 할당 하한을 둠
  • 파일럿 실패 추종: 관측된 실패가 있는 곳에 할당하고, 그렇지 않으면 균등 표본 추출을 사용
  • 전체 실행에는 24,576개 기록과 393,216,000회 시뮬레이션 추출이 포함됨. 전체 조건, 짝지은 구간, 감사 자료도 제공됨.

범위

  • 합성 탐색적 재현 실험이며, 128개 세계로 진행한 파일럿 이후 새 시드를 사용함. 공개 사전 등록이 없고 실제 에이전트 벤치마크도 아님.
  • 보편적 개선을 주장하지 않으며 결과는 설정과 예산에 따라 달라짐. 위험 설정끼리 전체 사건 질량이 일치하지 않으므로 설정 간 차이를 인과 효과로 볼 수 없음.
  • 드문 실패는 놓치기 쉬움. 네 번의 추출로 발생 확률 0.001인 사건을 탐지할 확률은 0.4%임. 실패가 관측되지 않았다고 해서 안전성이 입증되는 것은 아님.
  • 기대 후회는 안전 제약이 아님. 짝지은 부트스트랩 구간은 기술적 설명을 위한 것이며 보정되지 않음. 한 번 확인하는 위험 한계는 언제든 유효한 보장이 아님.

배경

  • Lanctot 외(2026)의 [일반 에이전트 능동 평가](Active Evaluation of General Agents)에서 영감을 얻은 독립 실험임.
  • 이 실험은 드문 손실 효용과 표본 할당을 다루며, 해당 논문의 엘로(Elo) 또는 소프트 콩도르세(Soft Condorcet) 알고리즘을 재현하지 않음.
  • 고용주 데이터나 기관의 승인은 포함되지 않음.