TL;DR

  • 강화학습 기반 보정 의사결정(RLCD) 모델 Jev는 44개 벤치마크와 5개 대상 모델을 평가한 결과, 단일 일반 질문만으로 AI 정렬 실패를 제로샷 탐지하며 대부분의 벤치마크에서 지도 학습 기준선을 능가함.
  • RLCDAlignBench는 아부성, 탈옥, 기만 등 10가지 정렬 실패를 평가함.
  • Jev는 한 번의 호출로 하나의 입력에 관한 여러 유형의 질문에 보정된 확률을 답함.
  • 제로샷 성능의 중앙값 AUROC는 0.886이며, 질문 표현보다 입력 문맥이 성능에 더 큰 영향을 미치고 문맥의 영향은 주로 라벨을 담은 필드에서 비롯됨.
  • Jev는 인간 라벨에 대한 기준 채점기의 일치도를 재현하고 기존 벤치마크의 라벨 결함을 드러내며, 대형 언어 모델(LLM) 심판 채점기보다 63배 저렴함.

문제와 접근법

  • 배포된 언어 모델을 점검하고 정렬 벤치마크 점수를 매기는 기존 탐지기는 주로 생성형 심판과 분류기로 구성됨.
  • 생성형 심판은 기준마다 디코딩을 한 번씩 수행하며, Llama Guard처럼 토큰 확률을 읽는 분류기도 호출당 고정된 라벨 하나만 점수화함.
  • 강화학습 기반 보정 의사결정(RLCD)으로 훈련된 Jev는 입력 하나에 관한 여러 유형의 질문에 한 번의 호출로 보정된 확률을 답함. Jev가 정렬 실패를 탐지하는지는 측정되지 않은 상태임.
  • 많은 정렬 실패는 사용자 신념이나 삽입된 지시처럼 응답만으로는 알 수 없는 기준과의 관계로 정의됨.
  • 이에 질문의 표현과 답변 유형, 그리고 입력에서 제공하는 필드를 각각 달리하며 무엇을 묻는지와 무엇을 보여주는지를 분리해 평가함.

RLCDAlignBench 평가

  • RLCDAlignBench는 아부성, 탈옥, 기만, 프롬프트 삽입, 환각, 개인정보 침해, 사회적 편향, 보상 해킹, 불확실성 은폐, 권력 추구 등 10가지 정렬 실패를 다룸.
  • 평가 범위는 44개 벤치마크와 5개 대상 모델이며, 각 벤치마크의 채점기 라벨을 사용하고 그중 2개에서는 인간 라벨도 사용함.

결과와 비용

  • 단일 일반 질문은 제로샷에서 중앙값 AUROC 0.886을 기록하고, 대부분의 벤치마크에서 지도 학습 기준선을 능가함.
  • 질문 표현의 영향은 작고 문맥의 영향은 더 크며, 그 영향은 주로 라벨을 인코딩하는 입력 필드에서 비롯됨.
  • Jev는 인간 라벨에 대한 기준 채점기의 일치도를 재현하고 기존 벤치마크의 라벨 결함을 드러냄.
  • Jev의 비용은 LLM 심판 채점기의 63분의 1임.
  • 코드와 데이터: this https URL

서지 정보

  • 논문 제목: *Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures*
  • 저자: Ruoqi Guo, Yi Liu, Gelei Deng, Yuekang Li, Lida Zhao, Yutao Wu, Simin Chen, Ying Zhang, Leo Yu Zhang
  • 분야: 인공지능(cs.AI), 계산 및 언어(cs.CL), 암호학 및 보안(cs.CR)
  • 인용: arXiv:2609.29429 [cs.AI]
  • DOI: 10.48550/arXiv.2609.29429
  • 제출일: 2026년 9월 24일