원문 캡처 · epoch.ai
원문 캡처 · epoch.ai

평가는 SDPO 원 논문의 주요 결과에 맞춰 단답형 질문과 코딩, 두 영역에서 진행한다. 두 영역 모두 SDPO를 적용하기 위해 수정한 스택을 사용해 평가한 환경과 GPU에 맞춰 기준 점수를 갱신했다. 기준 점수는 논문 결과와 대체로 가까웠으며, 세부적인 차이는 아래에서 다룬다.

단답형 질문의 원점수는 다음 두 가지를 측정한다.

  • 학습 효율에서 GRPO 대비 SDPO의 향상 폭을 재현하는 정도다. 학습 1시간 시점의 진척을 측정하며, 단답형 과제 5개의 acc - acc_GRPO 평균을 같은 5개 과제에서 SDPO가 GRPO보다 향상된 acc_SDPO - acc_GRPO의 평균으로 나눈 통합 향상 점수다. 어떤 과제도 GRPO와 SDPO 간 가장 큰 단일 향상 폭인 10pp를 넘게 반영하지 않는다. 논문 표 3과 같은 설정이다.
  • 학습 5시간 시점의 기준 성능을 재현하는 정도다. 원 논문은 이 시점에 SDPO가 GRPO보다 약간 높은 성능을 보일 가능성을 제시했지만, 평가에서는 그 차이를 안정적으로 확인하기 어려웠다. 점수는 1 + z_score/6으로 계산하고 0에서 1 사이로 제한한다. 평균 성능 차이가 -3.6pp이면 0점, 성능이 같으면 1점이다. 이 역시 논문 표 3과 같은 설정이다.

코딩 문제의 원점수도 두 가지를 측정한다. 각 점수는 GRPO 대비 향상 폭의 평균을 SDPO 향상 폭의 평균으로 나눈 값이다.

  • 20,480회 반복 후의 LCB 성능이다. 기준 SDPO는 여기서 3.6pp 향상됐다. 논문 그림 1과 같은 설정이다.
  • 곡선 전체에서 평균을 낸 LCB 성능이다. 표본 효율의 향상 폭을 측정하며, 기준 SDPO는 6.8pp 향상됐다. 이 역시 논문 그림 1과 같은 설정이다.

두 영역의 점수를 평균하면 GRPO 기준 점수는 25%, SDPO는 약 100%다. 이를 앞서 논의한 SDPO 성능 대비 비율로 더 명확히 나타내기 위해 (x-25)/(100-25)로 재조정한다. 실제 평가에서는 실행마다 점수에 변동이 있으며, 점수 제한 때문에 SDPO를 다시 평가했을 때 중앙값은 100%보다 약간 낮다.