TL;DR

  • 프런티어 모델의 실험적 연구 역량을 평가하는 TasteVal에서 최고 성능 모델 Opus 5.5가 인간 전문가 기준선을 넘어 2.3배 컴퓨트 효율을 기록함.
  • 연구 취향은 문제를 정하고 실험을 설계·해석하는 능력으로 정의되며, 이 벤치마크는 그중 고정된 문제에서 실험을 반복하고 결과를 추론하는 역량을 측정함.
  • 8개의 개방형 과제를 사용하고, 코딩 능력과 실험 설계 능력을 분리하기 위해 평가 대상 모델은 연구자 역할을, 고정된 코더 에이전트는 구현 역할을 맡음.
  • 2025년 12월 이후 프런티어 모델의 컴퓨트 배율은 약 3개월마다 두 배가 됐지만, 최종 정규화 성능의 두 배 증가 주기는 14.6개월로 추정됨.
  • 벤치마크 오염 방지를 위해 과제는 공개하지 않으며, Opus 5.5의 실행 비용은 기준선 전문가들의 평균 실행 비용의 약 1/30임.

TasteVal: 실험적 연구 취향 평가

  • Oliver Jaffe와 Dane Sherburn은 프런티어 모델의 실험적 연구 취향을 평가하는 벤치마크 TasteVal을 소개함.
  • 연구 취향은 해결할 만한 흥미로운 문제를 선택하고, 실험을 설계하며, 실험 결과를 해석하는 능력으로 정의됨.
  • TasteVal은 연구 취향 가운데 실험적 요소를 측정함. 고정된 연구 문제를 제시하고, 모델이 실험을 반복적으로 설계하고 결과에서 결론을 도출하는 능력을 평가함.
  • 실험적 연구 취향은 컴퓨트 효율로 구체화됨. 전문가 인간과 같은 점수에 절반의 직렬 실험 컴퓨트를 사용해 도달하는 연구자는 실험 취향이 두 배인 것으로 간주됨.
  • 따라서 실험 취향은 실험 컴퓨트의 배율로 작용하며, AI 발전 전망을 예측하는 핵심 입력값임.

평가 방식과 과제

  • TasteVal은 프런티어 AI 연구개발(R&D)을 대표하는 새롭고 도전적인 개방형 과제 8개로 구성됨.
  • 코딩 능력과 연구 취향을 분리하기 위해 평가 대상 모델은 반복적으로 실험을 설계하는 연구자(Researcher) 역할을 수행하고, 고정된 코더(Coder) 에이전트가 실험을 구현하고 결과를 보고함.
  • 연구자는 H100 컴퓨트 40시간 또는 벽시계 시간 120시간 예산이 소진될 때까지 실험을 수행함.
  • 과제별로 최소 2명씩, 총 인간 전문가 24명을 모집하고 각 과제에서 가장 좋은 전문가 시도를 기준선으로 삼음.
  • 2023~2026년에 출시된 모델 20개를 평가함.

성능과 추세

  • 최고 성능 모델인 Opus 5.5는 전문가 기준선을 넘어섰으며, 컴퓨트 배율은 2.3배임(95% 신뢰구간 1.15~4.37).
  • Opus 5.5의 실행당 비용은 기준선 전문가들의 평균 실행 비용의 약 1/30임.
  • TasteVal에서 프런티어 모델의 컴퓨트 배율은 2025년 12월 이후 약 3.0개월마다 두 배가 됨(95% 신뢰구간 1.7~5.0개월). 이는 2023년부터 2025년 12월까지의 14개월 주기보다 빨라진 수치임.
  • 최종 정규화 성능으로 측정하면 프런티어 모델의 추세 변화는 나타나지 않으며, 두 배 증가 주기는 14.6개월임.
  • 벤치마크 오염을 방지하기 위해 TasteVal 과제는 공개하지 않음.

논문 정보

  • 논문 제목: *TasteVal: Measuring the Experimental Research Taste of AI Systems Against Human Experts*
  • 저자: Oliver Jaffe, Dane Sherburn
  • 제출일: 2026년 10월 5일
  • 분류: 인공지능(cs.AI)
  • 인용: arXiv:2610.06824
  • DOI: https://doi.org/10.48550/arXiv.2610.06824