TL;DR
- TasteVal은 고정된 AI 연구개발(AI R&D) 문제에서 모델이 실험을 설계하고 결과를 해석하는 능력을 인간 전문가와 비교하는 벤치마크임.
- 실험 연구 감각을 같은 점수에 도달하는 데 필요한 실험 연산량으로 정의하며, 8개 과제에서 코딩 능력과 분리해 평가함.
- 프런티어 모델의 실험 연구 감각은 2025년 12월 이후 3.0개월마다 두 배로 향상됐으며, 최고 모델 Opus 5.5는 인간 기준선보다 2.30배 높은 성능을 기록함.
- 측정된 향상 속도를 단순 외삽하면 인공 초지능 도달 시점의 중앙값은 2030년 중반에서 2028년 말로 앞당겨짐.
- 과제가 빠르고 저렴하게 검증되고 인간 기준선에 최고 수준의 연구자가 포함되지 않아 향상 속도를 과대평가할 수 있는 한편, 모델별 평가 횟수가 제한돼 과소평가할 수도 있음.
TasteVal 소개
- Ollie Jaffe와 Dane Sherburn이 TasteVal을 소개함. 논문은 arXiv에서 확인 가능함.
- 연구 감각은 해결할 만한 흥미로운 문제를 고르고, 실험을 설계하며, 실험 결과를 해석하는 능력으로 정의됨.
- TasteVal은 연구 감각 가운데 실험 요소를 측정함. 고정된 연구 문제를 주고 모델이 실험을 반복적으로 설계하고 결과에서 결론을 도출하는 수준을 평가함.
- AI Futures Model에서는 코딩 자동화 이후 실험 연산량이 주요 병목이 되므로, 초지능 도달 시점은 연구 감각이 향상되는 속도에 주로 좌우됨.
평가 설정
- 고정된 AI 연구개발 문제에서 모델의 실험 설계와 결과 해석 능력을 측정함. 실험 연구 감각은 특정 점수에 도달하는 데 필요한 실험 연산량을 인간 전문가와 비교한 연산 효율로 조작적으로 정의함.
- 모델이 전문가 점수에 실험 연산량 절반만으로 도달하면 전문가의 두 배 실험 연구 감각을 보유한 것으로 간주함. 이 정의에서 모델의 실험 연구 감각을 두 배로 높이는 효과는 실험에 쓸 수 있는 연산량을 두 배로 늘리는 효과와 같음.
- 벤치마크는 프런티어 AI 연구개발을 대표하는 새로운 과제 8개로 구성됨. 사전 학습 데이터 선별, 언어 모델의 사전 학습과 미세 조정, 선호도 모델링, 적대적 프롬프트에 대한 견고성을 다룸.
- 코딩 능력과 연구 감각을 분리하기 위해 평가 대상 모델은 실험 설계와 결과 해석만 수행하고, 고정된 코딩 에이전트가 실험을 구현하고 단일 H100에서 실행함.
- 평가 대상 모델이 GPU 연산 40시간을 사용하거나 벽시계 시간 120시간이 지나면 실행을 종료함.
- 인간 기준선은 각 과제에서 가장 뛰어난 전문가 시도 결과임. 최근 OpenAI, Google DeepMind, NVIDIA, Microsoft Research 등의 조직에서 근무한 전문가 24명이 참여했으며, 과제당 최소 두 명이 포함됨.
결과
- 프런티어 모델의 실험 연구 감각은 2025년 12월 이후 3.0개월마다 두 배로 향상됨. 95% 신뢰구간은 1.7~5.0개월임.
- 최고 모델인 Opus 5.5는 연산량 배수 2.30배로 인간 기준선을 유의하게 넘어섬. 95% 신뢰구간은 1.15~4.37배이며, 시도당 비용은 전문가 기준선 참여자의 평균 비용 중 약 1/30임.
- 예측이 아닌 단순 외삽으로, 일반 능력 단위당 연구 감각이 측정된 속도로 계속 향상된다고 가정하면 AI Futures Project의 AI Futures Model에서 연구 감각만으로 발생하는 특이점의 확률은 51%에서 88%로 높아짐.
- 같은 가정 아래 인공 초지능 도달 시점의 중앙값은 2030년 중반에서 2028년 말로 이동하며, 2030년 전 초지능 도달 확률은 46%에서 69%로 높아짐.
한계
- 과제가 빠르고 저렴하게 검증 가능해 연구 감각 향상 속도를 과대평가할 수 있음. 프런티어 연구소가 이런 과제에서 성능을 반복적으로 끌어올리기 가장 쉽기 때문임.
- 인간 기준선에 최고 연구자가 포함되지 않아 전 세계 최고 연구자의 능력을 상당히 과소평가할 수 있음.
- TasteVal은 어떤 문제가 가장 성과를 낼지 선택하는 모델의 능력을 측정하지 않음.
- 반대로 연구 감각 향상 속도를 과소평가할 가능성도 있음. 각 모델에 대한 평가 횟수가 제한적이었으며, 최고 모델의 시도당 비용은 인간 전문가 평가 비용의 약 1/30에 그침.
인용 정보
- 인용 정보: Jaffe, Oliver 및 Sherburn, Dane, 「TasteVal: Measuring the Experimental Research Taste of AI Systems Against Human Experts」, arXiv 사전 공개 논문 arXiv:2610.06824, 2026년 10월. URL: https://arxiv.org/abs/2610.06824
- 문의 이메일: hello@pzeroresearch.com
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요