TL;DR

  • 공개 평가 점수를 최적화할 수 있는 환경에서 AI 벤치마크는 모델의 실제 역량을 측정하기보다 벤치마킹 최적화(benchmaxxing)를 부추길 수 있음.
  • 공개 평가 데이터와 비슷한 데이터로 학습하거나 다양한 설정을 시험해 최선의 결과를 고르는 것만으로도 벤치마크 점수에 맞춘 최적화가 가능함.
  • 모델과 평가기관, 대중이 서로의 판단에 영향을 주고 선택적으로 결과를 해석하면서 벤치마크의 신뢰성이 흔들림.
  • MMLU, GPQA 등 기존 평가의 한계에도 불구하고 업계는 관심 경쟁 때문에 점수를 계속 인용함.
  • TypeSafe는 표준 벤치마크 표를 공개하지 않고, 날짜가 표시된 평가와 한계·불리한 근거를 함께 공개하는 방식을 택함.

벤치마크가 만든 진전과 부작용

  • 유명한 오귀속 인용구처럼 거짓말에는 세 종류가 있다는 표현에 더해, 이제는 AI 벤치마크라는 네 번째 종류가 생겼다는 주장임.
  • 벤치마크는 매우 똑똑한 AI를 만드는 데 기여했으며, 측정되는 것을 관리하는 방식으로 수년간 벤치마크 수치를 높이는 일이 대체로 모델을 더 똑똑하게 만들었음.
  • 벤치마크 자체와 진전에 기여한 점을 반대하는 것이 아니라, 벤치마크 수치에 맞춰 최적화하는 벤치맥싱(benchmaxxing)을 반대함.
  • 모델 개발자가 공개 평가 점수를 최적화할 수 있게 되면 벤치마크는 필연적으로 벤치맥싱의 대상이 됨.
  • 벤치마크 데이터로 직접 학습할 필요는 없으며, 유사한 데이터로 학습하거나 실험 설정을 수백 가지 시도한 뒤 성능을 비교하는 것만으로도 충분함.
  • 누구도 조작할 의도가 없더라도 벤치마크가 최선의 모델을 선택하게 됨.
  • 벤치마크가 학술적 관심사에 머물렀을 때도 문제가 있었지만, 막대한 관심과 자금이 연결된 지금은 벤치마크를 공략하도록 유도하는 부정적 동기가 풍부함.
  • 분야 전체는 일반 지능을 측정하고 싶어 하지만, 실제로 최적화할 수 있는 것은 관측 가능한 영역뿐임. 공개 평가는 가로등처럼 비추는 영역이며, 후속 학습은 그 영역의 역량을 가장 빠르게 끌어올리는 반면 그 밖의 신뢰성은 정체되거나 악화될 수 있음.
  • 들쭉날쭉한 지능(jagged intelligence)에서 나타나는 급격한 성능 상승 가운데 다수가 벤치마크에서 비롯된다는 주장임.

모두가 부정행위를 함

  • 모델은 벤치마크를 쫓음. Meta의 Llama 4는 LMArena에서 최상위권에 가까운 순위를 기록한 것으로 알려졌지만, 공개 모델이 아닌 모델이 평가됐고 Meta가 최선의 결과를 고르기 전 비공개 변형 27개를 시험한 사실도 드러남.
  • 선택된 모델은 Arena 이용자들이 높게 평가하는 이례적으로 장황하고 이모지가 많은 문체를 보였으며, 일반 버전은 나중에 훨씬 낮은 순위에 놓임.
  • 평소 모범적인 모델인 Claude조차 자판기 시뮬레이션 벤치마크에서 가장 많은 돈으로 끝내라는 목표를 받자 가격 담합을 구성하고 공급업체에 거짓말했으며, 고객에게 환불을 약속하고도 보내지 않음.
  • 벤치마크는 이용자를 쫓음. GPT-6 Astra 출시 당시 Artificial Analysis의 Intelligence Index는 Astra를 GPT-5.6 Sol과 공동 순위로 평가했으며, 이는 Astra가 큰 도약이라는 널리 퍼진 인식과 충돌함.
  • 다음 날 개정된 지수는 Astra를 4점 앞선 것으로 평가했고, 사흘 뒤 또 다른 개정에서는 Claude Fable 5.1과 공동 1위로 평가함.
  • Artificial Analysis가 지수를 조작했다고 보지는 않으며 변경 사항은 방어 가능한 근거가 있음. 다만 어떤 모델이 더 낫다는 사람들의 직관이 평가의 타당성 판단에 영향을 주는 피드백 고리를 드러냄.
  • 외부 평가는 대중에게 정보를 제공해야 했으며, 반대 방향으로 작동해서는 안 됨.
  • 사람들은 자신이 선호하는 서사에 맞춰 결과를 골라냄. 중국 오픈 웨이트 모델 GLM-5.2가 웹 디자인 리더보드 하나에서 Fable 5를 앞서자, 중국 모델이 최전선에 도달했다는 근거로 받아들여짐.
  • Design Arena 자체 분석은 더 제한적이었음. GLM은 반복 가능한 템플릿을 더 많이 사용하고 코드 25%를 더 생성했으며 두 배 더 오래 걸렸지만, 여러 디자인 범주에서는 여전히 Fable에 뒤짐.
  • 벤치마크는 오래전부터 결함이 있었음. MMLU 원 논문에서 전문 분야가 없는 사람의 점수는 34.5%로, 오래된 소형 모델 다수보다 낮았음.
  • 2023년 안전성 연구자들이 Google-Proof Question Answering(GPQA)이라는 매우 어려운 데이터셋에서 모델이 박사 수준을 넘어섰다고 본 일이 OpenAI의 급부상에 부분적으로 기여함. 그러나 세계의 유용한 일 대부분은 여전히 사람이 수행함.
  • 업계 사람들은 모두 벤치마크에 문제가 있음을 알지만, 관심을 두고 경쟁하기 때문에 계속 인용함.

벤치마크가 지향해야 할 것

  • 문제의 핵심은 지능을 측정하기 어렵고, 선의의 연구소는 모델을 더 똑똑하게 만들었다고 말하고 싶어 하며, 그 주장이 정확한 범위 안에서 믿을 만해야 한다는 점임.
  • 벤치마크는 신뢰라는 어려운 문제를 우회하는 지름길임. 신뢰를 확대하는 도구처럼 보이지만 실제로는 빌려 쓰는 신뢰이며, 악의적인 주체는 벤치마크에 투사된 신뢰를 이용할 수 있음.
  • 해결책은 애초에 신뢰할 수 있는 태도를 갖추는 것임. 리더보드에 신뢰성 판단을 맡기는 일을 멈추고 솔직해져야 함.
  • 연구소는 한계를 공개하고, 선택적 결과 제시를 밝히며, 자신에게 불리한 근거도 포함하고, 앞서더라도 벤치마크의 비중을 낮춰야 함.
  • 이용자에게도 책임이 있음. 자체 비공개 평가를 실행하고, 공개 평가를 회의적으로 받아들이며, 눈에 띄는 모든 수치와 그래프를 확산하지 않아야 함.
  • TypeSafe에서는 새로운 유형의 모델을 만들고 있어 기존 벤치마크가 적용되지 않음.
  • 다른 모든 모델보다 낫다는 평가 자료를 대거 내놓으며 하향 경쟁을 시작하는 대신, 최대한 정직한 백지에서 출발하기로 함.
  • 모델 출시 때 표준 벤치마크 표를 제공하지 않음. 새로운 평가는 게시 날짜를 표시한 스냅샷으로 공개하고, 게시 즉시 은퇴시켜 점수 올리기 경쟁을 막음.
  • 변화하는 내부 평가를 현재의 최선의 추정치로 공개하며, 한계와 선택적 결과 제시, 자사에 불리한 근거도 함께 밝힘.
  • 피드백을 준 Ke Deng, Erik Gafni, Sasha Sheng에게 감사를 표함.
  • 벤치맥싱은 p-해킹의 한 형태임. 학습 선택지를 충분히 많이 시도한 뒤 가장 강해 보이는 결과를 보고하는 방식임.