TL;DR

  • 유출된 벤치마크에서 Gemini 4 Pro가 소프트웨어 엔지니어링, 터미널 실행, 데스크톱 조작 평가에서 경쟁 모델을 앞서는 것으로 나타나 Google의 성능 선두 복귀 가능성이 부상함.
  • DeepSWE v1.1 88.7점, Terminal-Bench 2.1 95.3점, OSWorld 2.0 86.8점으로 각각 Claude Opus 5.5와 GPT-6 Astra를 앞서는 수치임.
  • GDPval-AA Elo 2,064점, 200만 토큰 문맥 창과 백만 토큰당 입력 2.25달러, 출력 11.25달러가 유출 사양으로 제시됨.
  • 익명의 체크포인트가 초기 비공개 시험에서 gemini-3.8-flash라는 이름으로 관측됐으며, 개발자들은 웹 프로토타이핑과 실시간 UI 생성 등을 시험했다는 보고임.
  • 공식 문서와 공개 검증 데이터가 나오기 전까지 유출 수치는 예비 정보이며, 표준 시험에 맞춘 최적화 가능성도 고려해야 한다는 신중론임.

유출된 벤치마크 수치

  • 유출된 성능표는 Gemini 4 Pro를 Anthropic의 Claude Opus 5.5, OpenAI의 GPT-6 Astra와 비교하며 코딩, 시스템 탐색, 일반 추론 평가에서 Gemini 4 Pro의 우위를 제시함.
  • 주요 벤치마크 및 사양 비교는 다음과 같음.
  • DeepSWE v1.1: Gemini 4 Pro 88.7, Claude Opus 5.5 74.2, GPT-6 Astra 74.1.
  • Terminal-Bench 2.1: Gemini 4 Pro 95.3, Claude Opus 5.5 약 88, GPT-6 Astra 약 88.
  • OSWorld 2.0: Gemini 4 Pro 86.8, Claude Opus 5.5 81.8(부분 결과), GPT-6 Astra 72.6(오프라인 부분 결과).
  • GDPval-AA: Gemini 4 Pro 2,064점(v2), Claude Opus 5.5 1,846점(v2.1), GPT-6 Astra 1,542점(v2.1).
  • 문맥 창: Gemini 4 Pro 200만 토큰, Claude Opus 5.5 100만 토큰, GPT-6 Astra 110만 토큰.
  • 토큰 100만 개당 가격: Gemini 4 Pro 입력 2.25달러, 출력 11.25달러; Claude Opus 5.5 입력 4달러, 출력 20달러; GPT-6 Astra 입력 10달러, 출력 50달러.
  • 에이전트형 소프트웨어 작업에서 Gemini 4 Pro는 DeepSWE v1.1 88.7점으로 Opus 5.5와 GPT-6 Astra를 거의 14점 차이로 앞섬.
  • 명령줄 인터페이스(CLI) 실행 평가인 Terminal-Bench 2.1에서는 95.3점을 기록했으며, 터미널 명령 생성 성능을 측정하는 수치임.
  • 운영체제 탐색과 데스크톱 상호작용을 평가하는 OSWorld 2.0에서는 86.8점으로 가장 가까운 경쟁 모델보다 5%포인트 높은 수치임.
  • 일반 지식과 복합 추론을 다루는 GDPval-AA에서는 Elo 2,064점이 제시되며, 여러 분야에 걸친 문제 해결 역량을 나타내는 지표임.

대규모 문맥 창과 API 가격

  • 벤치마크 점수 외에도 유출 정보는 API 가격을 입력 토큰 100만 개당 2.25달러, 출력 토큰 100만 개당 11.25달러로 제시함.
  • 비교 대상 가격은 GPT-6 Astra가 입력·출력 기준 10달러·50달러, Claude Opus 5.5가 4달러·20달러임. 유출된 가격이 실제로 적용된다면 더 낮은 운영 비용으로 높은 성능을 제공하는 구도임.
  • 경쟁 모델의 두 배에 가까운 200만 토큰 문맥 창은 대규모 코드베이스, 긴 문서 분석, 연속적인 다중 턴 에이전트 실행을 처리할 수 있는 사양으로 제시됨.

개발자 기대와 업계의 신중론

  • 유출 지표는 최근 주요 모델 출시 이후 Google DeepMind의 대응으로 보는 개발자들 사이에서 큰 기대를 일으킴.
  • 유출된 엔드포인트를 시험한 초기 사용자들은 웹 프로토타이핑, 절차적 시각 디자인, 실시간 사용자 인터페이스(UI) 생성에서 원활한 실행을 보고함.
  • 연구자들은 균형 잡힌 관점을 유지해야 한다고 제안함. 유출된 점수표는 실제 개발자 작업 흐름보다 표준화 시험 성능에 맞춰 모델을 조정하는 이른바 ‘벤치맥싱(benchmaxxing)’을 반영할 수 있음.
  • Google의 공식 문서와 공개 검증 데이터가 나오기 전까지 수치는 예비 정보로 취급해야 함.

더 넓은 AI 업계 동향

  • 이번 유출은 OpenAI의 DevDay를 앞둔 업계의 분주한 시점에 등장함.
  • 개발자들은 산업 장비와 전기 절연체의 미세 결함 감지 같은 시각 작업을 다룬 OpenAI의 GPT-6 비전 기능 업데이트도 분석하고 있음.
  • Google DeepMind가 공식 출시에서 유출 사양을 제공한다면, 벤치마크 성능과 넓은 문맥 길이, 낮은 API 가격의 조합이 경쟁사에 성능 목표와 가격 전략의 재검토를 요구할 가능성이 있음.