TL;DR

  • Nerftracker는 모든 모델에 같은 코딩 과제를 정기적으로 제공하고 결과가 나빠지는 시점을 추적해 알리는 서비스임.
  • 비교 과제는 자체 물리 엔진을 갖춘 앵그리버드 스타일 새총 게임을 만들어 데스크톱과 휴대전화에서 실행하는 것임.
  • 과제 점검 항목은 서 있는 탑, 명중, 재료, 폭탄 새, 1단계와 조준, 다듬기, 검사임.
  • 결과 화면에서 기본 정렬, 시간, API 비용, 입력 토큰, 출력 토큰을 확인하고 데스크톱·휴대전화 실행 및 에이전트 세션을 재생할 수 있음.
  • 비교 대상으로 Fable 5.1, GPT-6 Astra, Opus 5.5, Sonnet 5.5, Grok 4.7, Sonnet 5, GPT-6 Sol, Grok 4.6, Haiku 4.5, GPT-6 Luna가 나열됨.

Nerftracker의 모델 비교 과제

  • 모든 모델에 같은 코딩 과제를 정기적으로 제공하고, 작업 결과가 나빠지는지 추적해 성능 저하가 발생하면 알리는 방식임.
  • 과제는 자체 물리 엔진을 갖춘 앵그리버드 스타일 새총 게임을 제작하는 것이며, 데스크톱과 휴대전화에서 플레이할 수 있어야 함.
  • 게임의 점검 항목은 서 있는 탑, 명중, 재료, 폭탄 새, 1단계와 조준, 다듬기, 검사임.

모델 실행 결과

  • 화면에서 기본 정렬을 선택하고 시간, API 비용, 입력 토큰, 출력 토큰을 확인할 수 있으며, 데스크톱·휴대전화 결과와 에이전트 세션을 재생할 수 있음.
  • Fable 5.1 — Claude Code 2.1.28, 354, min, high, effort, 3.5Min, 160Kout, API 비용 $11.26.
  • GPT-6 Astra — Codex CLI 0.15, 7.0, 24, min, high, effort, 1.4Min, 43Kout, API 비용 $4.08.
  • Opus 5.5 — Claude Code 2.1.28, 332, min, high, effort, 12Min, 170Kout, API 비용 $6.95.
  • Sonnet 5.5 — Claude Code 2.1.28, 456, min, high, effort, 31Min, 290Kout, API 비용 $9.97.
  • Grok 4.7 — Grok Build 1.0.4, 11 h, 2, min, high, effort, 8.9Min, 250Kout, API 비용 $6.40.
  • Sonnet 5 — Claude Code 2.1.28, 346, min, high, effort, 22Min, 220Kout, API 비용 $7.11.
  • GPT-6 Sol — Codex CLI 0.15, 7.0, 18, min, high, effort, 3Min, 48Kout, API 비용 $1.22.
  • Grok 4.6 — Grok Build 1.0.4, 135, min, high, effort, 3.6Min, 120Kout, API 비용 $2.93.
  • Haiku 4.5 — Claude Code 2.1.28, 310, min, high, effort, 9.3Min, 59Kout, API 비용 $1.33.
  • GPT-6 Luna — Codex CLI 0.15, 7.0, 12, min, high, effort, 1Min, 38Kout, API 비용 $0.03.