TL;DR
- Nerftracker는 모든 모델에 같은 코딩 과제를 정기적으로 제공하고 결과가 나빠지는 시점을 추적해 알리는 서비스임.
- 비교 과제는 자체 물리 엔진을 갖춘 앵그리버드 스타일 새총 게임을 만들어 데스크톱과 휴대전화에서 실행하는 것임.
- 과제 점검 항목은 서 있는 탑, 명중, 재료, 폭탄 새, 1단계와 조준, 다듬기, 검사임.
- 결과 화면에서 기본 정렬, 시간, API 비용, 입력 토큰, 출력 토큰을 확인하고 데스크톱·휴대전화 실행 및 에이전트 세션을 재생할 수 있음.
- 비교 대상으로 Fable 5.1, GPT-6 Astra, Opus 5.5, Sonnet 5.5, Grok 4.7, Sonnet 5, GPT-6 Sol, Grok 4.6, Haiku 4.5, GPT-6 Luna가 나열됨.
Nerftracker의 모델 비교 과제
- 모든 모델에 같은 코딩 과제를 정기적으로 제공하고, 작업 결과가 나빠지는지 추적해 성능 저하가 발생하면 알리는 방식임.
- 과제는 자체 물리 엔진을 갖춘 앵그리버드 스타일 새총 게임을 제작하는 것이며, 데스크톱과 휴대전화에서 플레이할 수 있어야 함.
- 게임의 점검 항목은 서 있는 탑, 명중, 재료, 폭탄 새, 1단계와 조준, 다듬기, 검사임.
모델 실행 결과
- 화면에서 기본 정렬을 선택하고 시간, API 비용, 입력 토큰, 출력 토큰을 확인할 수 있으며, 데스크톱·휴대전화 결과와 에이전트 세션을 재생할 수 있음.
- Fable 5.1 — Claude Code 2.1.28,
354,min,high,effort,3.5Min,160Kout, API 비용$11.26. - GPT-6 Astra — Codex CLI 0.15,
7.0,24,min,high,effort,1.4Min,43Kout, API 비용$4.08. - Opus 5.5 — Claude Code 2.1.28,
332,min,high,effort,12Min,170Kout, API 비용$6.95. - Sonnet 5.5 — Claude Code 2.1.28,
456,min,high,effort,31Min,290Kout, API 비용$9.97. - Grok 4.7 — Grok Build 1.0.4,
11 h,2,min,high,effort,8.9Min,250Kout, API 비용$6.40. - Sonnet 5 — Claude Code 2.1.28,
346,min,high,effort,22Min,220Kout, API 비용$7.11. - GPT-6 Sol — Codex CLI 0.15,
7.0,18,min,high,effort,3Min,48Kout, API 비용$1.22. - Grok 4.6 — Grok Build 1.0.4,
135,min,high,effort,3.6Min,120Kout, API 비용$2.93. - Haiku 4.5 — Claude Code 2.1.28,
310,min,high,effort,9.3Min,59Kout, API 비용$1.33. - GPT-6 Luna — Codex CLI 0.15,
7.0,12,min,high,effort,1Min,38Kout, API 비용$0.03.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요