TL;DR

  • 37signals의 칸반 앱 Fizzy에서 제품 담당자가 작성하는 방식의 기능 규모 티켓 20개를 평가한 결과, GPT-6 Astramax가 성공 실행 비율 53.3%로 가장 높은 정확도를 기록함.
  • 비교 항목은 모델별 정확도, 실행 속도, 실행당 평균 토큰 수, 실행당 평균 비용임.
  • 정확도 2위는 GPT-6 Astramedium의 35.0%이며, 중앙값 실행 시간은 9분 11초, 실행당 평균 비용은 $2.51임.
  • 가장 빠른 모델은 GPT-5.6 Lunamedium으로 중앙값 실행 시간이 3분 19초이며, 정확도는 0.0%임.
  • 평가는 2026년 9월에 모델별 티켓을 반복 실행하는 방식으로 진행됐으며, 모델 간 정확도 차이가 몇 퍼센트포인트에 불과하면 실행 간 변동 범위일 수 있음.

모델별 지표

  • Fizzy의 기능 규모 티켓 20개는 제품 담당자가 티켓을 작성하는 방식으로 구성됨. 모델별 정확도는 성공 실행 비율이며, 속도는 중앙값, 토큰과 비용은 실행당 평균임.
  • GPT-6 Astramax — 정확도 53.3%, 속도 23분 55초, 토큰 128,900개, 비용 $6.63.
  • GPT-6 Astramedium — 정확도 35.0%, 속도 9분 11초, 토큰 58,000개, 비용 $2.51.
  • Claude Opus 5.5medium — 정확도 33.3%, 속도 11분 25초, 토큰 110,900개, 비용 $2.78.
  • Claude Fable 5.1high — 정확도 31.7%, 속도 23분 25초, 토큰 177,000개, 비용 $9.14.
  • Claude Fable 5.1max — 정확도 31.7%, 속도 45분 21초, 토큰 314,700개, 비용 $19.1.
  • Claude Opus 5max — 정확도 31.7%, 속도 33분 9초, 토큰 268,900개, 비용 $15.0.
  • Grok 4.7high — 정확도 31.7%, 속도 21분 48초, 토큰 180,600개, 비용 $5.95.
  • GPT-5.6 Solmax — 정확도 28.3%, 속도 29분 39초, 토큰 207,900개, 비용 $3.68.
  • Gemini 3.8 Flashmedium — 정확도 28.3%, 속도 26분 31초, 토큰 203,000개, 비용 $2.92.
  • GPT-5.6 Lunamax — 정확도 26.7%, 속도 18분 42초, 토큰 212,300개, 비용 $0.491.
  • Claude Opus 5high — 정확도 25.0%, 속도 24분 5초, 토큰 186,800개, 비용 $9.85.
  • Gemini 3.8 Flashhigh — 정확도 23.3%, 속도 24분 41초, 토큰 224,900개, 비용 $3.19.
  • GPT-6 Solmedium — 정확도 21.7%, 속도 5분 26초, 토큰 47,800개, 비용 $0.453.
  • Muse Spark 1.3max — 정확도 20.0%, 속도 20분 1초, 토큰 213,700개, 비용 $13.0.
  • GPT-5.6 Solmedium — 정확도 18.3%, 속도 10분 33초, 토큰 71,300개, 비용 $0.753.
  • GPT-6 Lunamax — 정확도 18.3%, 속도 19분 53초, 토큰 213,100개, 비용 $0.191.
  • DeepSeek 4.1 Flashmax — 정확도 16.7%, 속도 39분 17초, 토큰 332,200개, 비용 $0.548.
  • Grok 4.6xhigh — 정확도 16.7%, 속도 24분 10초, 토큰 169,000개, 비용 $6.58.
  • GLM 5.3 Flashmax — 정확도 15.0%, 속도 53분 28초, 토큰 184,600개, 비용 $0.313.
  • Grok 4.6high — 정확도 15.0%, 속도 17분, 토큰 129,200개, 비용 $4.23.
  • Kimi K3max — 정확도 13.3%, 속도 70분 7초, 토큰 150,700개, 비용 $5.16.
  • DeepSeek 4.1 Flashhigh — 정확도 11.7%, 속도 27분 22초, 토큰 233,400개, 비용 $0.39.
  • GPT-6 Lunamedium — 정확도 11.7%, 속도 7분 10초, 토큰 80,100개, 비용 $0.053.
  • Muse Spark 1.3medium — 정확도 10.0%, 속도 11분 32초, 토큰 135,900개, 비용 $2.63.
  • GPT-5.6 Lunamedium — 정확도 0.0%, 속도 3분 19초, 토큰 35,400개, 비용 $0.028.

정확도와 토큰 효율성

  • 정확도와 토큰 효율성 그래프에서 강한 모델은 오른쪽 위쪽에 위치함.
  • 정확도는 높을수록 좋고, 실행당 평균 토큰 수는 적을수록 좋음. 그래프에서 오른쪽으로 갈수록 토큰 사용량이 적고 정확도가 높을수록 위쪽에 표시됨.
  • 비용, 속도, 토큰 지표도 모델별로 비교할 수 있으며, 모델이나 결과를 선택하면 해당 평가의 세부 정보를 확인할 수 있음.

방법론

  • 각 모델은 2026년 9월에 모든 티켓을 세 차례 실행했으며, 제공업체 기본 추론 노력(effort) 설정과 제공업체가 제공하는 최고 노력 설정에서도 각각 평가됨.
  • 모델과 노력 설정별 실행 횟수는 60회이며, 실행별 제한은 90분, 400단계, $60임.
  • 정확도는 앱 자체 테스트와 티켓의 숨겨진 검사 항목을 모두 통과한 실행의 비율임. 모델 간 정확도 차이가 몇 퍼센트포인트라면 실행 간 변동 범위에 해당할 수 있음.
  • 속도는 실행 시간의 중앙값이며, 토큰과 비용은 실행당 평균임.
  • 오픈 소스 Rails AI 평가 도구 모음을 살펴볼 수 있음.