TL;DR

  • Anthropic의 Claude Sonnet 5.5는 최대 추론 강도에서 Artificial Analysis Intelligence Index 56점을 기록해 Opus 5.5에 2점 뒤처지지만, 작업당 출력 토큰 사용량은 측정된 모델 중 가장 많고 작업당 비용은 7.60달러임.
  • Sonnet 5보다 Intelligence Index 점수가 18점 상승해 2위에 올랐으며, Terminal-Bench 4.0에서는 64%로 Opus 5.5와 GPT-6 Astra의 60%를 앞섬.
  • AA-Briefcase, GDPval-AA, AutomationBench-AA에서는 Opus 5.5와 대등한 성능을 보였지만, 이를 달성하는 데 훨씬 많은 토큰을 사용함.
  • 최대 추론 강도에서 작업당 출력 토큰은 약 19만 3,000개로 Opus 5.5 및 Sonnet 5보다 약 60%, GPT-6 Astra보다 약 7배 많음.
  • 입력·출력 토큰 가격은 백만 토큰당 2달러·10달러로 Sonnet 5와 같고 GPT-6 Sol과도 일치하지만, 비용 대비 성능에서는 대부분의 설정이 Pareto 전선에 들지 못함.

출시 및 주요 평가

  • Anthropic이 Claude Sonnet 5.5를 출시했으며, Artificial Analysis Intelligence Index에서 56점을 기록함. 이는 최대 추론 강도의 Opus 5.5보다 2점 낮은 점수임.
  • 최대 추론 강도에서 Sonnet 5보다 18점 상승해 Intelligence Index 2위에 올랐으며, 1위는 Opus 5.5임.
  • Terminal-Bench 4.0에서 64%를 기록해 Opus 5.5와 GPT-6 Astra의 60%를 웃돎. Sonnet 5 최대 추론 강도보다 50%포인트 높은 점수임.
  • 실제 과학 연구 워크플로를 수행하는 에이전트형 터미널 사용 벤치마크인 Terminal-Bench-Science에서 53%를 기록해 GPT-6 Astra와 Opus 5.5 다음 순위임. 이 평가는 Artificial Analysis Intelligence Index에 포함되지 않음.
  • 지식 업무와 에이전트형 작업 평가에서 Opus 5.5와 대등한 성과를 보임.
  • AA-Briefcase: Sonnet 5.5 1811 Elo, Opus 5.5 1822 Elo임.
  • GDPval-AA: Sonnet 5.5 1844 Elo, Opus 5.5 1846 Elo임.
  • AutomationBench-AA: Sonnet 5.5 71%, Opus 5.5 70%임.
  • 해당 평가에서 Opus 5.5와 대등한 성능을 내는 데 Sonnet 5.5가 훨씬 많은 토큰을 사용함.

토큰 사용량과 비용 효율

  • 최대 추론 강도의 Sonnet 5.5는 Intelligence Index 작업당 약 19만 3,000개의 출력 토큰을 사용함. 측정된 모델 중 가장 많은 양이며, Opus 5.5와 Sonnet 5의 최대 추론 강도보다 약 60%, GPT-6 Astra 최대 추론 강도보다 약 7배 많음.
  • Sonnet 5.5의 토큰 가격은 Sonnet 5와 동일한 백만 토큰당 입력 2달러, 출력 10달러임. 캐시 입력 가격을 포함한 상세 가격은 캐시 입력 0.2달러, 입력 2달러, 출력 10달러임.
  • 작업당 비용은 7.60달러로, Sonnet 5보다 약 50% 높음.
  • 지능 점수와 작업당 비용을 비교하면 Sonnet 5.5는 Pareto 전선 밖에 위치함. 높은 추론 강도 설정에서는 Opus 5.5보다 뒤처지고, 낮은 설정에서는 GPT-6 Astra 또는 Sol 설정이 더 낮은 비용으로 동등한 성능을 제공함.
  • 높은 추론 강도 설정은 비교적 경쟁력이 가장 높으며, 사실상 같은 작업당 비용으로 GPT-6 Sol보다 지능 점수가 아주 근소하게 낮음.
  • 낮음·중간·높음 추론 강도 설정은 지능 점수와 작업당 출력 토큰 사이의 더 넓은 절충 범위를 형성하지만, 이 구간에서는 GPT-6 Sol의 높음·초고강도·최대 설정이 더 적은 출력 토큰으로 높은 성능을 제공함.

사실 지식과 과학 추론

  • 더 작은 모델 계열인 Sonnet 5.5는 AA-Omniscience의 사실 지식 평가에서 Opus 5.5에 뒤처짐.
  • 사실 정확도는 Sonnet 5.5 54%, Opus 5.5 66%이며, 환각률은 각각 47%, 59%임.
  • Humanity's Last Exam과 SciCode에서도 Opus 5.5보다 약 6점 낮은 점수를 기록함.

평가 조건과 모델 세부 정보

  • 평가는 출시 전 Claude Sonnet 5.5 배포판으로 수행됨. Anthropic은 구조화된 출력(structured outputs)을 사용하는 요청의 응답 품질을 저하시킬 수 있는 버그를 확인했으며, 공개 출시판에서는 수정됨.
  • Anthropic은 수정 사항으로 인한 성능 변화가 미미하거나 기존 평가 성능이 다소 낮게 측정됐을 것으로 예상함. 관련 평가는 추후 다시 진행할 예정임.
  • 컨텍스트 윈도는 이미지·텍스트 입력을 포함해 100만 토큰이며 Sonnet 5와 동일함.
  • 가격은 Sonnet 5의 최신 가격과 동일하게 입력·출력 백만 토큰당 각각 2달러·10달러임. 캐시 쓰기는 2.5달러, 캐시 읽기는 0.2달러임.
  • 추론 강도 설정은 낮음, 중간, 높음, 초고강도, 최대의 5단계임. Intelligence Index 평가는 Anthropic 기본 대체 설정을 켠 상태에서 모든 단계로 수행됨.
  • Intelligence Index 작업의 약 0.1%에서 Sonnet 5.5가 대체 설정으로 전환됐으며, 주로 Terminal-Bench 4.0에서 발생했고 모든 경우 Sonnet 5로 전환됨.
  • Claude Sonnet 5.5와 다른 주요 모델 비교: https://artificialanalysis.ai/models/releases/claude-sonnet-5-5