TL;DR

  • GPT-6.1 Sol이 GPT-6 Sol 출시 7일 만에 이를 대체했으며, 지능 지수(Intelligence Index)에서 GPT-6 Astra보다 1점 낮으면서 작업당 비용은 4분의 1 미만임.
  • GPT-6.1 Sol은 GPT-6 Sol보다 지능 지수에서 4점, GPT-5.6 Sol보다 5점 높고, 여러 에이전트형 지식 작업 평가에서도 향상됨.
  • 최대 추론 강도에서 지능 지수 작업당 비용은 $0.72로 GPT-6 Astra의 $3.26보다 낮고, GPT-6 Sol보다 31%, GPT-5.6 Sol보다 64% 저렴함.
  • GPT-6.1 Sol은 GPT-6 Sol보다 추론 강도별 출력 토큰을 약 10~30% 더 사용하지만, 지능 점수 향상으로 낮음·중간 추론 강도에서 토큰 효율성 파레토 최적임.
  • 코딩 에이전트 지수(Coding Agent Index)에서 최대 추론 강도 기준 GPT-6 Sol보다 3점 높고, GPT-6 Astra보다 2점 낮음.

가격 및 주요 평가 결과

  • GPT-6.1 Sol은 GPT-6 Sol과 동일하게 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $10의 가격을 적용하며, 캐시 읽기 할인율은 90%에서 95%로 상승함.
  • 이에 따라 에이전트형 작업의 종합 평균 비용(blended price)은 GPT-6 Sol보다 소폭 낮음. GPT-6 Sol이 GPT-5.6 Sol보다 가격을 50% 인하한 데 이어 추가 가격 인하가 이뤄짐.
  • GPT-6.1 Sol은 GPT-6 Sol보다 지능 지수에서 4점, GPT-5.6 Sol보다 5점 향상해 GPT-6 Astra보다 1점 낮은 점수를 기록함.
  • 에이전트형 지식 작업에서 AA-Briefcase v1.1은 4점, GDPval-AA v2.1은 5점 향상됨.
  • 그 밖에 Terminal-Bench 4.0에서 12점, Humanity’s Last Exam에서 5점, GDP.pdf에서 6점 상승함.
  • AA-Omniscience Accuracy는 8점 상승했고, 환각률은 60%에서 54%로 하락함.

비용 효율성

  • 최대 추론 강도에서 지능 지수 작업당 비용은 GPT-6.1 Sol이 $0.72, GPT-6 Astra가 $3.26으로, GPT-6.1 Sol은 GPT-6 Astra 비용의 4분의 1 미만임.
  • 작업당 비용은 GPT-6 Sol의 $1.05보다 31%, GPT-5.6 Sol의 $1.99보다 64% 낮음.
  • GPT-6.1 Sol은 모든 추론 강도에서 비용 효율성 파레토 경계를 확장함. 같은 수준의 지능을 제공하는 더 저렴한 모델이 없음.

토큰 효율성

  • GPT-6.1 Sol은 모든 추론 강도에서 GPT-6 Sol보다 출력 토큰을 약 10~30% 더 사용함.
  • 지능 지수 점수가 높아진 결과, 낮음 및 중간 추론 강도의 GPT-6.1 Sol은 토큰 효율성 기준 파레토 최적임.

코딩 에이전트 지수

  • Artificial Analysis 코딩 에이전트 지수에서 최대 추론 강도 기준 GPT-6.1 Sol은 GPT-6 Sol보다 3점 높고, GPT-6 Astra보다 2점 낮음.