TL;DR

  • 카페 네 곳으로 이뤄진 체인의 장부를 받아 1년간 운영하는 Cafe Bench에서 GPT-6.1 Sol(중간 추론 노력)은 평균 수익 186,449달러로 2위를 기록했지만, Claude Opus 5.5에는 미치지 못함.
  • Claude Sonnet 5.5는 낮음·중간 추론 노력에서 GPT-6 Luna보다 수익과 비용 모두 뒤졌으며, 높은 추론 노력에서만 수익을 냄.
  • GPT-6.1 Sol은 추론 노력을 높여도 수익이 늘지 않았고, 높은 설정에서는 약 3시간 30분이 걸려 테스트 모델 중 가장 느림.
  • 파레토 프런티어는 GPT-6 Luna → GPT-6.1 Sol(낮음) → Opus 5.5로 이어지며, Sonnet 5.5는 Opus 5.5보다 비용이 높고 수익이 낮아 프런티어에서 제외됨.
  • 설정별 실행은 두 번이며, 시뮬레이션은 지난주와 동일해 이번 결과를 이전 게시물과 직접 비교할 수 있음.

Cafe Bench 결과

  • 지난주 공개한 Cafe Bench는 Dot이 4개 카페 체인의 장부를 받아 1년간 운영하고, 그 결과 더 벌어들인 수익을 점수로 삼는 벤치마크임.
  • OpenAI의 GPT-6.1 Sol과 Anthropic의 Claude Sonnet 5.5를 낮음·중간·높음의 추론 노력 설정으로 실행함.
  • GPT-6.1 Sol은 중간 설정에서 평균 186,449달러를 벌어 Opus 5.5 다음으로 높은 순위를 기록함.
  • Sonnet 5.5는 낮음·중간 설정 모두에서 GPT-6 Luna보다 수익이 낮고 비용은 높음.
  • 파레토 프런티어는 GPT-6 Luna, GPT-6.1 Sol(낮음), Opus 5.5 순으로 구성됨.

추론 노력과 실행 시간

  • GPT-6.1 Sol은 추론 노력을 높여도 수익이 늘지 않음. 우연한 결과일 가능성은 있지만, 여러 공개 벤치마크에서도 같은 양상이 나타남.
  • GPT-6.1 Sol의 높은 설정 실행은 약 3시간 30분이 걸렸으며, 테스트한 모델 중 가장 느린 실행임.
  • Sonnet 5.5는 중간에서 높은 추론 노력으로 바꿀 때 성능이 크게 상승하며, 수익을 낸 설정도 높음이 유일함.
  • 그럼에도 Sonnet 5.5는 Opus 5.5보다 비용이 높고 수익이 낮아 파레토 프런티어에 들지 못함.

전체 결과

  • 아래 순위표의 금액은 달러 기준이며, 연도 A·연도 B의 수익과 평균 수익, 비용, 실행 시간을 표시함.
  • Claude Opus 5.5(중간): 연도 A +$236,638, 연도 B +$216,454, 평균 +$226,546, 비용 $8.57, 시간 22분.
  • GPT-6.1 Sol(중간): 연도 A +$184,813, 연도 B +$188,084, 평균 +$186,449, 비용 $13.09, 시간 98분.
  • GPT-6.1 Sol(높음): 연도 A +$200,084, 연도 B +$148,113, 평균 +$174,098, 비용 $27.20, 시간 214분.
  • GPT-6 Astra(중간): 연도 A +$129,942, 연도 B +$184,064, 평균 +$157,003, 비용 $56.34, 시간 132분.
  • Claude Fable 5.1(중간): 연도 A +$75,072, 연도 B +$204,709, 평균 +$139,890, 비용 $12.81, 시간 27분.
  • GPT-6.1 Sol(낮음): 연도 A +$138,793, 연도 B +$73,347, 평균 +$106,070, 비용 $3.97, 시간 38분.
  • GPT-6 Sol(중간): 연도 A +$106,889, 연도 B +$90,213, 평균 +$98,551, 비용 $7.41, 시간 28분.
  • Claude Sonnet 5.5(높음): 연도 A −$17,574, 연도 B +$185,433, 평균 +$83,929, 비용 $15.65, 시간 40분.
  • GPT-6 Astra(낮음): 연도 A +$87,107, 연도 B +$63,128, 평균 +$75,117, 비용 $22.68, 시간 51분.
  • GPT-5.6 Sol(중간): 연도 A −$19,374, 연도 B −$73,116, 평균 −$46,245, 비용 $9.40, 시간 28분.
  • GPT-6 Luna(중간): 연도 A −$22,696, 연도 B −$98,103, 평균 −$60,400, 비용 $1.86, 시간 40분.
  • Claude Sonnet 5.5(중간): 연도 A −$271,768, 연도 B +$32,737, 평균 −$119,516, 비용 $3.38, 시간 12분.
  • Claude Sonnet 5.5(낮음): 연도 A +$4,934, 연도 B −$341,267, 평균 −$168,167, 비용 $2.17, 시간 9분.
  • GPT-5.6 Luna(중간): 연도 A −$226,377, 연도 B −$339,861, 평균 −$283,119, 비용 $1.11, 시간 10분.

결과 해석 시 유의점

  • 설정마다 실행 횟수는 두 번임. Sonnet 5.5의 두 연도 결과 차이가 큰 만큼 실행 횟수를 늘리면 순위가 크게 달라질 수 있음.
  • 시뮬레이션은 지난주와 동일하므로 각 행을 첫 게시물의 결과와 직접 비교할 수 있음.