TL;DR

  • 같은 Codex 클라이언트와 바이트 단위로 동일한 입력을 사용한 비교에서 Luna 6 Medium의 평균 추론 토큰 사용량이 API는 96.30개, ChatGPT Pro 로그인은 3.025개로 약 32배 차이남.
  • 서점 과제에서 Luna 6와 Sol 6.1의 일부 설정은 API와 구독 로그인 사이에 큰 차이를 보였으며, 네 가지 차이는 원래 연구와 후속 연구 모두에서 다중 비교 보정을 통과함.
  • 토큰 수가 많다고 답변이 더 정확한 것은 아니며, 서점 의사 결정은 480건 모두 정답이었고 프로젝트 과제의 Luna Low 정확도 차이는 전체 자료에서는 보수적 보정을 통과했지만 후속 자료만으로는 통과하지 못함.
  • 두 과제와 두 모델의 설정별로 로그인 방식마다 40건씩, 총 960건의 응답을 수집했으며 별도의 후속 배치와 구독 경로 용량 실패도 기록함.
  • 차이의 원인은 아직 밝혀지지 않았으며, 고정 프롬프트 두 개와 API 인증 정보 하나, Pro 계정 하나를 사용한 비교이므로 독립적인 재현이 필요함.

확인된 결과

  • 예산 안에서 프로젝트를 고르는 과제와 서점의 중복 이메일을 진단하는 과제에서 Luna 6와 Sol 6.1을 각각 Low, Medium, High 사고 수준으로 시험함.
  • 과제·모델·사고 수준·로그인 방식의 각 조합마다 완료 응답 40건을 수집함. 최초 480건 뒤에 별도로 분석한 고정 후속 배치 480건을 더해 총 960건임.
  • 서점 과제에서 응답 하나당 보고된 평균 추론 토큰 수는 다음과 같음.
  • Luna 6, Low: API 키 68.550개, ChatGPT Pro 로그인 0.000개.
  • Luna 6, Medium: API 키 96.300개, ChatGPT Pro 로그인 3.025개.
  • Luna 6, High: API 키 148.525개, ChatGPT Pro 로그인 85.200개.
  • Sol 6.1, High: API 키 216.675개, ChatGPT Pro 로그인 138.700개.
  • 각 수치는 로그인 방식별 완료 응답 40건의 평균임. 이 네 가지 차이는 최초 연구와 후속 연구 모두에서 다중 비교 보정을 통과함.
  • 토큰이 더 많이 사용됐다고 답변이 자동으로 나아지는 것은 아님. 서점 의사 결정 데이터 480건은 전부 정답임.
  • 프로젝트 과제의 Luna Low 전체 자료 정확도는 API 35/40, 구독 로그인 18/40임. 통합 정확도 차이는 사전에 계획한 보수적 보정을 통과했으나(p = 0.0083), 탐색적 결과임.
  • 후속 배치만 보면 정확도는 19/20 대 12/20이며 보정을 통과하지 못함(p = 0.371).
  • 후속 연구에서는 구독 경로의 용량 문제로 두 차례 실행 실패가 있었음. 두 사례를 데이터에 보존하고 수동으로 이어서 실행한 내용을 기록해 원래 일정을 완료함. 위 통계는 완료 응답을 대상으로 하며, 런타임 수정 기록에 중단 상황이 설명돼 있음.
  • 두 고정 프롬프트와 API 인증 정보 하나, Pro 계정 하나만 사용했으므로 차이가 얼마나 널리 나타나는지, 원인이 무엇인지는 아직 알 수 없음. 독립 실행으로 확인할 필요가 있음.
  • 후속 연구와 통합 정확도 결과, 원래 결과를 확인할 수 있는 자료가 제공됨.

비교 방법

  • 응답마다 새 Codex 세션을 시작함. 로컬 프록시를 사용해 짝지은 비교에서 같은 클라이언트가 보내는 모델 입력이 바이트 단위로 동일하도록 함.
  • 두 로그인 방식은 인증과 서비스 엔드포인트가 다름. 모델이 요청한 응답과 사용량 수치를 기록하고 Codex 자체 기록과 대조함.
  • 오답도 데이터에 포함하며, 프록시는 실제 서버 응답을 변경하지 않음.
  • 수치는 보고된 사용량을 나타내며 모델 내부 추론 예산을 보여주는 값은 아님. 전체 프로토콜에는 통제 방식, 프록시 동작, 비교의 한계가 설명돼 있음.

수치 재계산

  • 공개된 데이터로 Python 3.12 이상에서 모델 호출 없이 결과를 다시 계산할 수 있음. 검증과 분석 명령을 실행하면 보고서가 output/reports/followup/report.md에 생성됨.
  • 연구 색인에서 공개 보고서, 답변 표, 데이터 안내서, 기록된 계획을 확인할 수 있음.

재현 및 조사

  • 차이가 나타나지 않는 결과를 포함한 독립 재현이 필요함. 서로 다른 계정, 요금제, 수집 날짜를 사용한 실행이 특히 유용함.
  • 결과와 근거는 Studies, 실험 재현 절차는 Setup and run guide, 가능한 설명은 Investigation plan, 다른 보고서와 비교 근거는 Related reports and contrasting evidence에서 확인할 수 있음.
  • 실행 도구를 이해하거나 수정하는 자료는 Experiment code guide이며, 재현 결과 공유와 코드 개선은 Contributing에서 다룸.
  • 다른 사용자도 비슷한 동작을 보고함. Codex 이슈 #49757은 Astra를 Enterprise 로그인과 공개 API에서 비교함.
  • 관련 연구 검토에는 Luna 보고서, 추론 노력 설정 버그, 다른 결과를 낸 연구가 포함됨. 참고할 만한 단서지만 이번 관측의 원인을 입증하는 자료는 아님.
  • 저장소 라이선스는 MIT임.