TL;DR

  • GPT-6 AstraGPT-5.6 Sol보다 강력하고 프런트엔드 작업도 Fable 수준으로 개선됐지만, 일상적인 Codex 작업의 기본 모델로는 자율 실행 시간이 너무 길고 쿼터 소모가 큼.
  • GPT-5.5는 작업을 약 30분~1시간 수행한 뒤 검토 가능한 결과를 반환하는 반면, Astra는 동일한 작업을 12~24시간 계속 실행하거나 사용량 한도까지 진행하는 경향이 있음.
  • 휴가 중 하루 약 1시간만 지시하고 Codex를 자율 실행했음에도 200달러 Codex 구독 2개의 사용량을 일주일 만에 모두 소진함.
  • 현지 Codex 로그에서 GPT-5.6 Sol은 GPT-5.5보다 세션당 토큰을 2.25배 더 사용했으며, Astra에서도 더 강력한 모델이 세션을 과도하게 키우는 동일한 문제가 나타남.
  • Astra는 어려운 코드 리뷰·프런트엔드 작업·2차 의견·심층 탐색에 활용하고, 하루 종일 Codex 작업을 맡기는 기본 드라이버로는 GPT-5.5를 사용함.

GPT-6 Astra에 대한 첫인상

  • GPT-6 Astra는 지난 일주일 동안 주된 Codex 드라이버로 사용됐으며, 현재는 GPT-5.5로 돌아간 상태임.
  • Astra에 대한 평가가 부정적으로 들릴 수 있으나 실제 평가는 매우 좋으며, GPT-5.6 Sol보다 뛰어난 모델임.
  • 다만 일상적인 Codex 작업에서는 Sol과 같은 문제가 더 높은 능력 수준에서 나타남.

GPT-5.5와 GPT-5.6 Sol의 작업 리듬 차이

  • 지난달 GPT-5.5에서 GPT-5.6으로 전환한 뒤 생산성이 낮아졌으며, Sol은 5.5보다 분명히 더 똑똑하지만 작업 리듬을 바꾸는 모델임.
  • GPT-5.5는 작업을 맡으면 보통 30분~1시간 정도 수행한 뒤 검토할 수 있는 결과를 반환함.
  • Sol은 계속 작업을 이어가는 경향이 있음.
  • 일부 상황에서는 유용하지만, 실행 중인 세션을 확인하거나 계정의 쿼터가 모두 소진된 상태를 맞게 되는 경우가 자주 발생함.

프런트엔드 작업에서의 개선

  • Astra는 Sol과 같은 계열의 모델이며, Sol보다 더 높은 능력을 보유함.
  • 프런트엔드 작업에서는 Astra가 Sol보다 훨씬 우수함.
  • 일반 지능 측면에서 Sol은 해당 작업에서 이미 Fable보다 강했지만, Fable은 사용자 인터페이스(UI) 판단, 프런트엔드 감각, 디자인 취향에서 여전히 앞섰음.
  • Astra에서는 이 격차가 대부분 사라졌으며, 해당 영역에서 Fable과 대등한 동시에 일반 코딩 모델로서는 더 강하게 느껴짐.

멈출 시점을 모르는 문제

  • Astra의 장점은 분명하지만, 여전히 언제 멈춰야 하는지 판단하지 못하는 문제가 있음.
  • 지난 일주일은 휴가 기간이었으므로 구독 모델에 유리한 사용 패턴이었음.
  • 하루에 지시하는 시간은 약 1시간이었고, 이후에는 Codex가 독립적으로 실행되도록 둠.
  • 그럼에도 200달러 Codex 구독 2개를 모두 소진함.
  • 각 계정에는 사용량 초기화 기회가 대략 4회 남아 있었음.
  • 해당 사용량이 모두 일주일 안에 사라짐.

품질이 아니라 실행 규모의 문제

  • 작업 결과의 품질은 좋았으며, 품질에 대한 불만은 아님.
  • 문제는 Astra가 지나치게 많은 작업을 장기 실행 프로젝트로 바꾼다는 점임.
  • GPT-5.5가 30분 안에 마치고 결과를 넘길 작업이 Astra에서는 12시간 또는 24시간 실행으로 늘어나거나, 사용량 한도가 소진될 때까지 계속될 수 있음.
  • 모델은 계속해서 다음 작업을 수행함.
  • 결과 검증
  • 작업 범위 확장
  • 검토
  • 인접한 추가 작업 탐색
  • 각각의 작업은 따로 보면 유용하지만, 주된 작업 드라이버로 사용할 때는 시간과 쿼터 측면에서 비용이 너무 큼.

Sol에서 측정된 토큰 사용량

  • 이러한 현상은 앞서 측정한 Sol의 문제와 일치함.
  • 현지 Codex 로그에서 GPT-5.6 SolGPT-5.5보다 세션당 토큰을 2.25배 더 사용함.
  • Astra에 대해서는 아직 같은 방식으로 정리된 토큰 측정값이 없음.
  • 다만 결과는 유사하게 느껴짐.
  • 더 강력한 모델이 한 세션 안에서 더 많은 작업을 수행함.
  • 세션 규모가 구독을 통한 일반적인 일상 작업에 적합하지 않을 정도로 커짐.

OpenAI 사용량 안내와의 일치점

  • OpenAI의 자체 사용량 안내도 같은 방향을 가리킴.
  • 안내에 따르면 WorkCodex는 요금제 사용량을 공유하며, 사용량은 다음 요소에 따라 달라짐.
  • 모델
  • 작업
  • 설정
  • 입력
  • 출력
  • 다단계 작업
  • 안내에는 Astra의 예상 로컬 메시지 범위가 Sol과 GPT-5.5보다 낮게 제시됨.
  • Sol을 높은 노력 수준으로 사용할 때 이미 문제가 없었다면 Astra를 낮은 노력 수준 또는 중간 노력 수준으로 시도하라는 권고도 포함됨.
  • 해당 조언은 합리적이지만, 자율적인 후속 실행이 작업 흐름에서 가장 비싼 부분이므로 핵심 사용 사례를 해결하지는 못함.

Astra의 사용 방식

  • Astra는 도구 모음에 계속 포함하지만 기본 모델로 사용하지는 않음.
  • 다음 작업에 Astra를 사용함.
  • 어려운 코드 리뷰
  • 복잡한 프런트엔드 작업
  • 2차 의견
  • 모델이 의도적으로 더 깊이 탐색하기를 원하는 작업
  • 하루 종일 Codex에 작업을 맡기는 일반적인 반복 작업에서는 GPT-5.5를 주된 드라이버로 사용함.

Vroni

  • Vroni는 저장소를 읽고 변경 사항을 계획하며 코드를 작성하고 검사를 실행한 뒤 검토 가능한 풀 리퀘스트를 향해 작업하는 소프트웨어 위임 도구임.
  • GitHub 이슈, 버그 보고서, 사양서 또는 대략적인 아이디어를 Vroni에 전달하는 방식임.