TL;DR

  • Unreal Agent가 SWE-Marathon에서 Codex와 같은 점수를 48% 낮은 비용으로 달성함.
  • 컨텍스트 압축은 원래 시스템 지침과 최근 대화를 보존하면서 세션 중간 부분을 요약함.
  • 압축을 시작할 때 실행 중인 도구 호출을 중단하지 않고, 결과를 압축된 컨텍스트에 반영함.
  • 두 에이전트는 GPT-6.1 Sol, xhigh 추론으로 20개 작업을 각각 8회 시도했으며, 통합 pass@1 점수는 43.125%임.
  • Unreal Agent에 터미널 사용자 인터페이스(TUI)와 Anthropic Messages API를 통한 Claude 모델 지원이 추가됨.

컨텍스트 압축 아키텍처

  • 장시간 실행되는 작업을 처리하는 에이전트의 역량은 성능이 뛰어난 언어 모델, 하네스, 실행 환경이 함께 작동하는 데 달려 있음.
  • Unreal Agent에 하네스 개선 사항인 컨텍스트 압축 기능이 제공됨.
  • Unreal Agent의 비동기 논블로킹 아키텍처를 유지하고, 압축을 위해 모든 도구 호출이 끝날 때까지 기다리는 ‘전체 중단’ 방식을 피하도록 압축 메커니즘을 설계함.
  • Unreal Agent의 컨텍스트 크기가 설정된 임계값에 도달하면 세션 컨텍스트의 중간 부분을 요약하는 요청을 보냄. 원래 시스템 지침과 최근 몇 차례의 대화는 그대로 유지함.
  • 압축이 시작될 때 실행 중인 도구 호출을 중단하지 않음. 해당 도구 호출의 초기 요청 블록은 요약 메시지 뒤에 압축된 컨텍스트에 추가되며, 도구 호출이 완료되면 결과도 압축된 컨텍스트에 들어감.

벤치마크 세부 정보

  • 두 하네스 모두 GPT-6.1 Sol, xhigh를 사용했으며, 20개 작업 × 8회 시도로 평가함. 점수는 통합 pass@1 기준임.
  • SWE-Marathon 논문에 설명된 점수 산정 방법을 따름.
  • Unreal Agent: 69/160회 통과, 점수 43.125% ± 3.92%p, 총 추론 비용 445.75달러, 반복 실행 예상 비용 419.82~472.65달러(95% 신뢰구간)임.
  • Codex: 69/160회 통과, 점수 43.125% ± 3.92%p, 총 추론 비용 850.52달러, 반복 실행 예상 비용 781.60~920.40달러(95% 신뢰구간)임.

터미널 인터페이스

  • SDK를 깊이 살펴보지 않고 Unreal Agent를 사용해 볼 수 있는 터미널 사용자 인터페이스(TUI)를 제공함.
  • Homebrew로 unreallabsai/tap/unreal-agent를 설치한 뒤 unreal-agent를 실행하면 TUI를 시작할 수 있음.

Anthropic 지원

  • Unreal Agent가 Anthropic의 네이티브 Messages API를 통해 Claude 모델을 지원함.
  • OpenAI Responses API와 비교해 Messages API는 메시지와 콘텐츠 블록의 순서에 더 엄격한 요구 사항을 적용함. 이에 따라 하네스에서 비동기 도구 결과를 별도로 처리해야 함.
  • Responses API와 달리 Messages API는 도구 호출 직후에 해당 도구의 결과가 오기를 기대함. 다음 모델 턴 이후에 완료되는 도구 호출의 결과는 합성된 사용자 콘텐츠 블록으로 전달됨.