TL;DR

  • BREW는 과거 상호작용 궤적을 구조화된 지식 베이스(KB)로 변환해 재사용하는 프레임워크로, 세 가지 벤치마크에서 기본 에이전트보다 작업 성공률을 10~20% 높이고 실행 단계를 10~15% 줄임.
  • KB는 무엇을 해야 하는지, 어떤 상황에 적용되는지, 무엇을 주의해야 하는지를 담은 자연어 레시피로 구성됨.
  • BREW는 프로그램 합성의 라이브러리 학습 원리를 적용해 에이전트 메모리를 개념별 문서로 분리하고, KB 구축을 상태 공간 탐색 문제로 정식화함.
  • 확장 및 수집 몬테카를로 트리 탐색(EG-MCTS)은 개념별 병렬 탐색 트리를 통해 레시피의 정확성과 검색 가능성을 함께 최적화함.
  • 사후 시점 재라벨링으로 목표에 거의 도달한 궤적을 긍정적 시연으로 전환하며, 기존 메모리 증강 기준선보다 일관되게 높은 성능을 보임.

BREW와 경험 기반 지식

  • 대형 언어 모델(LLM) 기반 에이전트는 그래픽 사용자 인터페이스(GUI) 자동화, 도구 사용, 데이터 조작처럼 복잡한 다단계 작업을 수행하지만, 새 세션을 시작할 때마다 해결책을 처음부터 다시 찾아야 함.
  • BREW(Bootstrapping expeRientially-learned Environmental knoWledge)는 과거 상호작용 궤적을 구조화되고 검색 가능한 지식 베이스(KB)로 증류함.
  • KB의 자연어 레시피는 개념 수준의 절차 문서이며, 수행할 일과 적용 조건, 주의 사항을 기록함.

지식 베이스 구성과 탐색

  • 프로그램 합성의 라이브러리 학습 원리를 바탕으로 에이전트 메모리를 모듈형 개념별 문서로 분해하고, KB 구성을 상태 공간 탐색 문제로 정식화함.
  • 확장 및 수집 몬테카를로 트리 탐색(EG-MCTS)은 보상 기반 알고리즘으로, 개념별 병렬 탐색 트리에서 레시피 정확성과 검색 가능성을 공동 최적화함.
  • 사후 시점 재라벨링을 적용해 목표에 거의 도달했지만 성공하지 못한 궤적을 긍정적 시연으로 바꾸고, 에이전트의 잠재 역량을 재사용 가능한 지식으로 드러냄.

벤치마크 결과와 지식 베이스의 특성

  • OSWorld, tau^2-Bench, SpreadSheetBench 등 세 가지 실제 도메인 기반 벤치마크에서 BREW는 기본 에이전트보다 작업 성공률이 10~20% 높고 실행 단계가 10~15% 적음.
  • 기존 메모리 증강 기준선은 메모리가 없는 에이전트보다 성능이 낮아질 수 있지만, BREW는 이들 기준선을 일관되게 능가함.
  • 결과물인 KB는 검사 가능하고 모듈형이며 확장 가능해, 에이전트 최적화를 위한 투명하고 제어 가능한 기반을 제공함.

논문 정보

  • 논문 제목은 *Improving Language Agents through BREW: Bootstrapping expeRientially-learned Environmental knoWledge*이며, Shashank Kirtania, Param Biyani, Priyanshu Gupta, Yasharth Bajpai, Roshni Iyer, Sumit Gulwani, Gustavo Soares가 작성함.
  • arXiv 식별자는 2511.20297이며, 최초 제출일은 2025년 11월 25일, 현재 버전(v2)의 최종 수정일은 2026년 7월 10일임.
  • DOI: https://doi.org/10.48550/arXiv.2511.20297