TL;DR

  • ProVer는 모든 중간 상태를 평가하지 않고 성공과 실패 궤적의 차이를 만든 핵심 구간을 선별·검증해 GRPO의 신용 할당을 개선하는 프레임워크임.
  • 에이전트 판정기가 성공·실패 궤적을 비교해 결과가 갈라진 원인일 가능성이 있는 구간을 제안함.
  • 제안된 구간 전후에서 현재 정책으로 후속 실행을 표집하고 최종 성공률 차이를 계산해 구간의 이점을 검증함.
  • 검증 결과가 양수인 경우에만 해당 구간의 정책 토큰에 GRPO 이점을 반영함.
  • ALFWorld, WebShop, SearchQA에서 Qwen3.5-2B와 Qwen3.5-4B의 평균 성능이 GRPO보다 각각 9.91%, 7.12% 향상됨.

연구 배경과 문제

  • 대형 언어 모델(LLM) 에이전트 학습에 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO)가 유망한 접근법으로 자리 잡음.
  • 기존 GRPO는 궤적 수준의 이점을 모든 정책 토큰에 균일하게 할당하므로, 결과에 중요한 결정과 덜 관련된 결정을 구분하지 못하고 어떤 중간 결정이 성공에 기여했는지 흐려짐.

ProVer의 구간 선별과 검증

  • ProVer는 에이전트 강화학습에서 잠재적으로 핵심적인 결정을 겨냥해 세밀한 신용 할당을 수행하는 프레임워크임.
  • 롤아웃 그룹에서 에이전트 판정기가 성공 궤적과 실패 궤적을 대조해 결과 차이를 일으켰을 가능성이 있는 구간을 제안함.
  • 판정기의 평가를 그대로 신뢰하지 않고, 제안 구간 앞과 뒤에서 표집한 현재 정책의 후속 실행 간 최종 성공률 차이를 이용해 구간의 이점을 추정함.
  • 추정치가 양수인 경우에만 제안 구간 내 정책 토큰의 GRPO 이점에 반영함.
  • 모델 판단은 검증할 위치를 고르는 데만 사용하며, 국소 신용 할당은 관측된 결과에 근거함. 따라서 모든 중간 상태를 빠짐없이 평가할 필요가 없음.

실험 결과와 분석

  • ALFWorld, WebShop, SearchQA에서 두 모델 규모 모두 평균 성능이 가장 높았으며, GRPO 대비 상대 성능 향상 폭은 Qwen3.5-2B에서 9.91%, Qwen3.5-4B에서 7.12%임.
  • 추가 분석에서는 정보에 기반한 구간 선별이 생성 오버헤드를 소폭 늘리면서 정책 학습을 개선함을 보임.
  • 최첨단 규모의 판정기 모델이 없어도 효과가 나타나며, 핵심 결정을 선택적으로 겨냥하는 방식의 효율성을 뒷받침함.

논문 정보

  • 논문 제목은 *Targeting Pivotal Decisions for Credit Assignment in Agentic Reinforcement Learning*이며, Dongwon Jung, Hemanth Neelgund Ramesh, Yifan Wang, Xiaomin Li, Yuexing Hao, Yu Hu, Muhao Chen, Varun Chandrasekaran, Andrzej Banburski-Fahey, Jaron Lanier가 작성함.
  • arXiv 식별자는 arXiv:2609.36178, 제출일은 2026년 9월 28일이며, 분류는 계산 및 언어(cs.CL)와 인공지능(cs.AI)임.
  • DOI: https://doi.org/10.48550/arXiv.2609.36178