TL;DR
- ProVer는 모든 중간 상태를 평가하지 않고 성공과 실패 궤적의 차이를 만든 핵심 구간을 선별·검증해 GRPO의 신용 할당을 개선하는 프레임워크임.
- 에이전트 판정기가 성공·실패 궤적을 비교해 결과가 갈라진 원인일 가능성이 있는 구간을 제안함.
- 제안된 구간 전후에서 현재 정책으로 후속 실행을 표집하고 최종 성공률 차이를 계산해 구간의 이점을 검증함.
- 검증 결과가 양수인 경우에만 해당 구간의 정책 토큰에 GRPO 이점을 반영함.
- ALFWorld, WebShop, SearchQA에서 Qwen3.5-2B와 Qwen3.5-4B의 평균 성능이 GRPO보다 각각 9.91%, 7.12% 향상됨.
연구 배경과 문제
- 대형 언어 모델(LLM) 에이전트 학습에 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO)가 유망한 접근법으로 자리 잡음.
- 기존 GRPO는 궤적 수준의 이점을 모든 정책 토큰에 균일하게 할당하므로, 결과에 중요한 결정과 덜 관련된 결정을 구분하지 못하고 어떤 중간 결정이 성공에 기여했는지 흐려짐.
ProVer의 구간 선별과 검증
- ProVer는 에이전트 강화학습에서 잠재적으로 핵심적인 결정을 겨냥해 세밀한 신용 할당을 수행하는 프레임워크임.
- 롤아웃 그룹에서 에이전트 판정기가 성공 궤적과 실패 궤적을 대조해 결과 차이를 일으켰을 가능성이 있는 구간을 제안함.
- 판정기의 평가를 그대로 신뢰하지 않고, 제안 구간 앞과 뒤에서 표집한 현재 정책의 후속 실행 간 최종 성공률 차이를 이용해 구간의 이점을 추정함.
- 추정치가 양수인 경우에만 제안 구간 내 정책 토큰의 GRPO 이점에 반영함.
- 모델 판단은 검증할 위치를 고르는 데만 사용하며, 국소 신용 할당은 관측된 결과에 근거함. 따라서 모든 중간 상태를 빠짐없이 평가할 필요가 없음.
실험 결과와 분석
- ALFWorld, WebShop, SearchQA에서 두 모델 규모 모두 평균 성능이 가장 높았으며, GRPO 대비 상대 성능 향상 폭은 Qwen3.5-2B에서 9.91%, Qwen3.5-4B에서 7.12%임.
- 추가 분석에서는 정보에 기반한 구간 선별이 생성 오버헤드를 소폭 늘리면서 정책 학습을 개선함을 보임.
- 최첨단 규모의 판정기 모델이 없어도 효과가 나타나며, 핵심 결정을 선택적으로 겨냥하는 방식의 효율성을 뒷받침함.
논문 정보
- 논문 제목은 *Targeting Pivotal Decisions for Credit Assignment in Agentic Reinforcement Learning*이며, Dongwon Jung, Hemanth Neelgund Ramesh, Yifan Wang, Xiaomin Li, Yuexing Hao, Yu Hu, Muhao Chen, Varun Chandrasekaran, Andrzej Banburski-Fahey, Jaron Lanier가 작성함.
- arXiv 식별자는 arXiv:2609.36178, 제출일은 2026년 9월 28일이며, 분류는 계산 및 언어(cs.CL)와 인공지능(cs.AI)임.
- DOI: https://doi.org/10.48550/arXiv.2609.36178
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요