TL;DR
- 강화 학습 검증 가능 보상(RLVR) 후속 학습에서는 기저 모델이 목표 행동을 끌어낼 수 없는 새로운 추론 과제를 학습할 때 언어 드리프트가 나타나며, 드리프트를 제한하면 기대 보상도 제약됨.
- 최근 대형 언어 모델(LLM)의 추론 능력은 주로 RLVR 후속 학습을 통해 향상돼 복잡한 과제 수행이 가능해짐.
- 모델의 사고 사슬(CoT)에서는 비표준적이고 비상식적으로 보이는 언어 사용인 언어 드리프트가 점점 더 나타나며, CoT 모니터링 가능성을 저해할 수 있음.
- 이론적으로 RLVR 최적화 압력은 언어 드리프트를 무한히 허용하지만, 지도 미세 조정(SFT)은 이를 허용하지 않음.
- 최첨단 RLVR 후속 학습에서 CoT 모니터링 가능성을 성능 저하 없이 높일 수 없다는 결론임.
배경
- 검증 가능한 보상을 이용한 강화 학습(RLVR) 기반 후속 학습이 최근 대형 언어 모델(LLM)의 추론 능력 발전을 주도하며, 복잡한 과제 수행을 가능하게 함.
- 능력이 향상되는 동시에 LLM의 사고 사슬(CoT)에서 이례적이고 비표준적이며 겉보기에 무의미한 언어 사용인 언어 드리프트가 점점 더 관찰됨.
- 언어 드리프트는 잘 알려진 현상이지만 CoT 모니터링 가능성을 저해할 수 있으며, 그 원인은 아직 충분히 밝혀지지 않음.
언어 드리프트가 발생하는 조건
- 이론적 증명에 따르면 RLVR 최적화 압력은 언어 드리프트를 무한히 허용하지만, 지도 미세 조정(SFT)은 그렇지 않음.
- 경험적 결과에 따르면 언어 드리프트는 새로운 추론 과제에 대한 RLVR 학습 중에 구체적으로 발생함. 즉, 기저 모델에서 목표 행동을 끌어낼 수 없는 경우임.
보상과 모니터링 가능성의 상충 관계
- 언어 드리프트를 제한하면서 기대 보상을 제약하지 않는 것은 불가능하다는 점을 증명함.
- 따라서 최첨단 RLVR 후속 학습에서 성능 저하 없이 사고 사슬(CoT)의 모니터링 가능성을 개선할 수 없다는 결론임.
- 논문: https://doi.org/10.48550/arXiv.2610.02015
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요