TL;DR
- 미세조정용 참조 모델을 기준으로 오프폴리시 데이터를 점진적으로 온폴리시 데이터에 가깝게 변환하면, 지도 미세조정(SFT)이 여러 과제에서 강화학습(RL)에 필적하고 일반화와 기존 역량 보존 면에서 강한 온폴리시 기준선보다 나은 성능을 보임.
- 기존 관점에서는 RL이 새 과제에 강하게 일반화하고 기존 역량을 유지하는 반면, SFT는 일반화가 약하고 치명적 망각에 취약하다고 봄.
- SFT는 오프폴리시 전문가 데이터에서 학습할 수 있지만, RL은 반복 샘플링으로 성공 궤적을 찾는 모델의 능력에 의존함.
- 제안하는 마르코프 연쇄 몬테카를로(MCMC) 샘플링 알고리즘은 학습 목표를 바꾸는 대신 학습자가 더 잘 학습하도록 데이터 분포를 조정함.
- 샘플링을 학습 가능성을 고려해 데이터를 구성하는 모델 고유의 연산자로 제시하며, 미세조정 후 모델은 강한 분포 성능과 기반 모델 분포를 정교화하는 수준을 넘어 학습하는 역량을 보임.
연구 배경과 접근
- 프런티어 모델에 새로운 역량을 추가하는 것은 사후 학습의 주요 목표이며, 이 과정에는 주로 지도 미세조정(SFT)과 강화학습(RL)이 사용됨.
- 통념상 RL은 기존 역량을 잃지 않으면서 새로운 과제에 강하게 일반화하는 반면, SFT는 일반화가 약하고 치명적 망각에 취약함.
- SFT는 오프폴리시 전문가 데이터에서 학습할 수 있지만, RL은 반복 샘플링으로 성공 궤적을 찾아내는 모델의 능력에 의존함.
- 오프폴리시 데이터에 담긴 유용한 정보를 활용하면서 온폴리시 학습의 강점도 살리는 접근을 탐색함.
- 학습 목표를 오프폴리시 데이터에 맞게 바꾸는 대신, 학습자에게 더 적합하도록 데이터 분포를 조정하는 마르코프 연쇄 몬테카를로(MCMC) 샘플링 알고리즘을 제안함.
- 알고리즘은 미세조정의 참조 모델을 기준으로 오프폴리시 궤적을 점진적으로 더 온폴리시에 가깝게 변환함.
실험 결과
- 과학적 기술 습득, 수학적 추론, 개방형 전문성 과제에서 제안한 샘플링 알고리즘을 적용한 SFT는 널리 쓰이는 사후 학습 기법에 필적하는 성능을 보임.
- 여러 과제에서 강한 온폴리시 기준선보다 일반화 성능이 높고 기존 역량을 덜 잊는 결과를 보임.
- 미세조정된 모델은 강한 분포 성능을 나타내며, 기반 모델 분포를 단순히 정교화하는 수준을 넘어 학습할 수 있음.
사후 학습에서의 의미
- 샘플링을 학습 가능성에 맞춰 데이터를 구성하는 모델 고유의 연산자로 제시함.
- 이 접근은 사후 학습 전반에서 범용 기본 연산자로 활용될 가능성을 제시함.
- 논문: arXiv:2610.02140
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요