TL;DR
- 자연 데이터 없이 생성기와 학습자 두 모델을 자기 대국 방식으로 훈련하는 사전학습 개념 증명으로, 계산량에 따라 자연 데이터의 제로샷 손실이 예측 가능하게 변함.
- 생성기는 범용 튜링 머신이 해석하는 프로그램을 제안해 바이트 시퀀스를 만들고, 학습자는 이를 자기회귀적으로 예측함.
- 학습자는 표준 교차 엔트로피로 훈련되고, 생성기는 강화학습으로 학습자의 능력 한계에 도달하는 시퀀스를 생성해 적응형 커리큘럼을 형성함.
- 범용 튜링 머신을 사용해 특정 분야 구조에 거의 의존하지 않는 계산 가능한 데이터 생성 과정의 탐색 공간을 구성함.
- 모델은 문맥 내 학습을 보이고, 훈련 중 알아볼 수 있는 수학적 수열을 발견함.
초록
- 언어 모델의 발전은 점점 더 많은 데이터로 사전학습을 확장하는 방식으로 이루어졌지만, 학습 데이터는 여전히 대부분 모델을 대신해 선별됨. 더 일반적인 사전학습 방식은 모델이 자신의 개선에 가장 유용한 데이터를 생성하도록 하며, 이 경우 인간 지식이 아니라 계산량에 제한되는 사실상 무한한 학습 데이터 공급원이 가능함.
- 이 연구는 해당 비전을 실현하기 위한 초기 개념 증명인 데이터 없이 자기 대국 사전학습(Self-Play Pretraining with Zero Data)을 제시함. 합성 데이터 생성을 솔로모노프 귀납법(Solomonoff induction)에서 착안해 모든 계산 가능한 구조의 공간을 탐색하는 문제로 설정함.
- 무작위 초기화에서 출발한 두 모델을 함께 학습함. 생성기는 프로그램을 제안하고 범용 튜링 머신이 이를 해석해 바이트 시퀀스를 생성하며, 학습자는 해당 시퀀스를 자기회귀적으로 예측함.
- 학습자는 표준 교차 엔트로피로 훈련하고, 생성기는 강화학습으로 학습자의 능력 한계선에 있는 시퀀스를 생성하도록 훈련해 적응형 커리큘럼을 형성함. 범용 튜링 머신은 특정 분야 구조에 거의 의존하지 않는, 모든 계산 가능한 데이터 생성 과정을 포괄하는 탐색 공간을 제공하며 자기 대국은 그 안에서 유용한 학습 데이터를 탐색함.
- 생성기와 학습자 어느 쪽도 자연 데이터로 훈련하지 않은 조건에서 전이 성능을 명확히 시험하기 위해, 자기 대국 계산량에 따라 자연 데이터의 제로샷 성능이 예측 가능하게 향상되는지 평가함. 여러 자연 데이터셋에서 제로샷 손실은 계산량에 따라 예측 가능한 스케일링을 보임.
- 모델은 문맥 내 학습을 보이며, 훈련 중 알아볼 수 있는 수학적 수열을 발견함.
논문 정보
- 제목: Self-Play Pretraining with Zero Data
- 저자: Aditya Cowsik, Kfir Dolev, Michael Y. Li, G. Bruno De Luca, Nourya Cohen, Noah D. Goodman, Yoav Levine
- 제출일: 2026년 9월 24일
- 분류: 인공지능(cs.AI), 계산 및 언어(cs.CL)
- 인용: arXiv:2609.30063 [cs.AI]
- DOI: https://doi.org/10.48550/arXiv.2609.30063
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요