TL;DR
- 장난감 평가 스위트에서 사전 학습 중인 언어 모델(LM)이 패턴 매칭과 일반화 사이를 갑작스럽게 오가는 모드 홉핑을 보이며, 일반화가 학습에 따라 안정적으로 성숙한다는 통념과 다르게 나타남.
- OLMo3-32B는 ‘answer+1’ 산술 평가에서 2.17T 토큰 시점 81%, 2.19T 시점 0%, 2.21T 시점 81.7%를 기록해, 인접 체크포인트 사이의 급격한 행동 변화를 보임.
- 모드 홉핑은 정확도뿐 아니라 정답·오답 확률 차이에서도 나타나고, 사전 학습 부동소수점 연산량(FLOPs)을 기준으로 해도 관찰되며, 체크포인트 평균화만으로 제거되지 않음.
- 연구진은 제한된 모델 용량 안에서 얕은 회로와 일반화 회로가 경쟁하고 사전 학습 데이터가 어느 쪽이 우세할지 좌우한다는 가설을 제시함.
- 평가 스위트로 선택한 OLMo3-32B의 4.5T 토큰 체크포인트는 특정 후속 학습 설정에서 4.9T 체크포인트보다 추론 및 정렬 관련 지표가 높았으며, 데이터 선택 실험은 한 행동의 안정화 가능성을 보임.
행동으로서의 일반화
- 여기서 일반화는 얕은 단서를 따르는 대신 과제나 전이 가능한 구조를 추론하는 행동임. 연구진은 저비용 제로샷·퓨샷 행동 평가 6개와 미세 조정 일반화 평가 2개로 구성된 스위트를 구축함.
- 평가 항목은 다음과 같은 대조를 다룸.
- 익숙한 감정 분석 패턴과 뒤집힌 레이블
- 반복되거나 연속되는 프롬프트 답변과 제시된 문제의 실제 풀이
- 사실과 사실처럼 들리는 내용
- 직관적이지만 틀린 답과 숙고 기반 추론
- 서로 연결되지 않은 사실과 일관된 페르소나
- 산술 사례의 시연 답변은 1, 2, 3이며, 시험 산술 문제의 답은 8임. 유혹적인 패턴 연속 답변은 4임.
- 프롬프트 기반 평가는 모델이 추출 가능한 답변을 생성하는 방식에 의존하지 않고 미리 정한 답변 구간의 확률을 비교하며, 결과는 무작위 시드 4개의 평균임.[p3]
- 멀티홉 페르소나 질의응답(QA)은 생성형 평가로 작동하며, 페르소나당 시험 질문은 5개뿐이고 반복 샘플링됨.
- 연구는 OLMo3와 Apertus의 일반 사전 학습 체크포인트를 추적하며 미드트레이닝과 장문맥 단계를 제외함. 해당 모델은 친칠라(Chinchilla) 최적 예산의 9~90배 규모로 학습된 상태임.[p2]
- ‘answer+1’ 산술 평가에서 성공은 유혹적인 연속 패턴 답변보다 산술적으로 일관된 답이 우세한 경우를 뜻함. OLMo3-32B는 사전 학습 토큰 2.17T에서 81%, 2.19T에서 0%, 2.21T에서 81.7%를 기록함.[p2] 이 산술 사례는 특정 과제의 사례이며 모든 종류의 일반화가 같은 방식으로 역전됨을 보여주지는 않음.
역전은 단순한 잡음이 아님
- Schaeffer 외 연구진은 「Are Emergent Abilities of Large Language Models a Mirage?」에서 불연속적이거나 비선형적인 평가 지표가 부드러운 출력 변화를 갑작스러운 출현처럼 보이게 할 수 있다고 주장함. Wen 외 연구진은 다음 두 결과로 그 단순한 설명을 배제함.
- 모드 홉핑이 정확도뿐 아니라 부드러운 확률 마진인 P(정답)−P(오답)에서도 나타남.
- 토큰 수뿐 아니라 사전 학습 FLOPs를 기준으로 그래프를 그려도 같은 현상이 나타남.[p6]
- 반면 일반 벤치마크 성능은 사전 학습 전반에 걸쳐 안정적으로 유지됨.[p6]
- 단일 업데이트가 홉핑을 일으키는지 확인하기 위해 OLMo3-32B에 무작위 표본 사전 학습 데이터로 최적화 단계 1회를 적용하고 배치 크기와 학습률을 바꿈. 학습률이 1e-2인 경우에도 스위트 평가 확률의 변화는 미미함.[p7]
- 진동 곡선을 따라 체크포인트 5개를 평균하면 모드 홉핑이 완화되지만 사라지지는 않음.[p7]
- 이 검사는 국소 최적화 변동만으로 현상을 설명하기 어렵다는 점을 뒷받침하지만 원인을 규명하지는 않음. 결과는 데이터셋별 차이도 보이며 데이터셋 쌍 사이의 평균 상관관계는 대체로 낮고, 더 큰 모델에서 상관관계가 높아지는 경향임.[p7]
체크포인트와 데이터라는 조절 수단
- 연구진은 장난감 평가 스위트를 이용해 OLMo3-32B의 사전 학습 토큰 4.5T 및 4.9T 체크포인트를 선택함. 수학 지도 미세 조정(SFT) 후 4.5T 체크포인트의 GPQA 점수는 36.3%, 4.9T 체크포인트는 29.8%임.
- 일반 후속 학습 이후 프리필링 공격에 대한 견고성은 4.5T 체크포인트가 53%, 4.9T 체크포인트가 21%임.[p8]
- 이 비교에서 4.5T 체크포인트는 표본으로 선정된 다른 체크포인트도 앞섬. 다만 이후 사전 학습이나 미드트레이닝이 분포 내 성능을 높일 수 있음.[p9] 해당 후속 학습 설정에서는 중간 체크포인트가 더 나은 시작점일 수 있지만, 초기 체크포인트가 일반적으로 우세하다는 결과는 아님.
- 위쪽 그래프는 미세 조정 단계에 따른 MATH-500 정확도, GPQA-Diamond 정확도, 프리필링 공격 견고성을 4.5T 및 4.9T 체크포인트 간 비교함. 아래쪽 그래프는 선택된 높은·낮은 문맥 내 학습 체크포인트를 표시하며 같은 지표를 사전 학습 토큰(T)에 따라 보여줌.
- 한 평가에서 데이터가 행동을 유도할 수 있는지 시험한 예비 소규모 실험은 중간 OLMo3-32B 체크포인트에서 시작해 다음 세 종류의 데이터로 학습을 이어감.
- 무작위 표본 데이터: 통제하지 않은 실행
- 이전 학습 구간에서 ‘answer+1’ 평가의 패턴 매칭을 선호한 하위 데이터 집합
- 이전 학습 구간에서 해당 평가의 일반화를 선호한 하위 데이터 집합
- 통제된 실행은 각각 의도한 행동 방향으로 안정화되고, 통제하지 않은 실행은 홉핑함.[p9]
- 연구진은 이 결과를 용량이 제한된 모델에서 얕은 회로와 일반화 회로가 경쟁하는 현상으로 해석함.[p2] 이는 가설이며, 실험이 직접 입증한 것은 행동 변화이지 회로 자체가 아님.
다음 체크포인트 확인
- 일반화가 학습량 증가에 따라 꾸준히 성숙한다고 보장할 수 없음.[p1] 이 스위트는 행동 역전을 드러내는 저비용 모니터임.
- 보고된 적용 사례에서는 체크포인트 선택에 활용됐고, 데이터 선택과 결합해 특정 행동 하나를 유도함. 평가 스위트는 GitHub 저장소에서 이용 가능함.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요