TL;DR

  • 특정 시작 토큰 단서를 고정하면 기반 모델의 수학·코딩 성능이 강화 학습(RL) 모델 수준에 도달하며, 학습 데이터가 단서와 추론 행동의 연결을 형성함.
  • Olmo-3-7B는 “.\n\nOkay” 단서로 MATH-500 pass@1 정확도가 42%에서 78%로 상승하고, Qwen3-14B는 “Alright,” 단서로 72%에서 87%로 상승함.
  • 강화 학습은 이런 단서의 출현 가능성을 높이며, 단서를 고정하면 기반 모델 대비 강화 학습의 성능 향상분 대부분이 재현됨.
  • 인과적 데이터 개입으로 임의의 단어인 “chicken”을 추론 단서로 만들거나 기존 단서의 효과를 제거할 수 있고, “Think duck duck goose”도 “Think step by step”만큼 추론을 유도함.
  • 서로 다른 단서로 형성된 은닉 상태 표현은 학습 데이터의 서로 다른 문서 유형과 연관되며, 안전성 실험에서도 단서에 따라 거부·응답 행동이 달라짐.

논문 정보

  • 논문 제목은 *Base Models Can Reason By Taking a Cue From Training Data*이며, Sophie L. Wang, Amil Dravid, Rulin Shao, Kevin Farhat, Sewon Min, Alexei A. Efros가 작성함.
  • 2026년 10월 5일 제출된 논문이며, 분야는 머신러닝, 인공지능, 계산 및 언어임.
  • 인용 정보는 arXiv:2610.06851임. DOI: https://doi.org/10.48550/arXiv.2610.06851

시작 토큰 단서와 추론 성능

  • 연구진은 기반 모델 응답의 시작 토큰과 그 뒤에 이어지는 추론 행동 사이의 연관성이 학습 데이터에서 어떻게 형성되는지 조사함.
  • 특정 시작 토큰 단서를 고정하면 수학·코딩 과제에서 기반 모델의 성능이 강화 학습(RL)을 거친 모델과 경쟁할 만한 수준으로 올라감.
  • “.\n\nOkay” 단서는 Olmo-3-7B의 MATH-500 pass@1 정확도를 42%에서 78%로 높이며, “Alright,” 단서는 Qwen3-14B의 정확도를 72%에서 87%로 높임.
  • 강화 학습은 이런 단서가 나타날 가능성을 높이며, 단서를 고정하면 기반 모델 대비 강화 학습이 얻은 성능 향상분의 상당 부분을 되찾음.

학습 데이터에 개입해 단서 효과 조절

  • 인과적 데이터 개입을 통해 “chicken”처럼 임의로 고른 단어를 효과적인 추론 단서로 바꾸거나 기존 단서의 효과를 없앰.
  • 비슷한 데이터 편집을 적용하면 “Think duck duck goose”라는 프롬프트 지시도 “Think step by step”만큼 추론을 유도함.
  • 서로 다른 단서가 유도하는 은닉 상태 표현은 학습 세트의 서로 다른 문서 유형과 상관관계를 보임.

안전성 행동과 단서

  • 언어 모델 안전성 사례 연구에서도 서로 다른 단서가 서로 다른 거부 및 응답 행동을 유도함.
  • 이러한 행동 차이는 학습 데이터의 서로 다른 유형에 대응함.