TL;DR

  • Queen은 40억 개 매개변수로 그랜드마스터 수준의 체스를 두고 수와 계획을 설명하며, 7회 반복 학습으로 2697 엘로에 도달함.
  • 침묵하는 체스 전문가 인코더와 명령어 미세 조정 언어 모델(LLM)을 교차 어텐션으로 결합한 인코더-디코더 구조임.
  • 질의응답 학습 과정으로 인코더 표현에서 체스 개념을 추출하고, 후보 수 이후의 국면을 분석해 설명을 개선하는 반복 증류 알고리즘임.
  • 7회 반복 과정에서 엘로 점수가 1782에서 2697로 900점 이상 상승했으며, 매개변수 수가 세 자릿수 배 적은데도 최첨단 모델을 체스 실력과 퍼즐 정확도에서 크게 앞섬.
  • 설명의 유창성은 높고 일관성은 GPT-5.6-Sol(high)에 근접하며, 이 구조와 학습 절차는 게임·로봇공학·컴퓨터 사용 등으로 적용 가능성이 제시됨.

연구 배경과 Queen

  • 최신 체스 엔진은 초인적 수준으로 경기하지만 수를 설명하지 않는 반면, 언어 모델(LLM)은 그럴듯한 설명을 생성해도 경기력이 약해 설명의 효용이 제한됨.
  • Adithya Bhaskar, Jeffrey Cheng, Danqi Chen은 수와 계획을 설명하면서 일반적인 그랜드마스터 수준으로 경기하는 매개변수 40억 개의 체스 언어 모델 Queen을 소개함.

모델 구조와 학습 방법

  • 도메인 특화 추론을 위해 인코더-디코더 구조와 반복 증류 알고리즘을 결합함.
  • 침묵하는 전문가 체스 인코더와 명령어 미세 조정 언어 모델을 교차 어텐션으로 통합하고, 질의응답 학습 과정으로 인코더 표현에서 체스 개념을 추출하도록 학습함.
  • 도메인에 적응한 모델의 설명을 개선하기 위해 벨만 업데이트(Bellman update)의 자연어 유사 방식을 사용함.
  • 모델이 상위 후보 수를 둔 뒤의 국면을 분석하고, 이를 현재 국면에 대한 설명으로 통합함.
  • 완성된 설명을 다시 모델에 증류함.

성능과 적용 가능성

  • 7회 반복 학습에서 엘로 점수가 1782에서 2697로 900점 이상 상승함.
  • 매개변수 수가 최첨단 모델보다 세 자릿수 배 적은데도 체스 경기력과 퍼즐 정확도 모두에서 모든 최첨단 모델을 크게 능가함.
  • 언어 모델 기반 평가에서 설명은 유창하고, 일관성은 GPT-5.6-Sol(high)에 근접함.
  • 침묵하는 전문가 인코더를 이용할 수 있는 게임, 로봇공학, 컴퓨터 사용 등의 분야에 언어 모델을 적용하는 방법으로 일반화될 가능성이 제시됨.
  • 논문: arXiv:2610.03695