TL;DR
- GPT-3.5 Turbo Instruct가 정교하게 형식화된 PGN을 입력받은 체스 대국에서 GPT-5.6 Sol과 Claude Opus 5를 상대로 4전 전승을 거뒀으며, 지난해에는 o3·Grok 4·Gemini 2.5 Pro를 상대로도 6전 전승을 기록함.
- 2026년 네 경기는 모두 20~22수 사이에 끝났으며, 세 경기는 이미 사라진 비숍이나 룩을 움직이려는 불법 수로, 한 경기는 체크 상태에서 합법 수가 아닌 킹 이동을 골라 패배함.
- 2025년 여섯 경기는 체스판 위에서 결정됐고 네 경기는 체크메이트로 끝났으며, 나머지 두 경기는 이미 패세가 기운 상태에서 불법 수가 나옴.
- GPT-3.5 Turbo Instruct는 PGN 형식에 민감해 공백이 조금만 달라져도 체스 실력이 떨어지며, 대국 기록을 이어 쓰는 방식이 학습 데이터의 강한 기보와 맞물렸을 가능성이 제기됨.
- 결과가 최신 모델의 체스 실력 부족인지 채팅 형식이 실력을 끌어내지 못한 것인지는 확정되지 않았으며, GPT-3.5 Turbo Instruct의 서비스 종료가 예정돼 있어 같은 조건의 재대결은 어려워짐.
모델과 대국
- 지난 몇 년간 여러 차례 진행한 실험을 다시 수행해 GPT-3.5 Turbo Instruct를 최신 대형 언어 모델(LLM)과 체스에서 대결시킴. GPT-3.5 Turbo Instruct는 GPT-5.6 Sol과 Claude Opus 5를 상대로 네 경기 모두 이겼으며, 지난해에는 o3·Grok 4·Gemini 2.5 Pro를 상대로 여섯 경기를 모두 이김.
- 지금까지 10전 10승이며, OpenAI가 다음 날 GPT-3.5 Turbo Instruct 접근을 종료할 예정이어서 2023년 모델이 무패로 은퇴하는 이유를 살펴볼 시점이라고 설명함.
- GPT-3.5 Turbo Instruct는 지시문 미세 조정 모델이지만 완성(completion) 인터페이스를 사용해 제공된 텍스트를 그대로 이어 씀. 체스에서는 미완성 기보를 휴대용 게임 표기법(PGN)으로 입력하고 다음 수를 이어 쓰게 함.
- 프롬프트의 헤더에는 최상위 수준의 대국임을 나타내는 정보와 다음 수를 둘 쪽의 승리 결과를 적어 최선의 수를 두도록 유도함.
- GPT-5.6 Sol과 Claude Opus 5는 일반 사용자용 채팅 앱에서 중간 수준의 추론 설정으로 대국함. 초기 설정 메시지 이후 양측의 모든 메시지는 기보 표기법(SAN)으로 된 한 수였으며, 수 번호나 체스판은 제공되지 않았고 재시도도 허용되지 않음. 불법 수를 두면 패배 처리됨.
- 2025년 상대 모델들은 애플리케이션 프로그래밍 인터페이스(API)를 통해 대국함. 매 차례 전체 PGN을 받고 다음 수를 두라는 지시를 받음.
- 2026년 네 경기는 모두 20~22수 사이에 끝났고 체크메이트로 끝난 경기는 없음. 세 번은 이미 체스판에서 사라진 비숍이나 룩으로 잡기를 시도함. 나머지 한 번은 Opus 5가 체크 상태에서 합법 수가 두 개뿐인데도 둘 다 두지 않고, 킹으로 수비받는 나이트를 잡으려 함.
두 가지 패배 방식
- 프런티어 모델의 실패는 기물 위치를 잊는 경우와 위치를 알고도 나쁜 수를 두는 경우로 나뉨.
- 2026년 대국은 대부분 첫 번째 유형임. 네 번의 불법 수 중 세 번은 이미 사라진 기물을 사용함. Opus 5의 킹 이동 실수(2번 경기)는 조금 다른 유형으로, 나이트는 실제로 c6에 있었지만 그 나이트를 지키는 폰도 있었음.
- 대국 형식도 도움이 되지 않았을 가능성이 있음. 매 수가 번호나 체스판 없이 별도의 짧은 메시지로 전달돼 모델은 매번 긴 대화 기록을 바탕으로 대국을 재구성해야 했음. 반면 GPT-3.5에는 번호가 매겨진 전체 기록이 주어짐.
- 2026년 불법 수 시점의 체스 엔진 평가에서 1점은 대략 백의 폰 하나에 해당하는 우세를 의미함.
- 1번 경기: GPT-5.6 Sol이 흑을 둔 시점은 백 우세 +14임.
- 2번 경기: Claude Opus 5가 흑을 둔 시점은 백 우세임.
- 3번 경기: GPT-5.6 Sol이 백을 둔 시점은 흑 우세 -7임.
- 4번 경기: Claude Opus 5가 백을 둔 시점은 흑 우세 -7임.
- 2025년 대국은 체스판 위에서 승패가 갈림. 여섯 경기 중 네 경기는 체크메이트로 끝났고, 나머지 두 경기는 이미 회복하기 어려운 국면에서 나온 불법 수로 끝남. 매 차례 전체 PGN을 제공해도 불법 수를 막지는 못함.
- o3는 특히 눈에 띄는 상대임. PGN 수 목록을 최종 체스판으로 변환하는
PGN2FEN벤치마크에서 모든 대국 길이에 걸쳐 90%가 넘는 점수를 얻었으므로, 체스판을 읽는 능력 자체가 문제였던 것은 아님.
자물쇠와 열쇠
- GPT-3.5 Turbo Instruct의 체스 능력에는 큰 제약이 있음. 신중하게 형식을 맞춘 PGN을 제공했을 때만 좋은 수를 두며, 시험한 다른 모든 표기 방식에서는 경기력이 낮음. PGN의 공백이 조금만 달라져도 체스 성능이 떨어짐.
- 가능한 설명은 학습 데이터임. 실제 대국 기록을 이어 쓰려면 지금까지의 대국에 맞는 수를 예측해야 하고, 강한 선수들의 기보에 기록된 수는 대부분 좋은 수임. 이런 데이터가 충분하면 체스를 명시적으로 가르치지 않아도 유능한 체스 플레이가 가능해질 수 있음.
- 2025년 대국에서는 같은 열쇠를 더 새로운 자물쇠에 넣어 시험함. 프런티어 모델은 같은 PGN을 받고도 여섯 경기에서 모두 패했지만, GPT-3.5는 대국 기록을 이어 쓴 반면 다른 모델들은 지시문 안에 기보를 받은 뒤 수를 선택하라는 요청을 받았다는 차이가 있음.
실력인가, 형식인가?
- 결과는 두 가지로 해석할 수 있음. 첫 번째 해석은 최신 모델도 체스를 잘 둘 수 있지만, 채팅 중심 학습 때문에 대국 기록만으로는 그 능력이 드러나지 않는다는 것임. 그렇다면 완성 방식의 프롬프트가 더 나은 체스 결과를 낼 수 있지만, 채팅 전용 API로는 이를 직접 시험하기 어려움.
- 두 번째 해석은 체스 실력 자체가 약해졌다는 것임. o3는
PGN2FEN에서 90%를 넘는 점수를 얻고도 대국에서 패했으므로, 체스판을 잘못 읽은 것이 원인은 아니었던 것으로 보임. 다만PGN2FEN은 요청받았을 때 체스판을 재구성할 수 있음을 보여줄 뿐, 수를 선택하는 동안 체스판을 추적한다는 뜻은 아님. 특정 형식에서만 발휘되는 능력이라면 같은 결과가 나올 수 있음. - 두 해석을 구분하려면 프런티어 모델을 완성 방식으로 시험해야 하지만, 재대결이 이뤄지기 전에 GPT-3.5 Turbo Instruct가 서비스에서 사라질 예정임.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요