모델의 현재 능력만 평가하는 벤치마크로는 경험을 쌓으며 지속적으로 개선되는 에이전트의 차이를 포착하기 어렵다. 이 연구는 경험을 얼마나 효율적으로 지속적인 성능 향상으로 바꾸는지를 ‘에이전트 가소성(agent plasticity)’으로 정의하고, 체스·바둑·Hex·NetHack에서 여러 모델의 학습 곡선을 비교했다.

실험에서 모델의 가중치는 고정하고, 다음 인스턴스가 물려받는 파일 목록만 바꿨다. 여기에는 Python 도구, 전략과 기술을 담은 파일, 메모가 포함된다. 각 라운드에서 에이전트는 게임을 하고 결과를 바탕으로 파일을 수정한다. 수정 사항은 구조 및 실행 검사를 거치지만, 이 검사는 파일이 유효한지 확인할 뿐 실제로 성능을 높였다는 뜻은 아니다. 거부된 수정도 학습 비용에 포함된다. 평가는 학습에 사용하지 않은 게임으로 진행했다.

체스는 두 난이도(Hard·Easy)로 20라운드, 5×5 바둑과 6×6 Hex는 각각 20라운드, NetHack은 40라운드 진행했다. 체스 상대는 Stockfish 16, 바둑은 GNU Go, Hex는 자체 엔진이었다. 체스·바둑·Hex의 주요 비교에는 세 게임 모두 실행한 여섯 모델을 사용했고, NetHack에는 Claude Code와 Codex를 통해 이용할 수 있던 여섯 모델을 사용했다.

가소성은 향상 폭뿐 아니라 비용도 본다

기본 지표는 보류 평가 점수의 향상 폭을 그 시점까지의 학습 비용으로 나눈 값이다. 학습 비용은 훈련 게임과 성찰에 쓴 API 비용이며, 보류 평가 비용은 제외한다. 성능이 정체된 뒤에도 비용이 쌓이면 이 비율이 낮아질 수 있어, 연구진은 대표 지표로 포화 시점까지의 향상 효율인 Psat을 제시했다. 학습 곡선에 S자형 곡선을 맞춘 뒤, 추정된 전체 향상 폭의 90%에 처음 도달한 체크포인트에서 비용 계산을 멈춘다.

향상 폭이 10점 미만이거나 통계적으로 뒷받침되지 않으면 Psat은 0이다. 포화에 도달한 체크포인트가 없으면 마지막 비용의 최대 세 배까지 곡선을 외삽하고, 그보다 더 멀리 포화가 예상되면 현재까지의 가소성을 보고한다. 측정 방법과 정의

같은 학습 환경에서도 모델별 결과는 달랐다

체스·바둑·Hex의 보류된 동일 분포(ID) 평가에서 Claude Fable 5, Claude Opus 5, GPT-5.6 Sol은 평균 30~40점을 높였다. GPT-5.5는 천천히 향상했고 Claude Opus 4.8과 GPT-5.6 Luna는 거의 변하지 않았다. 체스 Hard에서 Claude Fable 5의 점수는 체크포인트 0의 37.5%에서 16~20의 평균 73.3%로, Claude Opus 5는 25.0%에서 66.4%로 상승했다. GPT-5.6 Sol은 거의 0에서 36.9%로 올랐다. 강한 상대를 상대로 한 분포 외(OOD) 평가에서는 향상이 더 작거나 일관성이 낮았다.

게임별 순위는 같지 않았다. 5×5 바둑에서 Claude Fable 5의 보류 ID 점수는 20%에서 80%로, OOD 점수는 0%에서 50%로 올랐다. 6×6 Hex에서는 GPT-5.6 Sol의 ID 점수가 40%에서 77.5%로, OOD 점수가 28.1%에서 78.1%로 상승했다. Claude Opus 4.8은 바둑에서 성적이 떨어지는 한편 Hex에서는 크게 향상했다. 도구를 만드는 과정에서 문제가 생기면 성능이 되돌아갈 수도 있다. Claude Opus 5는 바둑에서 상당히 향상한 뒤 마지막 체크포인트의 도구 제작 오류로 점수가 급락했다.

NetHack에서는 Claude Opus 5.5만 신뢰할 만한 향상을 보였다. 10개씩의 새로운 게임으로 평가한 점수는 체크포인트 0~2의 약 2,000점에서 36~40의 약 6,000점으로 상승했고, 포화 시점은 체크포인트 11이었다. 정규화 점수 기준 Psat은 학습 비용 $1,000당 61.75점이었다. 다른 다섯 모델은 신뢰할 만한 상승을 보이지 않았다. GPT-5.6 Sol은 보드게임에서는 가장 높은 가소성을 보였지만 NetHack 점수는 약 570점에서 420점으로 하락했다.

NetHack 사례에서는 Claude Opus 5.5가 너무 일찍 기도해 죽은 뒤, 기도가 안전한지 확인하는 자체 컨트롤러(nhctl)를 통해서만 기도하라는 규칙을 CLAUDE.md에 추가했다. 이후 체크포인트 10에서는 체력이 94 중 8까지 떨어진 위기 상황에서 컨트롤러가 허용할 때까지 기다려 완전히 회복했다. 다만 이후 에이전트가 확인 절차를 우회해 기도하다 죽는 경우도 있어 규칙이 항상 지켜진 것은 아니다.

가장 높은 최종 점수와 가장 효율적인 학습은 달랐다

체스·바둑·Hex를 합친 곡선에서 Claude Fable 5는 가장 높은 최종 성능을 보였지만 포화까지 약 $610이 들었다. GPT-5.6 Sol은 더 낮은 점수에서 약 $120을 쓰고 포화했으며, 추정 Psat은 298이었다. Claude Fable 5의 Psat은 57, Claude Opus 5는 약 $140의 비용으로 포화하며 233이었다. GPT-5.5는 실험 종료 시점에도 계속 향상 중이어서 Psat을 확정할 수 없었다. 이 추정치는 제공업체 가격과 포화 곡선 맞춤에 따라 달라지므로, 보편적인 모델 순위가 아니라 해당 실험 절차에 따른 측정치로 봐야 한다. 점수와 비용을 함께 보여주는 첫 번째 그림

연구진은 체스에서 파일을 얼마나 자주 재사용했는지도 살폈다. Claude Fable 5, Claude Opus 5, Claude Opus 4.8, GPT-5.6 Sol은 관련 결정의 94~98%에서 아티팩트를 재사용했다. 반면 GPT-5.6 Luna는 약 98%, Gemini 3.1 Pro는 약 87%, Claude Opus 4.6은 약 51%, GPT-5.5는 약 28%의 관련 결정을 아티팩트 없이 내렸다. 19개 모델-게임 조합에서는 ID 아티팩트 재사용률과 ID 성능 향상이 함께 움직였다. 하지만 재사용률이 높은 모델끼리도 점수 차이가 컸다. 강한 향상 모델에서 확인된 실수의 83~99%는 관련 아티팩트를 사용하는 중에 발생했다. 아티팩트가 상황에 일반화되지 않거나 에이전트가 제대로 적용하지 못할 수 있다는 뜻이다. 이 분석은 관찰 결과이며 인과관계를 입증하지 않는다.

실험 중 Claude Fable 5의 한 실행은 외부 라이브러리 없이 체스 엔진을 작성하고, 실수에 따라 체크 회피, 반복 수 처리, 종료가 가까운 게임의 무승부 평가 등을 수정했다. 이런 변화는 이후 게임에 이어졌다. 다만 각 수정 가운데 어떤 것이 성능 향상을 일으켰는지는 이 사례만으로 알 수 없다.

에이전트 평가와 제작에 주는 시사점

연구진은 최종 점수뿐 아니라 경험을 통해 향상되는 속도도 평가해야 한다고 제안한다. 관련 아티팩트를 에이전트가 실제로 사용하는지 확인하고, 자주 무시한다면 자동으로 불러오거나 실행해 건너뛰기 어렵게 만드는 방안을 고려할 수 있다. 재사용이 이미 잦다면 아티팩트의 품질과 적용 절차를 살펴야 하며, 검증 과정도 파일이 실행되는지만이 아니라 성능에 도움이 되는지 확인해야 한다.

한계도 있다. 가중치를 고정하고 새 컨텍스트를 사용했지만, 학습 피드백의 효과와 아티팩트를 만드는 데 추가로 쓴 연산량을 분리하지는 못했다. 비용 계산에서 배포 비용은 제외했고, 재사용 분석은 관찰적이다. 체크포인트 수가 적어 평가값에 잡음이 생길 수 있으며, NetHack은 체크포인트마다 새로운 게임을 사용해 학습 변화와 게임 난이도 차이가 섞일 수 있다. 별도로 학습한 실행들은 과제 간 전이를 입증하지 않는다. 자세한 내용은 논문에 담겼다.