TL;DR

  • Nemotron 3를 지도 미세 조정(SFT), 강화 학습(RL), 피드백 기반 추론으로 특화해 IMO 2026에서 30/42점, IOI 2026에서 535.4/600점을 달성함.
  • IOI 점수는 금메달 기준인 361.12점과 인간 최고점인 498.27점을 웃돌았으며, 비공식·비감독 벤치마크로 진행돼 공식 순위에는 포함되지 않음.
  • IMO 시스템은 공식 금메달 기준인 29점을 넘었고, 제출한 증명은 공식 IMO 채점관이 평가함.
  • 두 대회 모두 도메인별 데이터와 SFT·RL에 생성·평가·개선 추론 루프를 결합했으며, 미세 조정이나 대량 샘플링만으로 성과를 내지는 않음.
  • IMO 체크포인트와 데이터셋, 벤치마크 및 추론 파이프라인, IOI 모델과 학습·평가 자료를 공개해 재현 가능한 특화 방법을 제공함.

재사용 가능한 특화 방법

  • ‘미세 조정하기 쉬움’은 체크포인트를 학습할 수 있다는 의미를 넘어, 성능이 뛰어난 기반 모델을 명확하고 재사용 가능한 절차로 까다로운 도메인에 적용할 수 있다는 의미임.
  • 두 프로젝트에서 사용한 절차는 다음 네 단계임.
  • 강력한 Nemotron 기반 모델로 시작함.
  • 도메인별 문제와 고품질 추론 과정을 선별함.
  • SFT와 필요한 경우 RL 등 표준 사후 학습 방법을 적용함.
  • 후보 답변을 생성하고 평가한 뒤 개선하는 추론 루프를 특화 모델에 결합함.
  • 학습과 추론에는 상당한 계산 자원이 들었지만, 접근 방식은 익숙하고 재현 가능함. 과제마다 새로운 기반 모델을 만들지 않고 Nemotron을 과제에 맞게 특화함.

일반 코딩 능력에서 IOI 금메달 수준까지

  • 경쟁 프로그래밍을 위해 22,000개 문제를 선별하고 합성 추론 과정을 생성해 두 가지 특화 모델을 학습함.
  • 총 300억, 활성 30억 매개변수인 Nemotron-3-Nano-CC에는 SFT와 RL을 모두 적용함.
  • 총 5,500억, 활성 550억 매개변수인 Nemotron-3-Ultra-CC에는 SFT를 적용함.
  • IOI 2025 점수에서 특화의 효과가 드러남. Nano는 사후 학습 전 130점에서 SFT 후 280점, RL 후 291점으로 향상됨. 반복 생성·평가·개선 전략인 GenCorrect를 적용하자 468점을 기록해 금메달 기준인 438.3점을 넘었으며, Ultra-CC는 같은 테스트 시점 전략으로 502점을 기록함.
  • 규모별로 적응 방식이 달라질 수 있음을 확인함. Nano에서는 SFT가 향상의 대부분을 이끌었고 RL은 더 작지만 일관된 개선을 더함. 더 강력한 Ultra 모델은 SFT 한 번의 에포크만으로도 IOI, ICPC, LiveCodeBench Pro 전반에서 완전히 사후 학습된 Nano 모델을 능가함.
  • 이 결과를 바탕으로 IOI 2026용 대회 특화 Ultra-CC 시스템을 구성했으며, 600점 만점에 535.4점을 기록함.

증명하고 검증하며 수정하도록 Nemotron 학습

  • IMO 프로젝트는 올림피아드 수학에 같은 접근 방식을 적용함. Nemotron 3 Ultra를 기반으로 SFT 특화 모델 하나와 RL 특화 모델 하나를 학습함.
  • SFT 데이터셋에는 15,818개의 고유 증명 문제에서 수집한 품질 필터링 사례 414,890개가 포함됨. 최종 답변뿐 아니라 증명 생성, 개선, 검증, 메타 검증을 다뤄 모델이 논증 구성, 빈틈 식별, 비판 대응, 증명 완결성 판단을 학습하도록 함.
  • RL 모델은 모델의 역량 한계선에 가까운 9,597개의 증명 문제로 학습함.
  • 개발 실험에서 두 사후 학습 체크포인트 모두 일반 제공 모델을 능가함. SFT 체크포인트는 첫 검색 라운드에서 가장 강했고, RL 체크포인트는 단일 체크포인트 기준 종합 성과가 가장 높았음. 두 모델의 강점이 상호 보완적이어서 최종 시스템은 두 특화 모델과 일반 모델을 함께 사용함.
  • 각 IMO 문제에서 모델들은 후보 증명을 생성하고 점수를 매긴 뒤 비평을 작성하고 유망한 시도를 개선함. 별도의 고계산량 단계에서 최종 제출물을 선정함.
  • 시스템 전체는 형식 증명기, 외부 도구, 인터넷 접속 없이 자연어만으로 작동함. 총 42점 중 30점을 얻었으며, 6개 문제 중 4개에서 만점을 받아 공식 금메달 기준을 넘음.

미세 조정과 테스트 시점 계산의 결합

  • 이전 IOI 2025 Hugging Face 게시물에서는 테스트 시점 계산이 오픈 웨이트 모델의 성능을 금메달 수준까지 끌어올릴 수 있음을 보였음. 이번 결과는 더 나은 특화가 추론 시스템에 더 나은 후보 답변과 비평, 개선 결과를 제공한다는 점을 더함.
  • IOI에서는 GenCorrect가 여러 피드백 라운드를 거치며 미세 조정의 이점을 더 큰 성능 향상으로 전환함. IMO에서는 한 체크포인트에서 샘플을 더 많이 뽑는 것보다 상호 보완적인 SFT·RL 체크포인트를 함께 사용하는 편이 더 효과적이었음.
  • 두 대회 모두 성능이 뛰어난 특화 모델에 탐색·검증·개선 시스템을 결합했을 때 최선의 결과를 얻음.
  • 메달 성과는 미세 조정만으로도, 무차별적인 샘플링만으로도 만들어지지 않음. 모델, 데이터, 추론 루프를 함께 설계한 결과임.

Hugging Face에서 공개한 모델·데이터·방법

  • Nemotron Labs IMO 2026 컬렉션에는 SFT·RL 체크포인트, 두 학습 데이터셋, 올림피아드 수준 문제 200개로 구성된 신규 벤치마크 Nemotron-IMO-Bench가 포함됨.
  • IMO 논문은 학습 접근 방식과 생성·검증·개선 시스템을 설명하며, NeMo-Skills 저장소에는 IMO 추론 파이프라인, 프롬프트, 제출 증명, 재현 가능한 빠른 시작 안내가 포함됨.
  • 경쟁 프로그래밍용 Nemotron-3-Ultra-CC 모델은 Hugging Face에서 제공되며, IOI 논문에는 학습 방법과 GenCorrect 방법론이 담겨 있음. IOI 평가 및 추론 파이프라인도 NeMo-Skills에서 제공됨.
  • IMO와 IOI 결과는 Nemotron을 미세 조정해 세계적 수준의 도메인 특화 모델로 만들고, 투명한 추론 워크플로와 결합해 인간 경쟁의 최전선에 있는 문제를 풀 수 있다는 점을 보여줌.