Datology는 Datology Curation Studio로 공개 데이터셋을 큐레이션해 학습한 모델이 강력한 공개 데이터 기준선 모델보다 모든 테스트 규모에서 높은 성능을 냈다고 밝혔다. 회사의 실험에서 큐레이션 모델은 기준선의 가장 큰 모델과 같은 점수를 학습 컴퓨팅 6분의 1로 달성했으며, 30B-A3B 모델의 사후 학습 벤치마크 평균 점수도 46.8%로 기준선의 37.7%를 앞섰다.
실험 결과와 조건
Datology는 두 모델을 정확히 같은 데이터셋에서 추출한 1조 토큰으로 사전 학습하고, 데이터 큐레이션만 다르게 적용했다고 밝혔다. 사후 학습을 마친 30B-A3B 모델은 기준선보다 평균 벤치마크 점수가 9.1점 높았다. 수학·코드 성능 차이도 컸다. AIME 2025 점수는 19.4에서 35.6으로, HumanEval++은 54.1에서 70.2로, MATH-500은 76.4에서 89.6으로 올랐다.
또한 큐레이션 데이터로 4400억 토큰을 사전 학습한 12B-A1.4B 모델이 1조 토큰으로 학습한 30B-A3B 기준선 모델보다 전반적인 수학·코드 역량에서 높은 점수를 기록했다고 밝혔다. 이때 사전 학습 컴퓨팅은 약 5분의 1이었고 활성 파라미터 수는 절반보다 적었다. 회사는 추론 때도 더 작은 모델의 비용 절감 효과를 기대할 수 있다고 설명했다.
사전 학습 평가에서는 큐레이션 모델이 여러 규모에서 기준선과 비슷한 점수를 더 적은 컴퓨팅으로 냈다. 자유 형식 질의응답 벤치마크에서는 바이트당 비트 손실(bits per byte)이 10~12% 개선됐으며, 이 경향은 사전 학습 컴퓨팅 규모가 3.9e19부터 3.7e22까지 약 세 자릿수 차이 나는 다섯 모델 규모에서 나타났다고 Datology는 밝혔다. 관련 벤치마크는 Hugging Face 컬렉션에서 확인할 수 있다.
기준선과 큐레이션 모델에는 같은 사전 학습 설정과 사후 학습 절차를 적용했다. 사후 학습에는 컨텍스트 확장, 지도 미세 조정(SFT), 검증 가능한 보상 기반 강화 학습(RLVR)이 포함됐다. 사전 학습에서는 기준선에 맞춰 최적화 설정을 조정한 뒤 큐레이션 데이터에도 같은 설정을 사용했다. 다섯 가지 모델 규모에서 토큰 대 활성 파라미터 비율과 너비 대 깊이 설정도 비례해 맞췄다.
공개 데이터 기준선과 큐레이션
Datology는 비교 기준을 높이기 위해 공개적으로 큐레이션된 학습 데이터 39종을 모아 기준선과 큐레이션 데이터셋을 각각 10조 토큰 규모로 설계했다. 자료에는 NVIDIA의 Nemotron 공개 데이터, 합성 SFT 데이터, The Stack v3 코드 저장소, FineWeb과 DCLM 등이 포함됐다. 기준선 혼합 비율은 OLMo 3, Nemotron 3, IBM Granite 4.1의 공개 학습 방식을 참고해 구성했다. 큐레이션 데이터에는 같은 원천 자료를 Datology Curation Studio의 기본 설정으로 처리했다.
기준선의 강도를 확인하기 위해 4B-A0.6B 모델들을 각 데이터 구성으로 1900억 토큰씩 학습했다. FineWeb-Edu와 수학·코드 데이터셋 MegaMath Web, The Stack v2를 2:1:1로 섞은 구성은 FineWeb-Edu 단독보다 전반적으로 나은 성능을 냈다. 여기에 Nemotron-CC 웹 데이터, 수학 데이터, The Stack v3 코드를 넣은 구성은 추가 개선을 보였다. Datology는 자체 기준선의 평균 바이트당 비트 성능이 이 구성보다도 3% 더 좋았으며, 10조 토큰까지 확장할 수 있는 혼합이라고 설명했다. 비교에 사용한 자료는 FineWeb-Edu, MegaMath, The Stack v2, Nemotron-CC-v2, Nemotron-CC-Math-v1, The Stack v3이다.
Datology Curation Studio의 범위
Datology는 Curation Studio가 공개·독점·라이선스 데이터로 학습 데이터셋을 만드는 제품이며, 데이터 정제와 보정, 합성 데이터 생성, 데이터셋 구성 분야의 3년간 연구·개발을 반영했다고 설명한다. 회사가 소개한 주요 처리 방식은 다음과 같다.
- 수학 데이터는 Luxical 기술을 활용해 수학·추론 가치가 높은 자료를 빠르게 평가하고, 독자적인 방식으로 고품질 합성 수학 데이터 수십억 토큰을 생성한다.
- 수학 데이터에서 반복 누출을 찾아 완화한다. Datology는 MegaMath와 UltraData-Math 같은 자료에서 우연한 반복이 1,000회를 넘는 사례도 있었다고 밝혔다. UltraData-Math
- 코드는 여러 단계의 분류를 거쳐 언어별 고품질 자료를 식별하고 균형을 맞춘 뒤, 언어를 고려한 합성 데이터 생성으로 보강한다.
- 합성 데이터는 BeyondWeb 연구를 바탕으로 원천 자료 중 바꿔 쓸 대상을 선택하고 재작성한다.
- 다국어 데이터는 ÜberWeb 연구를 토대로 언어별로 품질이 균일한 결과물을 만든다고 회사는 설명한다.
- 데이터 혼합은 수천 개의 대리 모델과 분석을 이용해 여러 역량의 균형을 맞추는 구성을 찾는다.
Datology는 고정된 공개 데이터셋과 달리 큐레이션 과정은 고객의 독점·라이선스 자료, 목표 역량, 토큰 예산에 맞춰 조정할 수 있다고 강조한다. 새로운 데이터가 나오거나 연구가 진전되면 과정을 다시 실행할 수도 있다고 설명했다. 회사는 제품을 출시 글에서 소개했으며, Thomson Reuters가 독점 법률 자료에 큐레이션을 적용해 Thomson-1을 구축했다고 밝혔다. Datology는 Thomson Reuters, Hudson River Trading, Deepgram도 고객이라고 덧붙였다.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요