TL;DR
- 인터넷 규모 데이터로 사전 학습한 대조 언어 모델(Contrastive Language Model, CLM)인 CLM-8B가 컴퓨터 사용, 게임, 도구 호출에서 비슷한 성능을 내면서 Jev보다 최대 9배 빠른 추론을 제공함.
- 가벼운 미세 조정만으로 에이전트 코딩 벤치마크인 DeepSWE 81.6%, Terminal-Bench 2.1 87.6%를 달성해 새로운 최첨단(SOTA) 성능을 기록함.
- Jev는 장기 작업에서 효과적인 검증기로 기능하지 못하는 반면, CLM은 해당 작업에서 성능을 보임.
- 상태와 행동을 분리하는 학습·서빙 인프라로 두 요소의 임베딩을 독립적으로 캐시하고 재사용해, 상태는 계속 변하고 행동 집합은 고정된 환경에서 추론 지연을 크게 줄임.
- 테스트 대조 손실이 학습 연산량, 모델 크기, 데이터셋 크기에 따라 멱법칙으로 예측 가능하게 감소한다는 CLM 스케일링 법칙을 수립했으며, 블로그, 코드, Discord, 데이터 및 모델을 공개함.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요