TL;DR
- 대규모 언어 모델 사전 학습에서 동기화로 인한 전체 작업 중단을 줄이기 위해, Decoupled DiLoCo가 독립적으로 작동하는 학습자와 비동기 업데이트 병합을 활용해 장애가 잦은 환경에서도 높은 학습 처리 효율을 달성하는 방식임.
- 기존 SPMD(단일 프로그램 다중 데이터) 학습은 가속기 간 긴밀한 동기화를 요구해 일시적 성능 저하, 하드웨어 장애, 동기화 오버헤드가 전체 연산을 멈추게 함.
- DiLoCo가 통신 대역폭을 줄였지만 동기식 구조를 유지한 반면, Decoupled DiLoCo는 여러 독립적인 학습자가 로컬 최적화를 수행하고 중앙 동기화 장치와 비동기적으로 통신하는 구조임.
- 중앙 동기화 장치는 최소 정족수, 적응형 유예 시간, 토큰 가중치 기반 동적 병합으로 장애가 발생하거나 뒤처지는 학습자를 우회함.
- 수백만 개 칩을 시뮬레이션한 장애 취약 환경에서 전역 가동 중단 없이 학습 효율을 높였으며, 텍스트·비전 작업과 밀집형·전문가 혼합 모델에서 경쟁력 있는 성능을 유지함.
기존 분산 사전 학습의 문제
- 현대의 대규모 언어 모델 사전 학습은 가속기 간 긴밀한 결합을 요구하는 SPMD 패러다임에 크게 의존함.
- 이 결합 구조에서는 일시적인 처리 속도 저하, 하드웨어 장애, 동기화 오버헤드가 전체 계산을 멈추게 해 대규모 환경에서 상당한 연산 시간을 낭비함.
- 최근의 분산 학습 기법인 DiLoCo는 통신 대역폭을 줄였지만, 근본적으로 동기식이며 시스템 중단에 취약함.
Decoupled DiLoCo의 구조
- Decoupled DiLoCo는 DiLoCo 프레임워크를 확장해 단계별 동기화 장벽을 해체하고, SPMD를 넘어 학습 처리 효율을 극대화하는 방식임.
- 계산을 여러 독립적인 학습자(learner) 에 분할하며, 각 학습자는 자체적인 내부 최적화 단계를 실행함.
- 학습자는 매개변수 조각을 중앙 동기화 장치에 비동기적으로 전달함.
- 중앙 동기화 장치는 다음 메커니즘을 사용해 장애가 발생하거나 처리 속도가 늦은 학습자를 우회함.
- 최소 정족수
- 적응형 유예 시간
- 토큰 가중치 기반 동적 업데이트 병합
실험 결과와 적용 범위
- ‘카오스 엔지니어링(chaos engineering)’에서 영감을 받은 접근법으로, 수백만 개의 칩을 시뮬레이션한 장애 취약 환경에서 학습 효율을 크게 높이고 전역 가동 중단을 완전히 제거함.
- 텍스트 및 비전 작업에서 경쟁력 있는 모델 성능을 유지하며, 밀집형 모델과 전문가 혼합(MoE) 모델 모두에 적용됨.
논문 정보
- 제목: *Decoupled DiLoCo for Resilient Distributed Pre-training*
- 제출일: 2026년 4월 23일
- 저자: Arthur Douillard, Keith Rush, Yani Donchev, Zachary Charles, Nova Fallen, Ayush Dubey, Ionel Gog, Josef Dean, Blake Woodworth, Zachary Garrett, Nate Keating, Jenny Bishop, Henry Prior, Edouard Yvinec, Arthur Szlam, Marc'Aurelio Ranzato, Jeff Dean
- 분류: 계산과 언어(Computation and Language, cs.CL)
- 논문 식별자: arXiv:2604.21428
- DOI: https://doi.org/10.48550/arXiv.2604.21428
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요