TL;DR
- 일일 활성 사용자(DAU) 1억 명 규모의 Muse를 운영하는 기본 시나리오에서는 평균 총전력 약 1~2GW가 필요하며, 추론 호출량에 따라 3~4GW도 가능함.
- 사용자가 하루 두 시간 에이전트를 실행한다고 가정하면 평균 동시 활성 가상 머신(VM)은 약 800만 대, 피크와 여유 용량을 반영한 운영 규모는 약 2,500만 대임.
- 샌드박스 계층은 물리 중앙처리장치(CPU) 코어 약 1,250만 개와 동적 램(DRAM) 약 75~100PB로 추산되며, 공개 가격 기준 비용은 각각 약 8억 달러와 약 20억 달러임.
- Muse의 개인용 컴퓨터는 도구를 실행하고 상태를 저장하지만, 모델 추론은 별도의 Meta 추론 인프라에서 수행됨.
- 소비자 에이전트는 CPU와 일반 DRAM 수요를 키울 수 있지만, 에이전트 작업량이 늘고 추론 궤적이 길어질수록 실제 연산 병목은 추론이며 사용자 수보다 빠르게 수요가 증가할 수 있음.
추정의 전제와 결론
- 에이전트의 활성 시간, CPU와 메모리의 오버서브스크립션 수준, 에이전트당 모델 호출 수, 모델 서빙 효율 등 변동 가능한 가정이 많음.
- 기본 시나리오에서 DAU 1억 명을 지원하는 데 필요한 평균 총전력은 약 1~2GW이며, 이 가운데 CPU·가상 머신(VM) 계층은 약 0.1GW임.
- Muse DAU당 하루 추론 환산 호출 수에 따라 필요한 전력이 달라지며, 총전력 3~4GW도 충분히 가능한 규모임.
- 샌드박스 계층의 비용 추산은 CPU 콘텐츠 10억 달러 미만, DRAM 콘텐츠 약 20억 달러로, 예상보다 작을 수 있음.
- Muse에는 성격이 다른 두 인프라가 있음.
- Muse VM·샌드박스 인프라
- Muse Spark 추론 인프라
Muse VM·샌드박스 인프라
- 사용자당 vCPU 2개, 램(RAM) 약 8GB, 영구 논리 저장 공간 약 100GB를 제공하는 Muse VM 구성이 관찰됨.
- 참고 자료: 관찰된 Muse VM 구성.
CPU
- DAU 1억 명이 동시에 컴퓨팅 자원을 사용한다고 가정하는 것은 첫 번째 계산 오류임.
- Muse DAU 한 명이 하루 평균 두 시간 동안 에이전트를 활성 상태로 둔다고 가정하면 평균 동시 활성 VM 수는 다음과 같음.
- 1억 명 × 2시간 ÷ 24시간 = 약 800만 대
- Meta는 일일 평균만을 기준으로 인프라를 준비할 수 없으며, 사용량은 깨어 있는 시간에 집중되고 순간적으로 급증함.
- 피크 대 평균 비율을 2.5배로 가정하면 피크 활성 VM은 약 2,000만 대이며, 여기에 용량 여유분 약 20%를 더하면 실제 운영 VM은 약 2,500만 대임.
- 따라서 기본 가정은 Meta가 DAU의 약 25%가 동시에 활성화되는 상황을 지원할 만큼의 인프라를 갖춰야 한다는 것임.
- 가상 CPU 할당량과 실제 물리 CPU 수요는 구분해야 함. 에이전트 샌드박스는 대기 시간이 길어 CPU 오버서브스크립션에 특히 적합하며, VM이 실행 상태를 유지하더라도 대기 중에는 CPU를 거의 사용하지 않음.
- DeepSeek이 최근 공개한 DSec 인프라는 비교 기준을 제공함.
- 프로덕션 에이전트 샌드박스 플랫폼은 물리 CPU 코어 약 3만 개와 DRAM 250TB를 약 160개 노드에서 운영하며, 피크 동시성은 샌드박스 38만 개 초과임.
- DSec 논문은 노드당 마이크로 VM(microVM) 약 800개를 안정적으로 운영할 수 있음을 보여줌.
- 노드당 물리 코어가 약 188개이므로, 물리 코어 188개 ÷ microVM 800개 = 활성 VM당 물리 코어 약 0.23개임.
- DeepSeek은 효율성 측면에서 두드러지므로 Muse의 활성 VM당 물리 코어는 0.3~0.75개일 수 있음. 기본 시나리오는 활성 VM당 0.5개로, Muse VM 두 대가 물리 CPU 코어 하나를 동시에 사용하는 수준임.
- 기본 가정에 따른 물리 CPU 코어 수는 2,500만 대 × VM당 물리 코어 0.5개 = 1,250만 개임.
- 256코어 CPU 기준 약 5만 개의 CPU가 필요하며, 192코어 CPU 기준으로는 약 6만 5,000개가 필요함.
- 현재 공개 가격으로 환산한 비용은 약 8억 달러임.
DRAM
- 대기 중인 VM은 CPU를 거의 사용하지 않을 수 있어 CPU는 공격적으로 오버서브스크립션할 수 있지만, 활성 VM은 작업 상태를 유지해야 하므로 메모리는 오버서브스크립션하기가 더 어려움.
- Muse는 사용자 환경에 RAM 약 8GB를 제공하지만, 관찰된 한 인스턴스는 측정 당시 약 3GB만 사용함.
- 활성 VM 2,500만 대 × VM당 3GB를 적용하면 물리 DRAM 75PB가 필요하며, 기본 범위로 약 75~100PB가 합리적임.
- 현재 공개 가격으로 환산한 DRAM 비용은 약 20억 달러임.
샌드박스 전력
- DAU 1억 명 규모에서 Muse 샌드박스·VM 계층 전체의 전력은 약 0.1GW로 추산됨.
추론 인프라
- Muse의 개인용 컴퓨터는 도구를 실행하고 상태를 로컬에 저장하지만, 실제 모델은 별도의 추론 인프라에서 실행됨.
- 모델 추론은 Meta의 외부 추론 인프라를 통해 이뤄짐.
- 참고 자료: Meta의 Muse 아키텍처 설명.
추론 이벤트당 에너지
- Microsoft의 2026년 연구는 최적화된 프런티어급 모델의 일반 질의가 중앙값 기준 약 0.31Wh를 소비한다고 추정함.
- 토큰 수가 약 15배인 긴 추론 질의는 에너지를 약 13배 소비하며, 긴 추론 질의당 소비량은 약 4Wh임.
- 이 연구는 추론 및 에이전트형 작업 부하의 에너지 소비가 상당히 크다고 강조함.
- Muse와 유사한 작업 부하에서는 무거운 추론 환산 이벤트 하나당 5~10Wh를 민감도 분석을 위한 대략적인 범위로 가정함.
- 참고 자료: Microsoft Research의 AI 추론 에너지 연구.
DAU당 하루 추론 환산 이벤트 수에 따른 민감도
- DAU 한 명당 하루 50회의 추론 환산 이벤트를 가정함.
- 활성 Muse 사용자 한 명이 하루에 무거운 추론 이벤트 50회에 해당하는 작업을 생성한다고 가정함.
- 이벤트당 5Wh를 적용하면 1억 명 × 하루 50회 × 5Wh = 하루 25GWh이며, 25GWh ÷ 24시간 = 평균 전력 약 1.0GW임.
- 따라서 추론만으로도 평균 전력 약 1~2GW가 필요할 수 있음.
- 이에 따라 Muse 전체에 3~4GW가 필요한 시나리오도 충분히 가능함.
- Meta가 다음 해 컴퓨팅 용량을 7~10GW 추가할 것이라는 소문도 있음.
핵심 결론
- Muse에 사용자마다 vCPU 2개와 RAM 8GB를 제공한다는 점에 주목하면 CPU 수요가 막대해 보이지만, 논리 VM 할당을 전용 물리 인프라로 간주하는 단순 계산은 CPU 수요를 상당히 과대평가함.
- 소비자 에이전트는 CPU와 일반 DRAM의 새로운 주요 수요원이 될 수 있지만, 컴퓨팅의 실제 병목은 추론임.
- 에이전트가 더 많은 작업을 수행하고 더 긴 실행 궤적을 거치며 다른 에이전트를 점점 더 많이 생성하면, 추론 수요는 사용자 수 자체보다 훨씬 빠르게 증가할 수 있음.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요