TL;DR
- 추론 서비스 GPU 클러스터에서 활용률만 최적화하면 에너지 소비가 오히려 늘 수 있으며, EnerTune은 성능 서비스 수준 목표(SLO)를 충족하면서 에너지 소비를 1.4~2.3배, 전력 사용량을 1.3~2.6배 줄임.
- GPU 할당 크기, 작동 주파수, 배치 크기가 에너지·지연 시간·처리량에 미치는 영향을 함께 고려해야 함.
- 구성마다 광범위한 프로파일링을 수행하면 모델별로 수백 가지 구성과 프로파일링 자체의 에너지 비용 때문에 규모 확장에 부담이 됨.
- EnerTune은 모델별 성능·전력과 공유 GPU에 함께 배치된 모델의 전력 소비를 추정하는 분석 모델을 도입함.
- 분석 모델을 에너지 인식 빈 패킹 알고리즘에 적용해 모델 배치와 구성을 공동으로 결정함.
저자
- Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma, Neeraja J. Yadwadkar가 작성함.
게재 정보
- SOSP '26: ACM SIGOPS 32nd Symposium on Operating Systems Principles에 게재 예정이며, 발표일은 2026년 9월 28일임.
초록
- GPU는 비용이 높지만, 추론 서비스 GPU 클러스터는 여전히 활용률이 낮으며, 최신 시스템은 활용률을 높이기 위해 GPU 멀티플렉싱을 채택함.
- 그러나 활용률만을 최적화하면 직관과 달리 에너지 소비가 증가할 수 있음. 전력과 에너지를 핵심 지표로 다루는 정책을 설계하려면 GPU 할당 크기, 작동 주파수, 배치 크기 등 배포 결정이 에너지·지연 시간·처리량에 미치는 영향을 파악해야 함.
- 이들 간 관계가 복잡해 기존 접근법은 광범위한 프로파일링에 의존함. 모델마다 수백 가지 구성으로 배포할 수 있어 대규모 환경에서 프로파일링 비용이 감당하기 어려워지며, 프로파일링 자체에도 상당한 에너지가 들어 정확하면서도 에너지 소비를 고려하는 방법이 필요함.
- 이런 시스템은 공유 GPU에서 함께 배치된 모델들의 전력 소비를 모델링하고, 동적으로 변하는 워크로드에도 적응해야 함.
- EnerTune은 모델별 성능과 전력, 공유 GPU에 함께 배치된 모델들의 전력 소비를 추정하는 분석 모델을 도입하고, 이를 에너지 인식 빈 패킹 알고리즘에 적용해 모델 배치와 구성을 함께 결정함.
- EnerTune은 성능 SLO를 충족하면서 최신 기준 시스템보다 에너지 소비를 1.4~2.3배, 전력 사용량을 1.3~2.6배 줄임.
서지 정보
- 논문 제목: Beyond Utilization: Energy-Conscious GPU Sharing for Inference Serving
- 학회: SOSP '26: ACM SIGOPS 32nd Symposium on Operating Systems Principles
- 연도: 2026
- DOI: 10.1145/3830418.3843913
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요