TL;DR
- GPU 스레드가 NIC에 직접 RDMA 작업을 제출하는 GPU 직접 통신을 NVIDIA H100, H200, B200, GB200에서 분석한 결과, 제출 경로만으로 통신 성능을 예측할 수 없음.
- 최소 GPU 경로는 작업을 0.7μs에 제출하고 4.0μs에 완료하지만, 라이브러리는 큐 관리·메모리 순서 지정·완료 범위 처리로 제출 시간에 최대 4.6μs를 더함.
- 최적화된 CPU 프록시는 유휴 상태에서 GPU 경로와 대등하거나 더 빠르지만, 전용 코어가 필요하고 코어의 동작 상태가 지연 시간과 처리량을 좌우함.
- 대량 트래픽과 큐를 공유하면 양쪽 경로의 지연 시간이 10~1,000배 높아지며, InfiniBand의 초당 2억 6,000만 메시지 한계에 이르려면 도어벨 배치와 큐 병렬화가 필요함.
- 통신 코드는 사용하지 않을 때도 GPU 블록 상주율을 낮출 수 있고, 약 3,000개 활성 연결의 올투올 트래픽은 NIC 메시지 처리율을 59% 낮춤.
연구 배경 및 범위
- GPU 직접 통신은 GPU 스레드가 NIC에 RDMA 작업을 직접 제출하는 방식이며, Mixture-of-Experts(MoE) 모델의 세분화되고 지연 시간에 민감한 통신에 쓰이는 NVSHMEM, NCCL GIN, DeepEP의 기반임.
- 하드웨어 메커니즘 자체의 비용과 이를 둘러싼 라이브러리 비용을 분리한 성능 분석 및 최적화 정보는 소스 코드 외에는 거의 문서화되지 않았으며, 기존 라이브러리 비교는 두 비용을 분리하지 못함.
- GPU-NIC 경계의 GPU 측 네트워크 경로를 분석하며, 큐 배치, 작업 요청 구성, 도어벨 순서 지정, 완료 의미를 다룸.
- GPU 제출 경로용 최소 전송 계층
mini-gda와 CPU 프록시 제출 경로용mini-proxy를 도입함. - NVIDIA H100, H200, B200, GB200에서
mini-gda,mini-proxy를 NVSHMEM IBGDA, NCCL GIN, DeepEP, UCCL-EP, MSCCL++, fabric-lib와 함께 측정함.
제출 경로 성능
- 최소 GPU 경로는 작업을 0.7μs에 제출하고 4.0μs에 완료하며, 제출 시간은 SM 클록에 따라 달라짐.
- 라이브러리는 큐 관리, 메모리 순서 지정, 완료 범위 처리로 제출 시간에 최대 4.6μs를 추가함.
- 최적화된 CPU 프록시는 유휴 상태에서 GPU 경로와 대등하거나 더 나은 성능을 냄. 다만 전용 코어가 필요하며, 코어의 동작 상태가 지연 시간과 처리량을 결정함.
큐 공유와 확장성의 비용
- GPU 경로와 CPU 경로 모두 대량 트래픽과 큐를 공유할 경우 지연 시간이 한 자릿수에서 세 자릿수 배 증가함.
- InfiniBand 플랫폼의 최대치인 초당 2억 6,000만 메시지에 도달하려면 도어벨 배치와 큐 병렬화가 필요하며, 두 기법 모두 자원을 소모함.
- 통신 코드는 사용하지 않는 경우에도 GPU 블록 상주율을 낮출 수 있음.
- 올투올 트래픽에서는 활성 연결이 약 3,000개일 때 NIC 메시지 처리율이 59% 감소함.
- 따라서 제출 경로만으로 통신 성능을 예측할 수 없음.
자료 및 서지 정보
- 실험 코드와 결과는 논문에서 제공하는 HTTPS 링크를 통해 확인할 수 있음.
- 논문 제목은 *GPU-Initiated Communication: Dissecting Down to the Bone*이며, Javid Baydamirli, Ismayil Ismayilov, Kaan Oktay, Didem Unat이 작성함. 제출일은 2026년 10월 1일이며, 식별자는 arXiv:2610.01380임.
- 분류는 분산·병렬·클러스터 컴퓨팅(cs.DC), 네트워킹 및 인터넷 아키텍처(cs.NI), 성능(cs.PF)임.
- DOI: https://doi.org/10.48550/arXiv.2610.01380
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요