TL;DR

  • Purlin은 GPU 집단 통신에서 오케스트레이션과 데이터 경로를 분리하는 스케일업 통신 프레임워크로, A100·H200·B200에서 통신 성능과 추론·이미지 생성 성능을 개선함.
  • 최상위 계층은 입력·출력 레이아웃과 복사 또는 축소 연산으로 집단 통신을 명세함.
  • 중간 계층의 SNAC(Stage, Notify, And Consume) 프로토콜은 명세에서 조정 절차를 도출함.
  • 하드웨어별 데이터 경로인 Atom은 복사와 축소라는 두 가지 데이터 이동 기본 연산을 구현함.
  • 7개 집단 통신에서 지연 시간 최대 5.14배, 대역폭 최대 4.50배 개선을 달성하고, SGLang 통합 시 여러 추론 및 이미지 생성 작업의 성능도 향상함.

배경과 문제

  • 분산 추론은 변화하는 하드웨어와 특화된 작업에 맞춰야 하는 GPU 집단 통신에 의존함.
  • 기존 집단 통신 구현은 의미 체계, 데이터가 이동하는 위치와 시점을 정하는 오케스트레이션, 데이터 이동 방식을 정하는 데이터 경로를 결합하는 경우가 많음.
  • 이 결합은 새로운 하드웨어 메커니즘을 도입하고 애플리케이션에 맞춰 통신을 조정하는 일을 어렵고 비용이 많이 들게 함.

Purlin의 설계

  • Purlin은 집단 통신의 관심사를 분리하는 스케일업 통신 프레임워크임.
  • 최상위 계층에서는 입력 및 출력 레이아웃과 복사 또는 축소 연산을 지정해 집단 통신을 표현함.
  • 중간 계층에서는 공통 오케스트레이션 프로토콜인 SNAC(Stage, Notify, And Consume)를 사용하며, 이 프로토콜은 명세를 바탕으로 조정 방식을 도출함.
  • SNAC 아래에는 하드웨어별 데이터 경로인 Atom이 위치하며, 집단 통신에 필요한 두 가지 데이터 이동 기본 연산인 복사와 축소를 구현함.
  • 관심사 분리를 통해 SNAC의 오케스트레이션을 재사용하면서 집단 통신을 맞춤화하고 새로운 하드웨어 메커니즘을 적용할 수 있음.

평가 결과

  • A100, H200, B200 GPU에서 Purlin을 평가함.
  • 7개 집단 통신에서 기준 구현 대비 지연 시간은 최대 5.14배 빨라지고 대역폭은 최대 4.50배 향상됨.
  • SGLang에 통합했을 때 오프라인 대형 언어 모델(LLM) 서빙의 처리량과 상호작용성이 기준 구현 대비 평균 1.13배, 최대 1.37배 향상됨.
  • 온라인 LLM 추론의 상호작용성은 평균 1.26배, 최대 2.85배 향상되며, 가장 큰 개선은 과부하 상황에서 나타남.
  • 확산 이미지 생성의 종단 간 지연 시간은 최대 1.13배 감소함.

논문 정보

  • 제목: *Purlin: Separating Orchestration from the Datapath of Collectives*
  • 저자: Osayamen Jonathan Aimuyo, Swapnil Gandhi, Christos Kozyrakis
  • 제출일: 2026년 9월 29일
  • 분야: 분산·병렬·클러스터 컴퓨팅(cs.DC), 인공지능(cs.AI)
  • 인용 정보: arXiv:2609.36954 [cs.DC], 버전 1은 arXiv:2609.36954v1 [cs.DC]임.
  • DOI: https://doi.org/10.48550/arXiv.2609.36954