Prime이 오픈 모델을 위한 추론 서비스 Prime Inference를 공개했다. 서버리스 엔드포인트와 예약 용량을 제공하며, 여러 데이터센터의 GPU 인프라에서 모델을 서비스한다. 기존 OpenAI SDK와 도구를 Prime 엔드포인트 및 API 키로 연결할 수 있다.

Prime은 공개 전부터 강화학습 롤아웃, 합성 데이터 생성, 평가, 코딩 에이전트에 이 서비스를 사용했다고 밝혔다. 내부에서 하루 거의 1조 토큰을 처리했고, 고객의 대규모 프로덕션 배포도 1월부터 지원했다고 설명했다. 첫 공개 배포인 GLM-5.3은 9월 22일 OpenRouter에 출시됐다. Prime에 따르면 해당 엔드포인트는 OpenRouter에서 가장 빠른 GLM-5.3 엔드포인트 중 하나이며, 출시 이후 가동률은 100%, 도구 호출 오류율은 거의 0에 가깝다.

  • 서버리스 엔드포인트는 수요 변동이 큰 작업에, 예약 용량은 지속적인 작업에 맞춰 제공한다.
  • 데이터센터 간 자동 장애 조치와 여유 용량을 활용해 트래픽을 정상 배포로 돌린다. Prime은 NVIDIA Blackwell을 사용 중이며 Vera Rubin 도입은 예정돼 있다고 밝혔다.
  • 모델 간 통합 청구와 팀 단위 사용량 추적 기능을 제공한다.
  • 인프라에는 NVIDIA Dynamo, vLLM, Mooncake, FlashInfer가 포함되며, Prime은 Inferact 및 NVIDIA와 협력하고 개선 사항을 상위 오픈소스 프로젝트에 기여한다고 밝혔다.

시작 방법과 서비스 운영

CLI 사용 예시는 다음과 같다.

prime inference chat 'z-ai/glm-5.3' "Write a haiku about KV caches."

또는 OpenAI SDK가 https://api.pinference.ai/api/v1을 사용하도록 설정할 수 있다. 전체 API 설명은 문서에서 확인할 수 있다.

Prime은 공개 API와 모델 서버를 분리해 용량을 이동하거나 확장해도 클라이언트 엔드포인트를 바꾸지 않도록 설계했다고 설명한다. 공유 회로 차단기와 임대 기반 요청 제어로 장애에 대응하고 과부하를 막는다. GPU 클러스터는 NVLink와 InfiniBand까지 상태를 점검하며, 24시간 대기팀이 알림을 받는다고 밝혔다.

GLM-5.3 서빙 최적화

Prime은 장시간 대화하는 에이전트 요청과 긴 신규 프롬프트가 함께 들어오는 상황을 기준으로 GLM-5.3을 조정했다. 벤치마크에는 다중 턴 세션을 재생하는 SemiAnalysis의 AgentX를 사용하고, 긴 프롬프트를 가진 신규 요청도 추가했다. 사용자별 초당 토큰과 GPU별 출력 토큰을 측정했다.

긴 입력을 처리하는 프리필(prefill)과 토큰을 생성하는 디코드를 별도 GPU 그룹으로 분리했다. NVIDIA Dynamo가 라우팅과 오케스트레이션을 맡고, vLLM이 각 그룹에서 모델을 실행한다. 프리필이 끝나면 디코더가 NIXL을 통해 KV 캐시를 가져온다. Prime은 이 구성을 통해 자체 테스트에서 p90 토큰 간 지연을 거의 40% 줄였다고 밝혔다.

Dynamo의 KV 인식 라우터는 프롬프트 캐시가 얼마나 있는지와 대기 작업량을 고려해 프리필 워커를 선택한다. 세션은 턴 사이에 같은 디코더에 유지하고, Mooncake를 이용해 호스트 메모리에도 캐시를 보관해 GPU 메모리에서 밀려난 대화 기록을 재사용한다.

Prime은 사용자별 초당 100토큰을 목표로 동시 세션 수를 조정했다. GB200 NVL72에서 프리필과 디코드 그룹 비율을 1:4로 설정했을 때 프리필 그룹당 66개 세션을 처리했으며, 사용자당 초당 101토큰과 GPU당 초당 출력 100토큰을 기록했다고 밝혔다.

프리필 단계에서는 GPU당 처리 토큰 예산을 8K에서 4K로 줄였다. 요청이 더 자주 스케줄러에 들어갈 기회를 얻으면서, 해당 구성에서 중앙값 대기 시간이 550밀리초에서 110밀리초로 줄고 첫 토큰까지 걸리는 중앙값은 약 20% 감소했다. 다만 긴 프롬프트를 캐시 없이 처리할 때는 작은 단위로 나누는 데 따른 추가 비용이 생긴다. Prime은 대부분의 턴이 기존 접두부를 재사용하는 자사 작업에서 이 절충이 효과적이었다고 설명했다.

KV 캐시와 데이터 전송

Prime은 NVFP4 압축을 적용해 MLA의 512개 값으로 구성된 잠재 표현을 값당 4비트로 저장하고, 16개 값마다 FP8 스케일을 사용했다. 위치 정보에 해당하는 64개 값은 FP8로 유지했다. 스케일을 포함한 캐시 행 크기는 576바이트에서 352바이트로 줄었다. 같은 메모리 예산에서 디코더당 캐시 용량은 109만 토큰에서 163만 토큰으로 약 50% 늘었다고 밝혔다.

압축 데이터를 기존 어텐션 커널에 전달하기 전 FP8 임시 버퍼로 풀어 쓰는 방식은 변환과 GPU 메모리 쓰기·읽기가 추가됐다. Prime은 이를 없애기 위해 FlashInfer에 실험용으로 기여할 네이티브 희소 MLA 커널을 만들었다. GB200에서 쿼리 토큰 15개를 처리한 측정에서는 커널 시간이 약 12.0마이크로초였다. 비교 대상으로 제시한 단계식 NVFP4 경로는 17.7마이크로초, FP8 어텐션은 13.7마이크로초였다. 이는 해당 작업 조건의 결과이며 모든 배치 크기에서 FP8보다 빠르다는 뜻은 아니라고 밝혔다. NVFP4가 정확도를 떨어뜨리지 않는지 확인하기 위해 긴 문맥 작업을 특히 강조한 평가도 수행했다고 설명했지만, 구체적인 평가 결과는 제시하지 않았다.

프리필에서 디코드로 KV 캐시를 옮기는 과정에서는 NVLink 구성이 InfiniBand보다 첫 토큰 지연을 약 292밀리초 늘리는 문제가 있었다. Prime은 전송이 작은 복사 작업으로 쪼개지는 것을 원인으로 지목했다. TP4 랭크에 20만 토큰 요청 하나가 들어올 때 복사 작업이 3만 2천 건 발생했다.

vLLM 커뮤니티가 도입한 블록 우선 메모리 배치인 BLHNC를 적용하자 데이터 전송을 더 적고 큰 복사 작업으로 묶을 수 있었다. 별도의 TP8 비교에서 레이어 우선 LBHNC는 1,024토큰 블록을, BLHNC는 그보다 16배 작은 64토큰 블록을 사용했다. 그럼에도 전송 설명자 수는 19,559개에서 약 1,940개로 줄었고 평균 전송 시간은 146밀리초에서 78밀리초로 약 47% 감소했다고 Prime은 밝혔다.

에이전트 도구 호출과 향후 계획

Prime은 GLM-5.3 서빙 과정에서 선언되지 않은 도구 호출이 조용히 버려지고 정상 종료로 처리되거나, 인수가 누락되거나 형식이 맞지 않는 문제가 있었다고 설명했다. Dynamo에 GLM 형식의 구조 태그 빌더를 기여해 도구 이름과 인수 형식을 제한하도록 했다. vLLM은 xgrammar를 사용해 디코딩 중 규칙에 맞지 않는 토큰을 차단한다. 파싱 과정에서 &lt;가 <로 바뀌어 코드나 파일 내용이 달라지는 문제와 스키마 참조·널 허용 인수의 해석 오류도 수정했다고 밝혔다.

자체 테스트에서는 인수 형식과 필수 필드, 열거형, 중첩 스키마, 스트리밍 응답, 도구 선택 옵션 등을 확인한다고 한다. Prime은 NVIDIA와 협력하고 오픈소스에 기여한 결과 장시간 에이전트 세션에서 도구 호출 오류율이 거의 0에 이르렀다고 밝혔다.

향후 계획에는 대규모 오프라인 작업을 위한 저가 배치·비동기 추론과, Prime 학습 과정에서 미세 조정한 모델을 포함해 예약 용량에 전용 배포를 한 번의 클릭으로 설정하는 기능이 포함된다. Prime은 관련 분야 인력도 채용 중이다.