TL;DR

  • ContextCube는 NVIDIA CMX 추론 스토리지 참조 아키텍처를 바탕으로 추론 클러스터 전체가 공유하는 영구 KV 캐시 풀을 제공해, 같은 문맥의 재계산을 줄이는 장치임.
  • 기존에는 KV 캐시가 GPU의 HBM이나 서버의 DRAM·NVMe에 국한돼 캐시 축출과 서버 간 캐시 접근 불가 문제가 발생함.
  • ContextCube는 GPU HBM, DRAM, 로컬 NVMe와 함께 Layer 3.5 공유 캐시 계층을 구성하며, 노드는 RDMA로 일치하는 KV 캐시를 가져옴.
  • 에이전트, 코딩 보조 도구, 다중 턴 대화, 긴 문서 처리, 검색 증강 생성(RAG), 대규모 토큰 처리 환경 등 반복되는 문맥을 사용하는 작업을 대상으로 함.
  • ContextCube는 현재 주문 가능하며, 성능은 구성과 작업 부하에 따라 달라짐.

문제: 좋은 문맥이 잘못된 위치에 갇힘

  • 추론 서버가 긴 프롬프트를 처리할 때 모델이 계산한 어텐션 키와 값이 KV 캐시에 저장됨. 이를 재사용하는 비용은 다시 계산하는 것보다 훨씬 낮으며, 프롬프트가 길수록 재사용의 중요성이 커짐.
  • 하지만 대부분의 클러스터에서 KV 캐시는 한 GPU의 HBM이나 해당 서버의 DRAM 또는 NVMe에 로컬로 저장됨.
  • 이로 인해 두 가지 문제가 발생함.
  • 캐시 축출(Eviction): 긴 프롬프트가 로컬 메모리를 빠르게 채워 캐시 문맥이 재사용되기 전에 밀려남.
  • 캐시 고립(Stranding): 사용자의 다음 요청이 다른 서버로 라우팅되면 첫 서버에 저장된 캐시에 접근할 수 없음.
  • 결과적으로 같은 문맥을 반복해서 계산하게 됨. 첫 토큰 생성 시간(time to first token)이 늘어나며, 새 토큰 생성에 써야 할 GPU 연산이 프리필(prefill)에 소모됨.

ContextCube의 작동 방식

  • ContextCube는 NVIDIA CMX 추론 스토리지 참조 아키텍처를 기반으로 설계됨.
  • GPU HBM, DRAM, 로컬 NVMe에 더해 메모리 계층에 Layer 3.5라는 공유 계층을 추가함.
  • GPU에서 활성 계산을 수행하고, 재사용 가능한 문맥은 참여 노드 모두가 접근할 수 있는 대규모 클러스터 공유 캐시에 저장하는 구조임.
  • 요청이 들어오면 추론 노드가 ContextCube에서 일치하는 KV 캐시를 확인함. 캐시가 있으면 재계산하는 대신 RDMA를 통해 가져옴.
  • 캐시를 공유하므로 이전 요청을 처리한 서버가 어디였는지는 중요하지 않음. 각 노드는 자체 HBM, DRAM, NVMe를 유지하고, ContextCube가 모두 공유하는 캐시 계층을 추가함.

구성 및 호환성

  • 각 ContextCube 장치는 빠른 DPU 기반 데이터 이동을 위해 설계되며, 한 대부터 시작할 수 있음.
  • ContextCube는 팀에서 이미 사용하는 추론 엔진 및 KV 캐시 소프트웨어와 함께 작동하므로 기존 스택을 대체하지 않고 그 안에 추가할 수 있음.

문맥 사용량이 많은 작업에 적합

  • ContextCube는 같은 문맥이 반복해서 사용되는 작업에서 효과를 발휘함.
  • 여러 단계에 걸쳐 긴 도구 사용 기록과 시스템 프롬프트를 유지하는 AI 에이전트
  • 같은 저장소와 파일을 반복해서 읽는 코딩 보조 도구
  • 매번 이전 대화 내용을 이어가는 다중 턴 대화
  • 하나의 긴 문서에 여러 질문을 하는 장문서 처리
  • 인기 있는 원문 구절을 반복 검색하는 검색 증강 생성(RAG)
  • 여러 GPU에서 대량의 요청을 처리하는 대규모 ‘토큰 팩토리’
  • 이 모든 작업에서 재계산이 줄면 첫 토큰 생성 시간이 단축되고, 생성에 사용할 GPU 연산이 늘어나며, 같은 하드웨어에서 처리량과 동시성이 높아짐.

개발 배경

“문맥 창이 커지고 AI 에이전트가 프로덕션으로 이동하면서 모든 서버에서 같은 문맥을 반복해서 계산하고 있음. ContextCube는 클러스터 전체가 그 작업을 보관할 장소를 제공해 GPU가 이전 문맥을 다시 만드는 대신 새 토큰을 생성하는 데 시간을 쓸 수 있게 함.”

— Jenvik Li, TuringData 창립자 겸 최고경영자(CEO)

시작하기

  • ContextCube는 현재 주문 가능함. 클러스터, 작업 부하, 배포 방식을 논의하려면 TuringData 팀에 문의하면 됨.
  • 실제 성능은 구성과 작업 부하에 따라 달라짐.
  • NVIDIA와 BlueField는 미국 및 기타 국가에서 NVIDIA Corporation의 상표 또는 등록 상표임.