TL;DR

  • Chutes가 프로덕션 요청 추적 메타데이터를 바탕으로 LLM 서빙 연구에 활용할 수 있는 1년치 데이터셋을 공개함.
  • 데이터셋은 61억 2,000만 건의 요청, 9,174개 모델, 1년간의 트래픽을 포함함.
  • 요청 도착 시점과 입력·출력 토큰 길이를 활용해 배칭 및 스케줄링을 벤치마크할 수 있음.
  • 동일 사용자가 동일 모델에 보낸 반복 요청의 99%가 15분 이내에 도착해 높은 시간적 지역성을 보임.
  • LRU가 더 복잡한 캐시 축출 정책과 자주 대등하거나 우수하며, 캐시 인식 라우팅은 시뮬레이션에서 5~7%의 부하 불균형으로 토큰 적중률을 높임.

01 / Chutes · 1년간의 요청

LLM 서빙에서의 1년

  • 프로덕션 요청 추적에서 수집한 메타데이터를 기반으로 모델 사용량, 토큰 수, 접두사 캐시 재사용을 다루는 1년치 데이터셋임.
  • 데이터셋과 코드, 논문을 제공함.
  • 규모는 61억 2,000만 건의 요청, 9,174개 모델, 1년간의 트래픽임.

연구 활용

  • 기록된 요청 도착 시점과 입력·출력 토큰 길이를 활용해 배칭 및 스케줄링을 벤치마크함.
  • 요청 메타데이터에서 사용자 세션을 재구성해 사용 패턴과 행동을 분석함.
  • 사용량이 적은 모델의 바쁜 시간대와 유휴 시간대를 활용해 GPU 공동 배치(colocation)를 탐색함.

스키마

  • 데이터셋 문서를 제공함.
  • Chutes 스키마의 필드는 다음과 같음.
  • request_id: int
  • function_name: string
  • chute_id · instance_id: string
  • user_id: string
  • started_at · completed_at: timestamp
  • input_tokens · output_tokens · cache_tokens: int
  • ttft: float
  • user_id 값은 3개월마다 순환하므로, 한 사람이 1년 동안 서로 다른 ID로 나타남.

발견 사항

01

  • 요청은 높은 시간적 지역성을 보임.
  • 동일 사용자가 동일 모델에 보낸 반복 요청의 99%가 15분 이내에 도착함.
  • 분석 항목은 요청 간 도착 시간임.

02

  • LRU가 더 복잡한 캐시 축출 정책과 자주 대등하거나 우수한 성능을 보임.
  • 비교 대상은 캐시 축출 정책임.

03

  • 캐시 인식 라우팅이 토큰 적중률을 높임.
  • 시뮬레이션에서 부하 불균형은 5~7% 수준임.
  • 분석 항목은 캐시 인식 라우팅임.