TL;DR
- Chutes가 프로덕션 요청 추적 메타데이터를 바탕으로 LLM 서빙 연구에 활용할 수 있는 1년치 데이터셋을 공개함.
- 데이터셋은 61억 2,000만 건의 요청, 9,174개 모델, 1년간의 트래픽을 포함함.
- 요청 도착 시점과 입력·출력 토큰 길이를 활용해 배칭 및 스케줄링을 벤치마크할 수 있음.
- 동일 사용자가 동일 모델에 보낸 반복 요청의 99%가 15분 이내에 도착해 높은 시간적 지역성을 보임.
- LRU가 더 복잡한 캐시 축출 정책과 자주 대등하거나 우수하며, 캐시 인식 라우팅은 시뮬레이션에서 5~7%의 부하 불균형으로 토큰 적중률을 높임.
01 / Chutes · 1년간의 요청
LLM 서빙에서의 1년
- 프로덕션 요청 추적에서 수집한 메타데이터를 기반으로 모델 사용량, 토큰 수, 접두사 캐시 재사용을 다루는 1년치 데이터셋임.
- 데이터셋과 코드, 논문을 제공함.
- 규모는 61억 2,000만 건의 요청, 9,174개 모델, 1년간의 트래픽임.
연구 활용
- 기록된 요청 도착 시점과 입력·출력 토큰 길이를 활용해 배칭 및 스케줄링을 벤치마크함.
- 요청 메타데이터에서 사용자 세션을 재구성해 사용 패턴과 행동을 분석함.
- 사용량이 적은 모델의 바쁜 시간대와 유휴 시간대를 활용해 GPU 공동 배치(colocation)를 탐색함.
스키마
- 데이터셋 문서를 제공함.
Chutes스키마의 필드는 다음과 같음.request_id:intfunction_name:stringchute_id · instance_id:stringuser_id:stringstarted_at · completed_at:timestampinput_tokens · output_tokens · cache_tokens:intttft:floatuser_id값은 3개월마다 순환하므로, 한 사람이 1년 동안 서로 다른 ID로 나타남.
발견 사항
01
- 요청은 높은 시간적 지역성을 보임.
- 동일 사용자가 동일 모델에 보낸 반복 요청의 99%가 15분 이내에 도착함.
- 분석 항목은 요청 간 도착 시간임.
02
- LRU가 더 복잡한 캐시 축출 정책과 자주 대등하거나 우수한 성능을 보임.
- 비교 대상은 캐시 축출 정책임.
03
- 캐시 인식 라우팅이 토큰 적중률을 높임.
- 시뮬레이션에서 부하 불균형은 5~7% 수준임.
- 분석 항목은 캐시 인식 라우팅임.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요