TL;DR
- Inception의 확산형 언어 모델(dLLM)
Mercury 2.5가 표준 GPU에서 초당 1,107토큰을 처리하고Mercury 2대비 지능 점수를 10점 이상 높인 추론 모델로 출시됨. Mercury 2.5는 토큰을 순차 생성하는 대신 여러 토큰을 병렬 생성·개선해 높은 처리량을 구현함.GPT-5.6 Luna (Low),Gemini 3.5 Flash-Lite,Claude Haiku 4.5등 비용 최적화 프런티어 모델과 비슷한 품질을 제공함.- 조정 가능한 추론 수준, 병렬 도구 호출, 스키마 정렬형 JSON 출력을 지원해 검색 에이전트·음성 파이프라인·코딩 하위 에이전트 같은 지연시간 민감 워크로드에 적합함.
- 컨텍스트 길이는 260K이며 가격은 100만 토큰당 입력 0.04달러, 출력 0.15달러로 제시되고, 페이지 지표상 P50 처리량은 68토큰/초, P50 지연시간은 0.37초임.
Mercury 2.5 개요
- Inception이 가장 빠른 추론 대형 언어 모델(LLM)이자 최신 확산형 언어 모델(diffusion LLM, dLLM)인
Mercury 2.5를 출시함. - 일반적인 언어 모델이 토큰을 순차적으로 생성하는 방식과 달리 여러 토큰을 병렬로 생성하고 반복적으로 개선함.
- 표준 GPU에서 초당 1,107토큰을 달성함.
Mercury 2보다 지능 평가 점수가 10점 이상 상승함.GPT-5.6 Luna (Low),Gemini 3.5 Flash-Lite,Claude Haiku 4.5같은 비용 최적화 프런티어 모델과 비슷한 품질을 제공함.
기능과 적용 분야
- 추론 수준을 조정하는 기능을 지원함.
- 병렬 도구 호출을 지원함.
- 스키마에 맞춘 JSON 출력을 지원함.
- 지연시간이 여러 단계에서 누적되는 프로덕션 워크로드를 대상으로 함.
- 검색 에이전트
- 음성 파이프라인
- 코딩 하위 에이전트
가격 및 모델 사양
- 컨텍스트 길이: 260K
- 출시일: 2026년 9월 8일
- 가격: 100만 토큰당 입력 0.04달러, 출력 0.15달러
- 페이지의 가격 표에는 할인 전 기준으로 입력 0.20달러, 캐시 읽기 0.02달러, 출력 0.75달러가 함께 제시됨.
- 할인 적용 가격 표에는 입력 0.04달러, 캐시 읽기 0.004달러, 출력 0.15달러가 제시됨.
처리량·지연시간 및 가용성
- 페이지 지표상 제공업체 전체 기준 P50 처리량은 68토큰/초로 표시됨.
- 페이지 지표상 제공업체 전체 기준 P50 지연시간은 0.37초임.
- 최근 3일 가동 시간은 100.00%임.
- 최근 3일 가용성은 98.74%이며, 최근 24시간 가용성은 98.65%임.
- 상위 제공업체에서 오류가 발생하면 요청 필터가 허용하는 경우 정상 제공업체로 라우팅해 복구할 수 있음.
- 제공업체별 가동 시간 데이터는 Endpoints API를 통해 프로그래밍 방식으로 확인 가능함.
- 부하 분산 및 사용자 지정 옵션에 관한 추가 정보가 제공됨.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요