TL;DR

  • Inception의 확산형 언어 모델(dLLM) Mercury 2.5가 표준 GPU에서 초당 1,107토큰을 처리하고 Mercury 2 대비 지능 점수를 10점 이상 높인 추론 모델로 출시됨.
  • Mercury 2.5는 토큰을 순차 생성하는 대신 여러 토큰을 병렬 생성·개선해 높은 처리량을 구현함.
  • GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite, Claude Haiku 4.5 등 비용 최적화 프런티어 모델과 비슷한 품질을 제공함.
  • 조정 가능한 추론 수준, 병렬 도구 호출, 스키마 정렬형 JSON 출력을 지원해 검색 에이전트·음성 파이프라인·코딩 하위 에이전트 같은 지연시간 민감 워크로드에 적합함.
  • 컨텍스트 길이는 260K이며 가격은 100만 토큰당 입력 0.04달러, 출력 0.15달러로 제시되고, 페이지 지표상 P50 처리량은 68토큰/초, P50 지연시간은 0.37초임.

Mercury 2.5 개요

  • Inception이 가장 빠른 추론 대형 언어 모델(LLM)이자 최신 확산형 언어 모델(diffusion LLM, dLLM)인 Mercury 2.5를 출시함.
  • 일반적인 언어 모델이 토큰을 순차적으로 생성하는 방식과 달리 여러 토큰을 병렬로 생성하고 반복적으로 개선함.
  • 표준 GPU에서 초당 1,107토큰을 달성함.
  • Mercury 2보다 지능 평가 점수가 10점 이상 상승함.
  • GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite, Claude Haiku 4.5 같은 비용 최적화 프런티어 모델과 비슷한 품질을 제공함.

기능과 적용 분야

  • 추론 수준을 조정하는 기능을 지원함.
  • 병렬 도구 호출을 지원함.
  • 스키마에 맞춘 JSON 출력을 지원함.
  • 지연시간이 여러 단계에서 누적되는 프로덕션 워크로드를 대상으로 함.
  • 검색 에이전트
  • 음성 파이프라인
  • 코딩 하위 에이전트

가격 및 모델 사양

  • 컨텍스트 길이: 260K
  • 출시일: 2026년 9월 8일
  • 가격: 100만 토큰당 입력 0.04달러, 출력 0.15달러
  • 페이지의 가격 표에는 할인 전 기준으로 입력 0.20달러, 캐시 읽기 0.02달러, 출력 0.75달러가 함께 제시됨.
  • 할인 적용 가격 표에는 입력 0.04달러, 캐시 읽기 0.004달러, 출력 0.15달러가 제시됨.

처리량·지연시간 및 가용성

  • 페이지 지표상 제공업체 전체 기준 P50 처리량은 68토큰/초로 표시됨.
  • 페이지 지표상 제공업체 전체 기준 P50 지연시간은 0.37초임.
  • 최근 3일 가동 시간은 100.00%임.
  • 최근 3일 가용성은 98.74%이며, 최근 24시간 가용성은 98.65%임.
  • 상위 제공업체에서 오류가 발생하면 요청 필터가 허용하는 경우 정상 제공업체로 라우팅해 복구할 수 있음.
  • 제공업체별 가동 시간 데이터는 Endpoints API를 통해 프로그래밍 방식으로 확인 가능함.
  • 부하 분산 및 사용자 지정 옵션에 관한 추가 정보가 제공됨.