TL;DR
- Inception이 Mercury 2.5를 출시했으며, 저지연·저비용 프로파일을 유지하면서 Mercury 2 대비 지능 40% 향상, 초당 1,107토큰 처리, 260K 토큰 컨텍스트를 제공하는 생산 모델임
- Mercury 2.5는 Inception이 지금까지 학습한 모델 중 가장 큰 확산형 대형 언어 모델(dLLM)이며, 시장에서 가장 강력한 확산형 LLM으로 제시됨
- 검색, 음성, 코딩 제품의 실제 운영 피드백과 실패 사례를 평가·학습에 반영한 첫 결과물임
- OpenCall은 Mercury 도입 후 P99 응답 시간을 수 분에서 1초로, P50 응답 시간을 0.4초에서 0.2초 미만으로 줄였으며, Augment Code는 컨텍스트 압축 지연 시간과 비용을 각각 82%, 90% 절감함
- Mercury Voice와 Mercury Router 프리뷰가 함께 공개됐으며, Mercury 2.5는 Inception API, Baseten, OpenRouter에서 제공됨
변경 사항
- Mercury 2.5는 시장에서 가장 강력한 확산형 대형 언어 모델(dLLM)이며, Inception이 파악하기로 지금까지 학습된 확산형 언어 모델 중 가장 큰 모델임
- Mercury 2 출시 이후 수천 명의 개발자가 모델을 사용해 구축했고, 수십 개 기업이 프로덕션에 도입했으며, 사용량이 10배 이상 증가함
- 현재 검색, 음성, 코딩 제품의 지연 시간 민감형 워크로드를 처리함
- 실제 운영 워크로드에서 얻은 고객 피드백과 실패 사례를 바탕으로 평가(evaluation)를 정교화하고 학습 방향을 집중한 결과가 Mercury 2.5임
- 품질: Mercury 2 대비 지능 40% 향상. 비용 최적화 프런티어 모델인 GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite, Claude Haiku 4.5와 비교 가능한 수준임
- 속도: 널리 사용되는 NVIDIA GPU에서 초당 1,107토큰 처리
- 컨텍스트: 260K 토큰
- 가격: 입력 100만 토큰당 0.20달러, 출력 100만 토큰당 0.75달러
- 출시 시점에는 80% 할인된 입력 100만 토큰당 0.04달러, 출력 100만 토큰당 0.15달러로 제공됨
- 기능: 조정 가능한 추론(tunable reasoning), 병렬 도구 호출(parallel tool calls), 스키마 정렬 JSON(schema-aligned JSON)
- Mercury 2 출시 이후 Inception은 NVIDIA AI 인프라에서 확산 기반 언어 모델을 발전시켜 온 성과를 관찰함
- Mercury 2.5는 지능 향상과 지속적인 고속 처리, 낮은 비용을 결합해 새로운 아키텍처가 NVIDIA 플랫폼에서 프로덕션 준비 시스템으로 빠르게 성숙하는 양상을 보여줌
“Mercury 2.5의 지능 향상과 지속적인 속도, 낮은 비용은 새로운 아키텍처가 NVIDIA 플랫폼에서 프로덕션 준비 시스템으로 얼마나 빠르게 성숙할 수 있는지를 보여줌.”
— Shruti Koparkar, NVIDIA Accelerated Computing Group 제품 부문 수석 매니저
Mercury의 프로덕션 활용
검색 에이전트와 RAG 파이프라인
- 한 번의 검색 요청이 검색 계획 수립, 쿼리 재작성, 결과 재순위화, 사실 구조화, 출처 요약, 답변 검증 등 수십 번의 모델 호출을 유발할 수 있음
- Mercury는 이러한 호출을 하나의 사용자 상호작용 안에서 처리할 수 있을 만큼 빠르게 유지함
- 여러 주요 검색 인프라 기업이 현재 Mercury를 프로덕션에서 운영함
음성 에이전트와 인터랙티브 애플리케이션
- 음성 환경에서 지연 시간은 인프라 세부 사항이 아니라 통화자가 듣게 되는 침묵의 길이임
- OpenCall은 실시간 고객 통화를 처리하는 AI 전화 에이전트를 구축함
- 프로덕션 워크로드에서 Mercury는 모델 응답 중간값 지연 시간을 약 170밀리초까지 낮춤
“Mercury로 전환한 뒤 P99 응답 시간이 수 분에서 1초로 줄었고, P50 응답 시간은 0.4초에서 0.2초 미만으로 감소함. 추론을 포함해도 지금까지 경험한 다른 어떤 제공업체보다 빠른 수준임.”
— Oliver Silverstein, OpenCall 공동 창업자 겸 CEO
- 추가 읽을거리: 전화를 받을 수 있을 만큼 빠른 최초의 추론 모델
코딩 하위 에이전트와 어시스턴트
- 코딩 에이전트는 이미 여러 모델에 작업을 분산함
- 한 모델은 계획 수립이나 코드 작성을 담당하고, 다른 모델은 검색, 도구 실행, 요청 라우팅, 상태 요약, 긴 세션 압축 등을 담당함
- 지원 호출은 반복적으로 발생하므로 지연 시간과 비용이 빠르게 누적됨
- Augment Code는 컨텍스트 압축, 모델 라우팅, MCP 도구 검색에 Mercury를 사용함
- 컨텍스트 압축을 Mercury로 이전한 결과 지연 시간이 약 150초에서 27초로 82% 감소했고, 품질을 유지하면서 비용이 90% 감소함
- 도구 검색 요약은 1초 이내에 반환됨
- 같은 속도는 웹 애플리케이션 개발에도 적용되며, 몇 개의 프롬프트만으로 작동하는 음악 검색 로그 웹 앱을 생성하는 Mercury 2.5 데모가 제공됨
Mercury Voice와 Mercury Router 프리뷰
- Mercury 2.5와 함께 Mercury Voice와 Mercury Router 프리뷰가 공개됨
- Mercury Voice는 최초 토큰 생성 시간(TTFT) 170밀리초 미만을 제공하며, 가장 엄격한 지연 시간 예산을 가진 음성 에이전트에 최적화된 확산형 대형 언어 모델(dLLM)임
- Mercury Router는 확산형 대형 언어 모델(dLLM)로 입력 프롬프트를 이해하고, 품질·속도·비용의 최적 조합을 제공하는 최적 모델로 라우팅함
- 라우팅 대상은 오픈 모델과 폐쇄형 모델을 모두 포함함
시작하기
- Mercury 모델은 Inception API, Baseten, OpenRouter를 통해 제공됨
- 엔터프라이즈 배포는 전용 용량, 오토스케일링, 컴플라이언스 제어, 설정 가능한 데이터 보존을 지원함
- Mercury 2.5 채팅 체험
- API를 1억 무료 토큰으로 체험
- API 문서 읽기
- Baseten 고객은 기존 Baseten 설정을 통해 Mercury 2.5를 배포할 수 있음
- Y Combinator 기업은 50만 달러 규모의 배포 혜택을 신청할 수 있음
- 음성용 Mercury를 평가하는 경우 워크로드 적합성 테스트와 서빙 제약 조건에서의 성능 검증을 지원하며, 문의를 통해 진행 가능함
다음 단계
- 다음 모델의 학습이 이미 시작됨
- 다음 모델은 지금까지 가장 큰 모델이며, 수개월 안에 출시하는 것을 목표로 함
- 다음 모델은 확산 모델의 속도와 토큰 효율성을 포기하지 않으면서 역량에서 큰 도약을 이루는 것을 목표로 함
- 이를 위해 모델 학습, 추론, 평가, 인프라의 발전이 필요함
- 이러한 문제를 다루고 싶은 인재의 참여를 요청함
- 추가 내용은 추후 공개 예정임
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요