TL;DR

  • Mistral Large 4는 2026년 10월 6일 공개된 오픈 웨이트 모델로, Vals Index에서 44개 모델 중 32위, 정확도 48.05%를 기록함.
  • 최고 순위는 Harvey's Legal Agent Benchmark에서 75개 모델 중 6위이며, 최하위 순위는 MysteryMechanism에서 24개 중 24위임.
  • 컨텍스트 윈도는 512K, 최대 출력 토큰은 256K이며, 입력·출력 토큰 비용은 각각 $1.36/$4.18임.
  • Vals Index 테스트당 비용은 $13.78, 지연 시간은 105분 50초임.
  • 기본 제공자는 Mistral AI이며, 온도 1, Top P 0.95, Top K 기본값, 추론 강도 높음으로 설정됨.

모델 개요

  • Mistral Large 4는 Mistral이 개발한 오픈 웨이트 모델이며 공개일은 2026년 10월 6일임.
  • Vals Index에서 정확도 48.05% ± 1.11로 44개 모델 중 32위임.
  • 최고 결과는 Harvey's Legal Agent Benchmark에서 정확도 15.83% ± 2.96, 75개 모델 중 6위임.
  • 컨텍스트 윈도는 512K, 최대 출력 토큰은 256K, 입력·출력 토큰 비용은 $1.36/$4.18임.
  • Vals Index 테스트당 비용은 $13.78, 지연 시간은 105분 50초임.
  • 가중치는 오픈이며 개발사는 Mistral, 국가는 프랑스임.

벤치마크 결과

  • Vals Index: 48.05% ± 1.11, 44개 중 32위.
  • Code Migration: 30.56% ± 4.22, 74개 중 38위.
  • EMB: 56.21% ± 3.22, 71개 중 43위.
  • Finance Agent (v2): 54.68% ± 0.58, 75개 중 22위.
  • Legal Research Bench: 31.73% ± 3.23, 74개 중 38위.
  • MedCode: 40.69% ± 2.17, 105개 중 59위.
  • MedScribe: 80.43% ± 2.00, 107개 중 55위.
  • MysteryMechanism: 12.16% ± 2.20, 24개 중 24위.
  • ProofBench v1.1: 10.00% ± 3.02, 47개 중 42위.
  • Tax Agent Bench: 63.29% ± 3.23, 66개 중 25위.
  • Vibe Code Bench 1-100: 14.26% ± 3.21, 21개 중 16위.
  • Vibe Code Bench v1.1: 78.40% ± 3.55, 109개 중 25위.
  • BioMysteryBench: 67.04% ± 2.67, 24개 중 17위.
  • Harvey's Legal Agent Benchmark: 15.83% ± 2.96, 75개 중 6위.
  • IOI: 45.28% ± 3.78, 41개 중 28위.
  • Terminal-Bench 4.0: 22.73% ± 0.88, 44개 중 20위.

제공자 및 하이퍼파라미터

  • 기본 제공자는 Mistral AI임.
  • 온도는 1, Top P는 0.95, Top K는 기본값, 최대 출력 토큰은 256,000, 추론 강도는 높음임.
  • 일부 벤치마크는 다른 제공자와 매개변수를 사용할 수 있으며, 자세한 내용은 각 벤치마크 페이지를 참고하도록 안내함.

모델 목록

  • 페이지의 모델 목록에는 Mistral Large 4와 함께 다음 모델이 표시됨.
  • 2026년 10월 6일: Mistral Large 4.
  • 2026년 9월 30일: Gemini 4 Argon.
  • 2026년 9월 29일: GPT-6.1 Sol.
  • 2026년 9월 28일: Claude Sonnet 5.5, Step 5 Preview.
  • 2026년 9월 22일: Claude Opus 5.5, Claude Opus 5.5 (CVP), Ember-1, GPT-6 Luna, GPT-6 Sol.
  • 2026년 9월 21일: Grok 4.7, MiMo V2.6 Flash, MiMo V2.6 Pro.
  • 2026년 9월 18일: Grok Voice Transcribe 2.0.
  • 2026년 9월 10일: DeepSeek V4.1 Flash.
  • 2026년 9월 8일: Mercury 2.5.
  • 2026년 9월 5일: Muse Spark 1.3 Max.
  • 2026년 9월 3일: GPT-6 Astra, Ling 3.0 Flash Fin.
  • 2026년 9월 2일: Gemini 3.8 Flash.
  • 2026년 9월 1일: Muse Spark 1.3.
  • 2026년 8월 30일: Claude Fable 5.1.
  • 2026년 8월 28일: Muse Voice Transcribe.
  • 2026년 8월 26일: Hy4 Preview.
  • 2026년 8월 18일: GLM 5.3 Flash.
  • 2026년 8월 14일: GLM 5.3.
  • 2026년 8월 13일: Qwen 3.8 27B, DeepSeek V4 Pro 0813.
  • 목록에는 추가 모델 213개가 더 있음.