TL;DR

  • RunInfra의 DeepSeek V4.1 Flash는 1,048,576토큰 컨텍스트를 제공하며, 초당 378 출력 토큰과 최근 24시간 99.7% 캐시 적중률을 기록함.
  • 입력 가격은 100만 토큰당 0.10달러, 캐시 입력은 0.02달러, 출력은 0.43달러이며, 할인은 2026년 10월 13일 오전 5:44 UTC까지 적용됨.
  • 추론 토큰 첫 응답까지 걸리는 시간은 30밀리초임.
  • API는 OpenAI 호환 채팅 완성과 Anthropic 호환 Messages(POST /v1/messages)를 제공하며, 텍스트 입력과 도구 호출·JSON 모드·스트리밍을 지원함.
  • 자동 접두사 캐싱은 모든 복제본에서 실행되며, 캐시 보존과 적중은 보장되지 않고 캐시된 입력에는 별도 요금이 적용됨.

가격

  • RunInfra Model APIs에서 deepseek-ai/DeepSeek-V4.1-Flash로 제공되며, 입력 100만 토큰당 0.10달러의 할인 가격은 2026년 10월 13일 오전 5:44 UTC까지 적용되고 종료 후 표준 요금으로 자동 복귀함.
  • 표준 요금과 할인 요금은 다음과 같음.
  • 입력 토큰 100만 개당 표준 0.14달러, 할인 0.10달러
  • 캐시 입력 토큰 100만 개당 표준 0.03달러, 할인 0.02달러
  • 출력 토큰 100만 개당 표준 0.58달러, 할인 0.43달러
  • 입력과 출력 가격은 할인 기간에 25% 인하되며, 캐시 입력에는 캐시 입력 요금이 적용됨.

측정 성능

  • 모델 자체 출력 속도는 초당 378토큰임.
  • 첫 추론 토큰까지 걸리는 시간은 30밀리초임.
  • 최근 24시간 캐시 적중률은 99.7%임.

API 호환성과 접근

  • OpenAI 호환 채팅 완성 API와 Anthropic 호환 Messages API를 제공하며, Messages 엔드포인트는 POST /v1/messages임.
  • 입력은 텍스트만 허용됨.
  • 기본적으로 데이터 보존이 없으며, 데이터는 학습에 사용되지 않음.

용량

  • 컨텍스트 창은 1,048,576토큰임.
  • 요청 최대 크기는 요청당 3.5MB임.
  • 생성 가능한 출력의 최대 길이는 1,048,576토큰임.

기능

  • 도구 호출 지원
  • JSON 모드 지원
  • 스트리밍 지원

게이트웨이 호환성

  • 호환 클라이언트, 도구, 게이트웨이에서 사용할 수 있도록 OpenAI 및 Anthropic 호환 API를 제공함.

접두사 캐싱

  • 자동 접두사 캐싱은 모든 복제본에서 실행되며, 같은 세션이나 대화의 요청은 캐시된 접두사를 보유한 복제본으로 라우팅됨.
  • 안정적인 세션 힌트 또는 prompt_cache_key로 그룹을 명시할 수 있으며, 이를 지정하지 않으면 RunInfra가 대화 시작 부분을 기준으로 그룹을 정하고, 그 방식이 불가능하면 워크스페이스를 기준으로 삼음.
  • 캐시 적중은 제거(eviction) 또는 서빙 재시작 전까지 최선의 노력으로 제공되며 보장되지 않음.
  • 응답에는 캐시된 토큰 수가 표시됨.

캐시 보존

  • 접두사 캐시는 서빙 GPU에 저장되며 메모리 압박이 발생하면 제거됨.
  • 캐시 보존은 최선의 노력으로 제공됨.

상위 모델

  • 상위 모델은 DeepSeek임.