TL;DR
- RunInfra의 DeepSeek V4.1 Flash는 1,048,576토큰 컨텍스트를 제공하며, 초당 378 출력 토큰과 최근 24시간 99.7% 캐시 적중률을 기록함.
- 입력 가격은 100만 토큰당 0.10달러, 캐시 입력은 0.02달러, 출력은 0.43달러이며, 할인은 2026년 10월 13일 오전 5:44 UTC까지 적용됨.
- 추론 토큰 첫 응답까지 걸리는 시간은 30밀리초임.
- API는 OpenAI 호환 채팅 완성과 Anthropic 호환 Messages(
POST /v1/messages)를 제공하며, 텍스트 입력과 도구 호출·JSON 모드·스트리밍을 지원함. - 자동 접두사 캐싱은 모든 복제본에서 실행되며, 캐시 보존과 적중은 보장되지 않고 캐시된 입력에는 별도 요금이 적용됨.
가격
- RunInfra Model APIs에서
deepseek-ai/DeepSeek-V4.1-Flash로 제공되며, 입력 100만 토큰당 0.10달러의 할인 가격은 2026년 10월 13일 오전 5:44 UTC까지 적용되고 종료 후 표준 요금으로 자동 복귀함. - 표준 요금과 할인 요금은 다음과 같음.
- 입력 토큰 100만 개당 표준 0.14달러, 할인 0.10달러
- 캐시 입력 토큰 100만 개당 표준 0.03달러, 할인 0.02달러
- 출력 토큰 100만 개당 표준 0.58달러, 할인 0.43달러
- 입력과 출력 가격은 할인 기간에 25% 인하되며, 캐시 입력에는 캐시 입력 요금이 적용됨.
측정 성능
- 모델 자체 출력 속도는 초당 378토큰임.
- 첫 추론 토큰까지 걸리는 시간은 30밀리초임.
- 최근 24시간 캐시 적중률은 99.7%임.
API 호환성과 접근
- OpenAI 호환 채팅 완성 API와 Anthropic 호환 Messages API를 제공하며, Messages 엔드포인트는
POST /v1/messages임. - 입력은 텍스트만 허용됨.
- 기본적으로 데이터 보존이 없으며, 데이터는 학습에 사용되지 않음.
용량
- 컨텍스트 창은 1,048,576토큰임.
- 요청 최대 크기는 요청당 3.5MB임.
- 생성 가능한 출력의 최대 길이는 1,048,576토큰임.
기능
- 도구 호출 지원
- JSON 모드 지원
- 스트리밍 지원
게이트웨이 호환성
- 호환 클라이언트, 도구, 게이트웨이에서 사용할 수 있도록 OpenAI 및 Anthropic 호환 API를 제공함.
접두사 캐싱
- 자동 접두사 캐싱은 모든 복제본에서 실행되며, 같은 세션이나 대화의 요청은 캐시된 접두사를 보유한 복제본으로 라우팅됨.
- 안정적인 세션 힌트 또는
prompt_cache_key로 그룹을 명시할 수 있으며, 이를 지정하지 않으면 RunInfra가 대화 시작 부분을 기준으로 그룹을 정하고, 그 방식이 불가능하면 워크스페이스를 기준으로 삼음. - 캐시 적중은 제거(eviction) 또는 서빙 재시작 전까지 최선의 노력으로 제공되며 보장되지 않음.
- 응답에는 캐시된 토큰 수가 표시됨.
캐시 보존
- 접두사 캐시는 서빙 GPU에 저장되며 메모리 압박이 발생하면 제거됨.
- 캐시 보존은 최선의 노력으로 제공됨.
상위 모델
- 상위 모델은 DeepSeek임.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요