TL;DR
- 중국 연구소들이 공개한 캐시 최적화를 Anthropic과 OpenAI가 채택하면서, 서구 AI 기업의 추론 비용이 크게 낮아지는 상황임.
- Anthropic은 중국 연구소의 모델 증류가 인류에 위험하다고 반복해서 주장하며 향후 법률·규제 제한의 근거를 마련하고 있음.
- DeepSeek은 특정 장문맥 사용 사례의 KV 캐시 공간을 DeepSeek-V1 대비 약 437배 줄이는 최적화를 공개함.
- DeepSeek의 최신 기술에는 CSA2, 계층 간 캐시 재사용, 인과적 인코더-디코더 아키텍처, FP4 캐싱이 포함되며 토큰당 전역 KV 캐시가 890바이트까지 줄어듦.
- Claude Opus 5.5와 GPT-6.1 Sol의 캐시 읽기 가격은 각각 이전 모델 대비 60%, 80% 하락했으며, 중국 연구소의 최적화 채택을 보여주는 근거로 제시됨.
증류 논란
- 요즘 뉴스 헤드라인만 보면 서구 연구소들이 중국 연구소들에 대거 밀려나고 있다고 생각할 만함.
- Anthropic은 중국 연구소들이 자사 모델을 증류해 인류 자체에 위험을 초래한다는 내용의 글을 거의 매주 발표함.
- 이런 주장은 나중에 해당 모델을 법률과 규제로 제한할 근거를 마련한다는 점에서 Anthropic에 유리함.
- 하지만 무분별한 증류의 시대는 끝났으며, 이제는 중국 연구소들의 기술적 진전을 채택하는 것이 새로운 흐름임.
- 이를 Anthropic이 자주 쓰는 적대적인 표현인 ‘훔치기’ 대신 ‘채택’이라고 부르는 이유는 서구 기업과 달리 중국 연구소들이 기술의 세부 내용을 거의 그대로 공개하기 때문임.
다른 방식의 경쟁
- 최근 아무런 인정 표시 없이 대놓고 복사된 사례는 DeepSeek이 세계에 공개한 KV 캐시 최적화의 돌파구임.
- 코딩처럼 긴 세션 문맥을 사용하는 특정 사례에서 이 최적화는 KV 캐시 사용량을 DeepSeek-V1 대비 약 437배 줄임.
- DeepSeek은 캐시를 약 15배 압축하는 MLA 아키텍처를 처음 공개한 뒤, ‘Compressed Sparse Attention’과 ‘Heavily Compressed Attention’을 이어서 발표함.
- 최신 DeepSeek-V4.1-Flash는 CSA2, 계층 간 캐시 재사용, 인과적 인코더-디코더 아키텍처, FP4 캐싱을 적용해 전역 KV 캐시를 토큰당 890바이트까지 줄임.
- 장문맥 모델을 서비스할 때 주요 비용 가운데 하나는 GPU 메모리에 캐시를 보관하는 데 필요한 비디오 메모리(VRAM)임.
- 원문은 이 최적화의 규모를 보여주는 그래프를 언급하지만, 그래프 자체의 데이터는 포함하지 않음.
캐시 비용 비교
- 원문은 같은 등급의 모델이 약 두 달 전에는 얼마였는지 비교한다고 설명하며, 모든 가격의 기준을 토큰 100만 개당으로 제시함.
- 가격 비교 그래프나 구체적인 가격 수치는 원문에 포함되지 않음.
조용한 감사 인사
- 이 변화는 서구 AI 기업들이 이제 추론 단계에서 매우 높은 이윤을 얻고 있음을 뜻할 수 있음.
- 고성능 GPU에 대한 접근 제한으로 중국 연구소들은 성능 최적화를 최우선 목표로 삼았으며, 그 결과가 기술에 반영됨.
- 중국 연구소들이 이런 돌파구를 무료로 공개한 이유는 분명하지 않지만, Anthropic과 OpenAI는 해당 최적화를 사용하는 최상위권 모델을 내놓음.
- Claude Opus 5.5와 GPT-6.1 Sol은 모두 사전 발표를 거의 하지 않고 조용히 출시됐으며, 이는 복제에 대한 약간의 당혹감을 드러내는 듯함.
- 사용자들의 사용 경험 평가는 매우 좋고, 품질도 각사의 주력 모델인 Claude Fable 5.1과 GPT-6 Astra에 크게 뒤지지 않는 것으로 보임.
- 캐시 읽기 가격 하락은 기술 채택을 보여주는 근거임.
- Opus 5.5의 캐시 읽기 가격은 Opus 5보다 60% 낮음.
- GPT-6.1 Sol의 캐시 읽기 가격은 GPT-5.6 Sol의 7월 말 가격보다 80% 낮음.
- 중국 연구소들은 적자를 내는 서구 연구소들에 구명줄을 던진 셈이며, 그렇게 한 이유는 여전히 알 수 없음.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요