TL;DR
- DeepSeek 4.1 Flash는 약 한 달간 여러 프로젝트에서 사용한 경험상 프런티어 모델과 구별하기 어려울 만큼 유능하면서 비용은 훨씬 저렴함.
- 월 10달러 OpenCode Go 구독으로 DeepSeek를 사실상 무제한 사용할 수 있어, 탐색적 테스트와 반복 작업을 부담 없이 실행하는 개발 방식으로 바뀜.
- V1 대비 약 437배 줄어든 KV 캐시가 장시간 코딩 세션의 비용을 낮추며, 하루 종일 이어지는 세션도 1달러 미만으로 유지되는 배경임.
- 중요한 작업의 최종 검토에는 Opus 5.5를 쓰고, 수정 실행은 DeepSeek에 맡기는 식으로 모델을 조합함.
- 업계가 최고 성능과 지출에 집중하는 동안, 저비용·저전력·접근성 측면의 이점은 간과되고 있으며 캐시 최적화는 향후 로컬 실행에도 이어질 전망임.
DeepSeek 4.1 Flash의 실제 사용 경험
- DeepSeek 4.1 Flash를 약 한 달 동안 12개 프로젝트에서 집중적으로 사용한 결과, 성능이 매우 뛰어나고 ‘프런티어’ 모델보다 몇 자릿수나 저렴함.
- 대화, 작업 결과, 속도에서 차이가 느껴지지 않아 세션 중 모델 이름을 확인하지 않으면 DeepSeek와 Opus 중 어느 모델을 쓰는지 구분하기 어려움.
- 4.1 ‘Pro’ 모델이 없다는 점도 중요하지 않으며, 실제 동작이 프런티어 모델과 같아 프런티어 모델처럼 취급함.
- 이는 주관적인 사용 경험이며, 더 포괄적인 벤치마크는 별도로 확인할 수 있음.
- 프런티어 연구소가 동요하지 않는 이유에 의문을 제기함. 중국 모델이 Anthropic과 OpenAI보다 한두 달 늦을 수는 있지만, 증류된 중국 모델이 같은 작업을 처리할 수 있다는 주장임.
- DeepSeek가 Claude의 학습을 훔쳤고 Anthropic도 다른 사람들의 데이터를 훔쳤다는 표현을 사용하지만, 데이터 소유권 논쟁은 다루지 않음. 대다수 개발자는 그런 논쟁보다 비용 대비 효율을 중시한다는 관점임.
‘충분히 좋은’ 모델이 바꾸는 개발 방식
- 현재 모델은 품질 높은 작업을 사람의 개입 없이 처리할 만큼 충분히 유능하므로, 최신·최고 모델만 좇는 일은 실익이 적음.
- 새로운 Fable 기능을 보는 일은 흥미롭지만, 대형 언어 모델(LLM)의 지각 능력을 믿는 관점에서 보면 모델에 맡기는 작업이 터무니없거나 모욕적으로 보일 수도 있음. 수학 박사에게 데스크톱 파일 정리를 시키는 것과 같은 비유임.
- 월 10달러의 OpenCode Go 구독으로 DeepSeek를 사실상 무제한 사용할 수 있으며, 이로 인해 개발 방식이 완전히 바뀜.
- 단순 작업이나 탐색적 사용자 인터페이스(UI) 몽키 테스트를 부담 없이 시작할 수 있고, 데스크톱 파일 정리도 1달러 대신 0.003달러에 맡길 수 있음.
- 세션당 예상 비용이 1달러를 넘는 경우는 드물며, 세션을 짧게 유지하려고 하지만 때로는 하루 대부분 이어짐.
- 복잡한 계획 수립과 조사에도 4.1 Flash를 사용함.
- 간혹 중요한 작업에는 Opus 5.5를 불러 최종 코드 검토를 맡겨 몇 가지 예외 사례를 찾아낸 뒤, DeepSeek가 수정 사항을 실행하도록 함.
- Opus나 GLM을 사용하는 경우에도 주된 이유는 품질이나 기능보다 문제를 새로운 관점에서 살펴보기 위해서임. GLM도 DeepSeek와 비슷한 중국 모델의 흐름을 따르는 것으로 보임.
KV 캐시의 비용 절감 효과
- DeepSeek는 V1 모델과 비교해 키-값(KV) 캐시를 약 437배 줄임.
- 장시간 코딩 세션에서 캐시를 그래픽처리장치(GPU) 메모리에 유지하는 일은 운영 비용의 큰 부분을 차지하며, 캐시 축소가 하루 종일 이어지는 세션을 1달러 미만으로 유지하는 배경임.
- 캐시 사용량이 적으면 Claude를 사용하는 것보다 물과 전기를 덜 소비할 것이라는 견해임. Claude 사용은 비용뿐 아니라 자원 낭비처럼 느껴진다고 밝힘.
- 이 캐시 최적화는 Opus 5.5에도 별도의 효율 향상을 가져온 것으로 봄.
업계의 비용·성능 우선주의와 향후 전망
- 업무를 통해 Claude와 Cursor 등을 이용할 수 있고 프런티어 모델 구독도 보유하고 있으므로, 단순히 비용을 아끼려는 이야기가 아님.
- 장기 계획, 지속 가능성, 고성능 인공지능에 대한 접근성 확대 측면에서 이 변화가 판도를 바꿀 수 있다고 봄.
- 기술 업계는 최고가를 지불하지 않으면 가치가 없다고 생각해 이런 이점을 놓치고 있다는 비판임.
- FAANG은 윤리성, 높은 비용, 환경이나 경제에 미치는 영향과 무관하게 최고 지능을 위해 가장 많은 돈을 쓰려 한다는 시각임. 이는 약육강식식 자본주의로 이어짐.
- 그 결과 수많은 Claude Max 구독을 부하 분산하도록 복잡한 환경을 구성하고, 추가 구독을 구하지 못하면 불평하는 사람들이 생김.
- 자체 호스팅을 고려하는 경우에도 4.1 Flash의 경제성 때문에 비용 절감만이 목표라면 자체 호스팅 비용을 회수하기 어려움.
- 개인정보 보호가 우려라면 캐시 최적화가 자체 호스팅 환경에도 적용될 때까지 기다릴 수 있으며, 장차 이 캐시 최적화가 완전히 로컬에서 실행될 것이라는 전망임.
- 4.1 Flash는 기술적으로 자체 호스팅이 가능하지만 실용적인 수준은 아님. 가까운 시일 내에 달라질 수 있다는 기대임.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요