TL;DR
- 특정 사용 사례를 위한 AI 제품의 경쟁력은 모델 선택지가 아니라 최적의 작업 경험과 결과에 달려 있으며, 모델 선택기만 갖춘 복제품은 약한 전략임.
- 사용자가 프런티어 모델을 선택하는 이유는 업체에 대한 신뢰나 가격이 아니라 현재 이용 가능한 최고 성능이며, 오픈소스 모델은 격차를 좁히고 있지만 아직 프런티어 모델에 크게 못 미침.
- 모델 경제성은 토큰 100만 개당 비용보다 작업 하나를 끝내는 데 드는 작업당 비용으로 판단해야 하며, 토큰 단가가 다소 높아도 작업당 비용이 낮은 모델이 유리함.
- Codex와 ChatGPT 작업 기능, Anthropic의 컴퓨터 사용, T3 Code와 Paper는 모델 선택보다 작업에 맞는 사용자 경험을 앞세우는 사례임.
- 오픈소스 모델을 쓰는 것 자체는 문제가 아니며, 제품은 사용자가 모델을 고르는 일보다 원하는 결과를 얻는 일을 우선해야 함.
‘벤더 종속 없음’이라는 주장
- Claude가 더는 가장 지능적인 모델이 아니게 되거나, Muse의 성능이 갑자기 크게 나빠지거나, OpenAI가 모델 가격을 대폭 올리면 어떻게 하느냐는 주장은 모델 선택기를 붙인 기존 제품을 만들 때 흔히 제기되는 논거임.
- 이런 상황을 피하기 위해 여러 모델을 선택할 수 있게 한다는 것은 성공한 제품의 복제품을 만들 때 내놓을 수 있는 가장 약한 답변임.
- 오늘날 특정 사용 사례에 AI나 AI 에이전트를 활용하는 제품은 맞춤형 하니스(custom harness)임. Y Combinator도 최근 Paper Club 발표 중 하나에서 같은 취지로 말했으며, 최근 YC 배치의 상당수도 특정 사용 사례를 위한 맞춤형 하니스를 구축하는 것으로 보임.
- 여기서 새롭게 등장한 제품군은 프런티어 연구소 제품과 같은 일을 할 수 있으면서, 제공되는 수많은 모델 가운데 선택할 수 있다는 점을 핵심으로 내세움. Claude Code의 다른 모델 버전, 다른 모델을 쓰는 ChatGPT, 다른 모델을 쓰는 Grok 봇이 그 예임.
- 이런 제품의 존재를 뒷받침하는 주장은 Anthropic이나 OpenAI가 가격을 감당하기 어려울 정도로 올리거나 모델을 사용할 수 없게 만들 수 있다는 우려, 그리고 저렴한 오픈소스 모델이 존재하므로 이를 써야 한다는 주장임.
- 하지만 이런 주장은 사람들이 업체를 신뢰하거나 가격이 적절해서 프런티어 모델을 쓴다고 전제함. 실제 이유는 그렇지 않음.
사용자는 가장 좋은 모델을 원함
- 사용자가 원하는 것은 이용 가능한 최고의 모델임. GPT-6 Astra, Claude Fable 5.1, Opus 5.5는 매우 뛰어나며, 오픈소스 모델은 아직 그 수준에 가까이 도달하지 못함.
- 오픈소스 모델은 출시될 무렵에만 자주 언급되다가 점차 관심에서 멀어짐. 프런티어 모델이 매우 뛰어나고 쉽게 이용할 수 있기 때문임.
- Claude Fable이 너무 비싸고 Kimi K3가 모든 일을 할 수 있다고 생각해 Fable을 좋게 보지 않았지만, 실제로 사용한 뒤에는 Fable이 기대할 수 있는 최고의 솔루션 엔지니어임을 알게 됨. 사용해 본 다른 모델은 어느 것도 그 수준에 가깝지 않음.
- Astra는 매우 훌륭한 동료이며, 그런 면에서 Astra에 필적하는 모델도 아직 없음.
- 벤치마크도 같은 양상을 보여줌. 오픈소스 모델이 격차를 줄이고 있지만, 현재의 프런티어 모델과는 여전히 큰 차이가 있음.
- 성능이 더 약한 모델을 기반으로 제품을 만들고 모델 목록을 내세우는 것은 최악의 선택임. 사용자는 최고의 성능을 원하며, 밑단의 모델 순위에는 관심이 없음.
- 사용자는 언제나 작업에 가장 적합한 최고 성능 모델을 이용할 수 있어야 하며, 일을 끝내기 위해 더 저렴한 모델로 바꿀 필요가 없어야 함.
- 저렴한 모델은 오늘날에도 결과물이 때로는 조금씩 더 나쁨. 그렇지 않았다면 오픈소스 모델이 이미 기본 선택지가 됐을 것임.
작업당 비용과 제품 경험
- 과거에는 토큰 100만 개당 비용으로 모델을 평가했지만, 이제는 작업당 비용으로 평가하며 이 지표가 더 신뢰할 만함. 모델 토큰 단가가 조금 높더라도 작업당 비용이 더 낮으면 그 모델이 유리함.
- DeepSWE 점수와 평균 작업당 비용을 비교하는 차트, 지능 등급별 토큰 100만 개당 가격의 시간에 따른 변화를 나타내는 차트가 제시됨.
- 중요한 것은 제품임. 특정 작업에 맞는 사용자 경험(UX)이 무엇인지, 사용자가 특정 작업을 시도할 때마다 어디에서 막히는지, 그 지점을 어떻게 넘어가게 할지가 핵심임.
- 오늘날 이 점을 가장 잘 구현하는 제품은 개인적으로 Codex 또는 ChatGPT 작업 기능임. 밑단에서 어떤 모델을 사용하는지 여전히 알 수 있지만, 평균적인 사용자는 그 사실을 몰라도 더 나음. 요청에 맞는 사용자 경험을 제공하기 때문임.
- 이미지 생성을 요청하면 주석을 달고 에이전트에게 필요한 내용과 작업을 전달할 수 있는 이미지 경험을 제공함. 편집할 문서를 요청하면 OpenAI spaces에서 열리는 식임.
- OpenAI가 모델 연구소가 아니었다면 사용자에게 모델 선택기를 제공하지도 않았을 것임. 제품의 역할은 사용자가 원하는 결과를 전달하는 것이며, 선택된 모델이 무엇이든 그 일을 수행함.
- Anthropic도 같은 방향으로 가고 있음. Anthropic의 컴퓨터 사용 기능은 크게 향상됐음.
- 연구소 밖에서 성과를 내는 기업도 같은 접근을 취함. T3 Code는 소프트웨어 엔지니어링을 즐겁게 만들며, 이를 사용해 계획을 세우고 아키텍처를 설계하면 에이전트가 코드를 작성함.
- Paper도 제품 경험을 제대로 구현함. 소프트웨어 엔지니어로서 캔버스에서 디자인하고, 원하는 에이전트를 사용하고, 결과를 공유할 수 있음. 대부분의 경우 어떤 모델을 쓰는지는 중요하지 않으며, Codex나 Claude Code 안에서 또는 원하는 다른 하니스에서 작동함.
모델보다 모델로 만드는 것
- 2010년부터 2021년까지는 Apple의 모든 출시와 거의 모든 기술 제품을 추적했지만, 제품 대부분이 충분히 좋아져서 이제는 어떤 제품을 사도 일을 해낼 수 있게 된 뒤로 관심을 줄였음. 실제로 새로운 것이 있을 때만 주목함.
- 모델도 같은 방향으로 가고 있음. 어떤 모델을 쓰는지는 그 모델로 무엇을 만드는지보다 덜 중요함.
- 사람들이 즐겨 쓰는 제품을 만들고, 최고의 제품이 이기게 해야 함.
- 오픈소스 모델을 쓰지 말아야 한다는 뜻은 아님. 오픈소스 모델은 저렴하고 잘 작동하므로 사용해도 됨. 결국 어떤 모델을 쓰는지는 중요하지 않으며, 작업을 해내는지가 중요함.
- 사용자가 어떤 모델을 쓸지 직접 고르는 것보다 사용자에게 결과를 제공하는 일이 훨씬 중요함.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요