TL;DR

  • 지난 3년간 하나의 대형 언어 모델(LLM)에 묶였던 역량이 에이전트의 대규모 추론 비용과 지연 시간 문제로 분리되며, 기본값이 프런티어 모델에서 저렴한 모델로 바뀌고 예외 상황에만 프런티어 모델을 호출하는 구조임.
  • 에이전트는 하나의 인간 목표를 수백~수천 개의 기계 결정으로 나누며, 단계별 비용과 지연 시간의 작은 차이도 제품 전체의 경제성에 누적되는 구조임.
  • TypeSafe의 Jev는 자유 형식 문장을 생성하지 않고 판단과 확률을 구조화된 결과로 반환해, 에이전트 내부 루프에 적합한 비용과 속도로 판단 역량을 제공함.
  • 역량별 분리는 프런티어 모델에서 저렴하고 예측 가능한 작업을 걷어내고 어려운 작업을 집중시키며, 애플리케이션을 역량을 나누고 조합하는 지능 컴파일러로 만듦.
  • 저렴한 판단·순위화·검증은 일부 표본 점검을 모든 상호작용과 상태 변화의 연속 평가로 확장해, 지능을 간헐적 기능에서 기술의 배경 속성으로 바꿈.

지능을 묶어 온 3년

  • 지난 3년간 생성형 AI의 주요 혁신은 문서 추출, 검색, 순위화, 의심스러운 항목 판별, 도구 선택, 웹 탐색, 답변 작성, 결과 검증, 어려운 추론을 하나의 범용 제품에 묶은 데 있음.
  • GPT, Claude, Gemini, Kimi는 이전에 별개였던 수많은 역량을 하나로 통합했으며, 개발자는 여러 전문 시스템을 엮는 대신 애플리케이션의 중심에 충분히 지능적인 모델 하나를 둘 수 있음.
  • 그러나 역량마다 필요한 연산량은 크게 다르고, 각 모델은 묶음 안의 서로 다른 작업에서 이미 강점을 보임. 성능·지연 시간·비용의 차이가 커질수록 경제적으로 합리적인 아키텍처도 달라짐.

지능 분리가 시작되는 이유

  • 에이전트는 하나의 인간 목표를 수백~수천 개의 기계 결정으로 전환하므로, 단계별 비용과 지연 시간의 작은 차이가 제품 전체의 경제성에 누적됨.
  • 추론 비용은 실제 매출원가(COGS)가 됐으며, 비용과 투자수익률(ROI)이 제품 설계의 고려 사항으로 부상함.
  • 더 작고 오픈 웨이트인 모델이 일상적인 작업을 더 많이 맡을 만큼 충분한 성능을 갖춤.
  • 검색, 검색 증강, 재순위화, 메모리, 컴퓨터 사용이 별개의 인프라 계층으로 자리 잡는 중임.
  • 애플리케이션의 평가 체계(evals)가 개선돼 저렴한 시스템으로 충분한 작업을 실제로 판별할 수 있음.
  • 프런티어 모델의 성능 향상은 역설적으로 역량 분리를 더 안전하게 만듦. 저렴한 계층이 작동하지 않을 때 스택 상단의 프런티어 모델을 호출할 수 있기 때문임.
  • 아키텍처의 기본값이 ‘우선 프런티어 모델을 쓰고 나중에 최적화’에서 ‘우선 저렴한 모델을 쓰고 예외에 프런티어 모델을 호출’하는 방식으로 전환되는 흐름임.

에이전트 내부 루프의 판단 역량

  • TypeSafe의 Jev는 생성형 AI의 공통 역량 가운데 하나인 판단을 분리함. 정리되지 않은 상태 정보, 범위가 제한된 질문, 정의된 답변 후보를 입력하면 자유 형식 문장 대신 구조화된 결정과 확률을 반환함.
  • 핵심 아이디어 자체는 새롭지 않지만, 인지 작업 하나를 모델 계층에서 직접 제공하고 에이전트 내부 루프에 맞는 비용과 속도로 패키징한 점이 새로움.
  • 작업이 단순히 ‘이것을 보고 결정하기’라면, 모델이 먼저 문장을 생성할 필요가 없음. 에이전트의 등장으로 판단이 경제성 문제로 부상한 시점에 Jev가 등장함.
  • 소프트웨어가 ‘긴급/긴급하지 않음’, ‘계속/중단’, ‘허용/차단’, ‘어떤 도구를 쓸지’만 필요로 하는 경우에도, 현재는 언어 모델에 답변을 생성하게 한 다음 애플리케이션이 원하는 결정으로 다시 변환하는 일이 흔함.
  • 에이전트 내부 루프의 상당 부분은 문장 생성 자체가 필요하지 않을 수 있음. 판단 결과를 생성 텍스트에서 다시 추출하는 데 드는 비용을 ‘디코더 세금(decoder tax)’으로 볼 수 있음.

프런티어 추론 경제성의 변화

  • Anthropic의 매출총이익률은 80%를 넘는 것으로 알려져 있으며, Claude가 작성·분류·추출·순위화·판단·코딩·계획·검증·추론을 하나의 제품으로 제공하는 것이 강력한 묶음의 사례임.
  • 단순 분류나 검증 작업도 Claude 호출 안에서 이뤄진다는 이유만으로 프런티어급 가격이 적용되는 상황임.
  • 역량 분리는 하나의 호출 안에 숨은 각 역량의 독립 시장 가격이 얼마인지 묻는 접근임. 어려운 추론에는 큰 프리미엄이 적절할 수 있지만, 이메일의 긴급 여부 판별, 검색 문서 다섯 개의 순위화, 브라우저 작업 성공 여부 확인에도 그만큼의 가격을 지불해야 하는지는 별개의 문제임.
  • 판단 비용이 센트의 일부 수준으로 경쟁 압력을 받으면 순위화는 재순위화 시스템으로, 검색은 검색 제공업체로, 결정론적 작업은 코드로, 일반적인 생성은 더 저렴한 모델이나 오픈 웨이트 모델로 이동할 수 있음.
  • 애플리케이션은 Anthropic의 마진 자체를 직접 공격하지 않고, 그 마진을 높이는 작업의 구성 비율을 바꿀 수 있음.
  • 애플리케이션의 라우팅이 정교해지면 프런티어 모델이 받는 혼합 작업에서 저렴하고 예측 가능하며 빈도가 높은 작업이 체계적으로 빠져나가는 역선택이 발생함.
  • 반복적인 컴퓨터 제어는 브라우저 모델이, 결정론적 추론은 코드가, 일반적인 생성은 소형 모델과 오픈 웨이트 모델이 맡을 수 있음. 프런티어 연구소에는 저렴한 시스템이 불확실해하는 낯설고 모호하며 장기적인 문제의 비중이 커짐.
  • 이에 따라 프런티어 지능은 더 유능해지고 호출당 가치도 커질 수 있지만, 호출 빈도는 낮아질 수 있음. 라우팅이 가장 어려운 문제를 선별하면 프런티어 모델에 도달하는 작업마다 더 많은 테스트 시점 연산량(test-time compute)이 필요해질 가능성도 있음.
  • 프런티어 추론의 위협은 더 저렴한 프런티어 추론만이 아니라, 그 아래에 있는 작업 부하의 분해임.

애플리케이션은 지능 컴파일러가 됨

  • 역량이 분리되면 다시 조합할 주체가 필요하므로 애플리케이션 계층의 중요성이 커짐.
  • 애플리케이션은 전체 작업을 어느 모델이 맡을지 묻는 대신, 작업에 어떤 역량이 필요한지 결정함. 인간의 목표를 인지 작업으로 나누고, 각 작업에 충분한 수준에서 가장 저렴한 지능을 구매해 결과를 재조합한 뒤 필요할 때만 상위 모델로 넘기는 ‘지능 컴파일러’가 됨.
  • 다음 단계의 질문은 ‘이 프롬프트에 어떤 모델이 답해야 하는가’가 아니라 ‘이 작업 안의 각 역량을 누가 제공해야 하는가’임.
  • 역량에 안정적인 인터페이스가 생기면 제공업체를 각각 벤치마크하고 교체하며 라우팅하고 가격을 매길 수 있음. 지능의 대분해는 AI의 마진 풀을 없애는 것이 아니라, 각 역량이 마진을 얻을 자격이 있는지 입증하도록 만듦.

저렴한 판단이 가능하게 하는 제품

  • 판단을 센트의 일부 비용과 수백 밀리초의 지연 시간으로 제공할 수 있으면, 작업을 가끔 확인하는 대신 모든 에이전트 행동 뒤에 판단기를 둘 수 있음.
  • 수초 단위 추론이 너무 느린 브라우저·음성 루프에도 지능을 넣을 수 있으며, 시스템의 1%를 표본 검사하는 방식에서 지원 대화, 검색 결과, 거래, 보험 청구, 계약 조항, 고객 계정의 100%를 평가하는 방식으로 전환할 수 있음.
  • 이는 지속적인 감독과 품질 보증(QA), 새로운 제품 루프와 사용 사례를 가능하게 함.
  • 지능을 지속적으로 적용하기에는 여전히 비용이 높아, 소프트웨어가 내릴 수 있는 결정 중 상당수는 실행되지 않음. 판단·순위화·검증 등 여러 역량이 충분히 저렴해지면 모든 고객, 업무 흐름, 에이전트 행동, 상태 변화를 평가할 수 있음.
  • 저렴한 지능은 소프트웨어가 지능을 적용할 수 있는 범위를 넓힘. 핵심 변화는 지능이 일회성 사건이 아니라 기술의 배경 속성이 되는 세계임.
  • 지난 몇 년간 하나의 모델에 얼마나 많은 역량을 넣을 수 있는지 물었다면, 다음 10년에는 역량을 분리하고 애플리케이션 계층에서 다시 조합할 수 있음.