TL;DR
- 지난 3년간 하나의 대형 언어 모델(LLM)에 묶였던 역량이 에이전트의 대규모 추론 비용과 지연 시간 문제로 분리되며, 기본값이 프런티어 모델에서 저렴한 모델로 바뀌고 예외 상황에만 프런티어 모델을 호출하는 구조임.
- 에이전트는 하나의 인간 목표를 수백~수천 개의 기계 결정으로 나누며, 단계별 비용과 지연 시간의 작은 차이도 제품 전체의 경제성에 누적되는 구조임.
TypeSafe의 Jev는 자유 형식 문장을 생성하지 않고 판단과 확률을 구조화된 결과로 반환해, 에이전트 내부 루프에 적합한 비용과 속도로 판단 역량을 제공함.- 역량별 분리는 프런티어 모델에서 저렴하고 예측 가능한 작업을 걷어내고 어려운 작업을 집중시키며, 애플리케이션을 역량을 나누고 조합하는 지능 컴파일러로 만듦.
- 저렴한 판단·순위화·검증은 일부 표본 점검을 모든 상호작용과 상태 변화의 연속 평가로 확장해, 지능을 간헐적 기능에서 기술의 배경 속성으로 바꿈.
지능을 묶어 온 3년
- 지난 3년간 생성형 AI의 주요 혁신은 문서 추출, 검색, 순위화, 의심스러운 항목 판별, 도구 선택, 웹 탐색, 답변 작성, 결과 검증, 어려운 추론을 하나의 범용 제품에 묶은 데 있음.
- GPT, Claude, Gemini, Kimi는 이전에 별개였던 수많은 역량을 하나로 통합했으며, 개발자는 여러 전문 시스템을 엮는 대신 애플리케이션의 중심에 충분히 지능적인 모델 하나를 둘 수 있음.
- 그러나 역량마다 필요한 연산량은 크게 다르고, 각 모델은 묶음 안의 서로 다른 작업에서 이미 강점을 보임. 성능·지연 시간·비용의 차이가 커질수록 경제적으로 합리적인 아키텍처도 달라짐.
지능 분리가 시작되는 이유
- 에이전트는 하나의 인간 목표를 수백~수천 개의 기계 결정으로 전환하므로, 단계별 비용과 지연 시간의 작은 차이가 제품 전체의 경제성에 누적됨.
- 추론 비용은 실제 매출원가(COGS)가 됐으며, 비용과 투자수익률(ROI)이 제품 설계의 고려 사항으로 부상함.
- 더 작고 오픈 웨이트인 모델이 일상적인 작업을 더 많이 맡을 만큼 충분한 성능을 갖춤.
- 검색, 검색 증강, 재순위화, 메모리, 컴퓨터 사용이 별개의 인프라 계층으로 자리 잡는 중임.
- 애플리케이션의 평가 체계(evals)가 개선돼 저렴한 시스템으로 충분한 작업을 실제로 판별할 수 있음.
- 프런티어 모델의 성능 향상은 역설적으로 역량 분리를 더 안전하게 만듦. 저렴한 계층이 작동하지 않을 때 스택 상단의 프런티어 모델을 호출할 수 있기 때문임.
- 아키텍처의 기본값이 ‘우선 프런티어 모델을 쓰고 나중에 최적화’에서 ‘우선 저렴한 모델을 쓰고 예외에 프런티어 모델을 호출’하는 방식으로 전환되는 흐름임.
에이전트 내부 루프의 판단 역량
TypeSafe의 Jev는 생성형 AI의 공통 역량 가운데 하나인 판단을 분리함. 정리되지 않은 상태 정보, 범위가 제한된 질문, 정의된 답변 후보를 입력하면 자유 형식 문장 대신 구조화된 결정과 확률을 반환함.- 핵심 아이디어 자체는 새롭지 않지만, 인지 작업 하나를 모델 계층에서 직접 제공하고 에이전트 내부 루프에 맞는 비용과 속도로 패키징한 점이 새로움.
- 작업이 단순히 ‘이것을 보고 결정하기’라면, 모델이 먼저 문장을 생성할 필요가 없음. 에이전트의 등장으로 판단이 경제성 문제로 부상한 시점에 Jev가 등장함.
- 소프트웨어가 ‘긴급/긴급하지 않음’, ‘계속/중단’, ‘허용/차단’, ‘어떤 도구를 쓸지’만 필요로 하는 경우에도, 현재는 언어 모델에 답변을 생성하게 한 다음 애플리케이션이 원하는 결정으로 다시 변환하는 일이 흔함.
- 에이전트 내부 루프의 상당 부분은 문장 생성 자체가 필요하지 않을 수 있음. 판단 결과를 생성 텍스트에서 다시 추출하는 데 드는 비용을 ‘디코더 세금(decoder tax)’으로 볼 수 있음.
프런티어 추론 경제성의 변화
- Anthropic의 매출총이익률은 80%를 넘는 것으로 알려져 있으며, Claude가 작성·분류·추출·순위화·판단·코딩·계획·검증·추론을 하나의 제품으로 제공하는 것이 강력한 묶음의 사례임.
- 단순 분류나 검증 작업도 Claude 호출 안에서 이뤄진다는 이유만으로 프런티어급 가격이 적용되는 상황임.
- 역량 분리는 하나의 호출 안에 숨은 각 역량의 독립 시장 가격이 얼마인지 묻는 접근임. 어려운 추론에는 큰 프리미엄이 적절할 수 있지만, 이메일의 긴급 여부 판별, 검색 문서 다섯 개의 순위화, 브라우저 작업 성공 여부 확인에도 그만큼의 가격을 지불해야 하는지는 별개의 문제임.
- 판단 비용이 센트의 일부 수준으로 경쟁 압력을 받으면 순위화는 재순위화 시스템으로, 검색은 검색 제공업체로, 결정론적 작업은 코드로, 일반적인 생성은 더 저렴한 모델이나 오픈 웨이트 모델로 이동할 수 있음.
- 애플리케이션은 Anthropic의 마진 자체를 직접 공격하지 않고, 그 마진을 높이는 작업의 구성 비율을 바꿀 수 있음.
- 애플리케이션의 라우팅이 정교해지면 프런티어 모델이 받는 혼합 작업에서 저렴하고 예측 가능하며 빈도가 높은 작업이 체계적으로 빠져나가는 역선택이 발생함.
- 반복적인 컴퓨터 제어는 브라우저 모델이, 결정론적 추론은 코드가, 일반적인 생성은 소형 모델과 오픈 웨이트 모델이 맡을 수 있음. 프런티어 연구소에는 저렴한 시스템이 불확실해하는 낯설고 모호하며 장기적인 문제의 비중이 커짐.
- 이에 따라 프런티어 지능은 더 유능해지고 호출당 가치도 커질 수 있지만, 호출 빈도는 낮아질 수 있음. 라우팅이 가장 어려운 문제를 선별하면 프런티어 모델에 도달하는 작업마다 더 많은 테스트 시점 연산량(test-time compute)이 필요해질 가능성도 있음.
- 프런티어 추론의 위협은 더 저렴한 프런티어 추론만이 아니라, 그 아래에 있는 작업 부하의 분해임.
애플리케이션은 지능 컴파일러가 됨
- 역량이 분리되면 다시 조합할 주체가 필요하므로 애플리케이션 계층의 중요성이 커짐.
- 애플리케이션은 전체 작업을 어느 모델이 맡을지 묻는 대신, 작업에 어떤 역량이 필요한지 결정함. 인간의 목표를 인지 작업으로 나누고, 각 작업에 충분한 수준에서 가장 저렴한 지능을 구매해 결과를 재조합한 뒤 필요할 때만 상위 모델로 넘기는 ‘지능 컴파일러’가 됨.
- 다음 단계의 질문은 ‘이 프롬프트에 어떤 모델이 답해야 하는가’가 아니라 ‘이 작업 안의 각 역량을 누가 제공해야 하는가’임.
- 역량에 안정적인 인터페이스가 생기면 제공업체를 각각 벤치마크하고 교체하며 라우팅하고 가격을 매길 수 있음. 지능의 대분해는 AI의 마진 풀을 없애는 것이 아니라, 각 역량이 마진을 얻을 자격이 있는지 입증하도록 만듦.
저렴한 판단이 가능하게 하는 제품
- 판단을 센트의 일부 비용과 수백 밀리초의 지연 시간으로 제공할 수 있으면, 작업을 가끔 확인하는 대신 모든 에이전트 행동 뒤에 판단기를 둘 수 있음.
- 수초 단위 추론이 너무 느린 브라우저·음성 루프에도 지능을 넣을 수 있으며, 시스템의 1%를 표본 검사하는 방식에서 지원 대화, 검색 결과, 거래, 보험 청구, 계약 조항, 고객 계정의 100%를 평가하는 방식으로 전환할 수 있음.
- 이는 지속적인 감독과 품질 보증(QA), 새로운 제품 루프와 사용 사례를 가능하게 함.
- 지능을 지속적으로 적용하기에는 여전히 비용이 높아, 소프트웨어가 내릴 수 있는 결정 중 상당수는 실행되지 않음. 판단·순위화·검증 등 여러 역량이 충분히 저렴해지면 모든 고객, 업무 흐름, 에이전트 행동, 상태 변화를 평가할 수 있음.
- 저렴한 지능은 소프트웨어가 지능을 적용할 수 있는 범위를 넓힘. 핵심 변화는 지능이 일회성 사건이 아니라 기술의 배경 속성이 되는 세계임.
- 지난 몇 년간 하나의 모델에 얼마나 많은 역량을 넣을 수 있는지 물었다면, 다음 10년에는 역량을 분리하고 애플리케이션 계층에서 다시 조합할 수 있음.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요