TL;DR
- Jev는 확률 보정을 차별점으로 내세우지만, 보정 성능에 대한 의문이 있고 소규모 프리필 환경에서는 기존 모델과 비용·지연 시간 차이도 크지 않음.
- 구조화된 출력, 낮은 지연 시간, 낮은 비용은 기존 오토리그레시브 언어 모델로 재현 가능함.
- RLCD(보정된 의사결정)의 광범위한 보정 주장은 검증이 부족하며, 외부 데이터셋과 자체 실험에서 보정 실패와 높은 ECE(기대 보정 오차)가 관찰됨.
- 루브릭·선호도 모델 기반 평가와 정렬, 검색 엔진 재순위화·최적화는 Jev의 유용한 적용 분야일 수 있지만, 제품 사례의 성과가 RLCD 보정에서 비롯됐다고 단정하기 어려움.
- 신뢰도 높은 확률 보정은 임계값과 결합할 때 지속적인 이점이 될 수 있으나, 현재 Jev에서 확인하기 어려우며 역량 있는 팀은 자체 모델을 구축해야 함.
Jev의 차별점과 약속
- Jev는 흥미로운 모델이지만, 차별점인 확률 보정은 기대에 미치지 못함. 많은 경우 빠르고 맞춤화 가능한 오픈소스 대형 언어 모델(LLM), 예를 들어
Qwen-3.5-2b를 사용하거나, GPU가 있다면 DeepSeek와 Qwen의 Flash 모델을 사용하는 편이 나을 수 있음. - Jev는 ‘시스템 1’ 모델로 표시되지만 이는 마케팅에 해당함. 『생각에 관한 생각』의 구분에 따르면 빠른 모델은 시스템 1, 느린 모델은 시스템 2이며, 시스템 1 모델의 범위는 단순 선형 회귀부터 트랜스포머와 미래 모델까지임.
- 이 브랜딩을 제외하면 Jev가 내세우는 주요 약속은 네 가지임.
- 보정된 의사결정 또는 보정된 확률
- 구조화된 출력
- 낮은 지연 시간
- 낮은 비용
- 뒤의 세 가지는 기성 모델로 재현 가능함.
비용과 지연 시간
- 소형 LLM은 Jev와 비슷한 비용·지연 시간 특성을 보임.
@modal의 Eric Zhang은Qwen-3.6-35b-a3b와SGLang을 사용해 Jev 호환 API를 구축함.- Eric Zhang (@ekzhang1) on X
- Google의 Matt Mastracci는
DiffusionGemma와vLLM을 사용해 DGX Spark에서 Jev와 비슷한 지연 시간을 구현함. - Matt Mastracci (@mmastrac) on X
- 따라서 빠른 ‘의사결정’ API는 기존 모델로 재현 가능함. 소규모 프리필에서는 오토리그레시브 모델과 비오토리그레시브 모델 간 지연 시간·비용 격차가 무시할 만한 수준임.
구조화된 출력
- 구조화된 출력은 함수 호출 초기인 2023년부터 모든 오토리그레시브 언어 모델에 학습된 기능임.
- Jev는
choice(목록에서 선택),score(루브릭에 따라 상태 평가),noul(불리언 참·거짓)을 출력 형식으로 제공하며, 각 항목에 답변·확률·신뢰도를 포함함. - 이는 샌프란시스코에서 열리는 COLM 2026에서 선보일 예정인 Delip Rao의
AutoRubrics와 비슷한 추상화임.
보정된 의사결정
- 평가와 정렬에 지나치게 집중해 왔거나 제품 관점이 부족한 것일 수도 있음. Jev의 가장 유용한 적용 분야는 LLM 평가·정렬을 위한 루브릭 또는 선호도 모델, 그리고 검색 엔진 재순위화·최적화라고 봄. 보정된 확률을 제공하는 Jev의 API 설계는 이러한 직관과 맞음.
- 다만 Jev가 RLCD(보정된 의사결정)라고 부르는 광범위한 보정 주장에는 회의적임. 무엇에 맞춰 보정하는지 불분명하며, 보정은 알려진 분포의 확률
q에 크게 좌우됨. - Valeriy M은 데이터셋 8개에서 예측 1만 6,500건을 실행하고, 8개 중 7개에서 보정 실패를 발견함.
- Valeriy M., PhD, MBA, CQF (@predict_addict) on X
- 동전 던지기, 주사위 두 개 던지기, 서로 다른 UCI 데이터셋 3개를 사용한 실험에서도 Jev의 ECE(기대 보정 오차)가 높게 나타남. 시뮬레이션 기반 실험에서 벗어날수록 이 문제가 특히 두드러짐.
- 그림 1. 모든 실험의 예측 오차와 보정 결과. 낮을수록 좋음. 이 결과는 예측 가치를 입증하지 않음.
- 그림 2. 모든 실험의 보정 결과. 점선 대각선에 가까울수록 좋음.
제품 가치와 AI/ML 엔지니어링의 귀환
- 실제 제품 가치도 존재함. Pedram은
Poker Arena를 운영하는 데 Jev를 사용하고, Shengyao Zhuang은 재순위화에, Peter Wang은Warcraft 3플레이에 사용함. Warcraft를 플레이한다면 영상을 확인하고 Mountain King을 관찰할 만함. 거의 무작위로 움직이며 무작위 행동을 하고, 지능의 징후는 보이지 않음. 이러한 기능의 대부분은 RLCD 보정이 아니라 Jev의 기반 모델에서 비롯됐을 가능성이 있음.- pedram.md (@pdrmnvd) on X
- Shengyao Zhuang (@ShengyaoZhuang) on X
- Peter Wang (@BrainsAndTennis) on X
- 더 신뢰할 수 있고 잘 보정된 확률은 큰 지속적 우위이며, 임계값과 결합하면 더 나은 의사결정으로 직접 이어짐. 그러나 현재 Jev에서는 이런 보정이 관찰되지 않으며, 역량 있는 팀 대부분은 자체 모델을 구축해야 함. AI/ML 엔지니어링의 귀환임.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요