TL;DR
- Jev 1.1 한 종과 Claude 모델 세 종, 총 네 모델을 DoubtBench로 비교한 결과, 판단 성능은 비슷하고 최종 점수 1위는 Claude Haiku 4.5임.
- Jev는 원시 정확도에서 Claude 모델보다 몇 점 앞서지만, Claude는 더 낮은 평균 확신도로 확률 보정(calibration)에서 우위를 보임.
- 사람들의 의견이 갈리는 응답에서 네 모델 모두 불확실성을 거의 드러내지 않아, 어느 모델도 어려운 질문을 안정적으로 알아채지 못함.
- 전체 벤치마크 실행 비용은 Jev가 $0.10, Claude 모델은 $5.00~$23.30이며, 응답 지연 시간은 Jev가 98ms, Claude가 2.2~3.7초임.
- 고용량 채점·라우팅·가드레일에는 Jev가 저렴한 선택지지만, 사람에게 넘길 사례를 확신 점수만으로 가려내서는 안 됨.
Jev는 Claude보다 더 나은 판단자가 아님
- 2026년 10월 6일, Jev와 Claude 모델 세 종을 비교하는 데 $40을 지출한 결과, 어느 팬층도 반기기 어려운 결론에 도달함.
- TypeSafe가 9월 Jev를 출시하며 내세운 것은 글을 쓰는 대신 판단하는 모델이라는 점임. 모든 답변에 보정된 확률을 붙이고, 임계값을 설정해 확신이 높은 사례는 자동화하고 나머지는 사람에게 보낼 수 있다는 구상임.
- 검증 질문은 Jev가 실제로 Claude보다 더 나은 판단자인지, 질문이 정말 어려울 때 확신이 낮아지는지였음.
- 결론은 두 질문 모두 부정적임. Jev는 Claude와 비슷한 수준으로 판단하며, 어느 모델도 자신이 감당하기 어려운 상황을 알아채지 못함.
정답이 하나가 아닌 테스트
- 대부분의 모델 벤치마크는 정답을 골랐는지만 확인하므로 확신도를 평가하지 못함. 모든 질문에 98% 확신을 보이는 모델과 어려운 사례에서 망설이는 모델이 같은 점수를 받을 수 있음.
- NVIDIA의 HelpSteer2(CC BY 4.0)를 바탕으로 DoubtBench를 구축함. 데이터셋의 모든 AI 응답은 여러 사람이 평가했으며, 평가자별 투표가 공개됨.
- 응답의 유용성에 세 사람이 의견을 달리한다면 전문가 사이에도 단 하나의 정답이 없다는 의미임. 좋은 판단 모델도 이에 맞춰 불확실성을 드러내야 함.
- DoubtBench는 이를 7,455개 질문으로 구성함. 응답의 유용성·정확성·일관성·복잡성·장황함을 평가하고, 수용 가능한지 판단하며, 두 응답 중 더 나은 것을 선택함.
- 100점 만점 점수는 정확도, 확률 보정, 모델 확률과 사람들의 투표가 얼마나 일치하는지를 평균한 값임.
점수판
- 네 모델의 결과를 사람 평가자가 자신의 투표를 다시 재현하는 기준점(현실적인 상한)과 무작위 추측(하한) 사이에서 비교함. 네 모델 실행의 총비용은 $39.90임.
- 사람 평가자(상한): 점수 90.4, 정확도 82.6%, 사람 간 의견 차이 추적도 1.00.
- Claude Haiku 4.5: 점수 69.2, 정확도 45.8%, 의견 차이 추적도 0.15, 전체 실행 비용 $5.00, 중앙값 지연 시간 2.2초.
- Jev 1.1: 점수 67.8, 정확도 48.2%, 의견 차이 추적도 0.14, 전체 실행 비용 $0.10, 중앙값 지연 시간 0.1초.
- Claude Opus 5.5: 점수 67.8, 정확도 44.0%, 의견 차이 추적도 0.06, 전체 실행 비용 $23.30, 중앙값 지연 시간 3.7초.
- Claude Sonnet 5.5: 점수 67.4, 정확도 42.5%, 의견 차이 추적도 0.12, 전체 실행 비용 $11.50, 중앙값 지연 시간 2.4초.
- 무작위 추측(하한): 점수 54.8, 정확도 18.4%.
- ‘사람 간 의견 차이 추적도’는 모델의 불확실성과 평가자 간 의견 불일치 정도의 상관관계임. 1.0은 사람들이 의견을 달리하는 지점에서 모델도 정확히 불확실해짐을 뜻하고, 0은 둘 사이에 관계가 없음을 뜻함.
결과 1: Jev는 더 나은 판단자가 아님
- 과장된 홍보를 걷어내면 결과는 박빙임. 네 모델 모두 2점 이내에 들며, 1위는 Jev가 아니라 가장 작고 저렴한 Claude인 Haiku 4.5임.
- Jev는 원시 정확도에서 모든 Claude 모델보다 몇 점 앞섬(대응 맥니마 검정, p < 0.001). 평가자 전원이 동의한 쉬운 판단에서 Jev의 정답률은 62%, Claude는 53~55%임.
- Claude는 확률 보정에서 만회하며, 그 방식은 더 낮은 확신을 보이는 것임. 평균 확신도는 Claude가 약 0.54, Jev가 0.65임. 확신을 낮게 제시하는 Claude의 값이 실제 정답률에 더 가까움.
- 모델 규모가 클수록 성능이 좋은 것도 아님. Haiku는 정확도에서 Sonnet 5.5와 Opus 5.5를 모두 앞섬. 플래그십인 Opus는 비용이 가장 높고 2위와 동률임.
결과 2: 어느 모델도 어려운 질문을 알아채지 못함
- 이 수치는 해당 모델을 기반으로 시스템을 구축하는 사람이라면 우려할 만한 결과임. 사람들의 의견이 갈린 응답에서 모델의 확신이 낮아지는지를 측정했지만, 변화는 미미함. 사람 기준 점수가 1.0인 척도에서 모든 모델은 0.06~0.15에 머묾.
- Jev는 사람들이 의견을 두고 다툰 응답에도 모두가 동의한 응답과 거의 같은 확신을 보임. Claude도 마찬가지임. 0.06을 기록한 Opus가 가장 둔감함.
- 이는 핵심 약속을 무너뜨림. 확신 임계값은 사람이 판단하기 어려워할 사례를 가려내야 하지만, 이 테스트에서는 그러지 못함. 어느 모델이든 게이트키퍼로 활용한다면 먼저 자체 데이터에서 확률을 검증해야 함.
결과 3: 실질적인 차이는 가격
- 판단 성능은 비슷하지만 비용은 크게 다름. 벤치마크 전체 실행 비용은 Jev가 10센트, Haiku가 $5, Sonnet이 $11.50, Opus가 $23.30임. 최대 230배 차이임.
- 속도도 같은 양상임. Jev의 응답 시간은 98ms, Claude는 2.2~3.7초임. 모든 요청마다 실행할 수 있는 검사와 야간 일괄 작업으로 남겨둘 검사의 차이임.
- Jev를 더 나은 판단자라고 부를 필요는 없음. Claude만큼 판단하면서 비용은 몇 센트, 응답 시간은 10분의 1초인 모델임. 대량 채점·라우팅·가드레일에서는 이 비용 차이가 핵심임.
인용 전 유의사항
- Claude 모델은 선택지마다 확률을 구조화된 JSON으로 출력했고, Jev는 확률을 기본 출력으로 제공함. 토큰 로그확률(token logprobs)에서 확률을 읽으면 결과가 달라질 수 있음.
- Sonnet과 Opus는 낮은 추론 강도(low effort)로 실행함. 더 높은 추론 강도는 품질을 높일 수 있지만 비용도 더 커질 수 있음.
- 데이터셋 하나와 과제 하나만 사용함. HelpSteer2는 영어 데이터이며 AI 응답 채점에 관한 자료임. 분류나 라우팅에서는 Jev의 상대 성능이 다를 수 있음.
- 상한 점수는 100점이 아님. HelpSteer2의 공식 라벨은 투표 평균을 반올림한 값이므로, 때로는 어떤 평가자도 해당 라벨을 선택하지 않음. 이에 따라 사람 평가자의 정확도도 82.6%임.
어떤 모델을 사용해야 하는가?
- 의사결정에서는 비용이 훨씬 낮다는 점에서 Jev가 여전히 우위임.
- 다만 사람의 개입이 필요한 시점을 확신 점수로 판단하도록 어느 모델도 신뢰해서는 안 됨.
- 모든 과정은 공개되어 재현 가능함. Jev 실행 비용은 10센트이며, 모델을 추가하려면 어댑터 파일 하나와 풀 리퀘스트 하나가 필요함.
- 다음 테스트 대상으로 Laya와 SemIf가 예정되어 있음. 테스트를 원하는 모델은 이슈를 열면 실행 가능함.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요