TL;DR

  • Jev는 에이전트의 요청, 도구 호출과 결과, 최종 답변을 함께 살펴 에이전트 평가의 심판 역할을 수행하는 모델임.
  • 대형 언어 모델 심판(LLM-as-a-judge)은 다른 모델의 결과를 기준에 따라 채점·순위화·비교하는 방식임.
  • 심판 모델은 프롬프트, 도구, 모델이 바뀔 때마다 수천 건의 실행 결과에 같은 기준을 적용할 수 있음.
  • 에이전트 평가는 말만 그럴듯한 응답과 실제 작업 성공을 구분해야 하며, 환불 도구 시간 초과 사례가 이를 보여줌.
  • Jev는 판정과 함께 확률을 반환하며, 이 가이드는 환불 사례와 라이브 플레이그라운드를 통해 평가 워크플로를 다룸.

LLM 심판이란

  • 대형 언어 모델(LLM)을 다른 모델의 작업을 평가하는 심판으로 활용하는 방식임.
  • 심판에게 출력 하나 또는 두 개의 출력과 평가 기준을 제공하면 점수 매기기, 순위화, 비교가 가능함.
  • 정책 준수 여부, 두 응답 중 더 나은 응답, 에이전트의 작업 완료 여부 등을 판정할 수 있음.
  • 사람이 수십 개의 결과를 꼼꼼히 검토하는 데 그치는 반면, 심판 모델은 프롬프트·도구·모델이 바뀔 때마다 수천 건의 실행 결과에 같은 기준을 적용할 수 있음.

Jev를 에이전트 심판으로 활용

  • Jev는 이러한 판정을 위해 특별히 구축된 새 모델로, 심판 역할에 적합함.
  • Jev를 심판 LLM으로 사용하는 방식이 이 가이드에서 말하는 Jev-as-a-Judge임.
  • 에이전트는 실제 작업에 실패했더라도 정답처럼 들리는 답변을 할 수 있음. 예를 들어 환불 에이전트가 고객에게 환불 처리가 완료됐다고 말해도, 실제 환불 도구 호출은 시간 초과일 수 있음.
  • Jev는 에이전트가 한 말만이 아니라 실제 행동을 확인함. 요청, 각 도구 호출과 그 결과, 최종 답변을 읽고 확률이 첨부된 판정을 반환함.

가이드 구성

  • 환불 사례 하나와 라이브 플레이그라운드를 통해 에이전트 평가 개념을 살펴봄.
  • 전체 실습에서는 완전한 평가 워크플로를 구축함.