TL;DR
- Jevotron에 파일과 간단한 지침을 제공하면 명령줄에서 필드별 이상 점수, 집중 검토 대기열, 다음 실행 비용을 줄이는 캐시를 얻을 수 있음.
- 미리보기로 청크, 필드 경로, 모델에 전달될 정확한 요청을 API 호출 전에 확인할 수 있음.
- CSV, YAML, JSON, TOML, 텍스트, OBO 등과 gzip 파일을 기본 지원하며,
--field,--guidance,--guidance-file로 평가 범위를 설정할 수 있음. - 성공한 평가 결과를 SQLite에 저장해 변경되지 않은 항목을 재평가하지 않으며, 파일 순서 변경이나 임계값 조정, 실패한 실행 재개에도 활용할 수 있음.
- 공개 에이전트 추적 24개를 대상으로 한 소규모 파일럿에서
jt가 단계 품질 라벨 163개 중 130개(79.8%)와 일치했으며, 유해 단계 정밀도는 89.7%, 재현율은 70.3%임.
명령줄에서 한 번에 이상 탐지
jevotron에 파일과 간단한 지침을 제공하면 필드별 이상 점수, 집중 검토 대기열, 다음 실행 비용을 낮추는 캐시를 얻을 수 있음.- 예시 명령은
jevotron scan airports.csv --guidance "Check airport locations."이며,airports.csv의 공항 위치를 확인하도록 요청함. - 첫 스캔을 실행하고, 명령을 살펴보며, 에이전트 스킬을 설치할 수 있음.
- API 키는 TypeSafe 대시보드에서 발급받아 셸에
TYPESAFE_API_KEY환경 변수로 설정함. 이미 설정한 경우 바로 스캔할 수 있으며, 미리보기에는 키가 필요하지 않음. - API 키 설정 안내와 실제 공항 결과를 확인하는 링크가 제공됨.
01 / 미리보기
- API 호출 전에 청크, 필드 경로, 모델에 전달될 정확한 요청을 검사할 수 있음.
- 파일 미리보기 기능으로 입력 내용을 확인할 수 있음.
02 / 스캔
- Jev는 선택한 필드를 함께 평가하며, 각 항목에 동일한 지침과 선택적 예시를 적용함.
- 평가할 필드를 선택할 수 있음.
03 / 검토
- 의심 항목을 정렬하고 CSV로 내보내거나, JSONL을 기존 셸 작업 흐름으로 전달할 수 있음.
- 경고부터 검토하는 대기열을 구성할 수 있음.
간단한 설정과 유용한 기본값
- CSV, YAML, JSON, TOML, 텍스트, OBO 등 여러 형식과 gzip 파일을 기본 지원함.
- 형식 참고 문서에서 기본값과 형식별 옵션을 확인할 수 있음.
--field로 필드를 선택하고--guidance로 한 문장 지침을 추가해 실행하며, 더 긴 지침은--guidance-file에서 불러올 수 있음. - 프로젝트에 맞춤 파싱이나 재사용 설정이 필요하면 로컬 Python 설정을 사용할 수 있음.
- 입력이 바뀌지 않았으면 기존 평가 결과를 재사용함. SQLite는 성공한 각 결과를 생성되는 대로 저장함.
- 파일 순서 변경, 보고 임계값 수정, 실패한 실행 재개 시 변경되지 않은 항목은 재평가하지 않음.
- 검토 보고서에는 각 필드의 확률, 항목 점수, 원본 위치, 평가 날짜가 포함됨.
- 경고 점수는 필드별 이상 확률 중 최댓값이며, 임계값은 사용자가 선택함.
전체 예시
- 공항 / CSV: 공개 데이터에 주입된 국가 오류 두 건을 찾고 버전을 비교함.
- 재고 / YAML: 재고 기록에 작성된 규칙과 선택한 예시를 적용함.
- 측정 단위 / OBO: 독립된 스탠자 안에서 정의와 반복 동의어를 평가함.
- 에이전트 추적 / JSONL: 공개 에이전트 추적과 개별 단계를 분류한 뒤 공개된 라벨과 비교함.
에이전트 추적: 측정 파일럿
- 길이 필터를 적용한 공개 추적 24개의 소규모 표본에서
jt는 단계 품질 라벨 163개 중 130개와 일치했으며, 일치율은 79.8%임. - 유해 단계 정밀도는 89.7%, 재현율은 70.3%임.
- 예시에는 원본 메시지와 도구 정의를 사용하며, 사람의 라벨은 모델에 제공하지 않음.
- 추적 예시와 전체 분석 및 한계 문서를 확인할 수 있음.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요