Jevman은 AI 의사결정 모델 6종이 아케이드 유령을 상대로 각각 100게임씩 팩맨을 플레이하는 체험·벤치마크 사이트다. 순위를 확인하고 게임을 시청하거나 AI와 직접 대결할 수 있으며, HTTP 엔드포인트를 갖춘 자체 모델도 벤치마크에 제출할 수 있다.

자체 모델 제출 방법

게임은 교차로마다 미로와 점, 유령의 상태를 JSON으로 모델에 보내 방향을 묻는다. 모델은 방향별 확률을 반환하고, 팩맨은 그중 하나를 선택한다. 시작용으로 34줄짜리 엔드포인트 예제가 저장소에 제공된다.

벤치마크 실행 명령 하나로 게임을 진행한다. 규칙은 실시간 플레이, 응답당 2초 제한, 클래식 유령, 목숨 3개 또는 최대 5분이다. 2초 안에 답하지 못하면 간단한 대체 규칙을 적용하고, 해당 이동은 대체 이동으로 집계한다.

제출하려면 저장소에 풀 리퀘스트를 보낸다. CI가 제출된 게임을 다시 실행해 점수를 확인하며, 모델은 자기 보고 방식의 리더보드 항목으로 올라간다. Opper 또는 다른 공개 API에 있는 모델은 이슈를 열어 실행을 요청할 수 있다. 기여 안내는 opper-ai/jevman-benchmark 저장소에서 확인할 수 있다.

측정 방식과 한계

각 모델은 클래식 스크립트 유령을 상대로 목숨 3개를 모두 잃을 때까지 100게임을 치른다. 게임은 종료를 보장하기 위해 5분으로 제한하지만, 가장 긴 게임도 2분 24초였다고 사이트는 설명한다.

순위는 평균 점수와 95% 오차 범위(±2 표준오차)를 기준으로 한다. 오차 범위가 서로 겹치는 모델은 공동 순위로 표시하며, 최고 점수는 모델이 한 게임에서 기록한 가장 높은 점수다. 모든 게임은 기록되고 동일하게 재생되므로 결과를 확인할 수 있다.