TL;DR
- Artifact Arena는 언어 모델이 말하는 내용이 아니라 물리 환경에서 설계하고 제작하는 능력으로 평가하는 개방형 플랫폼임.
- 모델은 로봇의 몸체·제어기·경쟁 전략을 설계하며, 생성한 결과물은 시뮬레이션 대전에서 평가됨.
- 승패는 상대를 링 밖으로 밀어내거나 제압하는 방식으로 결정되며, 물리 시뮬레이터가 고정된 규칙에 따라 결과를 검증함.
- 모델별 순위는 각 모델이 만든 최선의 결과물 성능을 기준으로 정하고, 새로운 설계는 지금까지의 최우수 결과물과 경쟁함.
- 평가 방식은 샘플링, 검증기 기반 개선, 디자인 랩이며, 커뮤니티의 로봇 제출도 받음.
Artifact Arena란?
- Artifact Arena는 프런티어 언어 모델을 말하는 능력이 아니라, 현실에 기반한 물리 환경에서 무엇을 설계하고 제작할 수 있는지로 평가하는 개방형 플랫폼임.
- 프런티어 모델에 로봇 전체를 설계하도록 요청함. 설계 대상은 몸체, 제어기, 경쟁 전략임.
- 모델이 만든 결과물은 두 모델 생성 결과물이 맞붙는 시뮬레이션 게임인 Last Bot Standing Game에 참가함.
- 상대를 링 밖으로 밀어내거나 상대를 제압하면 승리함. (규칙)
- 물리 시뮬레이터는 모델 생성 결과물과 경기 결과를 검증하며, 고정된 경기 규칙에 따라 승리·패배·무승부를 판정함.
- 모델에는 가능한 최선의 결과물을 생성하도록 요청하며, 모델 순위는 각 모델이 만든 최선의 결과물 성능을 기준으로 정함.
- 모델 성능이 향상돼도 평가가 계속 도전적이고 포화되지 않도록 설계됨. 새 설계는 지금까지 만들어진 최우수 결과물과 경쟁함.
평가 항목
- 하드웨어·소프트웨어 공동 설계
- 3차원 물리 추론 및 세계 모델링
- 3차원 설계 및 코딩
- 경쟁 게임 전략
평가 하네스
- 모델이 설계를 생성하고 개선하는 방식을 세 가지 하네스로 시험함.
- 샘플링
- 검증기 기반 개선
- 디자인 랩
로봇 제출 공개 모집
- 커뮤니티가 결과물을 제출할 수 있도록 리더보드를 개방함.
- 공학 및 과학 분야에서 인공지능이 인간 수준의 역량에 접근하고 이를 넘어서는 과정에서, 인공지능의 한계를 지속적으로 추적할 수 있는 상시 평가 체계를 마련함.
- 전체 논문 읽기 ↗
- 결과물 제출 ↗
- 리더보드 불러오는 중…
인용
- 논문 제목: “ArtifactArena: Evaluating Models by What They Build in the Physical World”
- 저자: Kushagra Tiwary, David Mayo, Nikhil Behari, Xiangzhou Sun, Abdulrahman Alabdulkareem, Isaac Galatzer-Levy, Boris Katz, Brian Cheung
- 연도: 2026
- 분류: cs.AI
- 논문 URL: https://artifactarena.ai/paper
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요