TL;DR

  • OpenAI의 GPT-6 Astra가 화면을 전혀 보지 않고 서버 네트워크 트래픽과 퀘스트 데이터를 활용해 월드 오브 워크래프트의 오크 시작 지역을 40분, 사망 0회로 완료함.
  • 오픈소스 클라이언트 agent-wow는 게임플레이를 직접 구현하지 않고, 에이전트가 필요한 기능을 구성할 수 있는 모듈 시스템을 제공함.
  • 에이전트는 서버 메시지 28종을 수집하고, AzerothCore의 SQL 파일에서 퀘스트 정보를 가져와 진행 상황을 파악함.
  • 경로 탐색에는 AzerothCore의 내비게이션 메시와 Detour 라이브러리를 활용한 C++ 도구가 쓰였으며, 일부 지도 오류도 이용함.
  • 다음 과제는 단일 에이전트의 레벨 80 자력 도달과 여러 에이전트의 협력 플레이 가능성을 확인하는 것임.

월드 오브 워크래프트 시작 지역 완료

  • agent-wow 개발자에 따르면 OpenAI의 GPT-6 Astra가 월드 오브 워크래프트(WoW)의 오크 시작 지역을 40분 만에 완료했으며 사망 횟수는 0회임.
  • 에이전트는 렌더링된 화면을 단 한 프레임도 보지 않고, 서버 네트워크 트래픽과 서버 파일에서 가져온 퀘스트 데이터를 바탕으로 플레이함.
  • 개발자는 Codex에서 agent-wow와 함께 단일 프롬프트를 사용해 비공개 서버에서 모델을 실행함.
  • 해당 영상의 설명에 따르면 에이전트는 레벨 1 오크로 시작해 시험의 계곡의 모든 퀘스트를 완료하고 센진 마을에서 여정을 마침.

agent-wow와 서버 구성

  • agent-wow는 저장소 설명에 따르면 자율형 AI 에이전트 플레이어를 위한 AzerothCore WoW 클라이언트임.
  • 클라이언트는 이동, 전투, 게임 내 상호작용 같은 게임플레이 메커니즘을 정의하지 않고, 에이전트가 필요한 기능을 구성할 수 있는 모듈 시스템만 제공함.
  • AzerothCore는 WoW 3.3.5a, 즉 ‘리치 왕의 분노’ 최종 빌드를 실행하는 오픈소스 서버 소프트웨어이며, agent-wow는 게임 네트워크 프로토콜로 서버와 통신함.
  • 클라이언트는 실제 WoW 서버에 연결하지 않으며, 실험을 위해 로컬 비공개 서버에서 실행할 수 있음.
  • 개발자는 지난달 초 출시된 OpenAI의 플래그십 모델을 최고 또는 최대 설정보다 한 단계 낮은 높은 추론 노력 설정으로 실행함.
  • 장기 전략과 단기 전술을 모두 요구하는 게임이라는 점에서 WoW를 선택했으며, 궁극적인 목표는 서버 전체를 AI 에이전트로 채워 영웅 난이도의 얼음왕관 성채를 공략할 수 있는지 확인하는 것임.

서버 메시지와 퀘스트 데이터 활용

  • 에이전트는 서버 메시지 28종을 수집하는 단일 모듈을 만들고, 메시지를 메모리에 보관함.
  • Python 스크립트가 메시지를 주기적으로 확인해 에이전트가 세계 상황을 파악하도록 구성하고, 행동을 수행할 메시지를 서버로 전송함.
  • 개발자는 처음에는 더 높은 수준의 구현이 필요할 것으로 예상했지만, 실제로는 프로토콜 계층만으로도 충분히 작동했다고 설명함.
  • 퀘스트 데이터는 AzerothCore의 SQL 파일을 데이터 마이닝해 퀘스트 제공자, 퀘스트 완료 장소, 생성 지점을 가져오는 방식으로 확보함.
  • 개발자는 이 방식이 사람이 퀘스트를 조사하려고 Wowhead에서 몇 시간씩 정보를 찾는 것과 비슷하다고 설명함. 서버 자체가 실행하는 데이터에 직접 접근하므로 팬 사이트의 정보가 실제 서버와 다를 수 있는 문제도 피할 수 있음.
  • 프로젝트의 공개 작업 공간 지침에는 에이전트가 참고할 자원으로 AzerothCore 소스 코드도 기재돼 있지만, 이번 실행에서 해당 소스 코드를 사용했는지는 밝히지 않음.
  • 에이전트는 선행 퀘스트를 순서대로 수행하고, 잡동사니를 판매하고, 장비를 교체하고, 지역 마지막 동굴에 들어가기 전에 능력을 훈련함. 동굴 퀘스트 두 개를 동시에 받은 뒤 함께 완료함.

경로 탐색과 지도 오류

  • 경로 탐색을 위해 시작점과 목적지 사이의 경로를 계산하는 C++ 보조 도구를 구축하고, AzerothCore의 내비게이션 메시 파일인 mmaps를 사용함.
  • Detour 경로 탐색 라이브러리가 경로를 계산하고, 보조 도구는 경유 지점을 좌표로 반환하거나 완전한 경로가 없을 때 오류를 반환함.
  • 개발자는 휴리스틱 기반 봇에 관한 조사에서 경로 탐색이 언제나 주요 과제 중 하나라고 설명하면서도, 에이전트의 경로 탐색 능력을 ‘최적’이라고 평가함.
  • 에이전트는 충돌 속성이 빠져 있을 수 있는 위치에서 ‘지도 오류를 이용’하기도 함.

다른 게임 플레이와 다음 과제

  • GPT-6 Astra는 WoW 이전에도 게임을 플레이함. 출시 직후인 지난달 초에는 스크린샷과 플레이어 위치 정보를 사용해 Portal을 플레이함.
  • WoW 실행은 스크린샷을 전혀 사용하지 않았고 첫 지역만 다룬 반면, Portal 실행은 약 24시간에 걸쳐 게임 전체를 진행함.
  • 최근 개발자들은 맞춤형 소형 모델과 Claude의 코칭을 결합한 Jev 의사결정 모델 하니스 등 여러 기법으로 포켓몬 레드를 플레이함.
  • 다음으로 확인할 사항은 단일 에이전트가 완전히 혼자서 레벨 80에 도달할 수 있는지, 여러 에이전트가 게임의 소셜 기능을 통해 협력해 콘텐츠를 완료할 수 있는지임.