
Aleph Alpha의 데모에서는 Kolibri-1이 둠(Doom)의 이동·조준·발사·상호작용을 선택하고, 게임은 여러 사람이 함께 보는 실시간 화면에서 진행된다. 라운드가 끝날 때마다 맵이 바뀐다.
모델은 화면 이미지가 아니라 구조화된 게임 상태를 받는다. 네 차례의 확률값 기반 평가로 각 행동을 선택하며, 사용할 수 없는 대상은 점수를 매기기 전에 제외한다. 생성한 텍스트 대신 선택지에 해당하는 로짓(logit)을 점수화하고, 제공된 선택지 안에서 정규화한다. 이 점수는 성공 확률로 보정된 값이 아니다.
별도의 로컬 컨트롤러가 선택된 행동을 실행한다. 지속적인 탐색 목표 관리, 벽 회피, 조향, 제한된 코너 복구를 맡고, 획득에 실패한 목표는 일시적으로 제외한다. 이 데모에서 이런 동작 방식은 학습된 것이 아니며, 전술적 선택은 Kolibri-1이 한다.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요