TL;DR
- Cloudflare의 Clef 모델이 NVFP4 양자화 상태로 RTX 5090 한 대에서 오프라인 실행돼 Balatro를 앤티 8까지 클리어함.
- 게임은 단순하지 않으며, Clef에는 대형 언어 모델(LLM)처럼 계획을 세우는 사고 연쇄(CoT)가 없지만 결국 승리함.
- 평균 응답 시간은 거의 4초이며, 문맥 크기가 커질수록 속도가 느려지고 전체 플레이는 19분 40초 걸림.
- 게임 화면의 저해상도 스크린샷(640×426)을 포함해 최대한 많은 정보를 넣느라 입력은 16K 토큰 한도에 가까워짐.
- 선택지 구성에 따라 의사결정 평가가 달라질 수 있으며, 하네스에는 개선할 점이 남아 있어 다른 모델을 시험하면서 계속 개선할 계획임.
Balatro 플레이와 승리
- 약속한 대로 Cloudflare의 새 모델 Clef가 NVFP4 양자화를 사용해 Balatro를 플레이했으며, RTX 5090 한 대에서 완전히 오프라인으로 실행해 앤티 8까지 도달하고 승리함.
- 마지막 플레이가 특히 인상적인 콤보를 보여줌.
- Balatro는 단순한 게임이 아니며, 이 모델에는 LLM처럼 더 나은 계획을 위한 CoT가 없음.
- 신적인 모델은 아니며 좋지 않은 결정을 내리기도 하지만, 결국 게임을 이김.
응답 속도와 입력 구성
- 평균 응답 시간은 거의 4초로 빠르지 않으며, 문맥 크기가 커질수록 처리 속도가 느려짐.
- 전체 플레이 시간은 19분 40초로, Sparks에서 실행한 GLM 5.3 Flash NVFP4 플레이보다 약 3분 빠름.
- 모델의 비전 인코더를 활용해 게임 화면을 저해상도 스크린샷(640×426)으로 첨부하면서 최대한 많은 정보를 제공하려 했고, 입력은 16K 토큰 한도에 가까워짐.
선택지와 의사결정
- 이번 플레이에서는 선택지를 명확히 제시하고, 나쁘다고 생각하는 선택지도 포함해 모델을 편향시키거나 동조적인 기계로 만들지 않도록 하는 작업이 특히 까다로웠음.
- 고를 만한 나쁜 선택지가 없다면 모델이 잘 판단했는지 말할 수 없음.
- 경제 운영은 GLM 5.3 Flash 플레이와 상당히 달라 보였으며, 최신 하네스 상태로 GLM을 다시 실행해 돈을 모으기만 하지 않고 더 많이 지출하는지도 확인할 가능성이 있음.
- 버리기(discard)를 많이 사용한 점도 흥미로웠음.
하네스 개선
- 하네스에 몇 가지 문제가 남아 있다고 보고 있으며, 더 많은 모델을 시험하면서 계속 개선할 계획임.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요