TL;DR

  • OpenClaw에 LeRobot 101 로봇 팔을 연결한 결과, 팔 설정부터 물체 인식·집기, 특정 물체를 집어 옮기는 모델 훈련까지 수행함.
  • 직접 로봇을 연결하고 보정하는 과정은 몇 시간 걸렸지만, OpenClaw와 Codex의 도움으로 연결 설정과 관절 보정, 공을 집는 프로그램 작성을 진행함.
  • 코딩 기반 로봇 제어는 신뢰성은 높지만 일반화가 어려운 기존 공학 방식과 일반화 능력은 있지만 신뢰성이 아직 낮은 비전·언어·행동 모델 사이의 간극을 메울 가능성이 있음.
  • CaP-X 평가에서 로봇 프로그래밍에 가장 뛰어난 모델은 Claude나 ChatGPT가 아닌 Gemini로 나타났으며, CaP-Agent0는 일부 조작 작업에서 직접 제어 훈련 모델을 앞섬.
  • HuggingFace, Nvidia, UC Berkeley 등의 연구진은 코드 기반 로봇 제어 도구와 접근성을 확장하고 있으며, 음성·텍스트 명령이나 동작 시연을 통한 로봇 제어가 사회 속 로봇의 중요한 전환점이라는 전망임.

로봇 팔과 OpenClaw

  • OpenClaw에 실제 로봇 팔을 연결한 뒤, 에이전트가 팔을 설정하고 카메라로 사물을 살핀 다음 천천히 집는 데 성공함.
  • 에이전트는 특정 물체를 집어 옮기도록 또 다른 인공지능 모델을 훈련하는 과정도 수행함. 인공 일반 지능(AGI)이 몇 년 뒤라는 말에 놀라움을 표했지만, 아직 몇 년 남았을 가능성이 크다는 농담도 덧붙임.
  • 이 경험은 로봇공학의 돌파구가 가까워졌다는 확신을 줌. 과거에는 로봇을 훈련하고 제어하는 데 상당한 기술이 필요했지만, 오늘날의 인공지능 모델은 그 과정을 거의 쉽게 만들 수 있음.

“인공지능 기반 코딩은 신뢰성은 있지만 일반화하지 못하는 기존 공학 방식과, 일반화는 하지만 아직 신뢰성이 부족한 현대의 비전·언어·행동 모델 사이의 간극을 메울 잠재력이 있어 매우 흥미로움.”

— 이 접근법을 연구하는 UC Berkeley 로봇공학자 Ken Goldberg

  • 구매한 LeRobot 101은 로봇공학 실험을 비교적 저렴하게 시작할 수 있도록 지원하는 HuggingFace의 오픈소스 프로젝트에 속함.
  • LeRobot은 두 개의 팔로 구성됨.
  • 사람이 손잡이와 트리거를 조작하는 컨트롤러 팔임.
  • 카메라가 달려 있고 컨트롤러 팔의 움직임을 복제하는 팔로워 팔임.
  • 컨트롤러 팔을 원격 조작하고, 카메라에 보이는 장면에 반응해 팔로워 팔을 움직이는 방법을 모델에 학습시킬 수 있음.
  • OpenClaw에 새 팔을 움직여 보라고 하자 작은 손 흔들기 동작을 만들어 냄.

OpenClaw로 구축하기

  • OpenClaw를 사용하기 전 로봇 연결과 보정에 몇 시간을 들였으며, 잘못된 설정으로 모터가 과열되면서 거의 손상될 뻔한 상황도 있었음.
  • 이후 OpenClaw와 Codex의 도움으로 빨간 공을 감지하면 집게를 닫는 간단한 프로그램을 바이브 코딩함.
  • Codex는 터미널에서 로봇 연결 설정의 까다로운 부분을 처리했고, 이어서 관절 위치 보정을 진행하는 과정도 도움받아 수행함.
  • 여러 라이브러리를 사용하는 Python 스크립트를 작성해 해당 공을 식별하고 잡도록 구성함.
  • 바이브 코딩은 완벽하지 않으며, 특히 서로 다른 하드웨어를 다룰 때 환각이 버그를 일으킬 수 있지만 결과는 인상적이었음.
  • 사람의 도움을 받아 로봇 에이전트가 빨간 공을 식별하고 잡는 방법을 알아냄.
  • 다음으로 OpenClaw의 도움을 받아 팔을 제어하는 모델을 훈련함. 여러 접근법을 시험했으며, OpenClaw는 절차를 안내하고 매 훈련 실행 뒤 모델의 오류율을 점검하는 데 능숙했음.
  • 최종적으로 로봇 팔이 물체를 집을 수 있게 됨.

정책으로서의 코드

  • 인공지능 코딩을 로봇을 만드는 새로운 강력한 방법으로 보는 아이디어는 2022년 연구 논문에서 처음 부각됐으며, 이 접근법은 정책으로서의 코드(code as policy)라고 불림.
  • 이후 인공지능의 코딩 능력이 빠르게 발전하면서 코드 기반 정책 방식이 여러 연구실에서 주목받음.
  • Ken Goldberg의 연구 그룹은 Nvidia, Carnegie Mellon University, Stanford 연구진과 함께 코딩 모델의 로봇 역량을 측정하는 새 벤치마크 CaP-X를 개발함.
  • CaP-X에서 로봇 프로그래밍에 가장 뛰어난 모델은 Claude나 ChatGPT가 아니라 Gemini임. Google DeepMind가 모델의 다중 모달 학습과 물리적 세계 이해에 집중한 점이 이유일 수 있음.
  • 연구진은 벤치마크와 함께 코딩 에이전트가 시뮬레이션 로봇과 실제 로봇을 모두 제어할 수 있는 환경 CaP-Gym을 만들었음.
  • 또한 코딩 모델의 성능을 크게 높이는 에이전트 프레임워크 CaP-Agent0를 개발했으며, 일부 조작 작업에서 로봇의 움직임을 직접 제어하도록 훈련된 모델보다 좋은 성능을 냄.
  • Goldberg 연구팀은 Nvidia와 함께 코드 기반 정책 접근법의 잠재력을 탐구하고 있음.
  • Jensen Huang의 아들인 Spencer Huang은 사내에서 직원들이 로봇 바이브 코딩을 시도할 수 있도록 해커톤을 조직하는 일에 참여했으며, 현재 Goldberg와 함께 코드 기반 정책을 더 많은 로봇 소프트웨어 도구와 호환되게 하는 연구 프로젝트를 진행 중임.

“거의 누구나 로봇공학에 참여할 수 있게 되는 것이 진정한 성배임.”

Huang은 로봇을 음성이나 텍스트 명령으로 제어하거나 동작을 시연해 제어할 수 있게 하는 것이 “로봇이 사회에 자리 잡는 데 필요한 핵심적인 돌파구”라고 덧붙임.