TL;DR
- RobotUse는 이미지와 기하 정보를 통해 언어 모델의 결정을 물리적 실행으로 연결하고, 40개 조작 작업의 120개 에피소드에서 45.00%의 성공률을 기록함.
- 에이전트는 이미지에서 대상을 지정하고 그리퍼 자세를 선택한 뒤, 새로운 시야를 확인해 진행하거나 수정함.
- 메인 에이전트는 작업 목표와 보고 내용을 유지하고, 하위 에이전트는 관찰·선택·자세 결정·실행 피드백을 유지함.
- 두 차례의 그릇 쌓기 사례에서 실행 경험을 담은 플레이북이 후속 시도의 배치 방식에 반영되며, 물리적 Franka Panda 시연은 성공률을 대표하는 집계치가 아님.
- 공개 배포판에는 핵심 에이전트 하네스, 플레이북, 시각 동작 도구, RoboLab 통합이 포함되지만 물리적 Panda 어댑터는 포함되지 않음.
언어 목표에서 로봇 동작까지
- 언어 목표가 시각적 선택, 검사된 자세, 로봇 동작으로 이어짐.
- RobotUse는 이미지와 기하 정보를 거쳐 언어 모델의 결정을 물리적 실행에 연결함. 에이전트가 대상을 지정하고 그리퍼 자세를 선택한 뒤 새로운 시야를 확인해 계속 진행하거나 수정하며, 백엔드가 선택을 실행하고 다음 관측을 반환함.
- 전달되는 정보에는 물리적 하위 목표와 이를 뒷받침하는 시각적 증거가 포함됨. 각 국소 선택은 그 선택을 유도한 장면 및 그로부터 발생하는 로봇 동작과 연결된 상태임.
- 01 · 지정: 이미지에서 언어 목표를 구체화함. 원본 도구 이미지에 선택 지점과 객체 마스크가 표시됨.
- 02 · 선택: 실제 그리퍼 자세를 비교함. 반환된 청록색 메시 투영과 기록된 선택 후보를 확인함.
- 03 · 수정: 배치를 확인하고 조정함. 그릇 배치가 실행 전 +20/−30mm, 이어서 +1/−12mm 이동함.
- 기본 카메라 투영과 포인트 클라우드 뷰가 각 결정을 장면에 연결함. 시뮬레이터 재생은 팔 동작을 유지하고, 실제 로봇 재생은 같은 인터페이스에 기록된 카메라 관측을 결합함.
메인 에이전트와 하위 에이전트의 문맥 공유
- 메인 에이전트는 작업 목표와 반환된 보고를 유지함. 하위 에이전트는 관측, 선택, 자세 결정, 실행 피드백을 유지함.
- 보고에는 선택된 동작 또는 현재 결과와 다음 작업 수준의 결정에 필요한 시각적 증거가 포함됨.
- 이 표현에서 국소 역할은 “하위 에이전트”로 묶임.
실행 경험을 통한 학습
- 지속형 플레이북이 이전 시도의 지침을 전달함.
- 사례는 별도의 그릇 쌓기 실행 두 건으로 구성됨. 두 실행 모두 그릇을 집지만, 후속 실행에서는 그릇을 지지되는 배치 위치까지 옮김.
- 그릇 배치 비교: 이전 실행은 기본 방식에서 실패했고, 후속 실행은 기본 방식에서 성공함.
- 두 실행은 각각 완전한 별도 실행이며, 후보 선택과 실행 조건도 서로 다름. 영상은 정성적 사례로 선별됨.
물리적 Franka Panda 시연
- 시각 동작 인터페이스를 물리적 Franka Panda에 맞게 조정함.
- 쌓기 및 배치 사례:
- 집기 및 놓기: 주황색 큐브를 트레이 안으로 옮기며, 시각적 인계 정보를 확인할 수 있고 카메라 관측은 12회임.
- 큐브 쌓기: 주황색 큐브를 초록색 큐브 위에 놓으며, 시각적 인계 정보를 확인할 수 있고 카메라 관측은 11회임.
- 물리적 실행에서 기록한 카메라 관측을 재생함. 마지막 프레임은 요청된 객체 관계를 보여줌.
- 이 시연은 선별된 실행 기록이며 물리적 로봇의 전체 성공률을 입증하지 않음.
40개 조작 작업 평가
- 평가는 40개 조작 작업으로 구성되며, Simple 21개, Moderate 13개, Complex 6개임. RobotUse는 120개 에피소드 중 54개를 완료해 작업 성공률 45.00%를 기록하며, CaP-X보다 6.67%포인트 높음.
- RoboLab 전체 작업 성공률(%) 비교:
- RobotUse: 전체 45.00, Simple 53.97, Moderate 35.90, Complex 33.33, 에피소드 120개.
- CaP-X: 전체 38.33, Simple 42.86, Moderate 35.90, Complex 27.78, 에피소드 120개.
- Open Robot Skill: 전체 20.00, Simple 31.75, Moderate 10.26, Complex 0.00, 에피소드 120개.
- mini-SWE: 전체 20.83, Simple 25.40, Moderate 17.95, Complex 11.11, 에피소드 120개.
- π₀.₅: 전체 30.75, Simple 30.48, Moderate 33.08, Complex 26.67, 에피소드 400개.
- Cosmos 3: 전체 42.25, Simple 44.76, Moderate 45.38, Complex 26.67, 에피소드 400개.
- 언어 에이전트는 작업당 세 번, 직접 동작 정책은 작업당 열 번 시도함. 전체 작업 성공은 최종 작업 검증기로 판정함.
- 방법별 실행 제한과 선별 재실행 프로토콜은 서로 다름. 앞서 나온 정성적 영상은 집계 결과와 별도로 선별됨.
평가 출처와 조건
- RobotUse, CaP-X, Open Robot Skill의 집계치는 완료된 40개 작업 벤치마크 보고서에서 가져옴. 수정 결과는 수정 버전별로 선별된 40개 에피소드에 기반함.
- π₀.₅ 및 mini-SWE 결과는 에피소드 기록에서 재계산했으며, Cosmos 3 결과는 제공된 40개 작업 보고서를 사용함.
- 중단 규칙과 에피소드 수가 다르므로 이 결과는 시스템 간 비교임.
- 간결한 결과 표와 출처 메모를 내려받을 수 있음.
공개 배포와 설정
- 공개 배포판에는 핵심 에이전트 하네스, 플레이북, 시각 동작 도구, 기본 RoboLab 통합이 포함됨. 선택 사항인 웹 UI는 별도 진입점이며, 물리적 Panda 어댑터는 이번 배포에 포함되지 않음.
- 소스 코드를 복제하고 준비하는 명령은 다음 저장소를 재귀적으로 복제한 뒤 설정 스크립트를 실행하는 방식임:
git clone --recurse-submodules https://github.com/robotuse-team/RobotUse.git,cd RobotUse,scripts/setup/sources.sh. - 설정 안내서는 Git LFS, 세 가지 핵심 환경, 모델 인증 정보, 시뮬레이터 자산을 다룸. 시뮬레이션에는 Linux와 NVIDIA RTX GPU가 필요함.
- 코드, 설정 안내서, 핵심 모듈 구성도, 의존성 및 라이선스 자료를 확인할 수 있음.
- RobotUse 코드는 Apache-2.0 라이선스임. 일부 업스트림 모델과 시뮬레이터 자산에는 별도의 비상업적 사용 제한이 적용됨.
- 미디어 출처 기록에는 에피소드 식별자, 재생 표현 방식, 파일 해시가 포함됨. 시뮬레이터 인계 데모를 내려받을 수 있음.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요