TL;DR

  • Hiera-Hand는 사람의 신체가 온전히 보이고 카메라 컷 전환이 없는 영상에서 사람을 추적하고 손을 찾은 뒤, 모든 프레임의 손 동작을 쥐기(grasp), 잡고 있기(hold), 조작하기(operate), 놓기(release)로 분류하는 독립형 데모임.
  • 사람과 자세 추적에는 YOLO26m-pose와 BoT-SORT를 한 번에 사용하며, 논문에서 사용한 HRNet-W32 대신 속도를 위해 YOLO26m-pose를 사용함.
  • 손 동작 인식에는 손 주변을 자른 224×224 픽셀, 약 1초 분량의 32프레임 중 16프레임을 입력으로 받는 Hiera-Base 모델을 사용함.
  • Hiera-Base는 매개변수 5,100만 개, 용량 205MB이며, Kinetics-400 사전 학습 후 ChildPlay-Hand 데이터셋으로 미세 조정됨.
  • 데모는 손 위치 상자와 동작을 평활화해 표시하며, 학습·평가·데이터셋은 idiap/childplay_hand에서 확인할 수 있고 코드·체크포인트·자세 모델·Hiera 구조의 라이선스가 각각 다름.

손 동작 인식 데모

  • Hiera-Hand(ChildPlay-Hand, ECCVW 2024)를 사용해 임의의 영상에서 손 동작을 인식함.
  • 사람을 추적하고 손 위치를 찾은 뒤, 모든 프레임의 각 손에 grasp, hold, operate, release 라벨을 부여함.
  • 이 프로젝트는 원 연구를 바탕으로 한 독립형 데모임. 학습, 평가 및 데이터셋은 idiap/childplay_hand에서 확인 가능함.

설치

  • uv가 필요하며, setup_env.sh는 .venv에 Python 3.11 가상 환경을 구성함.
  • 가상 환경을 활성화한 뒤 Zenodo에서 체크포인트를 checkpoints/로 내려받음.
  • 기본 다운로드 명령은 조작(manipulation) 체크포인트 약 0.4GB를 내려받으며, --task all 옵션은 객체(object) 체크포인트를 추가해 총 약 0.8GB를 내려받음.

실행

  • python src/demo.py input.mp4 --output result.mp4 명령으로 입력 영상을 처리하고 결과를 저장함.
  • 주요 옵션은 다음과 같음.
  • --stride N: Hiera를 매 N개 프레임마다 실행하며, 2는 약 2배 빠른 처리에 해당함. 기본값은 1임.
  • --task: manipulation 또는 object(손에 든 객체) 작업을 선택하며, 기본값은 manipulation임.
  • --device: 기본값은 auto이며, CUDA → MPS → CPU 순으로 장치를 선택함.
  • --batch-size: CUDA/MPS/CPU에서 각각 16 / 4 / 2임.
  • --smoothing-window: 기본값은 5프레임이며, 0은 평활화 끄기를 뜻함.
  • --save-intermediates: 기본값은 꺼짐이며, 활성화하면 pose.pkl, pred.pkl을 저장함.
  • 사람의 몸 전체가 보이고 카메라 컷 전환이 없는 영상에서 가장 잘 작동함.

작동 방식

  • 사람과 자세 추적: YOLO26m-pose와 BoT-SORT를 한 번에 실행함.
  • 손 위치 탐지: 각 손 상자는 손목 바깥쪽, 팔꿈치에서 손목으로 이어지는 방향을 따라 배치됨.
  • 동작 인식: 각 손과 프레임마다 약 1초 분량의 시간 창을 사용함. 32프레임 중 16프레임을 샘플링하고 손 주변을 224×224 픽셀로 잘라 Hiera-Base에 입력함. 모델은 배경(background), 쥐기(grasp), 잡고 있기(hold), 조작하기(operate), 놓기(release)를 출력함.
  • 표시: 평활화된 손 위치 상자와 손 동작을 표시함.
  • 논문은 자세 추정에 HRNet-W32를 사용했지만, 이 데모는 속도를 위해 YOLO26m-pose를 사용하므로 예측이 보고된 결과와 조금 다를 수 있음.

라이선스

  • 코드: GPL-3.0이며, idiap/childplay_hand를 바탕으로 하고 Idiap Research Institute 저작권이 적용됨.
  • 체크포인트: Zenodo에서 제공하며, 비상업적 이용 조건의 CC BY-NC 4.0 라이선스임.
  • 자세 모델: Ultralytics YOLO26, AGPL-3.0 라이선스임.
  • src/hiera/의 Hiera 구조: Apache-2.0 라이선스이며 Meta 저작권이 적용됨.

인용

  • 논문 정보:
  • 저자: Arya Farkhondeh*, Samy Tafasca*, Jean-Marc Odobez
  • 제목: “ChildPlay-Hand: A Dataset of Hand Manipulations in the Wild”
  • 학회: Proceedings of the European Conference on Computer Vision (ECCV) Workshops
  • 연도: 2024
  • 참고: 별표(*)는 동등 기여를 뜻함.