TL;DR

  • OctLLM은 희소 옥트리(S-Octree)와 별도 학습 가능한 3D 분기를 활용해 사전 학습된 언어 경로를 보존하면서 통합 멀티모달 대형 언어 모델(LLM)의 3D 생성·이해 성능을 높임.
  • 기존 3D LLM은 도형을 잠재 코드북 인덱스나 좌표 텍스트로 압축해 공간 구조를 잃고, 백본 미세 조정 과정에서 일반 언어 능력을 덮어쓰는 한계가 있음.
  • OctLLM은 3D 형상을 옥트리 점유 토큰으로 표현하고, 도형을 보존하면서 시퀀스 길이를 줄인 좌표·깊이 기반 S-Octree를 생성에 활용함.
  • 텍스트·이미지 토큰은 동결된 비전-언어 경로에 유지하고, 메시 토큰은 일부 블록의 독립적인 학습 가능 분기로 보내며 공유 셀프 어텐션으로 두 흐름을 연결함.
  • 전체 미세 조정보다 훨씬 적은 매개변수를 학습하면서 ShapeLLM-Omni 대비 이미지-3D FID를 17.4% 낮추고 렌더링 기반 캡셔닝을 28.7점 높였으며, 일반 언어 벤치마크에서는 백본 수준을 유지함.

OctLLM: 명시적 3D 언어로서의 옥트리

  • 기존 3D 대형 언어 모델(LLM)은 형상을 잠재 코드북 인덱스나 좌표 텍스트로 압축하며, 이 과정에서 모델이 관찰하는 데이터의 공간 구조가 사라짐.
  • 기존 모델은 전체 미세 조정이나 저랭크 적응(LoRA)으로 3D 양식을 추가함. 전체 미세 조정은 비용이 크고 LoRA는 3D 처리 용량을 제한하며, 두 방식 모두 언어 경로를 수정함.
  • OctLLM은 형상을 옥트리 점유 토큰으로 구성된 명시적 3D 시퀀스로 입력함. 옥트리 시퀀스는 깊이가 커질수록 빠르게 길어지므로, 형상을 보존하면서 끝에서 두 번째 단계의 노드를 무작위로 비우고 그 하위 노드를 생략함.
  • 이렇게 얻은 희소 옥트리(S-Octree)는 좌표와 깊이에 고정된 짧은 표현이며, 위치 인식 마스크 모델링 생성과 3D 이해에 활용됨.
  • 사전 학습된 매개변수와 분리된 매개변수에 3D 처리 용량을 추가함. 일부 블록에서 메시 토큰은 독립적인 학습 가능 분기로 전달하고, 텍스트와 이미지 토큰은 동결된 비전-언어 경로에 유지하며, 두 흐름은 공유 셀프 어텐션을 통해 상호작용함.
  • 전체 미세 조정보다 훨씬 적은 매개변수를 학습하면서 통합 멀티모달 LLM 가운데 새로운 최첨단 성능을 기록함. ShapeLLM-Omni보다 이미지-3D FID를 17.4% 낮추고 렌더링 기반 캡셔닝을 28.7점 높이며, 일반 언어 벤치마크에서는 백본 성능과 일치함.

거친 형상에서 완성 형상으로

  • OctLLM은 6단계 옥트리를 층별로 구축하고, 3D U-Net으로 옥트리를 완성한 뒤 흐름 기반 디코더로 최종 메시를 복원함.
  • 이 과정은 형상 생성과 상호작용을 지원함.

하나의 3D 언어

  • 희소 옥트리: 3D 좌표와 깊이에 고정된 점유 토큰임.
  • 공유 어텐션: 동결된 텍스트-이미지 경로와 함께 학습 가능한 3D 분기를 운용함.
  • 메시 복원: 3D U-Net이 점유 정보를 완성하고, 사전 학습된 흐름 기반 디코더가 텍스처가 있는 메시를 생성함.

형상에서 언어로

  • OctLLM이 생성한 설명의 발췌를 제시함.