TL;DR

  • MaLiang-Harness는 실행 가능한 프로그램과 요청된 시각 결과 사이의 프로그램-시각 격차(P2V gap)를 다루며, 구성·검사·수정을 지속적으로 연결하는 통합 프레임워크임.
  • 지속 실행 생성(PEG) 상태가 프로그램과 작업 문맥을 보존하고, 추적 가능한 생성 과정(TGP)이 편집과 렌더링 근거를 연결함.
  • 수정 인식 편집 및 검증(REV)은 복원을 지원하고 완료 전에 현재 수정본을 확인하며, 이 메커니즘들이 여러 렌더링 백엔드에서 계획·실행·시각 피드백을 조율함.
  • MaLiang-IBench에서는 11개, MaLiang-VBench에서는 4개의 강력한 폐쇄형 대형 멀티모달 언어 모델(MLLM)을 생성 성공률·시각 품질·계산 비용으로 평가함.
  • GPT-6-Astra는 두 벤치마크에서 생성 성공률 100%를 달성했고, 모든 품질 기준을 충족한 비율은 이미지 작업 96.0%, 비디오 작업 76.9%임.

논문 정보

  • 논문 제목은 “MaLiang-Harness: A Programmable Path to Image and Video Generation”이며, Haoyu Zhao, Zihao Zhang, Xudong Wang, Jiaxi Gu, Zuxuan Wu, Yu-Gang Jiang, Shuicheng Yan이 작성함.
  • 컴퓨터 비전 및 패턴 인식 분야 논문으로, 2026년 9월 28일 제출됐으며 식별자는 arXiv:2609.34309임.
  • DOI: https://doi.org/10.48550/arXiv.2609.34309

프로그램에서 시각 결과까지

  • 실행 가능한 프로그램은 이미지와 비디오의 구성 과정을 명시적으로 제어하지만, 실행되는 코드를 생성하는 것만으로 시각적 생성이 완성되지는 않음.
  • 프로그램이 올바르게 실행되더라도 요청된 구도·외관·움직임을 위반할 수 있으며, 이 차이를 프로그램-시각 격차(P2V gap)로 정의함.
  • MaLiang-Harness는 MLLM 기반 시각 생성을 구성·검사·수정이 이어지는 지속적 과정으로 조직하는 통합 프레임워크임.
  • 핵심 설계는 변화하는 시각 프로그램, 구성 이력, 검증이 동일한 수정본 참조를 공유하도록 하는 것임.

프레임워크 메커니즘

  • 지속 실행 생성(PEG) 상태는 프로그램과 작업 문맥을 보존함.
  • 추적 가능한 생성 과정(TGP)은 편집 내용을 렌더링된 근거와 연결함.
  • 수정 인식 편집 및 검증(REV)은 이전 상태로의 복원을 지원하고, 완료 전에 현재 수정본을 점검함.
  • 세 메커니즘은 다양한 렌더링 백엔드에 걸쳐 계획·실행·시각 피드백을 조율함.

평가와 결과

  • MaLiang-IBench에서 강력한 폐쇄형 MLLM 11개, MaLiang-VBench에서 4개를 평가하고 생성 성공률, 시각 품질, 계산 비용을 측정함.
  • GPT-6-Astra는 두 벤치마크 모두에서 생성 성공률 100%를 기록함.
  • 모든 품질 기준을 충족한 작업의 비율은 이미지 96.0%, 비디오 76.9%임.
  • 일반 역량 점수와 시각 생성 성능 사이에 불일치가 드러났으며, 유사한 점수의 모델도 시각적 요구사항 충족 능력에서 상당한 차이를 보임.

의의

  • MaLiang-Harness는 MLLM이 실행 가능한 코드를 시각적 결과로 변환하는 방식을 연구할 체계적 기반을 제공함.
  • 프로그래밍 가능한 생성의 잠재력과 일반 벤치마크가 이 능력을 예측하는 데 지닌 한계를 함께 드러냄.
  • 프로젝트는 원문에서 “this https URL”로 안내되지만, 제공된 본문에는 실제 URL 문자열이 포함되지 않음.