TL;DR

  • PTXBench는 H100·B200 GPU의 GEMM·어텐션 작업에서 아키텍처별 PTX를 활용하는 대형 언어 모델(LLM)의 GPU 커널 최적화 성능을 평가하고 개선하는 벤치마크임.
  • 기능적 정확성, 선택한 대상 명령어의 런타임 실행 여부, 최첨단 라이브러리 대비 속도 향상을 측정함.
  • 복잡한 어텐션 역전파 작업에서 성공률이 크게 낮아지며, 대상 명령어를 실행하더라도 경쟁력 있는 성능으로 이어지지 않을 수 있음.
  • 평가한 모델 중 전체 작업군에서 최첨단 라이브러리 성능을 일관되게 따라잡은 모델은 없음.
  • Qwen3.6-27B의 지도 미세 조정에서 복구 조건부 학습이 일부 작업을 개선했지만, 데이터 범위·균형·추론 교사 모델의 품질에 따라 일반화 성능이 달라짐.

PTXBench 소개

  • 아키텍처별 PTX(Parallel Thread Execution)를 활용해 GPU 커널을 최적화하는 LLM을 평가하고 적응시키기 위한 벤치마크 PTXBench를 소개함.
  • H100 및 B200 GPU에서 GEMM과 어텐션 작업을 대상으로 기능적 정확성, 선택한 대상 명령어의 런타임 실행 여부, 최첨단 라이브러리 대비 속도 향상을 측정함.

평가 결과

  • 아키텍처별 PTX 활용 능력은 모델과 작업에 따라 고르지 않으며, 복잡한 어텐션 역전파 작업에서는 성공률이 크게 하락함.
  • 대상 명령어가 실제 실행되는 것만으로는 경쟁력 있는 성능이 보장되지 않음.
  • 평가한 모델 중 전체 작업군에서 최첨단 라이브러리와 일관되게 대등한 성능을 내는 모델은 없음.

모델 적응과 일반화

  • Qwen3.6-27B를 지도 미세 조정으로 적응시킴.
  • 복구 조건부 학습은 여러 작업의 성능을 개선했지만, 일반화는 여전히 고르지 않음.
  • 데이터셋 크기뿐 아니라 데이터 범위와 균형, 추론 교사 모델의 품질도 중요함.

연구 의의

  • PTXBench는 진화하는 GPU 아키텍처를 활용하는 LLM의 능력을 측정하고 개선하기 위한 감사 가능한 시험 환경임.
  • 논문 정보: arXiv:2608.17379, v3 제출일 2026년 9월 28일, 저자 Genghan Zhang, Yixin Dong, Chengze Fan, Zhichen Zeng, Yueming Yuan, Shaowei Zhu, Kunle Olukotun.
  • DOI: https://doi.org/10.48550/arXiv.2608.17379