Google의 ML Drift는 모바일·웹·데스크톱 기기에서 머신러닝 모델을 GPU로 추론하도록 지원하는 엔진이다. 기존 TFLite GPU delegate에는 더 이상 새 기능이 추가되지 않으며, Google은 개발자에게 LiteRT ML Drift GPU 가속기로의 이전을 권장한다.

Google은 Arm, Intel, Qualcomm Technologies와 협력해 각 GPU에 맞춘 최적화를 진행했다고 밝혔다. Arm Mali·Immortalis GPU에는 컴퓨트 커널과 텍스처 캐시 지역성 최적화를, Intel Core Ultra 프로세서의 Xe3 그래픽에는 WebGPU 컴퓨트와 Xe Matrix Extensions(XMX)를 활용한 가속을 적용했다. Qualcomm Adreno GPU에는 ALU와 메모리 대역폭 활용을 높이는 OpenCL 커널을 최적화했다. Google은 이를 통해 배터리 사용을 고려하면서 높은 프레임 속도로 추론할 수 있다고 설명한다.

기존 모델은 LiteRT ML Drift GPU 가속기에서 이전 버전과의 호환성을 유지하면서 사용할 수 있다. Android, iOS, 웹, 데스크톱을 지원한다. 앱 용량을 줄이기 위해 번들되지 않은 런타임을 쓰는 Android 개발자는 독립형 LiteRT 패키지에서 ML Drift 가속기를 이용할 수 있다. Google Play Services의 LiteRT에는 추후 제공될 예정이다.

앱 개발자는 LiteRT ML Drift 가속기를 통해 모델 분할, 텐서 가상화, LLM 가속 기능을 이용할 수 있다. GPU·시스템 엔지니어는 ML Drift GitHub 저장소의 독립형 C++ API로 커스텀 GpuModel 컴퓨트 그래프와 셰이더를 만들 수 있다. 시작 안내는 Android용 OpenCL 및 Dawn을 통한 WebGPU 문서에서 확인할 수 있다.

ML Drift는 Apache 2.0 라이선스로 공개됐다. 소스 코드는 GitHub에서 확인할 수 있으며, 이슈 등록과 토론·질문에 참여할 수 있다. 새 UCL 연산자나 하드웨어별 최적화를 추가하려면 기여 안내를 참고하면 된다.