구글, ML Drift GPU 엔진 공개
- •구글 AI 엣지가 10월 8일 Apache 2.0 라이선스의 온디바이스 추론용 오픈소스 ML Drift를 공개
- •YouTube Shorts 프레임 지연 최대 40% 감소, Adobe 모바일 사진 기능 최대 30% 향상
- •구글, TensorFlow Lite GPU 위임 도구 기능 업데이트 중단 방침…LiteRT ML Drift로 이전 권고
구글 AI 엣지는 2026년 10월 8일 기기 내 인공지능 및 머신러닝 추론을 위한 오픈소스 GPU 연산 엔진 ML Drift를 공개했습니다. Apache 2.0 라이선스로 배포되며 OpenGL ES, OpenCL, Metal, WebGPU를 지원합니다. LiteRT의 가속기로 쓰거나 독립 라이브러리로 이용할 수 있으며, 구글은 Chrome, YouTube Shorts, Photos, Meet, AI Edge Gallery에서 수백만 대 기기에 매일 적용 중이라고 밝혔습니다.
ML Drift는 엣지 기기마다 다른 GPU 아키텍처와 드라이버 버전, 저수준 API를 고려해 설계됐습니다. 텐서 가상화는 텐서의 논리적 표현과 실제 GPU 메모리 할당을 분리해, 여러 GPU 백엔드가 셰이더 템플릿을 공유하도록 합니다. 개발자는 사용자 지정 연산 프레임워크를 통해 저수준 셰이더에 접근할 수 있습니다. 코딩 에이전트가 사용자 지정 셰이더를 작성하고 등록·검증하도록 돕는 에이전트형 SKILL.md 가이드도 제공됩니다. LiteRT 가속기는 5차원 텐서를 지원해 3차원 합성곱 신경망과 YOLO 11n, MobileViT v2, Swin Transformer v2 같은 시공간 모델을 실행할 수 있습니다.
대규모 언어 모델에서는 입력 문맥을 처리하는 프리필 단계와 토큰을 하나씩 생성하는 디코드 단계에 맞춰 커널과 데이터 배열을 바꿉니다. 디코드 경로는 합성곱 연산에 맞춘 KV 캐시 배열과 커널 내부 활성값 양자화를 사용해 반복적인 메모리 전송을 줄입니다. 구글은 Gemma 벤치마크에서 다른 프레임워크보다 메모리 오버헤드가 최대 12% 낮다고 밝혔습니다. 데스크톱 미리보기에서는 같은 WebGPU 코드가 Dawn을 통해 Windows와 Linux에서 기본 실행되며, macOS에서는 Metal을 사용합니다. 구글이 밝힌 주된 초점은 모바일 및 엣지 기기입니다.
구글이 공개한 고객 성과에 따르면 ML Drift는 Android와 iOS의 YouTube Shorts 분할 효과에서 평균 프레임 지연을 최대 40% 낮췄습니다. Google Photos 편집은 기존 GPU 위임 도구보다 최대 2초 빨라졌습니다. Chrome은 Prompt, Summarize, Writer API에서 기기 내 Gemini Nano 모델에 ML Drift를 사용합니다. Adobe는 모바일 Lightroom과 Photoshop 기능의 기기 내 실행 속도가 최대 30% 빨라졌다고 밝혔고, Snap은 Android의 얼굴·스타일 효과 모델 지연시간이 30% 감소했다고 전했습니다. Snap은 이 가속기를 통해 더 큰 확산 모델도 지원한다고 덧붙였습니다.
구글은 Mali와 Immortalis GPU 커널을 위해 Arm과, Xe3 그래픽을 탑재한 Core Ultra 프로세서의 WebGPU 및 Xe Matrix Extensions를 위해 Intel과, Adreno GPU의 OpenCL 커널을 위해 Qualcomm과 협력했습니다. 구글은 기존 TensorFlow Lite GPU 위임 도구에 새 기능 업데이트를 제공하지 않을 예정이며, 하위 호환성을 갖춘 LiteRT ML Drift GPU 가속기로 이전할 것을 권고했습니다. 번들에 포함되지 않은 런타임을 사용하는 Android 개발자는 독립형 LiteRT 패키지에서 이미 ML Drift를 이용할 수 있습니다. Google Play Services의 LiteRT를 통한 제공은 곧 시작될 예정입니다. 개발자는 LiteRT 가속기를 쓰거나 ML Drift의 독립형 C++ API로 사용자 지정 연산 그래프를 만들 수 있습니다.