一句话看懂:谷歌 AI Edge 团队以 Apache 2.0 协议开源了面向端侧 AI/ML 推理的跨平台 GPU 计算引擎 ML Drift,用来取代此前的 TFLite GPU delegate,并已作为 LiteRT 的核心 GPU 加速引擎。
事件核心:发生了什么
2026 年 10 月,Google AI Edge 团队宣布 ML Drift 正式开源,采用 Apache 2.0 许可。它是一套面向端侧 AI/ML 推理的高性能、跨平台 GPU 计算引擎,通过抽象 OpenGL ES、OpenCL、Metal 和 WebGPU 等底层 API,屏蔽端侧 GPU 的硬件差异,让开发者能在多平台上构建实时交互式的 ML 体验。
ML Drift 是 LiteRT(原 TensorFlow Lite 运行时)的核心 GPU 加速引擎,同时也作为独立库提供。相比旧的 TFLite GPU delegate,它带来几项结构性变化:用张量虚拟化统一着色器代码,不再为 OpenGL、OpenCL、Metal 各维护一套硬编码映射;支持 5D 张量,能直接在端侧 GPU 上跑 3D 卷积网络和时空模型,如 YOLO 11n、MobileViT v2、Swin Transformer v2;提供可扩展的自定义算子框架,并附带一份 SKILL.md 指南,方便编码代理在几分钟内编写、注册和验证自定义着色器;针对端侧大模型,按 KV 缓存预填充和逐 token 解码两个阶段动态切换内核。
为什么重要
数据中心推理跑在同质、可预测的加速器集群上,端侧推理却面对大量 GPU 架构、驱动版本和底层 API 的组合,开发者事先并不知道应用会落在什么硬件上。TFLite GPU delegate 解决过基础的 GPU 加速问题,但如今端侧负载已从实时计算机视觉、音频、深度处理扩展到高参数生成式 AI,旧运行时的算力和内存设计不再够用。ML Drift 想做的,是在传统模型和生成式模型之间建立一套统一的工程基础:老模型迁移后性能不降,新模型也能获得峰值表现。
对生态而言,开源意味着厂商、芯片伙伴和开发者可以共同扩展这一层,而不必各自维护后端特定的着色器代码。这有助于减少端侧推理的碎片化。
对用户/开发者/创作者的影响
开发者如果此前基于 TFLite GPU delegate 构建应用,迁移路径被设计得尽量平滑,已有负载预期能保持或超过原有基准。想在边缘设备上跑 3D 卷积、视频特效或生成式 AI 的团队,可以直接使用 5D 张量支持,不必再为布局问题做 hack。自定义算子框架降低了接入专有模型块的难度,尤其适合需要把特殊结构直接嵌入执行图的场景。对终端用户来说,这类底层变化不会立刻改变应用界面,但会体现在实时视频处理、端侧大模型对话等体验的延迟和功耗上。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 ML Drift 作为独立库的实际采用情况,是否会有主流框架或硬件厂商跟进集成;二是端侧大模型的阶段感知优化在真实设备上的收益,需要等待第三方评测,目前公开信息仅来自官方博客;三是自定义算子与编码代理协作的实际效率,是否真能支撑开发者快速扩展模型覆盖。


