推出 @huggingface/kernels:200+ WebGPU 内核,支持本地 AI

Hugging Face 发布了一组包含 207 个 WebGPU 内核的开源工具包,试图把浏览器里的本地 AI 推理速度拉高一个台阶。这相当于把 GPU 的底层操作做成标准化模块,供开发者直接调用。

一句话看懂:Hugging Face 发布了一组包含 207 个 WebGPU 内核的开源工具包,试图把浏览器里的本地 AI 推理速度拉高一个台阶。这相当于把 GPU 的底层操作做成标准化模块,供开发者直接调用。

事件核心:发生了什么

Hugging Face 于 9 月 1 日宣布推出 @huggingface/kernels,这是一个用于在 Hugging Face Hub 上加载和运行优化 WebGPU 内核的轻量级 JavaScript 库。同时发布的还有一组初始集合,包含 207 个内核,托管在 huggingface.co/webgpu-kernels 组织下,采用 Apache-2.0 许可证。

这些内核覆盖了机器学习模型中常见的操作,例如矩阵乘法、归一化、卷积、注意力机制、量化操作和张量布局转换等。每个内核都以独立仓库形式发布,并且捆绑了接口定义(manifest.json)、WGSL 着色器模板、正确性测试用例和基准测试用例。Hugging Face 还同步推出了名为 Fleet 的浏览器端 GPU 基准测试工具,可以在用户自己的硬件上运行并打分,收集来自真实设备的性能和正确性数据。

该项目的核心维护者是 Hugging Face WebAI 团队的 Nico Martin 和 Joshua Xenova。

为什么重要

WebGPU 虽然提供了跨浏览器的 GPU 通用 API,但”能跑”和”跑得快”是两回事。同一个算子在不同 GPU、不同浏览器、不同输入形状下,最优的工作组大小、内存访问模式和向量化策略都可能不同。Hugging Face 的做法是先把底层算子逐个做成可测试、可基准、可版本化的独立制品,而不是把整套运行时一次性打包。这使得上层的推理引擎可以稳定对接底层优化,也方便社区针对特定硬件做精细化调优。

这件事的意义在于:它把”浏览器里的 AI”从演示层面推进到了工程化层面。过去浏览器推理的性能瓶颈往往出在底层算子的适配不充分,而现在这些内核变成了公开可审查的软件资产。Fleet 工具的众包测试机制则可能形成一个真实硬件覆盖矩阵,帮助开发者发现传统测试实验室里难以暴露的兼容性问题和性能退化。

对用户/开发者/创作者的影响

对于普通用户,这意味着未来在浏览器里运行的 AI 应用——比如翻译、摘要、或者本地模型辅助写作——可能在加载速度和响应流畅度上有实际提升,同时数据不需要离开本机。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于前端开发者和 AI 应用开发者,这批内核提供了可以直接调用的标准算子库,降低了在 WebGPU 上写高性能着色器的门槛。每个内核都附带文档、测试用例和可运行的示例,开发者可以参照集成,而无需自己从头调试 WGSL 代码。不过,目前这套工具仍处于早期发布状态,内核对不同浏览器和设备的覆盖能力还有待观察。

对于依赖浏览器端模型的创作者,底层性能提升可能意味着更复杂的模型能够在普通笔记本上运行,进而降低创作工具的硬件门槛。

值得关注的后续

目前公开信息显示,这批内核的覆盖范围是 207 个算子,但具体支持的模型类型和数据类型范围尚未逐一披露。建议关注以下三点:

第一,这些内核是否会被主流推理库(如 Transformers.js)正式接入,以及接入后对主流模型的推理速度有多大实际提升。第二,Fleet 众测机制上线后,能否积累足够多的真实设备数据来驱动内核变的持续优化。第三,WebGPU 本身在 Safari 和移动端浏览器的支持进度,以及各浏览器实现之间的性能差异是否会影响这套方案的推广效果。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 21346

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注