
一句话看懂:开发者正在尝试在浏览器中直接运行 1-Bit 量化的大语言模型(如 Qwen、Gemma),并通过 WebGPU 技术实现推理。虽然目前还远未达到可用速度,但这条路展示了大模型在端侧落地的另一种可能。
事件核心:发生了什么
在 Hacker News 上,一个以“浏览器中的 1-Bit LLM”为主题的项目引起了讨论。该项目依托名为 bitGPU 的引擎,尝试在浏览器端进行 1-Bit(特指极低精度量化)的大模型推理。目前已有人将aidekin.com 作为应用实例接入该引擎。测试显示:在浏览器中对 Qwen 3.6-27B 模型(使用 Q4_K_M 量化)进行推理时,速度仅约 0.5 token/秒;而 Gemma 4-26B(同样量化后)在同设备上可达约 10 token/秒。另有测试反馈,在 1255u 处理器仅靠 CPU 运行时,速度可能低于 1 token/秒。项目仍依赖 WebGPU 支持,部分设备因 WebGPU 实例失效而报错。
为什么重要
1-Bit 量化一直被视为在低成本设备(手机、平板、老旧笔记本电脑)上运行大模型的关键路径。过去,1-Bit 模型多依赖专用推理引擎或本地软件栈(如 llama.cpp、MLX),难以在 Web 环境推广。此次尝试将推理完全放入浏览器,意味着无需安装任何软件,打开网页即可与 27B 级别的模型对话。尽管当前推理速度极慢、错误率高,但它证明了三件事:1)浏览器内的 WebGPU 有能力执行低精度矩阵运算;2)不同模型对本地算力的消耗差异巨大(Qwen 0.5 tps vs Gemma 10 tps);3)1-Bit 量化技术尚未成熟,尤其在浏览器场景下仍有大量工程瓶颈。
对用户/开发者/创作者的影响
普通用户:暂时体验不到生产力级别的服务——当前速度仅可用于演示或非常简单的问答,且要求设备必须有 WebGPU 支持。如果未来优化,用户将免去下载大模型或付费云 API 的步骤。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
开发者:bitGPU 引擎提供了一个开源参考实现(GitHub 仓库 stfurkan/bitgpu),可基于它测试自己模型的 1-Bit 推理能力。需注意 WebGPU API 不稳定的问题,以及不同浏览器(Chrome/Firefox/Edge)对 WebGPU 支持程度不一。
创作者/企业:目前不宜依赖此技术用于生产环境。但它提示了一个方向:极低精度模型 + Web 推理可能成为“即时 AI 助手”的新方案,类似早期的 WebAssembly 应用。
值得关注的后续
1. 1-Bit 模型是否出现高质量变体? 社区关注 Prism ML 等团队是否推出 1-Bit 或 ternary 的“bonsai”版本(如 TFA 所用),这将直接影响浏览器端的推理效果。
2. bitGPU 引擎能否与主流模型格式(GGUF、ONNX)兼容? 目前测试中已出现 ORT 的 WebGPU 报错,需解决 GroupQueryAttention 等核心算子支持问题。
3. 苹果 MLX 与传统 WebGPU 路线的竞争。 有评论指出该演示并非真正在浏览器中运行(而是借道 MLX),这揭示了 WebGPU 生态尚未统一的事实。未来谁先提供稳定的浏览器端 1-Bit 推理库,谁将获得早期开发者市场。
来源:hackernews


