Show HN: Needle2:为手机、可穿戴设备、智能家居和机器人打造的14MB智能体LLM

Cactus Compute 发布了 Needle 2,一个只有 14MB 大小、45M 参数的智能体大模型,专为手机、手表、智能家居和机器人等低成本设备设计,能在无 GPU、无 NPU 的环境下本地运行,Pebble 已经将其用在 Index 01 应用中。

一句话看懂:Cactus Compute 发布了 Needle 2,一个只有 14MB 大小、45M 参数的智能体大模型,专为手机、手表、智能家居和机器人等低成本设备设计,能在无 GPU、无 NPU 的环境下本地运行,Pebble 已经将其用在 Index 01 应用中。

事件核心:发生了什么

Cactus Compute 推出的 Needle 2 是一枚面向智能设备的小型语言模型:45M 参数,量化压缩后文件仅 14MB,运行内存约 28MB。在树莓派 5 上,推理速度达到 prefill 800+ token/秒、decode 500+ token/秒。它的目标硬件不是 Mac 或 PC,而是预算手机、树莓派、微控制器、可穿戴设备和家用小机器人——这些设备的售价通常在 200 美元以下。

Needle 2 的核心思路是函数调用:设备能力被抽象成带类型参数的函数,模型只需要把用户的一句话映射到具体函数和参数上,而不需要开放式对话。它采用 CQ2-bit 量化,并非训练后再压缩,而是从预训练到后训练全程都按 2bit 精度训练。模型以单一 C++ 二进制文件交付,内部包含模型、分词器和语法编译器,可在 Cortex-M 到 x86 再到 WebAssembly 的设备上运行。

据公开信息,Needle 2 在 115B token 语料上预训练,并经过 38B token 的后训练,包含压缩推理轨迹数据。Pebble 已在 Index 01 应用中本地运行它,将语音请求转成设备动作,即使断网也能工作。

为什么重要

当前行业谈论边缘 AI,默认语境是运行大模型的 PC 和 Mac,但现实是约 21 亿台联网 IoT 设备对阵约 15 亿台 PC,且新兴市场多数手机低于 200 美元。Needle 2 验证了一个判断:把问题收敛到函数调用和结构化输出,45M 参数就足以完成很多实际控制任务,而无需数十亿参数的大模型。这为“端侧智能”提供了一条不同于云端大模型的低成本路径。

另一个行业意义在于训练与部署的一体化:Needle 2 直接训练 2bit 模型,避免事后量化带来的精度损失,同时字节级语法约束保证输出格式正确。这种“模型与推理协同设计”的思路,对追求极致压缩的边缘场景有示范作用。

对用户/开发者/创作者的影响

对开发者而言,Needle 2 支持在普通电脑上微调,几分钟到几小时即可让模型掌握自己的工具词汇表,且无需 GPU 服务器即可部署到目标硬件。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对硬件厂商和产品团队,它意味着放一台设备端智能体不再需要额外加装 NPU 或大内存,几百 MB RAM 即可运行,离线可用且延迟低,能减少对云端的依赖。

对终端用户而言,搭载这类模型的设备响应更快,隐私性更好——语音和指令停留在本机,不会上传云端。

值得关注的后续

第一,Needle 2 能否在真实产品中证明泛化能力,尤其是在更复杂的任务和更多设备类型上的表现。第二,是否有其他团队跟进此类“超小参数+函数调用”路线的模型,形成新的边缘 AI 生态。第三,2bit 训练方法是否会扩展到更大的模型,或改变小模型量

celebrityanime
celebrityanime
文章: 18305

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注