LLM的下一个时代?开发者让小型LLM在10美元微控制器上本地运行,每秒10个token

开发者 slvDev 让一个 2890 万参数的语言模型,在一块约 10 美元的 ESP32-S3 微控制器上以每秒约 10 个 token 的速度完全离线运行。它把大部分参数放到闪存里,突破了小芯片内存不足的限制,展示了未来更轻量、更私密的本地 AI 推理可能。

一句话看懂:开发者 slvDev 让一个 2890 万参数的语言模型,在一块约 10 美元的 ESP32-S3 微控制器上以每秒约 10 个 token 的速度完全离线运行。它把大部分参数放到闪存里,突破了小芯片内存不足的限制,展示了未来更轻量、更私密的本地 AI 推理可能。

事件核心:发生了什么

该项目名为 esp32-ai,于 2026 年 7 月底以 MIT 许可证开源,目前在 GitHub 上已获得超过 3600 个 star 和 470 多个 fork。模型本身有 2890 万参数,使用微软研究院的 TinyStories 数据集训练,运行在 ESP32-S3 芯片上,这款芯片仅有 512KB SRAM 和 8MB PSRAM,却实现了 9.88 token/秒的稳定输出,整个过程完全在本地芯片上完成。

为了塞进这块芯片,开发者做了两步关键处理:先把权重量化到 4-bit,将 60MB 的模型体积压缩到约 14.9MB;随后借鉴 Google Gemma 3n 的 Per-Layer Embeddings 思路,把大约 2500 万参数(约 12MB)转移到芯片的 16MB 闪存中,每个 token 只读取约 450 字节的数据到内存。最终,PSRAM 中仅保留约 2MB 的核心计算层,SRAM 只承载激活值和归一化权重。这种“按需读取”的分层存储设计,让闪存带宽没有成为推理瓶颈。

为什么重要

过去把大模型塞进不合适的硬件并不少见,但通常以牺牲吞吐为代价,结果往往变成几十秒甚至几分钟生成一个 token。esp32-ai 的突破在于证明了在极小内存设备上,语言模型依然能保持“可用”的推理速度,让端侧推理的硬件门槛进一步降低。这不是为了让模型更聪明,而是让模型能在更便宜、更省电、无联网依赖的设备上运行,对物联网、嵌入式设备、隐私敏感场景有直接参考价值。

不过需要指出的是,它并不改变模型的实际能力。其推理核心仍只有约 400 万参数,因此生成内容仅限短篇且大致连贯的故事,无法回答问题、执行指令或编写代码,开发者本人也明确认可了这一局限。目前这个项目的价值更多在于工程思路,而非模型能力本身。

对用户/开发者/创作者的影响</

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 18313

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注