在8的微控制器上运行一个拥有28.9M个参数的大语言模型

一位开发者成功在仅8美元的ESP32-S3微控制器上运行了拥有2890万参数的大语言模型,利用Google Gemma模型的逐层嵌入(Per-Layer Embeddings)技术,将模型主体放在闪存中按需读取,突破了微控制器512KB SRAM的内存瓶颈,实现约9.5 token/s的本地文本生成。

一句话看懂:一位开发者成功在仅8美元的ESP32-S3微控制器上运行了拥有2890万参数的大语言模型,利用Google Gemma模型的逐层嵌入(Per-Layer Embeddings)技术,将模型主体放在闪存中按需读取,突破了微控制器512KB SRAM的内存瓶颈,实现约9.5 token/s的本地文本生成。

事件核心:发生了什么

GitHub用户slvDev发布了开源项目esp32-ai,在一个售价约8美元的ESP32-S3芯片上部署了一个28.9M参数的语言模型(实际存储参数为2890万,其中约2500万位于闪存查找表中)。该芯片仅有512KB SRAM和8MB PSRAM,但通过将模型参数以4-bit量化压缩至14.9MB并存储于16MB闪存中,运行时每次仅读取约450字节的嵌入向量,使得推理速度达到约9.5 token/s(纯计算约9.7 tok/s)。模型基于微软研究院的TinyStories数据集训练,能够生成简单的连贯故事。相比此前同类芯片上运行的260K参数模型,参数规模提升了约100倍。

为什么重要

这项演示打破了“大语言模型必须有大量高速内存”的固有认知。传统上,微控制器受限于SRAM容量,只能运行极小模型;而该方案验证了通过Per-Layer Embeddings(源自Google Gemma 3n/4的设计),将大部分静态参数驻留在慢速闪存中、每次仅加载少量活跃数据的思路,可以显著降低对SRAM的需求。对于AI行业而言,这意味着极低成本(8美元芯片)的离线推理成为可能,开辟了边缘AI和物联网设备运行LLM的新路径。虽然模型能力有限(仅可写故事,不具备问答、代码等通用功能),但架构本身具有潜力,未来或可推广到更多嵌入式场景。

对用户/开发者/创作者的影响

开发者:项目完全开源(包含固件、训练代码、量化方法),可直接在ESP32-S3上复现。但需注意当前模型仅适用于TinyStories格式的简单故事生成,无法用于通用对话或指令遵循。这为探索低成本本地推理提供了可复用的技术框架。
创作者/硬件爱好者:可以将该技术用于制作离线故事机、教育玩具、交互式装置等,无需联网即可实现文本生成功能,成本极低。
普通用户:目前尚无直接面向消费者的产品,但此举展示了未来智能家居、可穿戴设备中嵌入轻量AI助手的可能性。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1. 该技术是否会被移植到其他常见微控制器平台(如STM32、RP2040),从而扩大开发者生态。
2. 模型能力能否通过更大规模的数据训练或架构改进(例如加入注意力机制)而提升到可以处理简单指令或问答的水平。
3. 是否会有商业公司基于此思路推出低价离线AI硬件产品,例如无需依赖云端的智能语音玩偶或密码管理器。

来源:github.com

celebrityanime
celebrityanime
文章: 15126

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注