纯C实现的Microgpt在Apple m5上达到10M tps

一个名为 microGPT-C 的开源项目用纯 C 语言、零依赖实现了一个字符级 GPT 训练与推理,在 Apple M5 Pro 上跑出了超过 1000 万 token/秒的推理速度,展示了极简实现配合现代 ARM 指令集能压榨出的惊人算力效率。

一句话看懂:一个名为 microGPT-C 的开源项目用纯 C 语言、零依赖实现了一个字符级 GPT 训练与推理,在 Apple M5 Pro 上跑出了超过 1000 万 token/秒的推理速度,展示了极简实现配合现代 ARM 指令集能压榨出的惊人算力效率。

事件核心:发生了什么

这个项目在 Hacker News 上引发讨论。它用单个 C 文件实现了 GPT 的完整流程:前向传播、反向传播、Adam 优化器和采样,不依赖任何第三方库,仅使用 libc。模型参数仅 4192 个,在约 3.2 万个名字数据集上训练数秒即可生成新名字。作者用 2 万个名字训练后,模型在未见过的 1.2 万个名字上取得了 2.2039 nats/字符的损失,甚至优于参数多近五倍的插值三元语法模型。

性能数据是最大亮点:在 Apple M5 Pro 上通过 NEON 指令集加速,推理达到每秒 1016 万 token;作为对比,AMD Ryzen 5 5600H 使用 AVX2 跑出每秒约 693 万 token。项目支持 macOS、Linux 和 Windows(MSYS2),Makefile 会自动选择适合宿主机的加速指令。

为什么重要

这一项目的价值不在模型规模,而在效率边界。它证明即使不依赖 CUDA、PyTorch 或任何重型框架,仅靠手写 C 代码和 SIMD 指令集优化,也能把小型 transformer 的推理速度推到千万 token/秒级别。这打破了一个隐含假设:高性能 AI 推理必须依赖大型框架或专用硬件。

对行业而言,这种“原子级”实现方式提供了教学和性能分析的绝佳样本。训练和推理使用分离的前向路径,推理专用路径的 logits 与训练路径在 fp32 精度下完全一致,这种工程细节为理解 transformer 底层计算提供了清晰参考。在算力成本成为 AI 落地瓶颈的当下,探索 CPU 平台的极限吞吐具有现实意义。

对用户/开发者/创作者的影响

对开发者来说,这个单文件实现是学习 GPT 内部机制的入门捷径,也展示了 NEON/AVX2 指令集在 transformer 推理中的实际收益。若需在无 GPU 的嵌入式设备或边缘服务器上部署轻量生成模型,microGPT-C 的思路可作参考。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户,这个项目暂时没有直接可用的产品级工具,但其展示的 CPU 推理效率意味着,未来小模型在本地设备上的响应速度还有提升空间。对创作者而言,字符级模型的效果有限,不适合直接用于中文或长文本生成,但可作为原型验证或教学演示工具。

值得关注的后续

目前公开信息显示,项目仍处于早期阶段,值得观察三点:其一,作者是否会扩展模型规模或支持更丰富的数据集类型,从名字生成走向更通用的任务;其二,M5 Pro 上千万 token/秒的成绩是否会被其他硬件实现超越,以及是否有团队将类似优化思路引入到更主流的小型 LLM 推理框架中;其三,纯 C 实现的维护门槛和可扩展性如何,是否有开发者社区愿意基于此继续贡献,推动其成为 CPU 推理的参考基准。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 19157

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注