纯C实现的Microgpt在Apple m5上达到10M tps

有开发者使用纯 C 语言实现了一个微型 GPT(Microgpt),据称在 Apple M5 芯片上跑出了惊人的 1000 万 tokens/秒(10M tps)推理速度。这一数据若属实,将大幅刷新人们对端侧大模型推理效率的认知,也再次引发关于“算法效率比堆算力更重要”的讨论。

一句话看懂:有开发者使用纯 C 语言实现了一个微型 GPT(Microgpt),据称在 Apple M5 芯片上跑出了惊人的 1000 万 tokens/秒(10M tps)推理速度。这一数据若属实,将大幅刷新人们对端侧大模型推理效率的认知,也再次引发关于“算法效率比堆算力更重要”的讨论。

事件核心:发生了什么

该消息来自 Hacker News 的讨论帖,原帖围绕一个名为 Microgpt 的开源项目展开。开发者采用纯 C 语言编写,这意味着没有依赖 Python 运行时、PyTorch 等重型框架,而是直接面向硬件做极致优化。根据帖子中透露的信息,该项目在 Apple M5 芯片上的推理吞吐量达到了 10M tps(每秒处理一千万个 token)。需要注意的是,M5 芯片目前尚未正式发布,因此这一数据或是基于开发环境或模拟器预估,目前公开信息显示尚无第三方独立验证。

评论区有用户表示“很想去 Strix Halo(AMD 的旗舰 APU)上跑一下”,侧面说明这一性能表现引发了跨硬件平台的兴趣,其优化思路可能对 AMD、高通等平台同样有效。

为什么重要

这一事件的价值不在于“又出了一个 GPT 复现”,而在于它指向一条被很多人忽视的技术路线:算法优化与工程实现带来的效率提升,可能比单纯增加算力更有效。正如帖中引用的《Bitter Lesson》所强调的,长期来看,利用算力做大规模搜索和学习是根本路径,但短期内的工程优化同样能带来数量级的收益。

如果纯 C 实现真的能在消费级芯片上达到 10M tps,那意味着端侧跑大模型的成本将大幅下降,不再需要依赖昂贵的云端 GPU 集群。这对于依赖 API 调用的 AI 应用开发商、做端侧智能硬件的厂商,以及关注国产算力替代的团队都有参考意义——它证明了推理引擎的底层优化空间远比想象中大。

对用户/开发者/创作者的影响

对开发者而言,Microgpt 展示了一种不依赖 Python 生态的推理路径。若后续开源代码完善,开发者可以在资源受限的设备上(如手机、嵌入式设备)运行小型模型,或将其作为自定义推理引擎的参考实现,用于降低单位 token 的推理成本。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户和创作者来说,更快的端侧推理意味着未来 AI 工具可以更实时地运行在本地设备上,减少网络延迟和隐私顾虑。例如,语音助手、实时翻译、本地图像生成等应用将受益于这种高效率的推理内核。

对企业采购和算力规划而言,这类技术如果成熟,可能改变“AI 应用必须依赖云端大厂 API”的既定观念,让中小团队也有可能自建低成本的推理服务。

值得关注的后续

第一,Microgpt 项目是否会开源完整代码,以及是否有第三方在真实硬件上复现这一性能数据。M5 芯片尚未量产,目前数字的真实性需要打一个问号。

第二,这种纯 C 优化思路是否能扩展到更大参数规模的模型(如 7B、13B),还是仅仅适用于微型 GPT。如果只对小模型有效,其行业影响力将局限在特定场景。

第三,AMD 的 Strix Halo 等 windows 平台是否会出现类似的极致优化实现,以及是否会推动主流推理框架(如 llama.cpp)采用类似的内核优化策略。

来源:hackernews

celebrityanime
celebrityanime
文章: 19137

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注