一句话看懂:一篇系统性的技术长文梳理了当前 AI 芯片的主流架构路线,指出 GPU、TPU 和类 TPU 的脉动阵列加速器是目前唯一大规模落地的方案,而英伟达以绝对优势领先,AMD 紧随其后,Cerebras 和 Groq 则分别通过新合作或被收购进入战场。
事件核心:发生了什么
文章以 2018 年图灵奖得主 John Hennessy 和 David Patterson 的演讲为起点,回顾了“领域专用架构”(DSA)从理论到现实的历程。当时他们预测“未来十年将出现新架构的寒武纪爆发”,如今这一预测已兑现:除了英伟达和 AMD 的 GPU,Google TPU 和 AWS Trainium 等脉动阵列加速器已大规模部署,Cerebras 晶圆级引擎开始为 OpenAI 提供推理服务,而 Groq 的 LPU 则通过 200 亿美元收购并入英伟达体系。
文章核心观点是:AI 计算本质上是矩阵乘法(训练和预填充阶段是高算力密度的 GEMM,解码阶段则是带宽受限的 GEMV),所有芯片设计的根本问题只有一个——如何把数据快速搬到计算单元附近,也就是突破“内存墙”。
为什么重要
这篇分析的价值在于提供了一个清晰的判断框架:评估任何 AI 芯片只需看四个维度——数据存在哪、如何移动、计算单元长什么样、芯片之间如何互联。按此标准,当前真正经受过大规模生产检验的只有 GPU(英伟达、AMD)、脉动阵列(TPU、Trainium)和晶圆级方案。
值得注意的产业信号是:OpenAI 和 Meta 分别向 AMD 承诺了 6GW 的算力采购,Google TPU 将用于训练 Gemini 并为 Anthropic 提供多达百万颗芯片的推理集群,Anthropic 的 Claude 也跑在超过一百万颗 Trainium 芯片上。这说明即使英伟达短期主导,买家也在主动培育第二、第三供应商,芯片竞争远未定局。
对用户/开发者/创作者的影响
对普通用户而言,芯片架构差异最终会体现在 API 价格和响应速度上。Groq 的 LPU 被并入英伟达后,其低延迟推理能力可能进入英伟达现有产品线,惠及依赖实时交互的 AI 应用。对开发者来说,CUDA 生态依然是编程门槛最低、兼容性最好的选择,但 Trainium 和 TPU 在固定工作负载(如大规模推理)下的性价比优势正在扩大,这意味着多云部署时按需选择芯片会成为常态。创作者若使用 Anthropic 或 Gemini 系产品,其底层算力变化不会直接可见,但推理成本的下降趋势值得关注。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,AMD 承诺的 6GW 订单能否在 2025-2026 年按期交付,将直接决定其是否能真正撼动英伟达的份额。第二,Groq 团队并入英伟达后,LPU 是作为独立产品线保留还是被整合进下一代 GPU,目前公开信息显示尚未有明确路线图,值得跟踪。第三,Cerebras 为 OpenAI 提供的推理服务若持续扩容,将验证晶圆级架构在非训练场景下的商业可行性,这可能是下一个重要的架构分水岭。


