一句话看懂:韩国 AI 芯片公司 FuriosaAI 公布了第三代推理加速器的技术细节,算力和内存带宽都做到上一代的 32 倍,并与博通合作采用 2nm 计算芯片加 HBM4(E) 内存。它代表推理专用芯片正在向更高带宽、更大内存的方向加速演进。
事件核心:发生了什么
据 AIbase 报道,FuriosaAI 在 2026 年 9 月公布了第三代 AI 推理加速器的技术规格。该产品与博通联合开发,内部包含两颗 2nm 计算 die、一颗独立 I/O die,以及 12 组 HBM4(E) 内存堆栈,每组容量 48GB。机架内采用 SUE 全互联拓扑,并支持 PCIe Gen7。
关键数据方面:芯片物理尺寸约为第二代产品(RGND)的 8 倍;算力达到 32 PFLOPS,是 RGND 的 32 倍;HBM 内存容量 576GB,为 RGND 的 12 倍;内存带宽 48TB/s,同样是 RGND 的 32 倍。目前公开信息显示,这些仍是官方公布的技术参数,尚未披露量产时间和客户名单。
为什么重要
大模型推理的瓶颈往往不在算力峰值,而在内存容量和带宽——模型权重、KV Cache 和长上下文都需要大量高带宽内存支撑。FuriosaAI 这一代把带宽和算力同时拉高 32 倍,明显是冲着大规模推理场景去的。
更值得关注的是路线选择:它没有走通用 GPU 路线,而是专攻推理加速,并借博通的 SerDes 和封装能力降低自研风险。在英伟达主导的 AI 加速器市场里,韩国厂商用 2nm 加 HBM4(E) 抢位,说明推理芯片的竞争正在从“能不能跑”转向“单位成本能跑多少 token”。
对用户/开发者/创作者的影响
对开发者和企业采购方来说,推理硬件的选项在变多。如果这类加速器能稳定落地,云端推理 API 的单价、延迟和上下文长度都可能受到影响,尤其是在长文本、多轮对话和图像生成等吃内存的场景。对普通用户而言,短期内感知不会太直接,但更便宜的推理成本最终会传导到 AI 应用定价上。创作者侧则可能看到更长的上下文窗口和更快的生成速度。需要注意的是,硬件参数不等于实际吞吐,编译器、框架适配和生态成熟度才是决定体验的关键。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是量产与供货时间,目前公开信息显示仍停留在技术公布阶段;二是软件栈能否兼容主流推理框架,这直接决定开发者迁移成本;三是英伟达、AMD 以及各家云厂商自研芯片是否在同类指标上跟进,尤其是 HBM4 的采用节奏。
来源:AIbase


