Etched Sohu 对阵 Nvidia:Transformer ASIC 对阵 GPU(2026)

Etched AI 发布了一款只跑 Transformer 架构的专用芯片 Sohu,声称单芯片推理速度远超英伟达 GPU,但代价是彻底放弃可编程性。这标志着 AI 推理硬件开始从“通用计算”走向“架构专用”的分岔路口。

一句话看懂:Etched AI 发布了一款只跑 Transformer 架构的专用芯片 Sohu,声称单芯片推理速度远超英伟达 GPU,但代价是彻底放弃可编程性。这标志着 AI 推理硬件开始从“通用计算”走向“架构专用”的分岔路口。

事件核心:发生了什么

Etched AI 于 2026 年 6 月 30 日正式结束隐身模式,公布了旗下首款芯片 Sohu 的进展:A0 芯片已点亮,8 芯片服务器将在 2026 年夏季出货。公司累计融资约 8 亿美元,估值达 50 亿美元,并已签下超过 10 亿美元的客户合同。

Sohu 是一款只支持 Transformer 架构的 ASIC(专用集成电路)。Etched 官方称,一台 8 芯片 Sohu 服务器在 Llama 70B 模型上每秒可生成 50 万 token,单芯片约 6.25 万 token/秒。作为对比,单张 H100 SXM5 在 batch 1 条件下、配合 vLLM 框架,每秒约生成 700 token。

这一性能差距来自架构本质不同:Sohu 把 Transformer 的注意力机制直接硬化成物理电路,而非像 GPU 那样通过 CUDA 内核在软件层面执行。FlashAttention、PagedAttention 等软件优化在 Sohu 上完全不需要——计算已经在硅片层面完成。

为什么重要

Sohu 的意义不在于“比 H100 快多少”,而在于它把 AI 芯片路线之争推到了极端位置。英伟达 GPU 的价值在于可编程性:无论模型是 Transformer、卷积网络还是未来的新架构,都能通过更新软件来适配。Groq 的 LPU 虽然也是定制硬件,但仍保留编译器层,理论上可扩展。

Sohu 没有软件抽象层。它不能跑卷积、不能跑 SSM 扫描、不能跑扩散模型——任何不映射到 Transformer 注意力的计算都无从执行。这是一场豪赌:押注 Transformer 在未来数年仍是主导架构,并且模型结构足够稳定,值得用全部可编程性换取推理吞吐量。

从行业格局看,这不再只是 Etched 与英伟达的对比,而是“通用 GPU + 软件优化”与“专用 ASIC + 硬件固定”两种技术路线的正面碰撞。类似 Trainium 3、Maia 200 等超大规模厂商自研芯片也在走专用化路线,但 Sohu 的“纯 Transformer”策略更为激进。

对用户/开发者/创作者的影响

到目前为止,Sohu 尚未开放任何租用渠道,也没有第三方独立基准测试。开发者无法在云上按需调用,工具链迁移成本也完全未知——由于没有可编程层,现有推理框架、调度器、量化工具都需重新适配,甚至可能无法直接使用。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业采购方而言,Sohu 的吸引力在于 token 成本可能大幅下降。但风险同样明显:供应链依赖单一初创公司、合同交付时间不确定、架构锁定后无法迁移到新模型类型。目前公开信息只展示了单点性能数字,尚未公布端到端延迟、批处理效率、功耗等关键指标。

对普通 AI 应用用户来说,短期内无直接影响。若 Sohu 能按计划出货并兑现性能承诺,长期可能降低大模型推理的边际成本,进而影响 API 定价——但这至少还需要一年以上的时间和市场验证。

值得关注的后续

第一,Sohu 夏季首批机架能否按期交付,交付后是否会有独立第三方(如 MLPerf)跑出可验证的基准数据。

第二,英伟达的回应。B200 及后续产品在推理吞吐上的优化幅度,以及是否会出现针对长时间推理场景的硬件级优化,将直接影响 Sohu 的差异化空间。

第三,开发者生态是否跟进。一个没有软件抽象层的芯片,需要配套的模型编译工具和算子库才能投入使用。如果 Etched 不能提供足够易用的工具链,即使性能领先,也难获规模采用。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 19861

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注