一句话看懂:英特尔在 8 月发布的白皮书中提出,衡量单机柜能跑多少 Agent,关键不在 GPU 峰值算力,而在于调度、内存与卸载效率;按其实测,优化后同一延迟目标下并发 Agent 数可从 235 提升到 300。
事件核心:发生了什么
过去几个月,Claude Fable 5.1、Gemini 3.8 Flash、GPT-6 Astra 等新模型密集发布,普遍强化 Agent 适配能力,推理链路更长、工具调用更频繁。InfoQ 引述的数据显示,2026—2027 年中国企业场景活跃 Agent 数量单年同比增长超 200%,到 2031 年预计达 3.5 亿个。
英特尔在 8 月白皮书中拆解了一轮 Agent 任务的时间构成:模型调用约占 40%,跑在 GPU 上;其余 60% 在主机端 CPU 上,其中工具执行 35%、数据服务 10%、状态搬运约 8%、编排调度 7%。一项对 739 次匿名化 Claude Code 对话的测量显示,单请求时主机端 CPU 仅占端到端延迟的 0.4%—0.6%,并发到 32 个会话时升至 11%—15%,其中约 94% 的增长来自调度与排队,而非实际计算。英特尔据此给出公式:每机柜可交付智能体数 = 理论值 × 调度有效性 × 资源平衡度 × 计算卸载效益。
为什么重要
现有数据中心基本是为大模型单次推理的吞吐量设计的,并未考虑 Agent 高频、突发、有状态、工具调用穿插的工作负载。谷歌调研称近 83% 的企业高管认为基础设施需要为 Agent 时代重新调整;AMD 主张重新调整 CPU 与 GPU 配比,AWS 与 NVIDIA 也在 8 月宣布联手推进下一代 AI 基础设施。但这些讨论多集中在核心数、带宽、功率等输入参数上。
英特尔的不同在于把评价标准换成“满足延迟承诺下的实际任务量”。其白皮书举例:理论容量高出 33% 的机柜,综合调度、内存与卸载因素后实际交付反而落后 23%;另一个理论容量较低但转换效率更高的机柜,交付 1.1 个单位,超过理论领先者的 0.85。这意味着竞争焦点可能从硬件参数转向系统内部“转换损耗”的压缩。
对用户/开发者/创作者的影响
对开发者而言,Agent 应用的成本与响应速度,未来更取决于调度与状态管理,而不只是模型本身。英特尔的方案包括:用性能核跑串行编排循环、超线程性能核跑 SQL 与向量检索、AMX 做嵌入与重排序、能效核承载数百个并行沙箱与子代理;通过 Flat Memory 模式把 CXL 扩展内存与原生 DDR5 合成统一地址空间,其与 SAP 的联合测试中在大规模内存 OLAP 上达到全 DDR5 性能的 96%,内存成本降低 25%;用 QAT、DSA、IAA 等加速引擎卸载 TLS、压缩解压与 KV 压缩,实测 IAA 压缩沙箱快照后恢复时延降低 38%—42%。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对企业和创作者来说,直接含义是同一机柜可能承载更多并发 Agent,单位任务成本有望下降,但前提是应用侧能配合状态复用与调度策略。当前公开信息显示,量化收益仍需结合具体负载验证。
值得关注的后续
一是 9 月 22 日~23 日英特尔在苏州举办的 2026 Intel Connection 大会,将展示最新 DCG 产品及企业 AI 落地场景方案,可观察白皮书中的调度与卸载能力是否产品化。二是 AMD 256 核 Venice 等竞品在固定功率下的实际交付表现,是否会被公开横向对比。三是 CXL 内存方案在企业采购中的真实成本与兼容性进展。
来源:InfoQ CN


