Artificial Analysis开源本地AI智能体压测工具,发布RTX 5090与DGX Spark等首轮结果

Artificial Analysis 开源了 AA-AgentPerf-Local,可在笔记本和工作站上回放真实智能体任务来测推理性能,并公布了 NVIDIA DGX Spark、RTX 5090、AMD Ryzen AI Halo 与 MacBook Pro M5 Pro 的首轮对比结果。

一句话看懂:Artificial Analysis 开源了 AA-AgentPerf-Local,可在笔记本和工作站上回放真实智能体任务来测推理性能,并公布了 NVIDIA DGX Spark、RTX 5090、AMD Ryzen AI Halo 与 MacBook Pro M5 Pro 的首轮对比结果。

事件核心:发生了什么

2026 年 9 月 29 日,Artificial Analysis 发布并开源了 AA-AgentPerf-Local。它的做法不是跑分软件式的单轮问答,而是回放 8 个真实记录的智能体任务、共 168 个模型轮次;每个请求都携带完整历史对话,上下文增长到约 56K tokens,每轮生成的 token 数按记录固定,以保证不同系统做的工作量一致。默认跳过工具执行以隔离推理速度,用户也可以选择回放真实工具延迟或在 CPU 上实际运行工具调用。

首轮公布的硬件包括 NVIDIA DGX Spark(128 GB)、AMD Ryzen AI Halo(128 GB)、MacBook Pro M5 Pro(64 GB)和 NVIDIA GeForce RTX 5090(32 GB);模型为 Qwen3.5-9B、Qwen3.8-27B、Qwen3.6-35B-A3B 和 Ling 3.0 Flash(124B 总参数 / 5B 激活),均采用 4-bit 量化,共 14 套配置并全部公开。结果上,RTX 5090 在能装进 32 GB 的模型上完成时间比其他系统快 3.5 倍以上;DGX Spark 在四个模型中的三个比 Ryzen AI Halo 快 1.4 至 1.7 倍,后者在 Qwen3.5-9B 上追平。

为什么重要

本地 AI 智能体能不能用,不只看模型能力,还取决于显存容量、内存带宽和推理框架成熟度。这次开源的测试工具把一个此前缺少统一口径的问题摆上台面:同一模型在不同硬件和配置下,多轮智能体任务的完成速度差距可能远大于纸面参数差异。对 CUDA、ROCm、Vulkan、Metal 多平台生态来说,这类基准会影响开发者选择本地推理栈,也会影响用户采购 AI 工作站时的判断。

对用户/开发者/创作者的影响

开发者可以直接用开源代码和公开配置测试自己的 OpenAI 兼容推理服务,不必依赖厂商宣传;创作者和企业采购者则可以把“跑得动”细化为“多轮智能体任务多久跑完”。目前公开信息显示,统一内存系统在带宽相近时性能仍可能拉开明显差距,软件栈和低精度算力同样是变量。需要强调,这些结果仅适用于该日期、该任务集和上述评测条件,不是永久排名。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是硬件覆盖是否扩展到 x86 笔记本和 RTX PRO 6000 Blackwell 等 AI 显卡;二是模型列表是否随新开源权重更新;三是多智能体并行、与日常进程共存的场景何时纳入测试。这些将决定该基准是停留在一次性榜单,还是成为本地 AI 部署的常用参考。

来源:Artificial Analysis

celebrityanime
celebrityanime
文章: 27922

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注