TensorRT Edge-LLM 完成 MLPerf Edge Agentic 基准测试,在 Jetson AGX Thor 上快 6.4 倍

NVIDIA 用 TensorRT Edge-LLM 在单台 Jetson AGX Thor 上跑通了 MLPerf 边缘 Agentic 基准,端到端耗时比 llama.cpp 参考实现快 6.4 倍。它说明长上下文、多轮工具调用的 AI Agent 已经能在边缘设备上实用化运行。

一句话看懂:NVIDIA 用 TensorRT Edge-LLM 在单台 Jetson AGX Thor 上跑通了 MLPerf 边缘 Agentic 基准,端到端耗时比 llama.cpp 参考实现快 6.4 倍。它说明长上下文、多轮工具调用的 AI Agent 已经能在边缘设备上实用化运行。

事件核心:发生了什么

在 MLPerf Inference v6.1 的边缘 Agentic 基准测试中,NVIDIA 的 TensorRT Edge-LLM 在单台 Jetson AGX Thor 开发者套件(128GB 统一内存,MAXN 功耗模式)上运行 Qwen3.6-27B 模型,输出吞吐达到 52.33 tokens/秒,首 token 中位延迟 247.12 毫秒,BFCL 函数调用准确率 87.94%。

该工作负载模拟软件工程 Agent 的多轮轨迹:20 段对话、共 1007 轮生成,输入长度逐轮增长至约 23.5K tokens。TensorRT Edge-LLM 用 24 分 36 秒完成全部轮次,而 MLCommons 公布的 llama.cpp 参考实现(Qwen3.6-27B,Q4_K_M 量化)耗时 2 小时 37 分,前者快约 6.4 倍。

性能提升来自三项技术:权重和激活采用 NVFP4 量化、基于树结构的多 token 预测(MTP)、以及跨轮次的 KV cache 复用。素材显示约 96% 的 prompt token 命中热缓存,运行时只需预填充约 0.5M 的新增部分。

为什么重要

聊天机器人只需回答单次提问,而 Agent 要选工具、看结果、在越来越长的对话里继续推理。这对边缘推理提出三重压力:快速生成 token、高效处理长共享历史、在有限功耗和内存下产出合法工具调用。此前这类任务通常被放在云端。

NVIDIA 公布这一结果,等于给出了边缘 Agent 的可行技术路线:低位宽量化压住 DRAM 带宽瓶颈,KV cache 复用削减重复预填充,MTP 减少生成步数。三者互补,分别对应“生成前”和“生成中”两段开销。对英伟达而言,这也是把 Blackwell 架构的 NVFP4 能力从数据中心延伸到 Jetson 产品线的直接证明,强化了其在边缘 AI 硬件与推理栈上的闭环。

对用户/开发者/创作者的影响

对做机器人和车载应用的开发者,这意味着本地部署一个能调用工具的 27B 级模型开始具备可行性,不必完全依赖云端 API,延迟和数据合规压力都会下降。NVIDIA 已发布经过校准的 Qwen3.6-27B NVFP4 checkpoint,团队可直接使用,也可在任何开发机上做一次后训练量化后再部署。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对推理成本敏感的企业,需要注意的是:这类结果的功耗、散热和 MAXN 模式下的实际表现仍需按场景评估,基准成绩不等于生产环境吞吐。创作者若想在本地跑长文写作或多步内容工作流,Jetson AGX Thor 是当前公开信息里较有代表性的选项,但生态和工具链成熟度仍在早期。

值得关注的后续

一是 TensorRT Edge-LLM 何时从基准走向正式产品化,是否开放更多模型和量化格式支持;二是 AMD、高通等边缘芯片厂商是否跟进发布同类 Agentic 基准成绩,形成可比竞争;三是 KV cache 复用与 recurrent state 恢复在真实多变对话下的稳定性,目前公开信息主要来自标准化基准,生产负载表现仍待观察。

来源:NVIDIA Generative AI Blog

celebrityanime
celebrityanime
文章: 23945

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注