用 AIPerf 大规模基准测试 LLM 推理

NVIDIA 推出 AIPerf,作为 GenAI-Perf 的官方继任者,用于大规模测试大模型推理性能。它用多进程架构替代单进程方案,避免压测工具自身成为瓶颈,并支持 15 种以上端点类型和真实流量回放。

一句话看懂:NVIDIA 推出 AIPerf,作为 GenAI-Perf 的官方继任者,用于大规模测试大模型推理性能。它用多进程架构替代单进程方案,避免压测工具自身成为瓶颈,并支持 15 种以上端点类型和真实流量回放。

事件核心:发生了什么

NVIDIA 在开发者博客中发布 AIPerf,定位为 GenAI-Perf 的指定继任者,且是一次从底层重写。与旧工具不同,AIPerf 不再运行在 Perf Analyzer 之上,而是采用多进程系统:工作进程生成负载,独立的记录处理服务负责结果,各组件通过 ZMQ 协调。这使它在大并发和高请求率下不会因 Python GIL 或单进程限制成为客户端瓶颈。

功能上,AIPerf 支持 chat、responses、NIM rankings、图像生成等 15 种以上端点,兼容 ShareGPT 等公开数据集以及 Mooncake、Baseten、WEKA(AgentX)的 trace 回放格式,并支持 constant、Poisson、gamma 到达模式与可调突发性,以及 vLLM/SGLang 的 range-ratio 合成分布。

为什么重要

大模型部署后,“快不快”始终缺少可信答案。用 curl、自写 asyncio 脚本或单次负载生成器测出的数字,往往受限于单进程性能或自建参照物,无法真实反映服务端极限。AIPerf 把压测客户端本身从瓶颈中摘出来,让测量结果更接近服务器真实能力。对推理服务商、云厂商和企业采购而言,这意味着性能对比和容量规划有了更统一的基准工具,也降低了不同团队各写一套压测脚本的重复成本。

对用户/开发者/创作者的影响

开发者可以用一条命令跑起合成负载。博客演示以 Qwen3-0.6B 搭配 vLLM 为例,通过 aiperf profile 指定端点类型、流式输出和固定 128 输入/128 输出 token,并配合 min_tokens 与 ignore_eos 确保输出长度可复现。其中 –streaming 是测量 TTFT 和 ITL 的前提,否则服务端会等整段响应完成再发送,缺少首 token 与解码事件。对需要评估推理服务、比较模型或做容量规划的团队,这是一个可直接纳入 CI 或上线前流程的工具。普通创作者若使用托管 API,短期内感受不直接,但服务商若采用类似基准,响应稳定性和定价透明度可能逐步改善。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 AIPerf 能否在开源社区形成事实标准,取代各团队自建压测脚本;二是除 NVIDIA 生态外,对非 NIM、非 vLLM 端点的支持深度和迁移指南的实际落地情况;三是竞品是否跟进多进程压测架构,以及未来是否加入更细的成本与能效指标。目前公开信息显示,该工具已可通过 uv 安装,aarch64 平台需注意 crick 依赖的 C 工具链要求。

来源:NVIDIA Generative AI Blog

celebrityanime
celebrityanime
文章: 24355

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注