用 NVIDIA NeMo Relay 追踪 Agent Harness 行为

NVIDIA 发布 NeMo Relay 追踪方案,配合 Hermes Agent 展示如何记录 Agent 的模型调用、工具调用、错误与重试,让开发者不仅知道“任务是否成功”,还能看清“它是怎么走完的”。

一句话看懂:NVIDIA 发布 NeMo Relay 追踪方案,配合 Hermes Agent 展示如何记录 Agent 的模型调用、工具调用、错误与重试,让开发者不仅知道“任务是否成功”,还能看清“它是怎么走完的”。

事件核心:发生了什么

NVIDIA 在开发者博客中介绍了一套用 NeMo Relay 追踪 Agent Harness 行为的完整教程,主角是原生集成 NeMo Relay 的 Hermes Agent。教程跑两个示例:第一个是在隔离 Docker 容器中调用终端工具运行 Python 脚本,脚本固定输出 VALUE=42,用于验证基础链路是否打通;第二个是文件与网页研究任务,把 OpenTelemetry 轨迹接入 Arize Phoenix 查看模型调用、工具调用、耗时、token 消耗和错误。

NeMo Relay 把一次 Agent 运行拆成三类输出:ATOF(JSONL 生命周期日志,记录 scope 起止和时间戳,用于审计单个事件)、ATIF(逐步的交互与工具调用记录,用于回看执行路径)、OpenTelemetry + OpenInference(父子 span,用于 Phoenix 等兼容工具中分析耗时与 token)。

为什么重要

Agent 有个隐蔽问题:答案对了,过程可能是浪费的。一次失败的搜索触发第二次搜索、文件读取被截断后又重新拉取,这些额外步骤不会出现在最终答案里,却直接抬高延迟和 token 成本,也增加出错概率。仅靠“成功/失败”校验无法解释 Agent 为什么从工具错误中恢复、为什么提前停止,或为什么多调了几次模型。

NeMo Relay 的价值在于补上“证据层”:把执行过程结构化成可查询的轨迹,让评测系统、安全系统和开发者能基于同一份记录讨论 Agent 行为。教程中还提到 Hermes ToolPerf 案例,用同样的方式在多轮重复运行中评估 Harness 改动是否真的有效,而不是被单次结果误导。

对用户/开发者/创作者的影响

对开发者而言,这意味着调试 Agent 不再只盯着最终输出。通过 ATOF 中配对的 uuid 和 parent_uuid,可以确认某次工具请求到底执行成功还是失败,并结合 ATIF 还原完整路径。对企业采购和合规团队,结构化轨迹是调查 Agent 行为、评估策略、扩展安全插件的基础设施;对做 Agent 应用的团队,token 与延迟可被量化归因后,优化目标会更明确。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

需要注意,教程提醒轨迹可能包含提示词、模型响应、工具参数与结果、文件路径等应用数据,分享前应先行审查。目前公开信息显示,该教程依赖 macOS 或 Linux、Git、curl、Docker,以及 NVIDIA Build 上 NVIDIA Nemotron 3.5 Lightning 的 API key。

值得关注的后续

一是 NeMo Relay 的原生集成是否会从 Hermes Agent 扩展到更多开源 Harness;二是 ATOF/ATIF 这类轨迹格式会不会被更多评测与安全工具采纳,形成事实标准;三是 Phoenix 之外的 OpenTelemetry 生态工具跟进情况,以及企业如何在可观测性与数据隐私之间做取舍。

来源:NVIDIA Generative AI Blog

celebrityanime
celebrityanime
文章: 26540

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注