Perplexity AI 发布 WANDR:评估必须广泛和深入搜索的研究代理的开放基准

Perplexity AI 正式推出 WANDR,一个面向研究型 AI 代理的开放评估基准,专门测试代理在复杂任务中能否既进行广泛搜索又完成深入分析的能力,为开发者和研究人员提供了量化「智能搜索」水平的新工具。

Perplexity AI 发布 WANDR:评估必须广泛和深入搜索的研究代理的开放基准

一句话看懂:Perplexity AI 正式推出 WANDR,一个面向研究型 AI 代理的开放评估基准,专门测试代理在复杂任务中能否既进行广泛搜索又完成深入分析的能力,为开发者和研究人员提供了量化「智能搜索」水平的新工具。

事件核心:发生了什么

Perplexity AI 于 2026 年 7 月 19 日发布了名为 WANDR 的开放基准测试。WANDR 的全称指向「必须做广泛和深入搜索的研究代理」,其设计目标是填补现有 AI 评估标准(如简单的问答或检索任务)的空白。与传统基准仅测试模型对已收录信息的匹配能力不同,WANDR 要求代理在开放互联网环境中自主规划搜索路径、筛选多源信息,并针对跨领域的复杂问题(如科学文献综述或市场趋势分析)给出有依据的结论。根据 Perplexity 官方说明,该基准包含数百个来自真实研究场景的高难度任务,每个任务都包含明确的搜索广度和深度评分标准。

为什么重要

WANDR 的发布标志着 AI 评估方向的一次关键转向。在过去两年里,大量 AI 代理在简单信息检索上表现优异,但在需要多步骤推理和长上下文整合的研究任务中常常失败。Perplexity AI 作为以「答案搜索引擎」为核心产品的公司,率先建立专为研究代理设计的开放基准,对行业有三层意义:第一,它迫使模型厂商从「记忆能力竞争」转向「探索与推理能力竞争」;第二,开放基准意味着学术界和小型团队可以免费使用它来评估自家的代理系统,降低了比较门槛;第三,它间接定义了下一代 AI 应用(如科研助手、法律分析代理)的合格标准——不仅要找到答案,还要能展示搜索过程的可信度和逻辑链条。

对用户/开发者/创作者的影响

对于普通用户,WANDR 的出现意味着未来使用 Perplexity 或同类产品进行深度研究时,结果的质量将更可预期,代理不再只是「给出一个答案」,而是会主动暴露搜索路径和置信度。对于开发者,这是一把「度量尺」——在构建自己的研究代理或调用相关 API 时,可以用 WANDR 快速诊断代理在哪个搜索环节(是广度不足还是深度不够)存在瓶颈。对于内容创作者和研究员,WANDR 可能成为评估 AI 辅助研究工具可信度的第一个标准化参考,帮助他们在选择工具时做出更理性的判断。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

首先,Perplexity 是否会在其商业产品中默认应用 WANDR 评分来标记答案质量,从而让用户直观看到代理的表现。其次,其他主要模型提供商(如 Anthropic、Google、OpenAI)是否会推出或采纳类似基准,进而形成行业共识。第三,WANDR 作为开放基准,其在学术社区的反馈度和 task 更新频率如何——如果被广泛采用,它可能成为衡量「下一代搜索型 AI」性能的默认标尺,并驱动整个行业优化推理架构和搜索策略。

来源:MarkTechPost Research

celebrityanime
celebrityanime
文章: 14486

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注