一句话看懂:Artificial Analysis 发布“Search Index”基准测试,对 Parallel、Exa、Firecrawl 等 7 家搜索 API 在 AI Agent 场景下的质量、成本与速度进行量化排名。结果显示,搜索质量直接决定 token 消耗与总成本,性能最高者未必总成本最低。
事件核心:发生了什么
8 月 18 日,AI 分析机构 Artificial Analysis 推出名为“Search Index”的行业基准,专门衡量搜索 API 在 AI Agent 工作流中的实际表现。首批参测对象包括 Parallel、Exa、Firecrawl、You.com、Tavily、Keenable 和 Brave 共 7 家服务商。
测试采用统一口径:所有 API 均搭配同一模型(GPT-5.6 Luna),在 Artificial Analysis 自研的开源 Agent 框架 Stirrup 上运行,每个任务执行 25 次搜索与页面抓取,仅替换搜索服务商。评测体系由三部分等权构成:包含 900 个研究型问题的 DeepSearchQA、200 道需多步浏览的 BrowseComp 子集,以及覆盖六大知识领域 600 道题的 AA-Omniscience。作为对照,模型在不调用搜索工具时仅得 33 分。
结果显示,Parallel、Exa、Firecrawl 分别以 75、74、73 分位列前三。更关键的是成本端数据:使用 Parallel Search 高级版时,模型 token 消耗比基础版降低超过 40%,单任务总成本从 0.11 美元降至 0.084 美元,尽管单次搜索 API 费用更高。而 Parallel Search 涡轮版虽然单次查询响应最快(0.51 秒对 1.03 秒),但因其质量得分较低(67 对 73),Agent 需要更多轮次搜索,最终任务总耗时与基础版几乎持平。
为什么重要
这是首个将“搜索质量”与“Agent 总成本”直接挂钩的公开基准。过去开发者选择搜索 API 时,往往只比较单次查询的价格与延迟,忽略了一个核心变量:搜索结果如果质量差,大模型会反复尝试、不断消耗推理 token,最终推高总成本。
该基准的价值在于把成本核算从“单次 API 价格”拉回到“端到端任务成本”。对于正在构建 Agent 的团队,这提供了比厂商宣传更可落地的选型依据。同时,Artificial Analysis 将方法与代码开源,允许其他服务商申请加入评测,有望形成类似大模型排行榜的第三方生态参照系。
对用户/开发者/创作者的影响
对开发者而言,这份榜单的实际意义在于成本优化:它提示选型时不只看单价,更要看搜索结果能否“一次到位”地满足 Agent 需求。根据报告数据,以任务总成本计,Parallel(高级版)、Firecrawl 与 Parallel(涡轮版)是目前性价比最优的选项。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对创作者或内容平台运营者,尤其依赖搜索增强生成(RAG)或联网信息整理的场景,这一评测方法可以迁移到自己的流水线里做小规模验证。
对普通用户,这类基准测试帮助间接筛选出更省 token 的 Agent 产品,可能带来更低的订阅服务成本或更快的响应体验。目前公开信息显示,评测覆盖范围仍有限,中文搜索源的表现尚未纳入对比。
值得关注的后续
第一,更多搜索 API 厂商是否会跟进参测,尤其是主攻中文市场或垂直领域(学术、法律、医疗)的服务商。第二,Artificial Analysis 是否会将该基准扩展至不同模型组合,观察模型与搜索 API 之间的匹配效应。第三,价格与质量榜单是否会随着参测方迭代产品而定期更新,进而成为 Agent 基础设施选型的默认参考工具。


