一句话看懂:一项针对网页信息抽取的测试显示,只要在指令中加入“缺失字段填 null、不要猜测”,16 个模型的编造率从 70.7% 降到 20.2%。这说明很多“自信的错误”并非能力上限,而是提示词没有把“我不知道”设为一个合法答案。
事件核心:发生了什么
测试方 Earn an Honest Dollar 做了一个面向 agent 服务采购的基准:给定网页,要求抽取若干字段,其中部分字段在页面上根本不存在。每个陷阱由两个几乎相同的页面组成,只差一行——一个给出真实答案,另一个不给,但两页都放了诱导信息,例如“Was $493.00”(旧价,非现价)、“Fact-checked by Omar Tamm”(不是作者)、“Last updated September 7, 2020”(不是发布日期)。诚实的抽取器应在第一页返回答案、第二页返回 null。测试覆盖 7 种页面类型、42 组配对,评分只看字段缺失的那一页。
所有参赛者在“带指令”组都收到同一句:Use null for any field whose value is not on the page. Do not guess. 模型组的“不带”即删除该句。结果为:16 个模型在无此句时共编造 573 个缺失字段中的 405 个(70.7%),加入后降到 574 个中的 116 个(20.2%)。表现较好的 Gemini 3.8 Flash、GLM 5.3 带指令时各只错 1 个;付费 API Firecrawl 编造 24/36,诱导答案全部照抄。纯 HTTP 抓取加 GPT-6 Luna 只错 5/36,整轮成本 0.0049 美元。测试时间为 2026 年 9 月 27 日,每个参赛者仅跑一次。
为什么重要
AI 应用落地时,agent 采购服务的一大障碍是“买家无法逐条核对”。这项测试把它量化成一个可比较的指标:服务会不会承认自己不知道。对行业而言,它把竞争焦点从“抽得多”拉向“错得少、可核查”。同一批数据还给出低成本校验路径:GPT-6 Luna 作为检查器抓出 49 个编造值中的 38 个,且没有拒绝任何一个正确值,成本不到一美分。这意味着“抽取 + 复核”可以组成流水线,而不必依赖单一高价 API。目前公开信息显示,这只是网页抽取的单项基准,不代表其他任务同样如此。
对用户/开发者/创作者的影响
开发者接 API 时,应把“缺失即 null”写进提示词或字段 schema,而不是依赖模型自觉;同时可挂一个便宜模型做值级校验,尤其在价格、作者、日期这类诱导密集的字段上。企业采购 agent 服务时,可以把“编造率”作为验收项,而不是只看演示效果。创作者若用大模型整理资料、生成结构化内容,也需默认把“不确定”设为合法输出,否则诱导信息会顺着旧价、旧日期混进成品。对闭源与开源模型而言,该测试说明提示工程仍能显著改变可靠性,成本最低的 GPT-6 Luna 在这项对照里并不落后。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
其一,测试方是否会对同一批参赛者复跑,验证单次结果是否稳定。其二,付费抓取 API 是否会把“空值规则”做成显式配置项,目前 ScrapingBee 只能写进字段描述。其三,其他任务类型(如简历解析、财报抽取)是否会出现类似幅度,以及“抽取 + 复核”两段式方案的实际单位成本会降到什么水平。


