一句话看懂:Product.ai 本周发布的研究显示,ChatGPT、Claude、Gemini、Perplexity 在网购场景下频繁给出互相矛盾的价格和规格答案,86% 的测试问题出现可核查的事实冲突。这意味着把付款决策直接交给 AI 购物助手,目前还不够安全。
事件核心:发生了什么
做产品信息核验的初创公司 Product.ai 用 220 道购物问题测试了 ChatGPT、Claude、Gemini、Perplexity 的免费版和付费版,覆盖笔记本、电视、床垫、防晒霜、扫地机器人等品类。每道题在每个服务上跑 5 次,共收集 8794 条回答。结果显示,86% 的问题出现了可重复的事实冲突,即不同回答之间在价格、型号或规格上互相打架。对比类问题(让 AI 比较两款产品)冲突率高达 97%,单纯查参数的问题为 75%。在能核实的 913 条价格回答中,85% 与当前标价一致,也就是说约一成半的价格是错的;一旦出错,价差中位数达到 300 美元。各模型表现分化明显:Gemini 免费版「高代价错误」占比 56%,付费版 54%;Claude 付费版把这一比例从 44% 降到 21%;Perplexity 付费版最低,为 14%;ChatGPT 付费版为 17%。此外,同一问题反复提问时,Gemini 免费版有 29% 的问题出现自相矛盾。
为什么重要
过去一年,零售商和大模型厂商都在推 AI 购物助手,Meta 的 Muse、Instinct 一类「AI 代理」也在往自动下单方向走。这次测试戳中的是更底层的问题:如果模型连价格和型号都说不准,上层代理做得再顺,也只是把错误答案执行得更快。Product.ai 搜索产品负责人 Dakota Nunley 的说法是,这些大模型在端到端购物体验上「还没到那一步」。需要指出的是,谷歌回应称该研究用的是面向开发者的 Gemini API 版本,而非接入 Google Shopping Graph 数十亿条持续刷新商品数据的消费端应用;Perplexity 则称自己以 100% 准确率为目标。其余三家未回应。目前公开信息显示,这场争议尚无第三方复现结论。
对用户/开发者/创作者的影响
对普通用户,短期结论很直接:旺季购物可以把 AI 当作发现工具和比价思路的起点,但别把支付信息交给代理,也别把回答当定论。Nunley 的建议是多问几个引擎做交叉验证,或回到卖家官网自己核对。对开发者和做购物类 AI 应用的团队,这类误差说明单靠大模型推理撑不起交易链路,商品库的实时性、价格校验层和冲突检测环节仍是刚需;做 AI 导购内容时,标注信息时效和数据来源会比「AI 推荐」本身更值钱。对企业采购而言,把 AI 代理接入下单流程前,先评估错误成本的量级——300 美元的价差中位数就是一个可参考的警戒线。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是谷歌是否会拿出消费端 Gemini 应用的数据反驳这项研究,以及 Shopping Graph 的接入能否实质降低错误率;二是各家是否会在购物场景引入更强的实时检索或商品库校验,把「推理」换成「查证」;三是监管与平台侧是否会对 AI 代理代下单设更明确的告知或校验要求。


