我尝试用3款顶级AI机器人搭建网站,结果发现一个无可争议的赢家

Android Police 作者用完全相同的自然语言提示词,让 Gemini、ChatGPT 和 Claude 分别搭建二手车经销商网站,结果显示 Claude 在图片匹配、细节理解和设计成熟度上明显胜出,成为这场同题测试的赢家。

一句话看懂:Android Police 作者用完全相同的自然语言提示词,让 Gemini、ChatGPT 和 Claude 分别搭建二手车经销商网站,结果显示 Claude 在图片匹配、细节理解和设计成熟度上明显胜出,成为这场同题测试的赢家。

事件核心:发生了什么

2026 年 8 月,技术作者 Debasish Mandal 在 Android Police 发布了一项实测:他给 Gemini 3.6 Flash(开启 Extended Thinking)、ChatGPT(开启 Think 模式)和 Claude Sonnet 5(开启 Thinking,力度设为 Extra)下达了同一段模糊提示,要求各自动手搭建一个包含首页、库存页和车辆详情页的二手车经销商网站。

三个模型都完成了基础任务,但差距出现在细节。Gemini 的输出乍看不错,实则图片与车辆严重错配,比如“2020 Jeep Wrangler”配了一张空路照片,“2019 Ford F-150”配的是法拉利超跑;价格也缺乏合理性。ChatGPT 表现居中,部分图片能匹配车型,设计比 Gemini 更协调。Claude 则准确匹配了每一辆车的型号,主动选用带有凹痕和划痕的高分辨率二手车实拍图,并添加了 A+、B 等车况徽章——这些都不是作者明确要求的。值得注意的是,Claude 首轮因担心品牌版权问题,自行生成了 SVG 草图;在作者建议改用真实图片后,它仍能自主理解“需要真实感二手车图”的隐含意图,最终在准确性和设计上双双领先。

为什么重要

这不是一次简单的“谁更快”的比赛,而是反映了当前大模型之间“理解意图”能力的真实差距。在提示词刻意模糊的情况下,Claude 展现出更强的推理能力和设计判断力,能主动补齐用户没有明说的需求;Gemini 则更接近“快速拼接代码”,图片选择近乎随机,设计上偏向“氛围正确”的模板感。这说明,推理能力、素材语义匹配和审美决策,正在成为区分 AI 编程助手实际可用性的关键维度。

对用户/开发者/创作者的影响

对普通用户,这个测试提示我们:当需要可交付的产品级输出时,Claude 这类更“慢”的模型可能更值得等待,速度并不等于最终质量。对使用 API 开发应用的团队,它提醒开发者要根据任务类型选择模型,涉及多模态内容生成和品牌素材匹配时,不能只考察代码正确率,还要关注素材与语义的对应关系。对内容创作者,AI 输出的“最后一公里”——细节真实感、

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 18687

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注