Gemini 3.7 Flash

有开发者用同一套网页设计需求横向测试 Gemini 3.7 Flash、Opus 5 与 Grok 4.6,结论是 Gemini 3.7 Flash 在图像生成上表现突出,但在 HTML 还原和整体任务完成度上仍未超过 Opus 5,而且比 Grok 4.6 的优势也没有想象中明显。

一句话看懂:有开发者用同一套网页设计需求横向测试 Gemini 3.7 Flash、Opus 5 与 Grok 4.6,结论是 Gemini 3.7 Flash 在图像生成上表现突出,但在 HTML 还原和整体任务完成度上仍未超过 Opus 5,而且比 Grok 4.6 的优势也没有想象中明显。

事件核心:发生了什么

一位 Hacker News 用户以“霓虹拉面店”网页为测试用例,分别让 Gemini 3.7 Flash、Opus 5 和 Grok 4.6 从零构建整套页面与素材。结果显示,Opus 5 仍是综合完成度最高的模型;Gemini 3.7 Flash 的图像生成观感不错,尤其是食物照片与餐车照片,但 HTML 布局还原度一般。测试者特别提到,本以为 Gemini 会在与价格接近的 Grok 4.6 对比中“碾压”对方,但 Grok 4.6 实际表现已经追平。测试者还指出,该测试中 Grok 4.6 是通过 Cursor CLI Agent 运行的,Agent 被允许自行决定生成资产类型与 prompt,这意味着 Grok 的完成度有一部分来自智能体编排能力,而不只是基础模型本身。

为什么重要

这次测试折射出大模型竞争的三个新变化:第一,Claude(Opus)仍然在视觉审美与前端还原类任务上保持领先,Anthropic 没有自研扩散模型,却能把多模态理解与代码生成结合得很好;第二,Gemini 3.7 Flash 作为强推理模型的“闪速版”,主打低成本和速度,但测试者认为它缺少明确的第一使用场景,且 Google 的 API 申请流程过于繁琐,形成了“高门槛但非帕累托最优”的组合;第三,Grok 4.6 在同等价位段的快速进步,说明吃瓜群众眼中“落后一个身位”的玩家,实际上正在快速补齐工程与审美能力。

对用户/开发者/创作者的影响

对开发者和创作者来说,这次对比的实际参考价值在于:如果任务包含“从零生成整套视觉素材 + 前端页面”,Opus 5 依然是最稳的选择;Gemini 3.7 Flash 更适合作为图像素材生成的补充工具,而不是直接负责最终 HTML 产出;如果想用 Grok 4.6 替代 Gemini 完成类似任务,这次测试表明它已经具备竞争力。另一个值得注意的信息来自素材中关于 OpenAI Luna 的定价描述:Luna 的输入价格为 0.2 美元/百万 tokens,远低于 OpenAI 其他模型,但从 2027 年 1 月 1 日起将涨至 1.5 美元/百万输入和 7.5 美元/百万输出。对于预算敏感的 API 用户,当前低价窗口期值得关注。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,Gemini 3.7 Flash 是否会针对前端生成场景做专门优化,还是继续以速度和价格为卖点打“性价比牌”;第二,Grok 4.6 在 Cursor 类 Agent 工作流中的表现能否复制到其他工具链,毕竟测试者明确提到 Grok 的完成度有一部分来自 Agent 自主决策;第三,OpenAI Luna 的涨价计划是否会引发一波 API 定价竞争,尤其是推动其他厂商在低成本模型上加速迭代。目前公开信息显示,上述测试只是单一用例,尚不能代表这些模型的全部能力差异。

来源:hackernews

celebrityanime
celebrityanime
文章: 18287

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注