Sources: some Google employees say Gemini 4 performs well on benchmarks but struggles with some real-world coding tasks; Google disputes that characterization (Bloomberg)

据 Bloomberg 报道,部分谷歌员工反映 Gemini 4 在基准测试中成绩出色,但在一些真实编程任务上表现不佳,谷歌方面否认了这一说法。这再次把"跑分好看"与"实际可用"之间的落差摆上台面。

一句话看懂:据 Bloomberg 报道,部分谷歌员工反映 Gemini 4 在基准测试中成绩出色,但在一些真实编程任务上表现不佳,谷歌方面否认了这一说法。这再次把”跑分好看”与”实际可用”之间的落差摆上台面。

事件核心:发生了什么

Techmeme 于 2026 年 9 月 30 日归档了这条消息,原始来源为 Bloomberg。报道称,谷歌内部有员工认为最新的 Gemini 4 模型在各类基准评测上表现良好,但落到部分真实世界的编码(coding)任务时,效果不如预期。谷歌对该描述提出异议,不认可这种”跑分强、实战弱”的定性。目前公开信息只有上述表态,具体是哪些任务、差距多大、样本量如何,都没有公开细节。

为什么重要

基准测试一直是各家大模型对外展示能力的主要凭证。但基准题往往有相对固定的模式和评分标准,容易在训练阶段被针对性地优化,而真实的软件工程任务涉及跨文件理解、模糊需求、遗留代码和长链路调试,考验的是训练数据之外的综合推理能力。如果头部模型也出现这种落差,说明行业目前缺乏能真实反映工程可用性的评测体系。对谷歌而言,Gemini 4 是其与 OpenAI、Anthropic 争夺企业客户和开发者 API 市场的主力产品,编码能力直接关系到订阅与 API 收入。谷歌的否认也说明,”内部员工吐槽”这类消息一旦传播,会被视为对模型信誉的挑战。

对用户/开发者/创作者的影响

对开发者来说,最实际的结论是:不要只看排行榜选模型。如果你的场景是代码补全、单元测试生成这类边界清晰的任务,基准分有参考价值;但涉及重构、集成、排查线上问题,建议先用自己项目的真实任务做小规模对比测试,再决定是否把 Gemini 4 接入 CI 或编码助手工作流。对企业采购方,评估阶段应要求厂商提供或自行构造贴合业务的评测集,而不是依赖公开榜单。模型迭代速度快,今天的能力排序可能几周后就变,保持多模型可切换的架构比绑定单一供应商更稳妥。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是谷歌是否公布更细分的编码评测数据,或通过产品更新缩小这块差距;二是 Bloomberg 报道中提到的具体任务类型和案例是否被进一步披露;三是竞争对手会不会借机强化自身在真实工程任务上的宣传,推动行业出现更贴近实战的评测标准。这些都会影响开发者在 API 选型时的判断。

来源:Techmeme

celebrityanime
celebrityanime
文章: 26594

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注