Google 发布 Gemini 4 Argon,号称迄今最强大的模型

Google 发布 Gemini 4 Argon,宣称是迄今最强模型,主打自主发现并修补软件漏洞的防御性网络安全能力,但首批只开放给少数安全合作伙伴,而非公众。

Google 发布 Gemini 4 Argon,宣称是迄今最强模型,主打自主发现并修补软件漏洞的防御性网络安全能力,但首批只开放给少数安全合作伙伴,而非公众。

Google DeepMind 的 Gemini 4 Argon (High) 在 Arena 的 Agent Arena 榜单上位列第 8,净提升 +7.92%,并凭每任务 0.62 美元的成本重画了性价比边界。这意味着谷歌新一代模型在真实 agent 任务上的表现和成本控制同时往前迈了一步。

OpenRouter 发布了一份教程,讲如何在 CI 流水线中用固定的 LLM eval 集合给 Pull Request 加门禁,让提示词或 Agent 逻辑的改动在“答错太多”时无法合入。它把大模型输出的质量问题,变成了一个和单元测试失败等价的工程约束。

OpenRouter 发布了一份关于"置信度阈值路由"的实操指南,让开发者用模型自评的置信分决定何时在便宜模型和强模型之间切换,把成本花在真正需要强模型的请求上。

OpenRouter 发布了一套 Agent 模型选型框架,主张不要看榜单排名,而是先定任务质量门槛、再测"每质量点成本",最后选刚好够用且最便宜的模型。这直接挑战了"用最强模型做 Agent"的默认做法。

Artificial Analysis 测算显示,GPT-6.1 Sol 完成单任务的加权平均成本比 GPT-6 Sol 低约 30%,而后者本身已只有 GPT-5.6 Sol 的一半左右。这值得关注,因为大模型竞争正从单纯拼能力转向拼“每任务成本”。

美国能源部计划出资 19 亿美元,撬动总额 52.5 亿美元的 31 个电网改造项目,覆盖 26 个州,核心目的是给 AI 数据中心等新增用电大户腾出输电容量。AI 竞赛的瓶颈,正在从芯片转向电力。

东京地方法院在一桩 TikTok AI 声音克隆案中认定,日本法律下人的声音可受“公开权”保护。这是日本首例针对 AI 仿声维护声音身份的诉讼,法院部分支持了声优津田健次郎的诉求。

普渡大学 CS 240(C 语言程序设计)课程在 2026 年春季学期发生大规模 AI 作弊争议,授课教师 Jeff 公开复盘处理过程,并披露了一款名为 Argus 的静态分析工具——它不是大模型,而是通过代码特征来识别 AI 生成痕迹。

Google 正在小范围测试一项名为“AI contribution pilot”的计划,根据出版商内容对其 AI 搜索结果的贡献程度直接付费,已有约 100 家出版商参与,个别出版商一年收入超过 100 万美元。