选择AI模型:同一个提示,11个模型,结果各异

Netlify 与 OpenRouter 达成合作,在其 AI Gateway 和 Agent Runners 中接入大量第三方大模型,并用同一提示测试了 11 个模型。结果显示不同模型生成的网站差别明显,这提醒开发者:选择哪个模型,正在成为 AI 编码工具里最实际的工程决策之一。

Netlify 与 OpenRouter 达成合作,在其 AI Gateway 和 Agent Runners 中接入大量第三方大模型,并用同一提示测试了 11 个模型。结果显示不同模型生成的网站差别明显,这提醒开发者:选择哪个模型,正在成为 AI 编码工具里最实际的工程决策之一。

亚马逊、谷歌、Meta、微软等巨头今年将在AI基础设施上合计投入超过5000亿美元,但真正的成本大头可能不是训练模型,而是模型日常运行时的“推理”开销。业界正在用“Tokenomics”(代币经济)重新审视AI的真实账单。

一位神经外科住院医师被指借助 ChatGPT(GPT-5.6)解决了 Crouzeix 猜想——一个长期悬而未决的数值线性代数开放问题。这一事件值得关注,因为它展示了前沿大模型在数学研究中的实际价值,但结果尚待严谨核查。

SpaceX AI 于 8 月 13 日发布旗舰模型 Grok 4.6,重点强化长期复杂智能体任务,综合基准得分追平 OpenAI 的 GPT-5.6 Sol,并延续了高速度、低定价的策略,直接冲击闭源大模型第一梯队。

YC 孵化的 Discovered Materials 发布了一个名为 Material Discovery Bench 的材料发现基准,测试多个前沿大模型能否独立设计出可用于 3D 芯片的新材料。结果显示大模型确实能批量“发现”新材料,却几乎给不出可行的实验室合成方案——500 多种材料中只有 1 种具备可…

YC 孵化的 Discovered Materials 发布了一个名为 Material Discovery Bench 的材料发现基准,测试多个前沿大模型能否独立设计出可用于 3D 芯片的新材料。结果显示大模型确实能批量“发现”新材料,却几乎给不出可行的实验室合成方案——500 多种材料中只有 1 种具备可…

阿里通义团队正式发布 Qwen3.8 开源模型家族,旗舰版本总参数 2.4T、激活参数 95B,并同时放出 FP8 量化权重,首次将 Qwen-Max 级能力开放给开源社区,推理成本与部署门槛显著降低。

Google Research 的一项新研究发现,前沿大模型(如 Gemini 3 和 GPT-5)的许多事实性错误,并非因为模型"没学过"这些知识,而是因为它"想不起来"——即编码没有问题,问题出在回忆环节。这为理解和改善大模型幻觉问题提供了新的诊断思路。

印度理工学院孟买分校与 Adobe Research 的研究人员提出了一种名为“Previous-Token Prediction”(PTP)的方法,仅凭大语言模型生成的输出文本,就能以近乎完美的准确率逆向还原原始提示词,整个过程无需访问模型权重,甚至对第三方模型也有效。这项研究把“提示词泄露”从理论风险变成…

xAI 今日发布 Grok 4.6,重点强化长时段自主代理(Agent)能力与交互式视觉项目执行,综合基准评分追平 GPT-5.6 Sol,并已在 Cursor、Grok Build 及 API 渠道开放使用。