选择AI模型:同一个提示,11个模型,结果各异

Hacker News 上一场关于“同一个提示词测试 11 个模型”的讨论,集中质疑了单次提示词评测(oneshot eval)的实际意义,指出真实世界中的 AI 使用是多轮、迭代、高度定制化的,简单提示词跑分无法反映模型真实能力,甚至可能误导选型。

Hacker News 上一场关于“同一个提示词测试 11 个模型”的讨论,集中质疑了单次提示词评测(oneshot eval)的实际意义,指出真实世界中的 AI 使用是多轮、迭代、高度定制化的,简单提示词跑分无法反映模型真实能力,甚至可能误导选型。

微软宣布将消费者版 Copilot 与 Microsoft 365 Copilot 合并为单一应用,不再让用户在任务栏里看到两个 AI 图标。这一步既解决了产品入口碎片化问题,也为微软计划在今年晚些时候推出的“超级应用”搭好底层框架。

DeepSeek 于 2026 年 8 月 13 日发布 Harness v0.1 开发者预览版,这是一个“一切皆插件”的 AI Agent 开发框架,并以 MIT 协议开源全部代码,让开发者可以自由替换模型、工具与界面组件。

Vetto Research 发布名为 GulliBench 的评测集,用 150 个刻意设置“表面数据在说谎”的简单任务,检验大模型是会盲目采信现成字段,还是愿意多一步验证。它提示:模型变聪明和变得可信,是两回事。

纽约时报记者实测了一款热门的AI垃圾检测器,并用“

DeepMind CEO 哈萨比斯在离任前,曾向特朗普政府高层提议成立一个模仿国际原子能机构(IAEA)的独立行业 AI 安全实体。这个想法如果落地,可能改变大模型发布审核、开源策略和跨国 AI 监管的方式。

CoreWeave、Nebius 等 AI 基础设施公司发布超预期财报,显示出算力需求依然坚挺,暂时打消了市场对“AI 资本开支见顶”的担忧。这为重仓 AI 交易的投资者争取到了一个观察窗口:即将发布的英伟达财报将成为下一块试金石。

Anthropic 将 Claude 的 Chrome 扩展升级为 Claude Cowork,让 AI 能以侧边栏形式直接操作浏览器内的各类工作系统。这不是简单加个按钮,而是把浏览器变成了 AI 执行跨平台多步骤任务的统一入口。

DeepSeek 于 2026 年 8 月发布最新模型 V4-Pro,在部分基准测试中与 Kimi K3 相当,但 API 定价显著更低:输入每百万 tokens 收费 0.44 美元,输出每百万 tokens 收费 0.87 美元。这是 DeepSeek 针对性价比区间的一次关键卡位。

开源项目 holaOS 发布了一个本地优先的 AI 代理工作区,让 Claude Code、Codex 等不同代理共用同一套记忆、工具和应用界面,并提供内置前沿模型或自带 API 密钥两种模型接入方式。这个项目把“代理碎片化”问题直接摆到了台面上:多代理协作能否成为下一个 AI 工作流常态。