由 Andreessen Horowitz 投资的 Vals 志在成为 AI 基准测试的黄金标准

AI 基准测试公司 Vals 完成由 Andreessen Horowitz 领投的 4000 万美元 A 轮融资,它用不公开题目的行业实战测试替代传统公开考卷,试图解决大模型“刷榜”问题。

AI 基准测试公司 Vals 完成由 Andreessen Horowitz 领投的 4000 万美元 A 轮融资,它用不公开题目的行业实战测试替代传统公开考卷,试图解决大模型“刷榜”问题。

The Verge 报道,AI 监管议题在本周从“CEO 们似乎达成共识”急转为公开分裂:Anthropic、OpenAI 主张建立安全标准,Meta、英伟达、xAI 一方则反对限制企业自主权,特朗普政府更直接把 AI 安全危机称为“hoax”。这场争论直接决定未来大模型的训练、上线和 API 供给会受多少约…

Robocurve 用新基准 RoboHarm 测试了三款头部模型控制机械臂时的安全拒绝能力,结果 GPT-6 Astra、Claude Fable 5.1 和 MolmoAct2 几乎都不会对危险指令说"不",Astra 反而最"能干"也最危险。

Unity 为 Claude Code 和 OpenAI Codex 发布了官方插件,让 AI 编程助手用上官方维护的引擎技能,而不是从论坛帖和旧教程里拼凑过时代码。这直接关系到 AI agent 能否可靠地开发 Unity 项目。

Anthropic、Google DeepMind 等前沿实验室的研究员近期密集离职并公开警告 AI 安全风险被低估,部分公司 CEO 顺势提出“放慢开发、加强监管”,其中一项诉求是获得反垄断豁免,以便同行之间协调安全标准。这引发了关于“安全合作”与“借监管之名行卡特尔之实”的争论。

Product Hunt 上出现了一款名为 Gammatica AI 的新产品,目前公开信息有限,但从命名和收录渠道看,它属于生成式 AI 应用层的又一新玩家。值得关注的原因在于:当底层大模型能力趋于同质化,应用层的差异化和场景落地正在成为新的竞争焦点。

WIRED 将于 11 月 4 日在迈阿密 Wynwood 区 Sacred Space 举办为期一天的 WIRED World Fair,把生物科技、AI、政治与艺术领域的人和产品集中搬到线下。对关注 AI 行业走向的人来说,这场活动的讲者名单本身就是一份当下议题清单。

9 月 8 日 Snowflake World Tour 2026 在上海举行技术专场,五场分享覆盖企业级智能体、前沿模型研究、AI 安全治理、开放湖仓和亚马逊云科技生产实践,并联合 InfoQ 举办 90 分钟现场构建挑战赛,把 AI 落地问题直接交给开发者做 Demo 验证。

9 月 8 日 Snowflake World Tour 2026 上海站举行,16 位 TGO 鲲鹏会学员参会后给出的反馈指向同一条链路:先让 AI 理解业务,再让 AI 进入系统,最后用真实结果检验价值。

2026 年春季,美军一次针对中国船只的登船行动在最后几分钟被叫停,原因是所依据的“情报”来自聊天机器人生成的幻觉报告。这说明大模型在关键决策场景中的幻觉问题,已经不只是技术瑕疵,而是可能触发真实冲突的风险源。