GPT-6 Astra展现恐怖统治力:模拟售货机一年狂揽1.5万美元,成绩碾压Claude近3倍

Andon Labs 用 Vending-Bench2 让 AI 从 500 美元起步经营一年模拟售货机,GPT-6 Astra 平均收官余额达 15,515 美元,最差一轮也超过 Claude Fable5.1 的最佳成绩。这说明长周期自主经营能力正在成为大模型竞争的新分水岭。

Andon Labs 用 Vending-Bench2 让 AI 从 500 美元起步经营一年模拟售货机,GPT-6 Astra 平均收官余额达 15,515 美元,最差一轮也超过 Claude Fable5.1 的最佳成绩。这说明长周期自主经营能力正在成为大模型竞争的新分水岭。

ElevenLabs 发布 ElevenMusic Music v2.5 音频生成模型,同步通过手机 App 和 API 向全球开发者与用户开放,主打更自然的声音质感和「合法授权数据训练」的合规定位。

DeepSeek 的新轻量旗舰 DeepSeek-V4.1-Flash 已上线阿里千问 AI 平台,API 与 Token Plan 同步开放;它用 552B 总参数、约 8B 输入激活的 MoE 结构,把百万级上下文和长程 Agent 任务的成本压了下来。

Anthropic CEO Dario Amodei 公开呼吁给前沿 AI 研发“限速”,并提出一套以“可验证”为核心的三步方案,Sam Altman 与马斯克先后表态支持。这场讨论的焦点不是要不要安全,而是谁有资格、按什么标准慢下来。

IEEE Spectrum 发布了一份关于家用 AI 机器人的专题,系统梳理了从 Roomba、Asimo 到 Tesla Optimus、Figure、Digit 等产品的技术与历史脉络。它值得关注的原因是:人形机器人第一次同时拿到了大模型、成熟供应链和真实场景数据这三张牌,但"进家门"这件事仍没有明确时间…

2026 年 9 月,作者 theahura 在 12gramsofcarbon 发文《AI 不是一项普通的技术》,主张 AI 与汽车、工厂自动化等历史技术的根本区别在于其"完全通用性"——任何人类能做的工作,理论上都能被 AI 更好地完成,因此"新工作会自动出现"这一传统论调在 AI 面前不成立。

一篇 2018 年首发、2024 年 12 月更新的 arXiv 报告系统梳理了 AI 被恶意使用的安全威胁,并提出预测、预防与缓解思路。它值得关注,是因为今天大模型、图像生成和自动化工具的能力,已经让报告里不少设想变得更现实。

Anthropic 与 Rumble 背后的 Rum Group 签下一份为期六年、总额约 137 亿美元的算力租赁协议,用来租用后者在佐治亚州新建数据中心的计算资源。这笔交易的关键不在于金额本身,而在于一家头部大模型公司开始把长期算力押注在传统云厂商之外的“第二梯队”供应商身上。

《纽约时报》报道称,硅谷内部对“放缓 AI 发展”的呼吁出现明显质疑声音,一部分从业者认为减速主张忽视了竞争压力与落地收益。这场分歧之所以值得关注,是因为它直接影响未来模型发布节奏、算力投入和监管讨论的走向。

据《华盛顿邮报》援引现任及前任官员消息,美国国家安全局(NSA)计划进行一轮大规模重组,新设五个业务单元,分别对应人工智能、中国方向、网络安全、作战支援和全球情报。这意味着AI首次被单独提升为NSA的一级组织方向,而不是附属在某一个技术部门之下。