Gemini 的智能体式视频理解

Google 正在将 Gemini 的能力从单次问答扩展为具备“智能体”特性的视频理解工具,使其能够对连续画面进行推理、定位关键事件并执行后续动作。这标志着多模态大模型的竞争焦点正从“看懂一张图”转向“看懂一段视频并采取行动”。

Google 正在将 Gemini 的能力从单次问答扩展为具备“智能体”特性的视频理解工具,使其能够对连续画面进行推理、定位关键事件并执行后续动作。这标志着多模态大模型的竞争焦点正从“看懂一张图”转向“看懂一段视频并采取行动”。

AI Toolbox 3.0 在 Product Hunt 上线,聚合 ChatGPT、Claude 等主流模型的对话与图像生成能力,把多模型切换从“复制粘贴”变成统一工作流。值得关注的是,这类第三方聚合工具正在成为普通用户接触大模型的默认入口。

美国多州民众对新建数据中心的反对率在一年内从 42% 飙升至 75%,面对中期选举压力,部分科技界与右翼人士将这股抵制潮归结为“中国在背后操纵舆论”。但多家追踪机构及公开报告显示,目前几乎没有确凿证据支持这一指控,本土环保与政治焦虑才是主因。

Wired 记者在试用 iOS 27 测试版中的新版 Siri AI 后,经历了一个从“惊艳”到“回归旧习惯”的过程。这表明苹果的 AI 助手尽管在能力上大幅进步,但尚不足以改变多数用户的手机交互习惯,其真正的护城河可能是隐私信任,而非技术领先。

OpenAI 开发者 Thibault Sottiaux 公开表示,内部使用尚未发布的 Astra 模型后生产力大幅提升,部分项目计划甚至提前了六个月。这一表态再次引发关于前沿模型是否“留作内部使用”而非对外发布的讨论。

多名医学与AI研究者提出,聊天机器人的“谄媚”机制可能强化用户妄想,形成“一个人的回音室”,并呼吁将“AI相关精神病”视为独立临床诊断,而非仅作为现有精神疾病的触发因素。

Anthropic 发布新一代旗舰模型 Claude Fable 5.1 及科研特化版 Mythos 5.1,在长周期自主任务能力上大幅增强,同时将上下文缓存读取价格下调 75%,试图解决此前旗舰模型企业落地“用不起、管不住”的核心痛点。

OpenAI 在发布 GPT-6 Astra 的数小时内多次修改了网页上的基准测试数据,部分模型成绩一度大幅波动(如 Astra 幻觉率一度从 4.2% 降至 2% 后又恢复原值),引发外界对 AI 评测透明度和“刷榜”操作的质疑。

OpenAI 在 GPT-6 Astra 发布后,被曝悄悄修改了官方评测指标,改动方向被认为更有利于模型自身表现,同时其他已上线模型的评测标准也在持续调整,引发外界对 OpenAI 评测透明度的新一轮质疑。

OpenAI 在 2026 年 9 月 4 日公开了 GPT-6 Astra 模型操控 YAM 机械臂的对比测试结果。在“拾取积木放入碗中”的任务中,GPT-6 Astra 以 95% 的成功率和不到 1 美元的单次运行成本,大幅超越 Anthropic 的 Fable 5.1;但在需要精细插拔的拼图任务中…