Gemini 的智能体式视频理解

Google 正在将 Gemini 的能力从单次问答扩展为具备“智能体”特性的视频理解工具,使其能够对连续画面进行推理、定位关键事件并执行后续动作。这标志着多模态大模型的竞争焦点正从“看懂一张图”转向“看懂一段视频并采取行动”。

Google 正在将 Gemini 的能力从单次问答扩展为具备“智能体”特性的视频理解工具,使其能够对连续画面进行推理、定位关键事件并执行后续动作。这标志着多模态大模型的竞争焦点正从“看懂一张图”转向“看懂一段视频并采取行动”。

AI Toolbox 3.0 在 Product Hunt 上线,聚合 ChatGPT、Claude 等主流模型的对话与图像生成能力,把多模型切换从“复制粘贴”变成统一工作流。值得关注的是,这类第三方聚合工具正在成为普通用户接触大模型的默认入口。

一位科技博主公开批评大学计算机教育迭代速度远落后于 AI 产业,认为当 OpenAI 以两个月一代的节奏发布模型时,高校仍在讲授二十年前的 C++ 教材,导致有天赋的学生靠自学自救,而被动接受填鸭教育者则在毕业后被市场淘汰。该帖在 X 平台获得超 3.5 万次浏览,引发关于学历价值与 AI 时代教育适配性的激…

斯坦福大学把 CS329A“自我改进 AI 智能体”研讨课的全部 9 节视频公开到 YouTube,两位曾参与 PaLM、Gemini、Claude 的主讲人系统拆解了“采样→验证→筛选→训练→更强模型”的循环,并解释了为何编程类智能体已普及、写作类却迟迟无法突破。

美国多州民众对新建数据中心的反对率在一年内从 42% 飙升至 75%,面对中期选举压力,部分科技界与右翼人士将这股抵制潮归结为“中国在背后操纵舆论”。但多家追踪机构及公开报告显示,目前几乎没有确凿证据支持这一指控,本土环保与政治焦虑才是主因。

Wired 记者在试用 iOS 27 测试版中的新版 Siri AI 后,经历了一个从“惊艳”到“回归旧习惯”的过程。这表明苹果的 AI 助手尽管在能力上大幅进步,但尚不足以改变多数用户的手机交互习惯,其真正的护城河可能是隐私信任,而非技术领先。

Meta 旗下 Superintelligence Labs 发布了首个实时音频感知模型 Muse Voice Transcribe,能在对话进行中同步完成语音转写、说话人区分和句子边界识别。该模型以每小时 0.18 美元的低价入市,被视为 Meta 推动“永不间断聆听”的个人 AI 助手底层技术。

OpenAI 开发者 Thibault Sottiaux 公开表示,内部使用尚未发布的 Astra 模型后生产力大幅提升,部分项目计划甚至提前了六个月。这一表态再次引发关于前沿模型是否“留作内部使用”而非对外发布的讨论。

多名医学与AI研究者提出,聊天机器人的“谄媚”机制可能强化用户妄想,形成“一个人的回音室”,并呼吁将“AI相关精神病”视为独立临床诊断,而非仅作为现有精神疾病的触发因素。

Anthropic 发布新一代旗舰模型 Claude Fable 5.1 及科研特化版 Mythos 5.1,在长周期自主任务能力上大幅增强,同时将上下文缓存读取价格下调 75%,试图解决此前旗舰模型企业落地“用不起、管不住”的核心痛点。