RL微调VLM的鲁棒性与思维链一致性研究

苹果最新研究发现,通过强化学习(RL)微调开源视觉语言模型(VLM)虽然能提升基准测试分数,但同时会削弱模型对视觉信息的真实依赖,并导致思维链(CoT)推理的可靠性和鲁棒性下降。这揭示了仅以准确率为目标的训练评价体系的局限性。

苹果最新研究发现,通过强化学习(RL)微调开源视觉语言模型(VLM)虽然能提升基准测试分数,但同时会削弱模型对视觉信息的真实依赖,并导致思维链(CoT)推理的可靠性和鲁棒性下降。这揭示了仅以准确率为目标的训练评价体系的局限性。

快手旗下AI公司“北京可灵”于7月2日获得初始投资者20.28亿美元(约138.24亿元人民币)注资,投后估值达180亿美元。这笔资金将主要用于算力扩充、数据中心建设和人才引进,并为其未来12个月内赴港上市铺路。

Anthropic与五角大楼的冲突核心并非模型访问权限,而是军事用途的护栏设定——Claude创始人希望禁止全自主武器和某些监控场景,美国国防部则坚持要在所有合法的国家安全用例中部署Claude。这场僵局最终导致五角大楼将Anthropic列为供应链风险,部分合作方已被迫更换AI工具。

快手的视频生成大模型“可灵AI”在近期完成一轮近30亿美元的融资,这笔金额刷新了全球视频生成模型赛道的单笔融资纪录,表明资本对该领域商业前景的判断正在提升。

Manufact 是一个面向 MCP(Model Context Protocol)应用的垂直云平台,旨在简化 MCP 服务器和应用的开发、测试、部署和发布流程。其核心逻辑是类比 Vercel 之于 Next.js,为 MCP 生态提供一站式的 DevOps 和分发基础设施。

近期一篇技术讨论指出,在强化学习(RL)后训练中,仅优化Transformer模型的中间层参数,就能达到与更新全部参数相近的效果。这暗示当前全参数RL训练可能效率不高,大量算力花在了对底层语法层和高层输出层的无意义调整上。

罗宾汉(Robinhood)CEO 弗拉德·特涅夫(Vlad Tenev)在采访中表示,AI 智能体(Agent)将在不远的将来拥有与人类交易员同等的专业能力。该公司已于今年5月上线工具,允许用户授权 AI 智能体代为执行股票交易与资产申购操作,意图将原本属于机构的高端交易工具普及给普通投资者。

微软斥资 25 亿美元、抽调约 6000 名员工,成立名为“Microsoft Frontier Co.”的新子公司,专为企业客户提供 AI 技术落地的现场实施服务。此举意味着头部 AI 公司已从“卖模型”转向“帮客户用起来”的贴身服务模式,是 AI 商业化进入深水区的关键信号。

美国国家经济委员会主任凯文·哈塞特透露,政府正在与所有大型人工智能公司沟通,探讨如何让美国公众分享AI产业增长的收益。这表明美国政府正在从单纯关注行业监管,转向思考如何让公共利益从AI商业化中获益。

微软宣布成立一家名为“Microsoft Frontier Company”的新运营公司,专门帮助大企业成功部署现有 AI 工具。微软为此投入 25 亿美元,并配备 6,000 名行业与工程专家。这是迄今为止科技巨头在企业 AI 落地服务上最大的一笔内部资金承诺,标志着 AI 部署已从模型竞赛转向效果交付。