RL微调VLM的鲁棒性与思维链一致性研究

苹果最新研究发现,通过强化学习(RL)微调开源视觉语言模型(VLM)虽然能提升基准测试分数,但同时会削弱模型对视觉信息的真实依赖,并导致思维链(CoT)推理的可靠性和鲁棒性下降。这揭示了仅以准确率为目标的训练评价体系的局限性。

苹果最新研究发现,通过强化学习(RL)微调开源视觉语言模型(VLM)虽然能提升基准测试分数,但同时会削弱模型对视觉信息的真实依赖,并导致思维链(CoT)推理的可靠性和鲁棒性下降。这揭示了仅以准确率为目标的训练评价体系的局限性。

快手旗下AI公司“北京可灵”于7月2日获得初始投资者20.28亿美元(约138.24亿元人民币)注资,投后估值达180亿美元。这笔资金将主要用于算力扩充、数据中心建设和人才引进,并为其未来12个月内赴港上市铺路。

Anthropic与五角大楼的冲突核心并非模型访问权限,而是军事用途的护栏设定——Claude创始人希望禁止全自主武器和某些监控场景,美国国防部则坚持要在所有合法的国家安全用例中部署Claude。这场僵局最终导致五角大楼将Anthropic列为供应链风险,部分合作方已被迫更换AI工具。

彭博社最新报道指出,AI技术正在被信贷市场大规模用于债务包装和风险评级,表面提高了市场透明度和安全形象,实则可能因模型过度拟合和“黑箱”决策,掩盖了底层资产质量恶化的真实风险。

快手的视频生成大模型“可灵AI”在近期完成一轮近30亿美元的融资,这笔金额刷新了全球视频生成模型赛道的单笔融资纪录,表明资本对该领域商业前景的判断正在提升。

开发者 Ben Emson 在 Claude Code 的状态行中嵌入了名为 Claudoro 的番茄时钟工具,可直接通过 Claude Code 或终端控制,将时间管理功能与 AI 编程助手的工作流合二为一。这展示了 AI 工具生态中“小而精”的深度集成趋势。

Manufact 是一个面向 MCP(Model Context Protocol)应用的垂直云平台,旨在简化 MCP 服务器和应用的开发、测试、部署和发布流程。其核心逻辑是类比 Vercel 之于 Next.js,为 MCP 生态提供一站式的 DevOps 和分发基础设施。

近期一篇技术讨论指出,在强化学习(RL)后训练中,仅优化Transformer模型的中间层参数,就能达到与更新全部参数相近的效果。这暗示当前全参数RL训练可能效率不高,大量算力花在了对底层语法层和高层输出层的无意义调整上。

开发者尝试用 Fable 和其他多个语言模型(包括 Opus、GLM、Kimi 等)重构 LangGraph 的神节点,并核算出若按 API 付费仅需 6.88 美元,引发社区对模型性价比与网络封锁问题的讨论。

日本最高法院驳回了将人工智能(AI)列为专利申请发明人的请求,明确只有人类才能被认定为发明人。这一判决呼应了全球主流司法管辖区对 AI 主体地位的限制态度,并对依赖 AI 生成发明的企业级研发、专利策略产生了直接影响。