7.20—7.26|本周Top 10 AI 论文

本周两篇论文分别从“框架可解释性”和“经验沉淀技能”两个角度提升LLM智能体的长期自主能力。Harness Handbook让智能体自主演化时能定位代码行为,MSCE框架让智能体把执行经验变成可调用技能,无需重复训练。

本周两篇论文分别从“框架可解释性”和“经验沉淀技能”两个角度提升LLM智能体的长期自主能力。Harness Handbook让智能体自主演化时能定位代码行为,MSCE框架让智能体把执行经验变成可调用技能,无需重复训练。
![[Bug][KV Offload][P2P] EngineCore crash reconnecting to peer: stale dead ZmqConnection remains registered](https://www.chat-gpts.plus/wp-content/uploads/2026/07/49809-64a65152-768x403.jpg)
该报错发生在 vLLM 使用 OffloadingConnector P2P 辅助层且大量请求反复连接/断开同一对等节点(peer)时,因会话清理与传输层连接清理时序不一致,导致 ZmqConnection 仍注册在 _connections 中,触发断言 AssertionError: ZmqCo

腾讯办公AI助手WorkBuddy正式上架鸿蒙PC应用市场,成为该生态首个桌面办公AI代理。基于鸿蒙底层能力,它推出了其他主流系统暂未实现的“碰一碰”分享功能,覆盖17个行业、140多个AI应用和2.2万个插件。
![[Bug]: MiniMax-M3 Multimodal Model Crashes During Inference](https://www.chat-gpts.plus/wp-content/uploads/2026/07/49940-e0372e77-768x403.jpg)
运行 MiniMax-M3 多模态模型进行推理时发生崩溃,报错为 CUDA illegal memory access。优先排查是否缺少对 MiniMax-M3 的模型架构支持,并尝试应用 vLLM 项目 PR #49149 中的补丁。

蚂蚁百灵于7月24日发布原生混合推理模型Ling-3.0-Flash,总参数124B但每次推理仅激活5.1B,在多项核心指标上匹配或超越参数规模2-3倍的行业领先模型,已上线OpenRouter免费试用一周,随后将开源。

美团官方否认了旗下大模型LongCat负责人裴鹏离职的传言,同时其万亿参数模型LongCat-2.0已实现全流程国产算力训练与推理,这既体现了团队稳定性,也意味着国产算力在大模型落地方向上取得实质性进展。

Google CEO 皮查伊在 2026 年第二季度财报会上确认,下一代旗舰大模型 Gemini 4 已进入训练阶段,并投入“大量资源”。此前 Gemini 3.5 Pro 跳票引发市场质疑,皮查伊承认在编程和 Agent 能力上存在差距,计划用 Gemini 4 在年底前追平竞品。

千问办公(Qwen Office)悄然开启内测,将企业IM、AI生成与多格式交付整合为一个平台,旨在提供“从任务到成果”的一站式智能协作体验。这意味着AI办公赛道迎来一位具备全栈能力的重量级选手。

美国数据工具公司Encord正在尝试用脑电波(EEG)信号和肌电(EMG)信号训练机器人模型。这项实验显示,物理AI的真正瓶颈不是模型架构,而是极度缺乏真实世界的操作数据。通过捕捉执行者的意图、错误和预测,希望能让机器人训练效率提升100倍,同时成本只增加20倍。

在 Open WebUI 中启用 ENABLE_MEMORY_BACKGROUND_REVIEW=true 后,流式聊天(Stream Chat Response)的对话永远不会触发背景记忆审查,因为流式响应处理未向 assistant_message 传入 content 字段,导致 review