MineExplorer:首个《我的世界》分钟级长程任务评测基准发布

美团LongCat团队发布MineExplorer,首个针对多模态大模型在《我的世界》中完成分钟级长程任务的评测基准。测试发现,当前最先进的18款模型(包括Claude、GPT、Gemini等)在需要隐藏前置条件的多跳任务上集体“考砸”,最高成功率仅41%,揭示了AI“能看不能做”的能力断层。

美团LongCat团队发布MineExplorer,首个针对多模态大模型在《我的世界》中完成分钟级长程任务的评测基准。测试发现,当前最先进的18款模型(包括Claude、GPT、Gemini等)在需要隐藏前置条件的多跳任务上集体“考砸”,最高成功率仅41%,揭示了AI“能看不能做”的能力断层。

开发者徐小夕发布了一款名为 wx-editor 的开源微信公众号编辑器,基于 Vue 3 和自研的 JitWord 协同文档 SDK,集成了 AI 写作助手、主题切换和微信兼容导出功能。这个项目的价值在于它为公众号创作者提供了一个从写作、排版到导出均可离线完成、不依赖后端的技术方案。

微软于7月23日发布两款自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,主打不依赖第三方模型蒸馏,已集成至Bing、PowerPoint和Dynamics 365等产品中。前者降低高达84%的GPU成本,后者速度提升约2倍,直接服务企业和开发者。

Mozilla AI 团队在 ACM FAccT 2026 大会上发布了一项关于大语言模型护栏(Guardrails)的研究,核心观点是:评估护栏与评估模型本身同样重要,且护栏需要结合工具(如搜索、检索)才能更可靠地运行,尤其在多语言和人道主义场景下。

美国佛罗里达州一名55岁男子因长期依赖ChatGPT-4o提供的医疗建议,拒绝就医,最终因双肺血栓引发大面积肺栓塞而濒临死亡。他于7月21日对OpenAI及其CEO萨姆·奥尔特曼提起诉讼,指控其“无证行医”和疏忽。此案再次将AI聊天机器人的医疗建议风险推向舆论焦点。

2026年7月23日,OpenAI正式面向美国18岁以上用户推出ChatGPT Health功能,允许ChatGPT在对话中引用个人健康数据(如医生笔记、血液检测结果、Apple Health数据),提供个性化健康解读。此举在拓展AI应用场景的同时,也因隐私诉讼和医疗建议可靠性问题引发争议。

GitHub 宣布,Copilot 云端智能体(Cloud Agent)现已全面集成到项目管理工具 Linear 中。开发者可将 Linear 上的 Issue 直接分配给 Copilot,由它自动分析、生成代码、创建 Pull Request,并在工作流中持续同步进度,标志着 AI 从代码补全向异步自主开发…

特斯拉和谷歌母公司Alphabet在财报电话会上明确表示将继续加大AI基础设施投入,引发投资者对AI成本失控的担忧,导致两家公司股价分别下跌14.52%和6.89%,市场正在重新评估AI烧钱模式的可持续性。

OpenAI 于 2026 年 7 月 23 日面向全球桌面端用户(macOS 和 Windows)推出 ChatGPT Voice 功能,允许用户通过语音同时控制运行在 ChatGPT Work 或 Codex 中的多个 AI 智能体。这意味着 AI 助手从单一的对话界面,正式进入可语音调动多任务、多智能体…

BDFL 是一个面向 AI 编程代理(如 Codex、Claude Code)的开源终端监督工具,允许用户在版本化计划、并行执行、逐段审批和隔离工作环境中保持对 AI 的控制,解决了当前 AI 代码生成中缺乏审批与回滚机制的问题。