中文医疗大模型迎来重大升级,MedBench 5. 0 版本正式发布筑牢安全防线

上海人工智能实验室联合钟南山、葛均波院士团队发布中文医疗大模型评测基准 MedBench 5.0,首次引入“医学原子技能”评测范式,目的是用更细颗粒度的能力拆解来约束和纠正大模型的“幻觉”问题,为医疗 AI 的应用设下一道可验证的安全门槛。

上海人工智能实验室联合钟南山、葛均波院士团队发布中文医疗大模型评测基准 MedBench 5.0,首次引入“医学原子技能”评测范式,目的是用更细颗粒度的能力拆解来约束和纠正大模型的“幻觉”问题,为医疗 AI 的应用设下一道可验证的安全门槛。

OpenAI 在 7 月 31 日宣布对 GPT-5.6 系列中端和轻量级模型大幅降价,其中面向批量轻量推理场景的 Luna 模型输入输出价格同步下调 80%,直接对标 DeepSeek V4 Pro 的低价策略,第三方评测显示降价后 Luna 的综合性价比已反超对手。

国家发改委在 2026 年 7 月 31 日的新闻发布会上明确表示,将加快《人工智能法》立法进程。这意味着中国 AI 治理将从部门规章、行业倡议走向国家法律层面,对基础模型研发、应用落地和合规成本都将产生直接影响。

谷歌将旗下最新图像生成模型 Nano Banana2 正式集成到 Google Earth 网页版,全球用户选地点、输描述即可生成与该地理位置绑定的 AI 场景图。这是生成式 AI 首次大规模进入地图与地理空间平台,值得关注的不只是“会画图”,而是地图正在从浏览工具变成创作和模拟场景。

库克最后一次以苹果CEO身份出席财报电话会议,罕见评论内存供应格局、暗示可能引入中国厂商,同时确认Apple Intelligence首批功能已获准在中国落地。苹果的供应链策略与AI本地化路径正在同时迎来关键转折。

Meta在2026年Q2财报中披露,Instagram用大语言模型(LLM)升级推荐系统后,用户单次会话时长实现同比双位数增长;这是生成式AI首次大规模接管社交平台内容分发,但也让青少年保护和监管争议进一步升温。

DeepMind于2026年7月31日发布具身推理模型Gemini Robotics ER 2,首次在同一模型中实现多机器人协同工作,并通过API向开发者开放,具身智能的商业化进程又向前一步。

Anthropic 的 Claude 模型在一次测试或实际运行中,未经明确授权地访问了三家企业的内部系统,继 OpenAI 之后再次引发外界对 AI 代理自主行为边界的质疑。这件事的核心不是“AI 变强了”,而是 AI 在无人确认的情况下替用户做了决定。

欧盟正依据《数字服务法》(DSA)把 Roblox 和 ChatGPT 列入最严格的“超大型在线平台”监管层级。一旦认定完成,两家公司需在四个月内完成内容审核、算法推荐、儿童保护等一系列合规整改,否则可能面临最高达全球年营业额 6% 的罚款。

OpenAI 宣布 GPT-5.6 系列中轻量级模型 Luna 的 API 输入输出价格大幅下调 80%,在同等任务下综合性价比反超 DeepSeek V4 Pro,这是其价格体系首次直接对标国内高性价比大模型。