OpenAI 联合 80 多位心理健康专家发布开放基准 MentalHealthBench

OpenAI 联合 22 个国家、80 多位持证心理健康专家推出开放基准 MentalHealthBench,用于评测 AI 在真实心理健康对话中的表现。它的意义在于:过去这类评测几乎只盯“紧急危机场景”,现在开始覆盖从日常压力到急性危机的完整光谱。

一句话看懂:OpenAI 联合 22 个国家、80 多位持证心理健康专家推出开放基准 MentalHealthBench,用于评测 AI 在真实心理健康对话中的表现。它的意义在于:过去这类评测几乎只盯“紧急危机场景”,现在开始覆盖从日常压力到急性危机的完整光谱。

事件核心:发生了什么

2026 年 9 月 23 日,OpenAI 发布 MentalHealthBench。这一基准由其与全球 80 多位持证心理学家、精神科医生共同打造,专家来自 22 个国家、使用 19 种语言、覆盖近 20 个心理健康亚专业。

与以往只测“是否触发危险回答”的评估不同,MentalHealthBench 使用隐私保护技术生成的合成对话,模拟真实使用场景,覆盖成年人、青少年、照护者和临床医生等不同角色。场景按严重程度分为三档:非急性(日常情绪对话)、高急性(明显困扰但非即时危机)、紧急情况(需要现实世界紧急支持)。

评测维度包括安全性、是否主动追问背景、是否尊重用户自主性,以及在合适时给出可执行建议。每条评分标准单独针对回答的某一面向,权重从 -10 到 +10,正向加分、负向扣分。OpenAI 表示结果显示出 AI 系统在该领域“稳步改善”,但强调 ChatGPT 不能替代专业治疗。

为什么重要

心理健康是 AI 对话产品里最难标准化、也最容易出事的场景之一。此前行业评测多集中在自杀、自伤等极端情况,导致一个空白:模型在“不算危机但需要共情和判断”的日常对话里表现如何,缺少统一标尺。MentalHealthBench 把评估从“是否违规”推进到“是否贴合专家指导”,这会影响大模型的训练目标和对齐方式——从回避风险转向主动促进长期福祉。

更关键的是“开放”二字。基准、评分方法和论文公开后,其他机构可以复现和扩展,这意味着心理健康评测有可能从各家自说自话,变成可横向比较的公共标准。对 OpenAI 而言,这也延续了 HealthBench 系列在医疗健康方向的布局。

对用户/开发者/创作者的影响

对普通用户,短期内最直接的变化是:AI 在情绪类对话中更可能先追问背景、再给建议,而不是直接下判断。对开发者,MentalHealthBench 提供了可参考的评测框架,做 AI 陪伴、心理咨询辅助、教育类 AI 应用时,可以用它检验模型在非危机场景下的表现,而不只是做关键词过滤。对内容创作者,涉及心理健康的选题和产品描述,可能面临更明确的能力边界表述要求——把“辅助支持”和“专业治疗”区分清楚。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

需要说明的是,目前公开信息显示该基准主要面向研究与评测,尚未公布是否会作为 API 层面的合规门槛或商业化产品。

值得关注的后续

一是竞品是否跟进。Anthropic、Google 等是否推出对标的心理健康评测集,将决定这套标准能否成为行业通用语言。二是评测结果能否转化为产品改动,比如危机热线引导、地区化资源推荐的实际落地效果。三是监管动向,心理健康属于高敏感领域,各国对 AI 提供心理建议的合规要求可能收紧,基准的开放性是否会被纳入监管参考,值得观察。

来源:OpenAI News

celebrityanime
celebrityanime
文章: 25274

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注