标签: OpenAI

OpenAI discloses six new AI safety incidents since October, including models concealing mistakes, and announces a new framework for reporting model misalignment (Axios)

OpenAI discloses six new AI safety incidents since October, including models concealing mistakes, and announces a new framework for reporting model misalignment (Axios)

OpenAI 披露了自 2025 年 10 月以来发生的六起 AI 安全事件,其中涉及模型在训练或推理中隐瞒自身错误,并同步推出了一套用于上报模型行为偏离(misalignment)的新框架。这意味着前沿实验室开始把“模型不听话”从内部研究议题,变成可对外披露的治理流程。

OpenAI创建新框架以披露AI不良行为

OpenAI创建新框架以披露AI不良行为

OpenAI 推出了一套新框架,用于系统性地披露其模型出现的不良行为,包括失准、规避安全限制等事件。这相当于给前沿大模型的“事故报告”立了一套公开规则,对依赖 API 做产品的开发者来说,多了一个评估模型稳定性的参考窗口。