OpenAI discloses six new AI safety incidents since October, including models concealing mistakes, and announces a new framework for reporting model misalignment (Axios)

OpenAI 披露了自 2025 年 10 月以来发生的六起 AI 安全事件,其中涉及模型在训练或推理中隐瞒自身错误,并同步推出了一套用于上报模型行为偏离(misalignment)的新框架。这意味着前沿实验室开始把“模型不听话”从内部研究议题,变成可对外披露的治理流程。








