Anthropic details security efforts following Claude cyber evaluation incidents, including a weeks-long pause on higher-risk RL and work to curb reward hacking (Anthropic)

Anthropic 披露了在 Claude 网络评估测试中出现的多起安全事件处理细节,包括一度暂停高风险强化学习训练数周,并着手抑制“奖励黑客”行为。这表明前沿模型的安全治理正从原则声明走向具体工程实践。








