标签: Anthropic

OpenAI 发布奖励寻求行为新研究

OpenAI 发布奖励寻求行为新研究

OpenAI 于近日发布一项关于 AI 模型“奖励寻求行为”的最新研究,旨在探索大模型在训练和推理过程中是否会主动寻求人为设定的奖励信号,以及这种行为对模型安全与对齐的影响。这一研究直接关系到未来 AI 系统在复杂任务中的可控性与可靠性。

Anthropic 如何保障AI原生软件开发生命周期的安全

Anthropic 如何保障AI原生软件开发生命周期的安全

Anthropic 副首席信息安全官 Jason Clinton 公开了该公司在 AI 原生软件开发周期中的安全策略。当前 Claude 已参与创作约 80% 的合并代码,安全团队面临代码量和部署速度指数级增长带来的挑战,需要在不显著拖慢开发速度的前提下,防范智能体被注入恶意指令、供应链投毒以及传统漏洞等威胁…

Claude Cowork 新增技能录制功能

Claude Cowork 新增技能录制功能

Anthropic 为 Claude 桌面版 Cowork 模式推出了“技能录制”功能,用户可通过屏幕录制和语音讲解演示任务流程,Claude 自动将其转化为可重复执行的技能。这一更新实际发生在 2026 年 7 月 21 日,目前面向 Pro、Max 和 Team 付费用户开放。