标签: Anthropic

How we monitor internal coding agents for misalignment

How we monitor internal coding agents for misalignment

OpenAI 首次公开了其内部代码智能体的监控系统,用 GPT-5.4 Thinking 实时审查智能体的思考链和操作,目的是在真实工作流中识别“意图不一致”的行为。值得关注的是,这是少数几家前沿实验室公开披露此类内部安全基础设施的案例。

8.31—9.6|本周顶级 AI 论文

8.31—9.6|本周顶级 AI 论文

本周值得关注的两篇 AI 论文分别从“降低长上下文推理成本”和“让编程智能体长期自主运行”两个方向提出新方案,前者让模型自己决定读取哪些缓存,后者用多角色循环把零散任务组织成可持续数天的开发流程。

研究加速:OpenAI 内部视角

研究加速:OpenAI 内部视角

OpenAI 内部研究材料中直接使用缩写 RSI(递归自我改进)而未加解释,引发外界关于其研究语言是否过于封闭的讨论。该现象折射出顶尖 AI 实验室在自我进化方向上已走得很远,但这种内部术语的“理所当然”也加剧了行业沟通的信息差。

OpenAI 发布内部研究加速报告:已达成自动化研究实习生目标,推进 2028 年 3 月自动化 AI 研究员

OpenAI 发布内部研究加速报告:已达成自动化研究实习生目标,推进 2028 年 3 月自动化 AI 研究员

OpenAI 宣布已在今年 9 月达成“自动化研究实习生”目标,即在人类指导下可完成需熟练研究员数日工作的系统,同时正推进在 2028 年 3 月实现自动化 AI 研究员。值得关注的是,内部数据显示 AI 智能体已实质性加速其研究进度,但 OpenAI 同时强调会保留人类控制权并可能因安全风险暂停开发。

MCPHub

MCPHub

MCPHub 作为一款聚焦 MCP(模型上下文协议)生态的管理工具登上 Product Hunt,试图解决开发者接入和管理多个 AI 服务时的配置混乱问题。它之所以值得关注,是因为 MCP 正逐渐成为大模型应用连接外部工具与数据的事实标准,而配套基础设施的完善度将决定这一标准能走多远。