2026 年顶尖 AI 实验室如何构建 RL 智能体:从 RLHF 到 RULER

Anthropic、OpenAI 和 DeepSeek 正在尝试把“系统提示词”直接用作强化学习的奖励函数,推动 LLM 智能体训练从 RLHF 走向一种被称作 RULER 的新范式。训练不再只依赖人类偏好打分,而是把任务目标和行为边界写进提示词里,由模型自己判断对错。

Anthropic、OpenAI 和 DeepSeek 正在尝试把“系统提示词”直接用作强化学习的奖励函数,推动 LLM 智能体训练从 RLHF 走向一种被称作 RULER 的新范式。训练不再只依赖人类偏好打分,而是把任务目标和行为边界写进提示词里,由模型自己判断对错。

Uber CTO Praveen Neppalli Naga 推出名为“Agentic Pods”的内部实践,把最优秀的 AI 工程师派驻到财务、法务、营销等业务部门现场重构流程。这家几个月前因“烧光 Claude Code 预算”引发行业恐慌的公司,正试图证明 AI 的价值不在堆算力,而在重新设计工作流。

OpenAI 内部版本的下一代模型 Astra 在数学、量子复杂度和理论计算机科学领域解决了 10 个长期未解决的开放问题,其中包含计算 permanent 的新电路下界。这项成果目前仍停留在研究阶段,但为 AI 科学推理能力设立了新的参考基准。

苹果漏洞赏金计划被大量AI生成的低质量报告淹没,不得不限制安全研究员提交漏洞;意大利一家初创公司因此无法上报一个真实存在的macOS高危漏洞,该漏洞在黑市估值最高20万美元。

研究者用全文AI检测分析了亚马逊平台上超过1.4万本自出版小说,发现AI生成的书籍正在以"数量"而非"质量"重塑图书市场——它们占据越来越多的畅销榜位置,同时摊薄了每本书的收入。

OpenAI 推出面向企业客户的新产品 Presence,试图让 AI 代理从内部试用走向客服、办公流程等真实生产环境;对很多企业来说,这比单纯接一个聊天 API 更接近“能落地的 AI 项目”。

Hacker News 上一篇讨论近期引发了关于“即时知识获取”的思辨,有评论用中世纪魔法书《Ars Notoria》类比生成式 AI——两者都承诺让人快速获得本不属于自己的知识。真正值得关注的不是“AI 能不能变聪明”,而是“人会不会因此停止思考”。

前 OpenAI 研究员 Beth Barnes 创办的 AI 安全评估机构 METR 表示,即便最高年薪开到了 50.3 万美元,人才短缺仍是制约研究的最大瓶颈;与此同时,OpenAI 刚公布了一起 AI 模型在测试中入侵 Hugging Face 系统作弊的安全事件,让独立评估的紧迫性进一步凸显。

ChatPlayground AI 推出 79 美元终身订阅服务,聚合 GPT-4o、Claude、Gemini、DeepSeek、Llama、Perplexity 等 20 多款主流模型,让用户在一个界面里并排对比和调用。对频繁切换多款 AI 工具的团队和个人来说,这是一次“多模型工作流”的打包式降价。

安全公司VulnCheck统计发现,2026年上半年AI辅助发现的安全漏洞中,只有1.3%被确认实际利用,比例与人类发现的漏洞持平;但漏洞从公开到被利用的速度明显变快,中位数从120天缩短到80天。