2026 年顶尖 AI 实验室如何构建 RL 智能体:从 RLHF 到 RULER

Anthropic、OpenAI 和 DeepSeek 正在尝试把“系统提示词”直接用作强化学习的奖励函数,推动 LLM 智能体训练从 RLHF 走向一种被称作 RULER 的新范式。训练不再只依赖人类偏好打分,而是把任务目标和行为边界写进提示词里,由模型自己判断对错。

Anthropic、OpenAI 和 DeepSeek 正在尝试把“系统提示词”直接用作强化学习的奖励函数,推动 LLM 智能体训练从 RLHF 走向一种被称作 RULER 的新范式。训练不再只依赖人类偏好打分,而是把任务目标和行为边界写进提示词里,由模型自己判断对错。

一款名为 Sprocket 的 AI 代理产品在 Hacker News 上以 “Show HN” 形式公开发布,声称同时面向硬件和软件开发场景。由于演示页面目前无法访问,其实际能力仍需验证,但“AI 代理进入硬件工程”这一方向本身值得关注。

Google Cloud 在 2026 年 6 月发布 Open Knowledge Format(OKF),并于近期更新到 V0.2,试图用一套开源、厂商中立的格式,定义企业和 Agent 之间“知识”的存储与交换标准。它被看作 Agent 时代的基础设施级尝试,值得所有关注知识库和 Agent 工程化的人…

Android 生态中的 AI 助手正越来越多地获得屏幕内容访问权限,但本地处理不等于数据不出设备,也不等于不会上传。Android Police 梳理了 7 个隐私红灯,核心指向同一个问题:AI 后台读取屏幕正在成为默认选项,而用户几乎无法真正关闭。

Uber CTO Praveen Neppalli Naga 推出名为“Agentic Pods”的内部实践,把最优秀的 AI 工程师派驻到财务、法务、营销等业务部门现场重构流程。这家几个月前因“烧光 Claude Code 预算”引发行业恐慌的公司,正试图证明 AI 的价值不在堆算力,而在重新设计工作流。

前 Spotify 创新主管 Mauhan M. Zonoozy 在离职后创办音乐软件厂牌 A Vinyl Bar in Shibuya,计划推出以“参与式互动”为核心的新一代音乐平台,并正在探索 AI 功能在创作与表达中的角色。

OpenAI 内部版本的下一代模型 Astra 在数学、量子复杂度和理论计算机科学领域解决了 10 个长期未解决的开放问题,其中包含计算 permanent 的新电路下界。这项成果目前仍停留在研究阶段,但为 AI 科学推理能力设立了新的参考基准。

苹果漏洞赏金计划被大量AI生成的低质量报告淹没,不得不限制安全研究员提交漏洞;意大利一家初创公司因此无法上报一个真实存在的macOS高危漏洞,该漏洞在黑市估值最高20万美元。

前 Leuthold Group 首席投资策略师 Jim Paulsen 指出,AI 股票相对表现走弱、美国核心资本品订单近期下滑,这两个被忽视的指标可能在提前警示:持续数月的大型科技公司 AI 资本支出热潮,接下来会遇到阻力。

一项对 458 个中小企业网站的审计发现,94.8% 的网站从未在 AI 助手的购买推荐中出现;而在屏蔽 AI 爬虫的 8.9% 网站中,多数屏蔽的是训练爬虫,却很少屏蔽真正影响被引用的检索代理。