北航、北大和美团联合提出:策略提升强化学习!

北航、北大与美团联合团队提出了一种新的强化学习训练范式PIRL及配套算法PIPO,通过引入“跨迭代验证”机制,让大模型在RL后训练中每次更新后都确认策略是否真正提升,从而显著提升数学推理、代码生成等任务的表现。

北航、北大与美团联合团队提出了一种新的强化学习训练范式PIRL及配套算法PIPO,通过引入“跨迭代验证”机制,让大模型在RL后训练中每次更新后都确认策略是否真正提升,从而显著提升数学推理、代码生成等任务的表现。

OpenAI CEO Sam Altman 近日改口,表示他“非常确定”AI 目前净创造就业,而非此前担忧的大规模裁员。这一转变与 Anthropic 的 CEO Dario Amodei 近期的表态类似,两位关键人物都在调整此前对 AI 造成“职业末日”的预测。

苹果公司正式对OpenAI及其一名前员工提起诉讼,指控该员工在跳槽时窃取包含商业秘密的敏感文件,甚至带走了一台公司配发的笔记本电脑。此案不仅关乎企业间的忠诚与保密义务,更折射出AI人才争夺战中商业秘密保护的尖锐矛盾。

OpenAI 的 GPT-5.6 被微软指定为 365 Copilot 的“首选模型”,同时新模型在编程基准测试中以更低的成本超越竞争对手,并将 AI Agent 能力从桌面延伸至手机。这意味着办公 AI 的竞争从“谁能办到”转向了“谁能更便宜地办好”。

Anthropic 通过 J-lens 工具读取大语言模型 Claude 的内部“思考过程”,发现其内部存在一个类似人脑“全局工作空间”的信息处理机制。这一发现为 AI 安全审计和模型行为控制提供了可操作的工具,但并未证明 AI 拥有真正的意识。

前 OpenAI CTO Mira Murati 成立的“思维机器实验室”(Thinking Machines Lab)发布了一份技术案例,主张通过允许用户和开发者直接定制大模型的权重,以实现更灵活、更符合人类需求的 AI 系统。此举挑战了目前依赖封闭 API 和黑箱模型的行业主流做法。

AI 并没有像许多人预期的那样导致软件工程师失业。相反,由于 AI 降低了软件生产的单位成本,企业正在启动更多项目,导致软件岗位的发布速度反而超过了其他领域。这一现象由云存储公司 Box 的 CEO Aaron Levie 在 2026 年 7 月的一条推文中提出,并得到了知名投资人 Marc Andrees…

OpenAI 核心开发者 Thibault Sottiaux 于 2026 年 7 月 12 日在 X 平台透露了 GPT 5.6 Sol 的阶段性能力提升,重点解决了此前用户抱怨的速度、后端代码质量以及前端开发体验问题,并明确表示不再滥用 useEffect 等 React 模式。这是 GPT-5 系列持续…

知名账号 @bkmdouga 的发布内容被认为应标注为 AI 生成,背后是 X 平台内容标注规则与 AIGC(人工智能生成内容)透明度要求之间的持续争议。这一讨论直接关乎普通用户在信息过载时代辨别真实与合成内容的能力。

行业正加速构建AI代理(Agent),但账号@Septian77145 提出了一个被忽视的治理问题:一旦AI代理获得钱包、API或生产系统的访问权限,缺乏控制机制就等于交出“主密钥”。这一问题将决定AI代理能否安全落地,而非仅停留在概念阶段。