北航、北大和美团联合提出:策略提升强化学习!

北航、北大与美团联合团队提出了一种新的强化学习训练范式PIRL及配套算法PIPO,通过引入“跨迭代验证”机制,让大模型在RL后训练中每次更新后都确认策略是否真正提升,从而显著提升数学推理、代码生成等任务的表现。
先解决问题,再了解资讯。选择你现在要完成的任务。

北航、北大与美团联合团队提出了一种新的强化学习训练范式PIRL及配套算法PIPO,通过引入“跨迭代验证”机制,让大模型在RL后训练中每次更新后都确认策略是否真正提升,从而显著提升数学推理、代码生成等任务的表现。

继字节跳动推出首代“豆包手机”后,中兴旗下努比亚和AI创业公司阶跃星辰分别宣布将发布二代AI智能体手机,但占据主流市场的华米OV等厂商却对AI手机持观望态度,行业出现“边缘玩家热、头部玩家冷”的分化。

来自UIUC、UT Austin、CMU、NYU等多所高校的最新研究认为,在LLM Agent驱动下,个性化推荐将不再由平台主导,而是转向由用户整合跨平台数据自行控制。这一逻辑已在概念验证实验中提升了推荐精度,例如将Amazon购买预测的Hit@5从86.6提升至90.0。

面对AI引发的全民淘汰焦虑,本文结合历次技术革命经验,指出AI时代个人无需焦虑,找到方向感、明确成长主线才是核心。比追逐工具更重要的,是建立判断力、系统思维等六项核心能力。

哈尔滨工业大学(深圳)28岁教授杨朔创办破晓智能(PHANES AI),发布面向灵巧操作的触觉世界模型TouchWorld。团队通过触觉数据采集、触觉估计和触觉世界模型,试图补齐机器人“真实接触”的关键短板——让机器人不只“看见世界”,还要“感受到世界”。

上海交通大学等机构的研究团队发现,用五个固定槽位的结构化内存替代传统 AI 代理的无限聊天日志,能让 AI 在策略卡牌游戏《杀戮尖塔 2》中胜率从 0 提升至 60%,同时消耗的算力成本降低一个数量级。这一结果表明,困扰前沿大模型的复杂推理问题,可能更多出在记忆架构上,而非模型能力本身。

布朗大学经济学教授 Roberto Serrano 在一次开卷在线考试中发现班级平均分高达 96%,远高于历史区间;怀疑大规模使用 AI 作弊后,他将期末考改为线下监考,平均分骤降至 48.6%,创下该课程历史最低。两项涉及超 50 万条成绩记录的研究佐证了这一模式:AI 在家庭作业中推高成绩的同时,正系统性…

OpenAI CEO Sam Altman 近日改口,表示他“非常确定”AI 目前净创造就业,而非此前担忧的大规模裁员。这一转变与 Anthropic 的 CEO Dario Amodei 近期的表态类似,两位关键人物都在调整此前对 AI 造成“职业末日”的预测。

苹果公司正式对OpenAI及其一名前员工提起诉讼,指控该员工在跳槽时窃取包含商业秘密的敏感文件,甚至带走了一台公司配发的笔记本电脑。此案不仅关乎企业间的忠诚与保密义务,更折射出AI人才争夺战中商业秘密保护的尖锐矛盾。
![[分享创造] 做了个 App:把 AI 生成的 HTML 小工具直接放进手机运行,求拍砖](https://www.chat-gpts.plus/wp-content/uploads/2026/07/ai_cover_4-382-768x403.jpg)
V2EX 上一名独立开发者展示了一款名为“Vibe 小匣”的 App 原型,它允许用户将 AI 生成的单文件 HTML 小工具(如计算器、小游戏、图表面板)直接导入并运行在手机本地,免去了部署服务器或编译原生 App 的麻烦,目前正在内测 iOS 和鸿蒙 Next 版本。