DeepSeek埋基建智谱亮牌:RSI从口号进入工程阶段

两份内部文档显示,中国头部大模型团队已在工程层面推进"AI改进AI":DeepSeek在做智能体自建训练环境的RL基建,智谱则直接把RSI(递归自我改进)写进了公开叙事。值得关注的是,这一闭环若跑通,人类工程师的角色可能从执行者转向审批者。

一句话看懂:两份内部文档显示,中国头部大模型团队已在工程层面推进”AI改进AI”:DeepSeek在做智能体自建训练环境的RL基建,智谱则直接把RSI(递归自我改进)写进了公开叙事。值得关注的是,这一闭环若跑通,人类工程师的角色可能从执行者转向审批者。

事件核心:发生了什么

据社交平台用户 @xiax0603 于2026年10月10日发布的分析,两份文档放在一起看,指向同一个方向:中国头部大模型团队已在内部把”AI改进AI”从概念推进到工程阶段。

DeepSeek走的是基建路线。梁文峰署名论文中的DSec系统,针对的是agentic RL对海量交互环境的依赖——人工搭建速度跟不上训练需求。其思路是让智能体在训练沙箱中自行构建环境,通过pack_diff做增量磁盘快照,支持随时checkpoint并恢复成新sandbox,把一次对话固化为可复用的训练关卡。配套还有内部质检平台、构建者与运行时账号隔离、数据残留清理等设计。发帖者认为,这套系统虽未使用RSI之名,但正是RSI所需的地基。

智谱走的是公开定义路线。其公开文档直接写出RSI全称:”能够完全自主地设计和训练自身后续版本的系统”。案例是GLM-5.3驱动Infra Agent,在10万+国产芯片集群上从零搭出生产级推理服务,GLM-5.3-Flash全部生产流量跑在这套系统上。智谱同时承认”尚未达到目标,雏形初现”,但已将该词写入官方叙事。需注意,以上为发帖者转述,论文摘要与内部讨论不等于已上线的对外产品能力。

为什么重要

RSI(递归自我改进)长期停留在理论讨论,如今两家团队的路径差异,反映出竞争焦点可能从单模型跑分转向”自我改进闭环”的运转效率。DeepSeek选择先补齐RL训练环境与数据基础设施,解决的是燃料问题;智谱选择公开定义赛道,抢占叙事位置。目前公开信息显示,Qwen、Kimi、混元、MiMo等团队大概率也在布局,只是尚未到公布节点。若闭环成立,大模型迭代周期可能进一步压缩,头部团队与追赶者的差距或从算力、数据扩展到工程体系本身。

对用户/开发者/创作者的影响

短期看,普通用户和开发者不会立刻感知到RSI能力,API与产品形态暂时不变。真正先受影响的是做Agent和RL训练的开发者:若环境自建、快照复用的工具链逐步对外开放,搭建训练环境的成本可能下降。企业采购方需要留意的是,智谱称GLM-5.3-Flash生产流量已跑在其自建推理系统上,这类自部署能力若成熟,国产芯片集群上的推理成本与交付周期或成为评估指标。创作者环节暂时不会被直接改变,但模型迭代变快可能让应用层的适配节奏更紧。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是DeepSeek的DSec相关系统是否公开、是否进入论文正式评审或开源工具链;二是智谱RSI叙事是否对应可调用、可验证的产品或API,而非仅停留在文档表述;三是未来半年内,各家模型迭代是否从单一版本发布转向披露自我改进流程的效率数据。

来源:@xiax0603

celebrityanime
celebrityanime
文章: 28689

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注