腾讯大模型迎来人事大地震:姚顺雨掌舵基础模型

腾讯混元大模型团队迎来重大人事调整,原 xAI 多模态理解负责人芦旭东加入,整个多模态团队并入由姚顺雨全权掌管的“基础模型部”。这标志着腾讯在 AGI 竞争下半场,明确将多模态能力收拢到基础模型主线,而非继续走独立的“世界模型”路线。

一句话看懂:腾讯混元大模型团队迎来重大人事调整,原 xAI 多模态理解负责人芦旭东加入,整个多模态团队并入由姚顺雨全权掌管的“基础模型部”。这标志着腾讯在 AGI 竞争下半场,明确将多模态能力收拢到基础模型主线,而非继续走独立的“世界模型”路线。

事件核心:发生了什么

据 AIbase 报道,腾讯混元多模态团队近期完成一轮密集的人事与战略重组。原 xAI 多模态理解负责人芦旭东正式加入腾讯混元,出任多模态内容生成算法负责人;此前担任多模态理解负责人的胡寒已离职创业;OpenAI 前研究员田永龙也同期加入团队。

在组织架构上,腾讯已将大语言模型部门与多模态模型部门合并为“基础模型部”,由姚顺雨全权负责。在此之前,腾讯混元的多模态技术布局覆盖了文生视频模型 HunyuanVideo(2024 年底发布,当时为最大的开源视频生成模型)、图像生成从 HunyuanImage 到 2.1 版原生 2K 分辨率、再到 80B 参数的 3.0 版本,以及 3D 模型 Hy3D 和开源 3D 世界生成模型 Hy World 1.0。

为什么重要

这次调整的实质是技术路线之争的落定。目前行业对多模态与智能主线的定位存在明显分歧:李飞飞领衔的 World Labs 认为世界模型是空间智能的一部分,是通往 AGI 的重要主线;而 DeepSeek 一派主张视觉模态应作为语言模型的工具,弱化独立 3D 或世界模型的路径。

从姚顺雨上任后的布局和旗舰产品 Hy3 的发布来看,腾讯明显选择后者。姚顺雨公开强调,AI 下半场的竞争壁垒在于上下文与推理能力,而非参数规模。把多模态理解能力深度整合进基础模型主线,优化工具调用稳定性和长上下文支持,意味着腾讯不再把多模态视为一个平行的独立赛道,而是服务于推理主干的“感知输入”。芦旭东的加入正是为了增强多模态理解能力,从而解决生成模型中一致性差、空间稳定性不足等痛点。

对用户/开发者/创作者的影响

对于开发者和企业用户,这次调整的直接影响体现在 API 和工具链的整合方向上。如果多模态能力被收拢进基础模型,那么混元的 API 接口、上下文窗口、工具调用能力有望进一步统一,开发者在构建 GUI Agent、办公自动化等场景时,可能不再需要分别调用图像、视频、3D 等多个独立模型,而是通过一个更完整的基础模型完成多步骤任务。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者而言,HunyuanVideo 和 Hy3D 等生成工具短期内依然可用,但后续迭代方向可能更偏向“理解驱动生成”——即模型先理解场景和指令,再生成内容,而不是单纯追求输出分辨率或参数规模。这意味着生成结果的稳定性和可控性可能比视觉惊艳度更受重视。

值得关注的后续

目前公开信息显示,这次调整的落地效果还需时间验证。有三个具体观察点值得跟踪:

一是芦旭东主导的多模态内容生成算法是否会在近期产品中体现为可感知的改进,比如 Hy3 在长视频生成或 GUI Agent 操作中的稳定性;

二是腾讯混元的多模态 API 是否会有定价或接口层面的调整,以配合“基础模型主线”的战略收敛;

三是竞品的反应——字节跳动的豆包大模型和阿里通义千问在多模态路线上各有布局,如果腾讯通过这次整合在推理能力上形成差异化,可能进一步加剧国内大模型厂商在 Agent 场景的竞争。

来源:AIbase

celebrityanime
celebrityanime
文章: 19091

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注