腾讯混元”合二为一”:多模态与大语言模型部门合并,姚顺雨统管冲全模态上限

腾讯于7月23日宣布,将其多模态模型部门与大语言模型部门合并,组建新的基础模型部,由腾讯首席AI科学家姚顺雨统一管理。此举旨在打破图像理解和语言生成两条技术路线的研发壁垒,集中资源冲击全模态大模型的上限。

腾讯混元

一句话看懂:腾讯于7月23日宣布,将其多模态模型部门与大语言模型部门合并,组建新的基础模型部,由腾讯首席AI科学家姚顺雨统一管理。此举旨在打破图像理解和语言生成两条技术路线的研发壁垒,集中资源冲击全模态大模型的上限。

事件核心:发生了什么

据媒体报道,腾讯在7月23日完成了一次重要的组织架构调整:将负责多模态模型(能理解图像、视频)的部门与负责大语言模型(能对话、推理)的部门合并,正式成立“基础模型部”。该部门将由腾讯首席AI科学家姚顺雨全面负责。此次合并早有征兆——去年12月,姚顺雨已出任大语言模型部门负责人。此次将多模态和语言两条线并入同一领导、同一部门,意味着腾讯在混元技术路线上将“能看图像”和“能对话”的能力整合在一个统一指挥中枢之下,为研发真正的全模态模型铺平了组织道路。

为什么重要

这一调整对AI行业具有明确的指向意义。首先,它反映出当前大模型竞争已从单一文本能力升级到多模态融合能力。此前,许多公司的大语言模型和多模态模型分属不同团队,导致“看到的”和“说出的”之间存在认知不一致、训练协同效率低的问题。腾讯此次合并,意味着在研发层面将图像理解、视频理解与语言生成视为一个整体问题来求解,这更接近人类感知与表达的自然统一方式。其次,在商业化层面,全模态模型能直接赋能腾讯的社交、游戏、广告、云服务等核心业务,例如实现更精准的图片内容审核、更自然的视频对话交互、更高效的AIGC内容创作。从行业竞争看,此举也表明腾讯正在加速追赶OpenAI的GPT-4V、谷歌Gemini等全模态领先产品,试图在组织效率上形成突破。

对用户/开发者/创作者的影响

对普通用户来说,未来使用腾讯混元系列产品时,可能会更早体验到“看图说话”与“对话推理”无缝衔接的连贯服务,例如用户上传一张照片后,AI能同时进行画面描述、风格分析并主动提问,而不是像现在这样分模块调用。对于开发者和创作者,组织合并可能带来API接口上的整合利好:未来腾讯混元的开放平台有望提供统一的多模态API,开发者只需调用一个端点,就能同时获得图像理解、文本生成、图像生成等能力,减少集成成本和调试难度。此外,内容创作者在高频使用AIGC工具(如AI作图、文案生成、视频脚本)时,也能获得更自然的产品体验,不再需要手动切换不同模型。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,以下三点值得持续跟踪:第一,合并后的基础模型部是否会在近期发布“混元全模态”新版本或对外演示视频,以展示组织整合后首个具体成果。第二,腾讯混元的API定价策略是否会因模型统一而调整,例如是否推出全模态混合计费或免费额度增加。第三,其他国内大模型公司(如百度、阿里、字节)是否也会跟进类似的组织合并,推动内部多模态与语言团队一体化,这将是检验行业趋势是否成真的重要信号。

来源:AIbase

celebrityanime
celebrityanime
文章: 15060

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注