
一句话看懂:前 OpenAI 研究员田永龙被曝已加入腾讯,将主导混元大模型的多模态视觉语言模型(VLM)研发。这是继姚顺雨之后,又一位具备 OpenAI 核心研发背景的人才加入腾讯,反映出腾讯在大模型领域正在持续加大投入,特别是在多模态和视觉理解方向。
事件核心:发生了什么
据行业信息,田永龙(Yonglong Tian)已于近期加入腾讯,预计担任腾讯混元多模态模型方向的负责人,主导视觉语言模型的开发。该消息尚未得到官方正式确认,但已在业内引发广泛关注。田永龙此前在 OpenAI 担任技术成员,并与腾讯现任首席 AI 科学家姚顺雨在 OpenAI 共事过。他的学术背景包括清华大学本科、香港中文大学 MMLab 硕士以及麻省理工学院(MIT)博士,研究方向从传统视觉识别逐步拓展至生成模型与表征学习。其提出的“监督对比学习”(Supervised Contrastive Learning)对视觉预训练模型的设计产生了重要影响;近期的“Fluid”系列工作则探索了自回归图像生成中连续 token 的优越性。在此之前,他还曾在 Google Research 及 Google DeepMind 工作。自 2025 年 4 月腾讯正式设立大语言模型部与多模态模型部后,团队已陆续吸纳来自微软、阿里、清华等多位资深研发人才。
为什么重要
此次人事变动,腾讯明显是在补齐多模态大模型的关键技术短板。过去腾讯在大模型上的布局曾被外界视为偏分散、资源整合不足。田永龙在视觉与生成模型上的积累,尤其是在 OpenAI 期间对 GPT 系列与多模态技术的近距离参与,直接对应了当前工业界最热门的视觉语言模型(VLM)和图像生成能力。他的加入,意味着腾讯混元在视觉感知、表征学习与图像生成这三条技术线上,有了更强的核心研发带头人。与此同时,这也让腾讯与大模型领域的顶尖人才库产生了更直接的连接——继姚顺雨后,又一位来自 OpenAI 的核心成员落地中国大厂,侧面印证了全球顶尖 AI 人才在组织间的加速流动。
对用户/开发者/创作者的影响
对普通用户而言,混元多模态能力的提升将直接影响腾讯旗下产品的 AI 功能体验,包括但不限于微信、QQ、腾讯广告、企业微信等场景中图片理解、图文生成、视频分析等能力的落地速度和质量。对开发者和企业客户来说,田永龙主导的视觉语言模型如果通过混元 API 对外提供服务,可能会带来更强的图像理解与生成能力,以及更低的调用成本。对于内容创作者,尤其是需要批量生成或编辑图片、视频素材的用户,未来通过腾讯生态的 AI 工具,可能获得更高效、更可控的视觉内容创作支持。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,田永龙主导的视觉语言模型是否会作为混元 API 的独立能力对外发布,以及开放时间表。第二,腾讯在图像生成领域是否会推出类似 DALL-E、Midjourney 的闭源商用产品,还是走开源生态路线。第三,他的研究方向中“连续 token”生成路线是否会改变当前图像生成模型的训练与推理效率,进而影响开发者对算力需求的选择。这些都需要等产品落地后才有更清晰的判断。
来源:AIbase


