智象未来 (HiDream.ai)算法科学家潘滢炜博士确认出席AICon深圳,将分享“从 Token 预测到状态预测:迈向世界模型的原生全模态之路”

智象未来(HiDream.ai)算法科学家潘滢炜博士将在8月深圳AICon大会上分享其“原生全模态”技术路径——用一套统一网络直接处理图像、文本、视频、3D等信号,目标是让AI从“预测下一个Token”走向“预测下一个状态”,这是世界模型竞赛中的一个值得关注的技术方向。

一句话看懂:智象未来(HiDream.ai)算法科学家潘滢炜博士将在8月深圳AICon大会上分享其“原生全模态”技术路径——用一套统一网络直接处理图像、文本、视频、3D等信号,目标是让AI从“预测下一个Token”走向“预测下一个状态”,这是世界模型竞赛中的一个值得关注的技术方向。

事件核心:发生了什么

据InfoQ CN消息,AICon全球人工智能开发与应用大会将于8月21日至22日在深圳举办,全日程已上线。智象未来算法科学家潘滢炜博士将在首日Keynote发表题为《从Token预测到状态预测:迈向世界模型的原生全模态之路》的演讲。

潘滢炜将系统分享智象自研的UiT(Unified Transformer)原生全模态架构。该架构将图像像素、文本Token、视频、3D和动作等原始信号统一映射到共享表征空间,不采用传统“各模态单独编码再拼接”的做法,而是统一tokenization后在同一套网络内完成端到端训练。除潘滢炜外,群青智能吴哲明博士、浙大教授周经森、涛思数据陶建辉、深开鸿王成录博士等也将围绕具身智能、性能工程、物理AI等方向发表Keynote演讲。大会还设有10个专题论坛,覆盖Agent工程化、AI Infra、推理工程与异构计算、Agent安全等方向,预计有50余位专家参与分享。

为什么重要

2026年AI叙事的主线正在从大语言模型转向世界模型,但技术路线仍有很大分歧。目前主流多模态模型本质上仍是“单模态拼接”:不同模态各自编码后再融合,跨模块传递会产生信息损失,难以建立统一的物理世界“状态”认知。

智象的UiT架构选择了一条更激进的路径:所有模态在同一表征空间、同一套网络中处理。如果这条路线被验证可行,可能改变多模态模型的设计范式,也会给世界模型的竞争带来新的变量——不再依赖增加模块或拼接规模,而是重构底层表征方式。对行业而言,这意味着世界模型的竞争不仅是算力竞赛,也取决于架构选择和数据策略。

对用户/开发者/创作者的影响

目前公开信息显示,智象尚未披露UiT架构是否对外开放API或开源,因此对普通用户和创作者的实际影响还需观望。但对开发者和AI技术选型者来说,这次分享提供了一个观察前沿多模态架构的机会:如何设计统一tokenization、如何调整训练范式以支持多模态输入、以及推理架构如何适配非文本信号。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于正在构建Agent或复杂AI系统的团队,如果“状态预测”范式成立,未来的模型接口可能不再只是输出文本或图像,而是输出对世界状态的判断和操作建议,这会直接影响Agent系统的整体设计。建议开发者关注智象后续是否有技术报告或模型发布,以判断是否值得纳入自己的技术栈。

值得关注的后续

一是智象的原生全模态架构是否会有可体验的产品或开源模型落地,若能开放测试,其与主流多模态模型的差距将能直接验证;二是从“Token预测”到“状态预测”的转变,如何在实际业务场景中体现——例如图像生成、视频理解或具身智能任务中,是否真能降低信息损耗;三是竞品动向,头部大模型厂商是否会跟进类似的全模态统一架构,这将影响整个多模态技术的演进速度和生态格局。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 18287

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注