
一句话看懂:北京智源人工智能研究院发布世界模型“悟界·RoboBrain Orca”,通过无意识与有意识两条路径学习世界规律,将视觉、语言、动作统一到一个潜在表征空间中,为通用世界基础模型奠定基础。
事件核心:发生了什么
近日,北京智源人工智能研究院发布了全新多模态表征世界模型“悟界·RoboBrain Orca”。这一模型的目标并非像ChatGPT或Sora那样专注于语言或视频生成,而是从更底层出发:让AI在脑海中形成一个统一的世界状态表征,使它能建模世界状态如何向前或向后演变。核心理念是“The World is in Your Mind”。
悟界·RoboBrain Orca将世界学习拆分为两条互补路径:“无意识学习”通过海量真实世界视频,让模型客观观察物体如何运动、场景如何变化;“有意识学习”则利用语言描述的事件、任务指令和VQA问答,帮助模型学习稀疏但具有具体意义的状态转移。这种设计类似于婴儿通过连续观察自然世界,再结合语言指导来理解因果关系。智源表示,随着训练数据的增加,悟界·RoboBrain Orca的下游任务能力可随之提升,具备持续Scaling的潜力。
为什么重要
当前AI模型往往在单一模态(语言、图像、动作)上表现优异,但缺乏对世界整体运行规律的统一理解。悟界·RoboBrain Orca的推出,试图补齐这一短板:它将视觉、语言、事件、任务意图等多模态信号组织到一个统一的世界潜在表征空间中,使得模型能同时理解物体运动、场景变化、动作后果以及事件之间的因果关系。这种范式有可能从具身智能进一步走向科学发现、复杂系统建模乃至更广阔的认知边界。虽然目前它只是多模态表征世界模型的早期版本,但可能成为通用世界基础模型的一块关键基石。
对用户/开发者/创作者的影响
对于机器人开发者:悟界·RoboBrain Orca并未在预训练中学习动作标签,但却能帮助下游机器人更好地泛化——这意味着具身模型开发可能降低对人工标注动作数据的依赖。对于AI应用开发者:该模型学到的表征可通过多种解码器读出,包括文本、图像和动作,这种多模态输出接口可能催生新的应用场景,如动态事件推理、环境交互预测等。对于关注AI行业趋势的从业者:悟界·RoboBrain Orca验证了“先学世界表征,再做具体任务”的技术路线,这可能影响未来大模型架构的设计方向。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
1. 悟界·RoboBrain Orca是否会开放API或开源模型权重?目前公开信息显示其为早期研究版本,后续开发者生态的搭建是关键观察点。2. 该模型在多模态数据规模上的Scaling效果如何?智源声称具备持续Scaling潜力,但实际能力边界需通过更多下游任务验证。3. 是否会有其他研究机构或企业(如DeepMind、OpenAI)跟进类似的世界表征学习路线?这可能会改变当前以语言/视频生成为主的AI竞争格局。
来源:InfoQ CN


