Reka AI 的全模态模型 Rho-1 可在单一模型中处理文本、图像、视频和机器人控制

Reka AI 发布了 190 亿参数的全模态模型 Rho-1 研究预览版,单一神经网络同时处理文本、图像、视频和机器人控制,不走工具调用或多模型拼接路线。这值得关注,因为它代表了“世界模型”方向的一次具体工程验证。

一句话看懂:Reka AI 发布了 190 亿参数的全模态模型 Rho-1 研究预览版,单一神经网络同时处理文本、图像、视频和机器人控制,不走工具调用或多模型拼接路线。这值得关注,因为它代表了“世界模型”方向的一次具体工程验证。

事件核心:发生了什么

Reka AI 于 2026 年 10 月发布 Rho-1 的研究预览版。这是一个 190 亿参数的全模态模型,能在同一个神经网络内处理和生成文本、图像、视频以及机器人控制动作。与多数将任务分发给专用模型的 AI 系统不同,Rho-1 把所有模态当作 token 放进同一个共享上下文窗口,不依赖工具调用或外部模型。

据公开信息,该模型可实时生成连续视频,并在不重启的前提下响应新指令。用于预测摄像头画面的同一套权重,也直接驱动机器人运动。为缓解机器人训练数据稀缺的问题,Reka AI 构建了一个逆动力学模型,从普通互联网视频中提取控制信号。训练使用了 320 块 H100 GPU,历时约三个月。

Reka AI 并非多模态新手。2024 年 4 月,该公司推出 Reka Core,一个在多模态基准上与 GPT-4、Claude 3 和 Gemini Ultra 竞争的语言模型。

为什么重要

当前主流多模态产品多为“路由式”架构:文本交给语言模型,图像交给视觉模型,控制交给专用策略网络。Rho-1 选择在单一模型、单一上下文里完成所有模态,指向一种更接近“世界模型”的技术路线——模型不只是理解内容,还要能预测和驱动物理世界的动作。如果这条路走通,模型对跨模态因果关系的建模能力可能更强,系统集成复杂度也会下降。

从竞争格局看,Reka AI 作为相对小型的团队,选择与头部实验室在技术路线上正面竞争,说明全模态统一建模正在成为一条被认真投入的方向。用互联网视频补机器人控制数据,也为数据稀缺场景提供了一种可复用的思路。

对用户/开发者/创作者的影响

对开发者而言,目前 Rho-1 仍是研究预览,官方未公布 API 定价、调用限制或开源计划,短期内不适合直接接入生产环境。但它提示了一种新架构:如果未来开放 API,开发者可能不再需要为视频理解、动作生成分别拼接多个模型,接口形态会更统一。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对内容创作者,实时连续视频生成和动态响应指令的能力,意味着交互式视频、动态分镜类工具可能出现新形态,但 190 亿参数模型的推理成本尚不明确。对企业采购方,是否跟进这类全模态方案,需要先观察其稳定性、延迟和合规情况。对机器人方向的研究者,逆动力学模型从普通视频提取控制信号的做法值得进一步验证。

值得关注的后续

一是 Rho-1 是否会从研究预览走向正式产品,并公布 API 价格与访问门槛。二是 Reka AI 是否开源模型权重,或仅提供闭源接口。三是同类全模态模型是否跟进,以及“世界模型”方向能否在机器人任务上给出可复现的评测结果。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 27466

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注