Reka 发布 Rho-1:一种 19B 全推理模型,可同时理解、生成视频和输出机器人动作

Reka 发布 19B 全推理模型 Rho-1 研究预览版,用一个神经网络同时理解与生成文本、图像、视频,并直接输出机器人动作。它把过去需要多个专用模型接力完成的任务压缩进单一上下文,试图替代多模型拼接的 Agent 流水线。

一句话看懂:Reka 发布 19B 全推理模型 Rho-1 研究预览版,用一个神经网络同时理解与生成文本、图像、视频,并直接输出机器人动作。它把过去需要多个专用模型接力完成的任务压缩进单一上下文,试图替代多模型拼接的 Agent 流水线。

事件核心:发生了什么

2026 年 10 月,Reka 推出 Rho-1 的研究预览。这是一个从零训练的 19B 参数模型,文本、视觉和机器人动作被统一编码为 token,放进同一个上下文窗口。在官方演示中,模型用 5 轮对话完成画灯塔、框选、生成动画、改造成暴风雪场景并解释差异,全程没有调用外部工具或第二个模型。

技术上有两点值得注意:一是架构采用双专家流,理解流处理语言和视觉解析,生成流把 latent 去噪成图像和视频,两者共享注意力和同一份 KV cache;二是蒸馏版本把去噪步数从 99 步压到 8 步,官方称约 1 秒可产出 5.3 秒视频片段。模型训练使用 320 张 H100、耗时约 3 个月,视频生成上限为 672×384。目前仅通过邮件开放研究预览,没有公开权重、API 或定价。

为什么重要

当前主流多模态系统本质是流水线:主模型规划,再把任务分发给图像、视频、检测等专用模型。每次交接都带来延迟,专用模型也只能看到狭窄的局部请求。Rho-1 的思路是把这些交接全部取消,让理解、生成和动作输出共享同一状态。如果这条路走通,Agent 架构的复杂度、成本和响应速度都会被重新定义。

从竞争格局看,Rho-1 的差异化在于“原生视频生成 + 连续动作输出”同时具备。对比 ByteDance BAGEL、BAAI Emu3.5 和 Google Genie 3,Rho-1 是少数直接输出机器人动作通道的模型,但目前不开源、无公开权重,与 Emu3.5、BAGEL 的 Apache 2.0 路线形成鲜明对比。这更像是一次技术方向宣示,而非可直接落地的产品发布。

对用户/开发者/创作者的影响

对开发者而言,Rho-1 提出的“单模型替代多模型流水线”值得跟踪,但现阶段无 API、无权重、无定价,无法接入实际项目。真正可参考的是它的设计思路:用离散 token 承载语言与符号推理,用连续 token 承载图像、视频和动作,共享注意力而非拼接模块。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对机器人方向的研究者,Rho-1 在 LIBERO 仿真中输出 7 个动作通道,并配合其 Inverse Dynamics Model 从原始视频推断控制信号,绕开稀缺的遥操作数据,这一组合思路有实际借鉴价值。对内容创作者,视频生成速度提升和连续 rollout 能力是潜在利好,但 672×384 的分辨率上限意味着短期内难以用于正式生产。

值得关注的后续

一是研究预览之后是否开放权重或 API,这决定它能否进入开发者的实际工作流;二是 99 步到 8 步的蒸馏效果是否在第三方独立测试中复现,目前所有性能数据均来自 Reka 内部测试;三是视频分辨率上限和机器人动作精度能否在后续版本中提升,以及 ByteDance、BAAI 等开源阵营是否会跟进类似的“全能单模型”路线。

来源:MarkTechPost Research

celebrityanime
celebrityanime
文章: 27562

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注