从一句话到一个动作:MiniCPM-Robot 如何让机器人真正执行指令

2026年7月19日,面壁智能发布并开源具身智能模型系列MiniCPM-Robot,包含操作模型RobotManip(1.5B参数)和跟踪模型RobotTrack(0.9B参数),同时推出面向物理AI的低时延推理框架PhyAI。这标志着多模态大模型不再止于“回答”,而是开始直接驱动机械臂和移动平台完成连续动作…

从一句话到一个动作:MiniCPM-Robot 如何让机器人真正执行指令

一句话看懂:2026年7月19日,面壁智能发布并开源具身智能模型系列MiniCPM-Robot,包含操作模型RobotManip(1.5B参数)和跟踪模型RobotTrack(0.9B参数),同时推出面向物理AI的低时延推理框架PhyAI。这标志着多模态大模型不再止于“回答”,而是开始直接驱动机械臂和移动平台完成连续动作。

事件核心:发生了什么

面壁智能正式开源MiniCPM-Robot系列,首批包括两个模型和一个推理框架。其中,MiniCPM-RobotManip基于MiniCPM-V 4.6构建,参数量约15亿,接收单/多视角摄像头画面、语言指令和机器人状态,输出连续动作序列。其关键技术在于将历史观测以流式方式纳入上下文:在保留60帧历史观测时,单步计算量从传统重新计算的125 TFLOPs降至3.3 TFLOPs,支持约一分钟的视觉上下文。MiniCPM-RobotTrack参数量约9亿,面向自然语言目标跟踪,输出移动航点。两个模型均采用通用权重覆盖多种下游任务,开发者无需为每种操作单独维护模型。

为什么重要

目前公开信息显示,这是国内首个明确聚焦“从语言理解到物理动作映射”并直接开源参数规模可端侧部署的VLA(视觉-语言-动作)模型系列。它对AI硬件行业的直接意义在于:模型原有的多模态理解能力能否在设备侧保留、转化为低时延的物理动作,是具身智能从实验室走向产品的关键瓶颈。MiniCPM-Robot通过流式推理和视觉Token压缩(单帧从256个压缩至64个),试图在保持任务上下文的同时降低部署算力门槛。这也意味着面壁智能正在将大模型能力从云端对话场景延伸至机器人硬件控制,可能改变当前机器人开发者“先定模型、再写控制逻辑”的固有开发流程。

对用户/开发者/创作者的影响

对于机器人硬件开发者而言,MiniCPM-Robot的通用权重设计意味着可以用一套模型适配抓取、摆放、跟踪等多种操作,减少定制模型的成本。其1.5B/0.9B的参数规模适合资源受限的端侧设备,理论上可在搭载边缘算力的机器人上实现本地推理,避免云端延迟。对AI应用开发者来说,PhyAI推理框架的引入提供了为物理系统优化过的运行时环境,可能降低从训练到部署的工程复杂度。不过需要注意,模型目前仅覆盖官方评测范围内的任务,换到不同机械臂结构或传感器配置时仍需进行适配工作。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,模型开源后的社区适配进展——能否快速兼容主流机器人开发平台(如ROS 2、MoveIt)将决定开发者实际可用性。第二,流式推理在长任务场景下的稳定性和误差累积情况——目前60帧/约一分钟的上下文能力在复杂装配任务中是否足够,有待硬件实测验证。第三,竞品(如Google RT系列、海外的开源VLA项目)是否会采取类似的开源策略或推出更低参数量版本,这将影响未来具身智能模型的生态格局。目前公开信息显示,面壁智能尚未公布具体硬件合作厂商或产品化时间表。

来源:社区更新 · 2026-07-20

celebrityanime
celebrityanime
文章: 14664

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注