一句话看懂:中国国家数据局在业界提出诉求十天后表态,将为具身智能数据制定标准并引导地方落地,直接瞄准机器人训练数据严重短缺这一瓶颈。目前全球高质量具身智能数据仅约 10 万至 100 万小时,而基础模型需求约 1000 万小时。
事件核心:发生了什么
据 Bloomberg 与 MLex 报道,中国国家数据局在 9 月 10 日由局长刘烈宏主持的会议后表示,将制定具身智能数据相关标准,指导地方开展这项工作,并支持企业加大对数据资源的投入。参会方包括研究机构、科技公司和人形机器人组织。
值得注意的是,仅仅十天前,该局刚与七家企业座谈,企业方面提出的正是为具身智能建设公共数据基础设施、制定通用数据标准。目前公开信息显示,这是一次业界诉求与监管回应之间的快速对接。
背后是供需缺口:中国信通院估算,具身智能基础模型需要约 1000 万小时真实训练数据,而全球现有高质量数据仅约 10 万至 100 万小时。据 TechNode 报道,中国已有 70 多个具身智能训练场投入运营,覆盖半数以上省级地区,另有 46 个在建或规划中,其中约 86% 面向工业制造,主要分布在长三角、京津冀和珠三角。
为什么重要
人形机器人的约束条件已经变了。过去讨论集中在模型架构和算力,现在真正卡住的是“有多少小时的真实世界记录”。谁能规模化生产高质量训练数据,谁就更可能把具身智能基础模型推到可用水平。
中欧路径差异明显。欧盟《数据法案》已于 2025 年 9 月 12 日适用,管的是谁能访问联网产品生成的数据,也禁止用这些数据开发竞品;2026 年 9 月 12 日后投放欧盟市场的联网产品还要满足设计义务。但欧洲缺少生产数据的国家级项目,其《数据联盟战略》承诺的数据实验室至今多数未落地,最接近中国训练场的其实是企业行为——NEURA Robotics 计划建 10 个训练场馆,年底前先跑 5 个,分布欧美中三地。
这意味着标准之争可能先于模型之争发生:谁定义了数据格式、采集流程和质量门槛,谁就掌握了生态话语权。
对用户/开发者/创作者的影响
对开发者而言,统一数据标准可能降低跨平台训练和迁移成本,公共数据基础设施若落地,中小团队不必自建昂贵采集管线。对做机器人应用和 AI 应用的企业,采购时或可参考标准化的数据质量指标,而非仅看演示视频。
但别把标准等同于市场。今年一项调查显示,仅 23% 的中国受访企业对现有机器人产品满意;训练场产出的是数据小时数,不是付费客户。数据开源与闭源的路线选择,也会直接影响开发者能否拿到可用的训练集。
值得关注的后续
一是标准草案是否明确数据采集、标注、共享的具体规则,以及是否强制开放部分公共数据;二是 46 个在建训练场能否按期投运并产出可交易的数据资源;三是欧盟数据实验室和《数据联盟战略》后续执行是否补上,否则规则优势难转化为数据供给能力。
来源:The Next Web


