一句话看懂:alphaXiv 收录的论文提出 TouchScale,一个用统一可穿戴设备采集的 500 小时人类视触觉数据集,用于视觉-触觉学习。在机器人策略中做视觉-触觉中期训练后,四项真实接触密集任务平均成功率从 22.5% 提升到 57.5%。
事件核心:发生了什么
论文页面显示,TouchScale 由约 500 小时、87,000 个片段组成,使用同一套可穿戴采集方案:头戴 RGB-D、双腕 RGB 以及双手密集触觉测量同步记录。每只手套有 880 个 taxel,覆盖手指和手掌,记录法向压力。数据集包含约 2,000 个任务描述和超过 1,500 个物体,涵盖日常活动和结构化操作。
在零样本触觉预测上,用完整 TouchScale 训练后,对未见过的触觉传感器的接触 IoU 从 0.134 提升到 0.383。与 20 小时的 EgoTouch / TouchAnything 在约 16 小时等量训练下直接对比,TouchScale 的 cIoU 为 0.181,EgoTouch 为 0.134。机器人实验中,基于 N0-VTLA 策略,在相同 50 条机器人演示和相同后训练流程下,加入 TouchScale 中期训练后,四项任务平均成功率从 22.5% 升至 57.5%。
为什么重要
第一人称视频长期是具身学习的重要监督来源,但视频拍不到接触位置和压力变化。触觉数据能补上这块,但此前公开的视觉-触觉数据规模远小于人类视频,且常混合不同传感器和标注流程,难以判断数据规模本身的作用。TouchScale 的价值在于用统一采集协议把规模推到 500 小时,并保持传感器和同步流程固定,使“数据量增加是否带来提升”变得可观察。论文称随数据量增加,零样本触觉预测和机器人成功率整体呈上升趋势,这为视觉-触觉预训练提供了一条可扩展路径,也意味着触觉数据正在从实验室小规模走向可复用的训练资产。
对用户/开发者/创作者的影响
对机器人学习和具身智能开发者,TouchScale 计划公开全部同步视触觉记录和重建物体模型,可用于视觉-触觉预训练、触觉预测或策略中期训练。其 N0-VTLA 适配方式不需要人类动作标签,也不把人类手部动作重定向为机器人指令,降低了利用人类数据做机器人策略训练的门槛。对做触觉传感器、灵巧操作或数据采集工具的团队,统一手套和采集协议可能成为后续数据集的标准参考。普通用户短期内不会直接用到该数据集,但它指向的能力——机器人在抓取、拧瓶盖、擦拭等任务中更稳定——会逐步影响服务机器人和工业自动化的产品体验。目前公开信息来自论文摘要和项目页,尚不构成已上线产品或正式产品公告。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 TouchScale 是否按计划公开,以及公开范围是否包含全部同步视触觉记录和重建物体模型;二是该数据集能否被更多机器人策略和视觉-触觉模型复用,形成类似视觉预训练的生态位;三是统一采集协议是否被其他团队跟进,推动触觉数据规模继续增长。评测结果目前限定在这批任务、这一策略和给定条件下,不宜写成永久排名。
来源:alphaXiv


