AI 机器人
Dyna-2 用百万小时人类视频测试机器人学习的新扩展路径
Dyna Robotics 表示,随着人类视频预训练规模从 1000 小时增至 100 万小时,其世界—动作模型改善了机器人预测和后训练表现。
Dyna Robotics 推出了 Dyna-2,这是一种世界—动作模型,已在超过 100 万小时展示人们执行日常实体任务的第一视角视频上进行预训练。该公司报告称,增加人类视频数量,不仅改善了模型对留出人类样本的预测,也改善了对其预训练期间从未见过的机器人数据的预测。其核心主张是存在一条从人类向机器人迁移的扩展规律:训练集中的人类经验越多,跨越身体形态差异后的结果就会逐步变好。
机器人学习团队常通过遥操作或专用采集设备收集数据。这些方法能提供有价值的动作标签,但每个小时都必须特意用机器人或受控设备录制。Dyna 的替代方案从人们做饭、整理、折叠和组装物品的第一视角视频开始。公司建立了清洗和手部姿态提取流程,将合适片段转成手腕轨迹与抓取信号;随后创建恰好为 1000、1 万、10 万和 100 万小时的嵌套训练集,让每次更大的训练都在不替换此前分布的情况下增加数据。
Dyna-2 使用视频扩散骨干网络和 Transformer 混合架构,同时建模未来视频和未来动作。视频与动作输入拥有不同层级但可以交换信息,语言指令则对视频流施加条件。尽管部署后的策略无需先生成未来视频再行动,这一设计仍让视频目标塑造场景和物体如何变化的共享表征。Dyna 表示,在架构测试中,较浅的动作层尽早连接视频流,改善了实时延迟且没有牺牲性能。
公司称,在留出的人类数据上,随着训练视频增加,连续误差指标和阈值准确率均单调改善。为研究迁移,它在来自两套固定式双臂 YAM 机器人平台的 39 项任务上评估同一组检查点,任务涉及布料处理、打结、打包、清洁、餐饮服务和组装。所有检查点均未训练过该机器人评估集中的轨迹。Dyna 表示,每项指标都随人类预训练规模单调排序,并在 1 万至 10 万小时之间出现拐点。
研究人员随后用同一批机器人任务数据集对四个检查点进行后训练,并在 14 项任务和三种身体形态上进行盲测实体实验。随着人类视频规模从最小值升至 100 万小时,平均归一化表现依次从 20% 增至 28%、45% 和 53%。最大模型在 14 项任务中的九项表现最佳。据公司结果,一项锁箱钥匙旋转任务直至 10 万小时检查点仍未解决,却在 100 万小时达到 90% 成功率。
最清楚体现人类视频与机器人学习关联的数据效率示例,是用两只五指手打开瓶盖。Dyna 后训练只使用约 10 分钟机器人演示数据;随着人类视频规模增长,表现从较小预训练预算下的 10% 提高到 40%,再到 50%。定向取饮料也从 58% 升至 83%。这些实验由公司执行,在把这种关系视为普遍规律前,还需要其他实验室、机器人和数据来源的独立复现。
报告中的受控比较表明,预测未来视频的作用不只是增加训练量。在所有测试过的动作数据规模上,视频与动作联合目标在全部 39 项离线机器人任务中都优于仅动作训练,而加入纯视频数据又进一步使跨身体形态泛化单调提升。这支持一条实用途径:用丰富的人类视频提供广泛实体知识,再用少量机器人专用数据把模型适配到特定身体与任务。剩余问题包括数据权利、记录活动的多样性与质量、测试操控场景之外的表现,以及随着模型、算力和机器人形态改变,报告中的曲线能否持续。