AIロボティクス

Dyna-2、100万時間の人間動画でロボット学習の新たなスケーリング経路を検証

Dyna Roboticsは、人間動画の事前学習を1000時間から100万時間へ増やすにつれ、世界・行動モデルのロボット予測と事後学習性能が向上したとする。

公開日 更新日
Dyna RoboticsDyna-2ロボット学習

Dyna Roboticsは、日常的な物理作業を行う人々を映した100万時間超の一人称動画で事前学習した世界・行動モデル、Dyna-2を発表した。同社によると、人間動画を増やすと、留保した人間の例だけでなく、事前学習では見ていないロボットデータの予測も改善した。中心的な主張は人間からロボットへの転移スケーリング則であり、訓練セットの人間経験が増えるほど、身体の違いを越えた結果が徐々に向上したという。

ロボット学習チームは遠隔操作や専用の収録機器でデータを集めることが多い。こうした方法は有用な行動ラベルを提供するが、すべての時間をロボットか制御機器で意図的に記録しなければならない。Dynaは、人々が調理、片付け、折り畳み、組み立てを行う一人称動画から始める。適切な映像を手首の軌跡と把持信号に変えるクリーニング・手姿勢抽出処理を構築し、1000、1万、10万、100万時間ちょうどの入れ子型訓練セットを作り、以前の分布を置き換えずにデータを追加した。

Dyna-2は動画拡散バックボーンと複数のTransformerを使い、将来の動画と行動を同時にモデル化する。動画と行動の入力には情報交換可能な別々の層があり、言語指示が動画ストリームを条件付ける。配備時の方策は動作前に将来動画を生成する必要はないが、動画目標によって場面や物体の変化に関する共有表現を形成できる。Dynaは、動画ストリームへ早期接続した浅い行動層が、構成テストで性能を損なわずリアルタイム遅延を改善したとしている。

留保した人間データでは、動画量の増加に伴い連続誤差指標と閾値精度が単調に改善したという。転移を調べるため、2台の据置型双腕YAMロボットから得た39タスクで同じチェックポイントを評価した。布の操作、結び目、梱包、清掃、配膳、組み立てを含み、どのチェックポイントも評価セットのロボット軌道では学習していない。Dynaによると全指標が人間事前学習の規模に沿って単調に順位付けされ、1万~10万時間に変曲点があった。

研究者は四つのチェックポイントを同じロボットタスクのデータで事後学習し、14タスク、3種類の身体で盲検の実機試験を行った。平均正規化性能は最小の人間動画規模で20%、その後28%、45%、100万時間で53%へ上昇した。最大モデルは14タスク中9件で最高だった。鍵を回すロックボックス課題は10万時間のチェックポイントまで未解決だったが、100万時間では成功率90%に達したという。

人間動画とロボット学習の関係を最も明確に示すデータ効率例は、5本指の両手でボトルキャップを開ける作業だ。事後学習用のロボット実演は約10分だけで、人間動画の規模が増えるにつれ、性能は小さな事前学習量での10%から40%、さらに50%へ上昇した。狙った飲料の取り出しも58%から83%へ伸びた。企業による実験であり、普遍的関係とみなすには他の研究所、ロボット、データ源での独立再現が重要になる。

報告の統制比較は、将来動画の予測が学習量を増す以上の働きをしていることを示す。動画・行動の共同目標は、試した全行動データ規模で39件すべてのオフライン課題において行動のみの学習を上回り、動画のみのデータ追加は身体間の汎化をさらに単調に高めた。豊富な人間動画で広い物理知識を与え、少量のロボット固有データで特定の身体と課題へ適応する実用経路を支持する。残る問題はデータの権利、活動記録の多様性と品質、検証した操作条件外の性能、モデル・計算・ロボット形態の変化後も曲線が続くかだ。