新着研究 / Robotics / AI Agent / VLM
一本の人の作業動画から、ロボットの訓練動作を作るDexAgent
DexAgent
DexAgentの原論文から掲載した図です。細部はクリックして拡大できます。
原論文の図の説明を読む
Fig. 2: DexAgent converts a single egocentric human video and a task prompt into robot training data through four stages. Stage 1 decomposes the task into subgoals and identifies the manipulated objects and their key properties. Stage 2 reconstructs the objects in simulation using property-specific skills (blue) from the tool library, creating new skills when needed. Stage 3 generates robot-hand trajectories by combining optimization guided by human motion priors with code-generated motion. Stage 4 varies viewpoints and object states to produce diverse simulation data, inpaints the original human video, and retextures the augmented simulation videos for policy training.
概要
- 人の一人称動画一本と作業文から、物体の再構成、ロボット軌道、訓練用データまでを段階的に生成する。
- 各段階を物体に合った検証器で確かめ、作成した技能と検証器を次の動画で再利用する。
- 著者らの11実機課題では、生成データで学習した方策の平均成功率が63.6%だった。
補足:編集した模式図で仕組みを確認する
VISUAL EXPLAINER
図でつかむ、DexAgentの仕組み
- 01一人称動画と作業文
- 02物体と小目標の把握
- 03模擬環境と動作の検証
- 04訓練軌道の生成
原論文の説明をもとにした模式図です。処理の細部は省略しています。
研究の背景
DexAgentは、人が物を扱う一本の動画を、ロボットが学習に使える動作へ変える。多指のロボットの実演データを大量に集めるのは難しく、人の動画を利用できれば訓練例を増やせる。
ただし人の手とロボットの手は形も動く範囲も異なる。硬い物体、関節のある物体、変形する物体では、模擬環境の作り方や動作の確かめ方も変わる。固定された変換手順だけでは、長い作業の途中で誤りが積み重なりやすい。
手法
最初に映像と文章から物体の種類や性質を読み取り、作業を「つかむ」「運ぶ」「置く」のような小目標に分ける。次に、物体を模擬環境へ再構成し、関節の向きや動く範囲など、物体に合った検証器で確かめる。検証器とは、生成した結果が指定した条件を満たすか判定するプログラムである。
ロボットの手の目標姿勢を決め、動画の動きを参考にした最適化や作業用の動作生成を選んで、各小目標の軌道をつなぐ。最後に模擬環境で物体とロボットの初期状態を変え、各軌道を再検証する。描画映像の見た目も調整し、方策の訓練用データにする。
新規性
DexAgentの主張は、物体の性質ごとに手順を選び、各段階の結果を検証しながら、人の動画をロボットの訓練データへ変えることだ。関節を持つ物体や変形する物体にも、同じ固定手順を当てはめず、必要な技能と検証器を選ぶ。
既存の技能で足りなければ新たに作り、検証器とともに保存して次の動画で再利用する。著者らは、この蓄積に伴って後続の処理時間が減ったと報告している。各段階で検証に通った結果だけを次へ渡す設計も特徴だ。
従来手法との違い
比較された手法には、人の手の動きをロボットへ移す方法や、映像から場面を再構成する方法がある。著者らは各手法が扱えない段階を共通の実装で補い、生成したデータに同じ加工手順を適用して、同じ方策モデルを学習した。
実機での一連の作業ではDexAgentの平均成功率は63.6%、比較対象で最も高いSPIDERは18.2%だった。これは対象の11課題と論文の実験条件での差であり、別の手や作業環境でも同じ倍率になることは示していない。
実験結果
著者らはHOI4Dで物体再構成、OakInkで人の動作から作った軌道の物理的な成立を評価した。OakInkでは、物体の平均位置誤差が0.1メートル未満、回転誤差が0.5ラジアン未満の動画を成功とし、DexAgentは85.7%、比較中の最良手法は81.0%だった。
実機では11課題を各10回試した。著者らによると、生成軌道をそのまま再生する評価では11課題すべてで少なくとも一回成功し、生成データで学習した方策の平均成功率は63.6%だった。各課題には一本の人の実演動画を使い、方策学習向けに模擬環境で500回分のロボット実演を生成した。
応用の可能性
編集上の応用案 · 論文が実証した用途とは区別しています。
編集上の応用案:引き出しを開けて物を入れる作業の訓練データを作る。入力は作業者の一人称動画一本と、作業内容を記した文章である。出力は、引き出しの可動部分を含む模擬環境、検証済みのロボット動作、初期位置を変えた訓練用の動画と軌道とする。
担当者は再構成した引き出しの動く向きと範囲、把持から収納までの順序を確認する。その後、模擬環境で生成した複数の軌道を使って方策を学習し、実機ではまず限定した初期位置で成功率を測る。
導入時の検証
導入時の検証案 · 対象データでの再評価が必要です。
導入時の検証案:引き出しを使う一作業に絞り、動画と作業文から生成した模擬環境を担当者が確認する。関節軸、可動範囲、物体の配置、作業の小目標ごとに、生成結果と実物が合うかを記録する。
比較対象は、人の手の動きを直接ロボットへ移す既存手順とする。同じ初期状態の範囲で、模擬環境の検証通過率、実機の作業成功率、一本の動画を処理する時間を測る。失敗した段階と修正回数も残し、技能の再利用で作業が短くなるか確かめる。
限界と課題
著者らの実機評価は、特定の両手ロボット設備と11課題で行われた。物体の初期状態を変えた10回の試行で方策の成功率を測っており、長期の反復運用や設備を替えたときの成績は、この結果からは分からない。検証器が通らず予算を使い切った段階は失敗として扱う設計である。
編集上の確認点は、新しい物体に必要な技能を作る時間、検証器が見落とす物理条件、生成動画と実際のカメラ映像の差である。検証器の合格は、実機での安全や成功をそのまま保証するものではない。
出典
元のタイトル・要旨を確認する(英語)
DexAgent: An Agentic Human2Sim2Robot Framework for Dexterous Manipulation with Self-Evolving Tool Library
Human videos offer a scalable source of demonstrations for dexterous robot manipulation. However, existing human-to-simulation-to-robot (Human2Sim2Robot) pipelines rely on predefined procedures that struggle to accommodate diverse object properties and interactions, particularly those involving articulated and deformable objects. We introduce DexAgent, an agentic Human2Sim2Robot framework that converts a single egocentric human video and a task prompt into physically grounded robot trajectories for policy training. It operates through four stages: semantic understanding of human videos, property-based simulation reconstruction, robot trajectory optimization, and robot data generation. At each stage, DexAgent adapts its approach to the task and object properties by selecting suitable skills from its tool library or developing new ones when needed. Property-specific verifiers assess stage outcomes for physical validity and task-specific requirements and provide feedback for refinement, preventing error propagation through the workflow. This adaptive, verification-guided process allows DexAgent to process diverse objects and long-horizon tasks. In the final stage, DexAgent varies object and robot states in simulation to generate diverse robot trajectories from a single human video, then retextures the rendered observations to facilitate sim-to-real transfer. Newly developed skills and verifiers are retained in its tool library, making it self-evolving to accumulate reusable capabilities. This reduces processing time as DexAgent encounters more human videos. Across eleven real-world tasks, policies trained with DexAgent-generated data achieve a 3.5x higher success rate than competing baselines. Project website: https://dexagent123.github.io/.
論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。解説更新:2026-09-29