AI ResearchNotes.法人向けのご案内 ↗
← 検索結果に戻る

人の道具使用動画を道具の姿勢に変え、ロボットの動作へつなぐ

P2P-T

保存した記事を見る
原論文の図

P2P-Tの原論文から掲載した図です。細部はクリックして拡大できます。

原論文の図の説明を読む

Fig. 3: Overview of the P2P-T pre-processing pipeline. We first extract the tool from the background environment to create a 2D segmentation mask. The mask and the raw RGB frames are subsequently fed into SAM 3D  [ 2 ] , which outputs a high-fidelity, instance-specific 3D tool mesh. Finally, FoundationPose  [ 3 ] takes the reconstructed 3D mesh and the sequence of raw video frames as inputs to compute and track precise 6D tool poses across the entire demonstration sequence.

出典:P2P-T / arXiv ↗

概要

  • 人の道具使用動画から、道具の位置と向きの軌道を取り出して学習する。
  • 将来の道具姿勢の予測を、ロボット固有の動作を作る方策へ渡す。
  • 六つの実機課題で平均成功率0.57を報告し、最良の比較手法は0.33だった。
補足:編集した模式図で仕組みを確認する

VISUAL EXPLAINER

図でつかむ、P2P-Tの仕組み

左から右へ読む
  1. 01人の道具使用動画
  2. 02道具姿勢の抽出
  3. 03将来姿勢の予測
  4. 04ロボット動作の生成

原論文の説明をもとにした模式図です。処理の細部は省略しています。

研究の背景

ロボットに道具を使わせるには、つかむだけでなく、向きを合わせ、接触を保ちながら動かす制御が要る。実機の操作データを大量に集めることは難しく、人の動画を使う研究でも人の手とロボットの手先を対応付ける工程が負担になる。

P2P-Tは、道具の動きに着目してこの隔たりを扱う。人の実演から得た道具の姿勢を、ロボット固有の動作を学ぶ手掛かりにする。

手法

まず動画内の道具を切り出し、三次元形状を作って各時刻の「六自由度姿勢」を推定する。六自由度姿勢とは、三次元空間での位置と向きを合わせた表現である。得た軌道を人が確認した後、現在の画像、作業指示、姿勢から将来の道具の動きを予測するモデルを学習する。

次に、その予測をロボットの画像や自身の関節などの状態と合わせ、短い動作列を作る方策へ渡す。たとえばブラシ作業なら、道具の向きと移動の見通しを使って次の動作を決め、新しい画像が入るたびに計画を更新する。出力はロボットが実行する動作列である。

新規性

P2P-Tは、人の手の動きをロボットの手先へ直接対応付ける代わりに、道具そのものの位置と向きの変化を学ぶ。人とロボットで形が違っても共有しやすい表現を中間に置く設計である。

動画から道具の姿勢を取り出す処理と、将来の姿勢を予測するモデル、ロボット固有の動作を作る方策をつないだ。著者らは、人とロボットの動きを対にした学習データを使わずに道具操作を学べると主張する。

従来手法との違い

著者らが挙げる従来の人の動画を使う方法には、人とロボットの動作を対応付けるデータを後段で要するものがある。P2P-Tでは道具の姿勢を中間表現にし、ロボットの動作データは後段の操作方策を学ぶために使う。

実機比較では最も高かった比較手法π0.5の平均成功率0.33に対し、P2P-Tは0.57だった。これは同じ六課題の条件で得た値であり、あらゆる道具や作業への優位を示すものではない。

実験結果

著者らは事前学習に3,094本、17種類の道具を含む動画を用いた。実機評価はハンマー、カップ、ブラシ、ドライバー、ナイフ、スプーンの六課題で、各手法を課題ごとに100件の実演で調整し、各課題50回試した。

平均成功率はP2P-Tが0.57、比較手法中で最高のπ0.5が0.33で、著者らは約73%の相対改善と報告する。実行頻度は双方30 Hzと表にある。前処理では追跡品質の確認後に動画の27%を除外している。

応用の可能性

編集上の応用案 · 論文が実証した用途とは区別しています。

編集上の応用案:作業台でブラシを使う反復作業を対象に、人による手本動画から道具の軌道を学ぶ。入力はブラシを使う動画、作業指示、実行時の画像とロボットの状態とする。

出力はブラシの将来の動きを踏まえたロボット動作である。まずブラシの追跡結果を人が確認し、少量のロボット実演で後段の方策を調整する。毛先の接触を保って指定範囲を掃けるかを、実機で評価する。

導入時の検証

導入時の検証案 · 対象データでの再評価が必要です。

導入時の検証案:ブラシ一種類と一つの作業に対象を絞り、人の動画から得た道具軌道の追跡誤りと除外率を記録する。後段のロボット実演は同じ条件で集め、姿勢の手掛かりを使う方策と、使わない方策を比べる。

成功率は道具の初期位置を変えた複数回の実機試行で測る。作業完了に加え、接触が途切れた回数、位置合わせの失敗、動作の更新頻度を記録する。対象外の道具へ進む前に、軌道抽出の品質を確認する。

限界と課題

著者らの前処理は完全な無人処理ではない。道具追跡の結果を人が確認し、不正確な動画を除外した割合は全体で27%だった。回転が追いにくいドライバーでは除外率が37.875%と報告されている。

編集上の確認点は、対象の道具を安定して追跡できるか、接触や力加減を姿勢情報だけで十分に導けるかである。評価は示されたロボット、六課題、各課題100件の実演を用いる条件に限られる。

応用先の候補
研究内容と応用案に基づく分類です。業界での導入実績を示すものではありません。

出典

元のタイトル・要旨を確認する(英語)

From Pixel to Poses: Object-centric Tool Manipulation Learning from Human Demonstrations

Scaling up robotic manipulation is primarily bottlenecked by the scarcity of real-world robot data. While recent approaches leverage human video demonstrations to mitigate this shortage, they remain computationally expensive and still rely on paired human-robot data for domain alignment. Although current state-of-the-arts excel at long-horizon tasks, they struggle with the delicate and precise control required for complex tool manipulation. To overcome these limitations, we introduce P2P-T, from Pixel to Poses for Tool Manipulation, a data-efficient, object-centric framework that learns tool use directly from human demonstrations. P2P-T bridges the cognitive and physical execution gap through a two-stage approach. First, pretraining an object-centric world model to extract stable pose priors; second, integrating these priors into an efficient, pose-aware low-level policy. By utilizing a robust automated data processing pipeline powered by modern foundation models, P2P-T completely bypasses the need for human-robot aligned data. This reduces overall training overhead drastically. With minimal per-task fine-tuning, our framework achieves a 73% improvement over the previous state of the art in execution performance on complex, real-world tool manipulation tasks that currently remain out of reach for standard large-scale pretrained models.

論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。解説更新:2026-09-29