新着研究 / Robotics / VLM
ロボットの動作モデルに、物体と手先の三次元的な位置関係を渡す
Spatial Grafting
Spatial Graftingの原論文から掲載した図です。細部はクリックして拡大できます。
原論文の図の説明を読む
Fig. 1: Overview of Spatial Grafting . A frozen geometry foundation model extracts multi-level features from each RGB view. Depth, calibrated rays, and end-effector anchors bind those features to metric, robot-relative 3D locations, forming a spatial bank per view. The magnified graft layer acts only on the flow-matching action expert: action tokens first cross-attend to the primary-view bank; the updated states then query the auxiliary-view banks. A single bias-free linear projection fuses the auxiliary attention outputs into the action update. This layer repeats in selected late action blocks, leaving the host’s vision-language or video pathway ungrafted.
概要
- 画像特徴に実寸の三次元位置と手先からの相対位置を結び付け、動作生成部へ渡す。
- RoboTwin 2.0ではπ0.5の成功率が通常場面94.0%、見た目を変えた場面92.4%と報告された。
- 導入には校正値と奥行きが必要で、対象作業の位置誤差と処理時間を実測する。
補足:編集した模式図で仕組みを確認する
VISUAL EXPLAINER
図でつかむ、Spatial Graftingの仕組み
- 01画像・奥行き・校正値
- 02特徴に三次元位置を付与
- 03動作部が空間特徴を参照
- 04ロボットの動作列
原論文の説明をもとにした模式図です。処理の細部は省略しています。
研究の背景
画像を見て指示に従うロボットでも、対象物の表面が手先から何センチ離れているかを、動作生成部が十分に扱えるとは限らない。物体や作業順序を選べても、つかむ位置がずれると作業は失敗する。
画像から三次元の形状を推定するモデルは、その場の構造を示せる。しかし画像内の形状特徴だけでは、ロボットにとっての実寸や手先との位置関係が明確でない。既存の動作モデルへその関係をどう渡すかが課題となる。
手法
Spatial Graftingは、固定した三次元再構成モデルから画像の各位置の特徴を取り出す。カメラ校正値と奥行きで各位置を実寸の三次元座標へ戻し、手首カメラを基準にした手先との相対位置を求める。特徴と座標を一組の「空間トークン」にし、画像ごとにまとめる。トークンはモデルが扱う情報の単位である。
動作を生成するモデルの後段には、動作側が必要な空間トークンを参照するクロスアテンションを加える。これは二つの情報列の対応を選ぶ仕組みで、まず主カメラ、次に補助カメラの情報を読む。フローマッチングという、動作候補を段階的に整える生成方式の各段階で参照し、最終的な動作列を出す。
新規性
Spatial Graftingは、画像から得た形状の特徴を、その場所の実寸位置とロボットの手先からの距離に結び付ける。結び付けた情報を動作生成部の後段へ渡すため、既存モデルの画像・言語処理経路には追加しない。
同じ追加モジュールを、視覚言語動作モデルと世界動作モデルの両方に適用した点も特徴である。ただし、適用にはカメラの校正情報、奥行き、手首カメラなど、論文が置いた入力条件が必要となる。
従来手法との違い
最も制御された比較は、各学習済み動作モデルに追加モジュールを付ける前後である。著者らは画像特徴を使わない場合や、別サンプルの特徴に入れ替える場合も調べ、追加したパラメータだけで改善したのかを検討した。
公表済みの三次元情報を使う方策との比較も示すが、課題、学習条件、入力がそろわない場合がある。RoboTwin 2.0でのWAM4Dとの数値は参考になる一方、方式の効果を判断する基準は同じホスト内の追加前後と読むのが妥当である。
実験結果
著者らは二つの視覚言語動作モデルと二つの世界動作モデルに同じ追加構成を適用し、四つのシミュレーション基準と三種の実ロボットで評価した。RoboTwin 2.0の二腕作業では、π0.5への追加で成功率が通常場面94.0%、見た目を変えた場面92.4%となり、元モデルからそれぞれ11.3、15.6ポイント上がった。
長い作業を扱うBEHAVIOR-1Kでは、六課題のうち五課題で2025年の挑戦課題の優勝方式を上回り、課題進捗を表すQスコアの差は最大0.47と報告された。ただし、これは六課題の結果であり、全課題の総合値を意味しない。
応用の可能性
編集上の応用案 · 論文が実証した用途とは区別しています。
編集上の応用案:二本腕で箱から部品を取り、決めた位置へ置く製造工程を想定する。入力は複数のRGB画像、カメラ校正値、奥行き、作業指示、ロボットの状態で、出力は次に実行する動作列である。
空間特徴を手先からの相対位置とともに動作生成部へ渡し、つかむ位置や置く位置のずれを減らせるか調べる。この工程自体は論文で評価された特定の実用ラインではなく、手先との位置関係が重要な作業としての適用案である。
導入時の検証
導入時の検証案 · 対象データでの再評価が必要です。
導入時の検証案:まず一つの把持作業を選び、既存の動作モデルを基準として成功率と失敗位置を記録する。対象のカメラ校正値と奥行きを用意し、同じ画像・指示・試行条件で空間特徴を追加したモデルと比較する。
把持成功率、置き位置の誤差、接触失敗、処理時間を測る。空間特徴を外した試行も設け、改善が追加経路の存在だけでなく、対象場面に対応した位置情報から生じているかを確認する。
限界と課題
著者らが記す実装上の注意として、追加情報をゼロにしたとき出力への影響も必ずゼロになるという性質は、投影部のバイアスなどの条件に依存する。示されたπ0.5実装では学習後までその性質が保証されないため、画像特徴を外した実測値で確かめている。
編集上の確認事項は、対象ロボットで校正と奥行きが十分正確か、手首カメラの視野が作業対象を捉えるかである。奥行きの誤差、遮蔽、動作に必要な処理時間、物理試行での接触失敗を、対象工程ごとに測る必要がある。
出典
元のタイトル・要旨を確認する(英語)
Spatial Grafting: Grounding 3D Features for Flow-Matching Robot Policies
Pretrained robot manipulation policies such as vision-language-action models (VLAs) or world-action models (WAMs) leave interaction-relevant metric geometry implicit. Recent breakthroughs in spatial reconstruction can supply the necessary geometry reliably, but their features describe local shape without stating where it lies with respect to the robot. How best to deliver these features to a pretrained policy remains unresolved. We propose Spatial Grafting, a versatile, lightweight spatial module that binds frozen reconstruction features to metric, robot-relative geometry. Spatial Grafting constructs metric-grounded spatial tokens and injects them into the flow-matching action expert through cross-attention, without modifying the host's perceptual pathway, so the host retains the full benefit of its pretraining. We evaluate it more broadly than any geometry-aware policy we compare against: one graft architecture, with no per-host redesign, on two VLAs and two WAMs, across four simulation benchmarks that span short-horizon manipulation, visual robustness, clutter and long-horizon mobile manipulation, and on three real-robot platforms with single- and dual-arm configurations. On RoboTwin 2.0, a dual-arm manipulation benchmark, the graft improves every host across VLAs and WAMs. Grafted $π_{0.5}$ gains 11.3% and 15.6% on clean and randomized scenes, reaching 94.0% and 92.4%, above the strongest published 3D-conditioned policy, WAM4D (93.8% and 89.9%). The margin widens as the horizon lengthens: on tasks from BEHAVIOR-1K, a dual-arm mobile manipulation challenge scored by average task progress, it surpasses the 2025 challenge winner on five of six tasks,by up to 0.47 Q-score, and exceeds a map-conditioned spatial policy on average across the three tasks both report.
論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。解説更新:2026-09-29