ロボットはどう現実を学ぶのか:手の実演からデジタルツインまで

Grabetteによる手の実演、合成データ、embodied reasoning、デジタルツイン、sim-to-real検証まで、Physical AIの学習ループを5段階で解説します。

AIZIGOO
ロボットはどう現実を学ぶのか:手の実演からデジタルツインまで

ロボットに「カップを持って」と伝えるのは簡単です。しかし、カップの位置や重さ、滑りやすい表面、隠れた取っ手、カメラの角度や照明まで理解し、安全に持たせることはまったく別の問題です。言語モデルはインターネット規模のテキストから学べましたが、ロボットが身体を通じた経験を同じ規模で集めるのは困難です。

2026年のPhysical AI競争の中心が、一つの巨大モデルから学習ループ全体へ移っている理由がここにあります。人の動作をデータにし、シミュレーションで何千もの変形を作り、空間を理解し、機械で行動し、失敗を新しい学習材料へ戻す必要があります。

最近の発表を並べると、この流れがはっきり見えます。Hugging FaceとPollen Roboticsは2026年7月21日、手で行った実演をロボット学習データに変換するオープンシステムGrabetteを公開しました。NVIDIAはSIGGRAPH 2026で、仮想キャラクターと実際のヒューマノイドに関連する運動表現を適用する研究や、エッジ向け世界モデルを紹介しました。Google DeepMindのGemini Robotics-ER 1.6は、複数のカメラを組み合わせて作業の完了を判断し、アナログ計器を読み取ります。ABBはデジタルツインで学習した産業用ロボットを生産ラインへ移すパイロットを進めています。

これらは一つのロボット製品の部品ではありません。データ → シミュレーション → 推論 → 行動 → 検証という同じパイプラインの異なる段階を担っています。

第1段階:人の動作をロボットデータに変える

ロボット学習の最初のボトルネックは、モデルよりデータであることが少なくありません。倉庫、キッチン、工場では必要な操作例が異なります。実機を遠隔操作すれば正確なデータを得られますが、機材と熟練者が必要で、多くの場所で繰り返すのは困難です。

Grabetteはより単純な方法を取ります。人がカメラとセンサーを備えた携帯型グリッパーを持ち、カップを移す、引き出しを開けるといった作業を実演します。二つのカメラ、IMU、グリッパー状態を同じ時間軸で記録し、SLAMで6自由度の軌跡を復元して標準LeRobotデータセットへ変換します。公開構成によれば、携帯ユニットの部品費は約490ユーロ、ロボットアームに装着する対応グリッパーは約120ユーロです。

エンジニアがセンサー付き携帯グリッパーでカップの持ち方をロボットに実演する場面

重要なのは、収録時にロボットを操作しなくてもロボット用の実演データを作れることです。公開例では、200回のカップ把持実演で方策を学習し、実際のロボットアームで実行しました。これはすべての物体や環境への汎化を証明するものではありません。高価なロボット研究室の外へデータ収集の入口を広げた例です。

データは多ければよいわけではありません。追跡が途切れた映像、手で物体が隠れた映像、失敗した実演、偏った場所が混ざれば、その誤りも学習されます。記録機器と視点、成功判定、力や接触の信号、座標系、異常場面の区別まで含むデータの方が、単なる件数より長期的な価値を持ちます。

第2段階:現実で経験しにくい状況を仮想世界で増やす

現実データだけでは、長い裾野を持つ例外状況を十分に集められません。暗い照明、予想外の積み方、異なる摩擦、危険な衝突を実際の工場で何千回も再現するのは遅く危険です。デジタルツインと合成データは、実機をさらす前に学習空間を広げます。

シミュレーションでは、同じ作業をカメラ位置、材質、照明、障害物、物理パラメータを変えながら繰り返せます。現場で失敗する前に、仮想環境で失敗させるのです。NVIDIAのSIGGRAPH 2026資料では、雪、砂、弾性体など難しい物質を扱う物理研究や、35万件を超えるモーションクリップで学習したMotionBricksが紹介されました。同じ運動表現が画面上のキャラクターと実際のヒューマノイドにつながる様子は、CGシミュレーションとロボット学習の境界が薄れていることを示します。

一つのロボット技能を多様な物体・視点・仮想環境で学習させる合成データファクトリー

世界モデルもこの段階で重要です。現在の画像を分類するだけでなく、ある行動の後に状態がどう変わるかを予測しようとします。NVIDIAはCosmos 3 Edgeを、テキスト、画像、映像、環境音、行動を扱う40億パラメータのモデルとして説明しており、物理世界の理解とロボット方策をエッジ機器へ持ち込むことを目指しています。

ただし、合成データは現実の代わりではありません。未知の摩擦、センサーノイズ、ケーブルの変形、予測できない人の動きは、モデル化されていないシミュレータには現れません。現実の測定を種にして仮想変形を作り、配備結果でシミュレーションを再調整する循環が必要です。

第3段階:見て、指し示し、完了を判断する

データとシミュレーションだけでは足りません。ロボットは現在の場面を理解し、自然言語の目標を小さな行動に分け、複数のカメラから同じ物体を見つけ、把持点を選び、作業が本当に終わったかを判断する必要があります。これがembodied reasoning、身体を持つシステムの空間・物理推論です。

Gemini Robotics-ER 1.6は、単独でモーターを制御する頭脳というより上位の推論層に近いモデルです。物体位置を点で表し、軌道や把持位置を考え、VLAモデルや別のツールを呼び出せます。上方カメラと手首カメラを組み合わせ、ペンが本当にホルダーへ入ったかを判断するような複数視点の成功検出も重視されています。

点検ロボットが複数視点を統合してアナログ計器と設備を理解する場面

計器の読み取りは実用的な例です。工場には圧力計、液面計、デジタル表示器が混在します。モデルは針と目盛り、カメラの遠近を区別し、複数の中間処理を通じて値を推定します。Google DeepMindの社内評価では、agentic visionを使用したRobotics-ER 1.6が計器読み取り課題で93%の成功率を記録しました。これはGoogleが構成した評価であり、すべての現場を保証する数値ではありません。

モデルカードの警告はさらに重要です。Googleは、生産・商用・公共環境で慎重に判断することを求め、誤作動が死亡、負傷、財産被害につながる医療や運輸などの安全重要用途には使わないよう明記しています。推論スコアが向上しても、独立した安全システムと責任を持つ人は必要です。

第4段階:仮想で学んだ行動を実機へ移す

シミュレーションで成功しても、現実で同じように動く保証はありません。レンズ、モーター遅延、部品公差、摩擦、振動の小さな差が積み重なります。これがsim-to-real gapです。

ABBのRobotStudio HyperRealityは、NVIDIA Omniverseベースのシミュレーションと、実機と同じファームウェアを動かす仮想コントローラーを組み合わせます。ABBはFoxconnの電子機器組立パイロットで、仮想学習から実配備まで最大99%の相関を報告し、設定時間やコスト削減の推計も公表しています。ただし、これはABBの製品と選定されたパイロットに関する主張であり、すべての工場や作業に共通する独立した性能値ではありません。

安全担当者がデジタルツインと実際のロボットの動きを照合し、配備前に検証する場面

実運用の検証は平均スコアを祝うことより、失敗の境界を見つけることに近い作業です。

  1. 隔離セルで速度と力を下げて始める。
  2. 物体位置、照明、摩擦を意図的に変える。
  3. センサー断や通信遅延を注入する。
  4. 安全停止と人への引き継ぎ条件を確認する。
  5. 実際の失敗を再現可能なシミュレーション事例へ戻す。

一度の成功より、失敗時に安全に止まり、原因を学習材料として残せることの方が重要です。

第5段階:行動結果を学習ループへ戻す

Physical AIの長期的な資産は一つのモデルではなく、閉じた循環です。

人の実演 → 現実データ → 仮想変形 → 空間推論 → ロボット行動 → 安全評価 → 新しいデータ

この循環が速いほど、新しい物体や環境への適応コストが下がります。各段階が異なるベンダー形式に閉じ込められるとデータは移動できず、失敗原因がモデル、センサー、制御器のどこにあるか分からなくなります。Grabetteが標準LeRobot形式を採用し、産業界がOpenUSDベースのツインを利用し、モデルがツールインターフェースを公開する動きは、接続コストを下げる方向です。

Physical AI導入前に確認する8項目

  • 業務範囲: 反復作業を一文で定義できるか
  • データ権利: 作業者、場所、製品の記録を利用する許可があるか
  • 失敗データ: 成功だけでなく失敗と中断も保存するか
  • シミュレーション差: 現実だけに存在する物理条件を測定しているか
  • 成功検出: ロボット自身の完了判断を独立した信号で確認するか
  • 安全境界: 速度、力、作業空間、人の接近規則をモデル外で強制するか
  • 復旧: 誤動作や通信断から安全状態へ戻れるか
  • 回帰評価: モデル、カメラ、グリッパー変更時に以前の作業を再試験するか

ロボットの「ChatGPTモーメント」は一つのモデルからは来ない

汎用ロボットが突然すべての家庭や工場へ現れる光景は魅力的です。しかし実際の進歩は、より安価な実演収集、仮想環境での豊富な失敗、複数視点による完了確認、配備前の厳格な検証という静かな基盤で起きています。

2026年の重要な変化は、ロボットが人間のように考えるようになったという宣言ではありません。現実をデータへ、データを行動へ、行動の結果を再び学習へ変える産業的な方法が具体化していることです。

最も強いPhysical AIチームは、最大のモデルを持つチームではないかもしれません。シミュレーションと現実の差を最も早く見つけ、失敗を最も安全に収集し、その経験を次の配備で再利用できるチームである可能性が高いのです。

参照した公式資料

性能とコスト削減の数値は、各社が公表した評価または事例に基づきます。結果はロボット、センサー、環境、安全管理によって変わるため、導入前に独立した現場検証が必要です。