動画生成ではなく動画から行動を学ぶ
NVIDIAは9月10日、Skild AIのS1を紹介しました。作業者が工程を一度撮影すると、S1が意図、物体、順序を読み、ロボット動作へ変換します。新データセットやタスク別後学習をせず、文脈内学習で未知作業を扱うという説明です。
植木、パンケーキ、ドリップコーヒー、キット組立など、数十工程・最大10分の作業を示しました。植木例は撮影から自律実行まで11分、新しい多段階作業の段階成功率は約66%、比較系は9%と報告しています。
段階成功率は全工程成功率ではない
選定環境での企業・提携先報告で、独立再現ではありません。各段階66%は長い工程全体の成功確率ではなく、比較条件や試行数も公開記事だけでは不足します。全工程完了、復旧時間、未知物体、照明、視点、力制御、人の接近を別々に試し、動画の権利、非常停止、人の承認も検証すべきです。