汎用VLMを小さな意味行動インターフェースでロボットへ接続するShow‑Harness

VLMが選ぶ意味行動を機体別の決定的な動作へ変換し、異なるロボットで同じ制御層を再利用する研究です。

モデルと機械の間に小さな行動言語

9月9日投稿のShow‑Harnessは、汎用VLMを機体ごとに再学習する負担を扱います。VLMは把持、移動、整列などの離散的な意味行動を選び、機体別インタープリターが座標と駆動命令へ決定的に変換します。

同じ仕組みで非公開フロンティアVLMのzero-shot制御と、小型オープンVLMの低費用適応を示したとしています。GUIで人やエージェントが専用遠隔装置なしにデモを集めるGUMIも提案しました。

「遊べる」と安全運用は異なる

複数作業・機体で既存方式を上回ると報告しますが、査読完了を確認できないプレプリントです。未知の機体、接触、センサー障害、人の近くでの安全を保証しません。実配備には衝突、力・速度、非常停止、隔離、人の監督を独立した安全層として置く必要があります。

原文