Apple共同研究MODUS、1つのデコーダーで文章・RGB・深度を生成

文章、RGB、深度、法線、エッジ、分割、特徴を専用ヘッドなしで1つのデコーダーの入出力にする。別モダリティによる自己検証も示した。

提案内容

Apple Machine Learning Researchなどによる7月28日の MODUS は、文章、RGB、深度、表面法線、エッジ、分割、位置、DINO特徴を1つのデコーダー専用モデルで扱います。モダリティ別ヘッド・損失・作業パイプラインを使いません。

新しい組合せ

RGBから深度、文章から画像だけでなく、RGB→エッジ→法線のような中間モダリティ経由の生成が可能です。生成画像から位置やVQA答を予測し、別モダリティとの整合性で候補を選ぶ自己検証も提案します。

公表評価

1モデルでMMMU 51.1、GenEval 0.81、RefCOCO val 54.5を報告し、4画像からVQAと位置で選ぶとGenEvalが0.84になりました。一部比較値は著者再現で、比較対象4Mの開発に一部著者が参加した利益相反も開示しています。

限界と意義

査読前で全専門モデルを上回るわけではなく、MMMUは論文表のGPT-4oより低い値です。価値は最高点より表現の組合せと相互検証にあります。公開資料を使う際もライセンス、計算量、偏り、失敗を確認してください。

原文