提案内容
Apple Machine Learning Researchなどによる7月28日の MODUS は、文章、RGB、深度、表面法線、エッジ、分割、位置、DINO特徴を1つのデコーダー専用モデルで扱います。モダリティ別ヘッド・損失・作業パイプラインを使いません。
新しい組合せ
RGBから深度、文章から画像だけでなく、RGB→エッジ→法線のような中間モダリティ経由の生成が可能です。生成画像から位置やVQA答を予測し、別モダリティとの整合性で候補を選ぶ自己検証も提案します。
公表評価
1モデルでMMMU 51.1、GenEval 0.81、RefCOCO val 54.5を報告し、4画像からVQAと位置で選ぶとGenEvalが0.84になりました。一部比較値は著者再現で、比較対象4Mの開発に一部著者が参加した利益相反も開示しています。
限界と意義
査読前で全専門モデルを上回るわけではなく、MMMUは論文表のGPT-4oより低い値です。価値は最高点より表現の組合せと相互検証にあります。公開資料を使う際もライセンス、計算量、偏り、失敗を確認してください。