マルチモーダル学習の変化を探す
MMDiffは基盤言語モデルとマルチモーダル適応後のsparse autoencoderを比較します。LLaVA‑MORE、PaliGemma 2、InternVL3.5で空間理解、OCR、安全行動を調べました。
著者報告では特徴除去で空間課題が平均12%、OCRが17%低下し、安全攻撃成功率は24%減少、VQAへの影響はなかったとします。特徴ステアリングは標準方式より空間精度を3.6ポイント、OCRを1.8ポイント改善しました。
意味と限界
全体再学習なしに特定の視覚行動を監査・調整する可能性がありますが、「解釈可能特徴」が人間の概念と完全一致するとは限りません。三系列と選択ベンチマークの査読前研究であり、他構造・実サービス・複合攻撃で独立再現が必要です。