長い視覚文脈のボトルネック
7月30日のReTokenは、画像群や動画が長くなるほど視覚言語モデルが必要な証拠を見失う問題を扱います。全視覚トークンの同時処理はGPUメモリを使い、妨害画像が増えると検索性能も下がります。
一つの学習可能な埋め込みを検索目標とし、事前構築した視覚KVキャッシュから質問関連トークンを疎に選択します。小規模な画像QAで学習し、画像・動画へ転移しました。
著者報告の結果
Visual HaystacksでQwen3VL-8Bは13.4点、InternVL3.5は12.4点向上し、長尺動画LVBenchではQwen3VL-8Bがゼロショットで8.0点改善したと報告しています。学習と長尺推論は各1台のH100で可能とし、コードも公開しました。
用途と限界
企業動画検索、監視映像、講義探索などに応用可能ですが、査読前の著者報告です。実運用では検索漏れ、キャッシュ構築費、動画長・質問別の遅延を再現する必要があります。