同じ視覚表現で見る・作る
SenseNova研究陣は9月10日、SenseNova‑U1.5を公開しました。8BのMoTモデル一つで画像理解、推論、生成、編集を扱い、別の視覚エンコーダーとVAEを使わず、最大4Kのネイティブ解像度で学習したと説明します。
美観、二言語文字、インフォグラフィック、編集の専門家を最適化し、on-policy distillationで統合しました。複雑な構図、複数参照編集、人物と形状、変更対象外の保持が改善したと著者は報告しています。
著者評価と実利用を分ける
論文は査読前プレプリントです。プロンプト修正、解像度、推論回数、例の選択で比較は変わります。8Bという値だけではVRAMや時間も分かりません。学習コードは公開予定とされますが、予定と現在の配布物は別です。同一条件で文字精度、主体一貫性、編集外の変化、速度、VRAMを測る必要があります。