最終画像の点数だけでは原因が分からない
8月20日投稿のDARSは、指示型画像編集をVLMの計画と拡散モデルの描画に分けます。完成画像の失敗だけでは、どちらを改善すべきか、計画内のどこが誤ったか分かりません。
複数計画・描画の報酬変動で学習比重を配分し、四項目の構造化推論へ接頭部報酬とトークン別重みを適用します。同じ条件のJoint RLより五つのベンチマークで高く、推論依存編集で差が大きいと著者は報告します。
査読前で絶対点や実利用者評価は示されません。商用編集、人物一貫性、文字、安全まで保証しません。価値は計画と実行の失敗を分離する学習構造です。