見栄えのよいAI科学動画でも間違う:Sci‑VBench公開

専門家注釈1,253例と動画モデル16種の評価で、知覚品質より科学・因果正確性に大きな差が出ました。

科学の因果を動画にできるか

Sci‑VBenchは見た目だけでなく、科学知識と因果を時間的に表現できるかを評価します。自然科学、医療、人文社会、工学の4分野60主題から専門家注釈1,253例を構成しました。

著者は商用・オープン動画モデル16種を比較し、知覚品質点は近くても、指示忠実度と科学・因果正確性は大きく異なり、商用とオープンの差も見られたと報告します。滑らかさは正しいシミュレーションを意味しません。

制作時の確認

力の方向、物質変化、生物学的順序、時間尺度を出典から検証し、専門家がフレーム間の原因と結果を確認すべきです。医療・安全教育で生成動画だけを証拠にできません。

限界

16モデルと新ルーブリックによる査読前研究です。非専門家・MLLM判定が専門家と比較的高く一致したという報告も、全科学分野の自動評価を保証しません。

原文