論文を読むAIと再現するAIは違う:AgentActionBench

150本の実験再現をMCPの行動記録で評価すると、現在の研究エージェントは実行段階が主なボトルネックでした。

最終リポジトリだけでなく過程を見る

NLPCC 2026 Shared Taskの研究陣は9月10日、AgentActionBenchを公開しました。MCPベースのAction Recorderでファイル、コマンド、ツール利用を記録し、論文別ルーブリックで再現過程を評価します。

対象は機械学習120本とAI4Science 30本の計150本です。10%を人が注釈し、モデル補助で1万項目超へ拡張しました。著者実験では、計画よりコード実行、エラー修正、結果生成が主な制約でした。

ルーブリック一致は科学的再現の保証ではない

自動ルーブリックと人注釈の高い相関は評価拡張の根拠ですが、主張の再現成功とは別です。標本と人注釈範囲には限界があり、査読前です。固定環境、データ来歴、実行ログ、復旧、数値誤差、核心主張の人手確認を合わせて評価すべきです。

一次資料