最終リポジトリだけでなく過程を見る
NLPCC 2026 Shared Taskの研究陣は9月10日、AgentActionBenchを公開しました。MCPベースのAction Recorderでファイル、コマンド、ツール利用を記録し、論文別ルーブリックで再現過程を評価します。
対象は機械学習120本とAI4Science 30本の計150本です。10%を人が注釈し、モデル補助で1万項目超へ拡張しました。著者実験では、計画よりコード実行、エラー修正、結果生成が主な制約でした。
ルーブリック一致は科学的再現の保証ではない
自動ルーブリックと人注釈の高い相関は評価拡張の根拠ですが、主張の再現成功とは別です。標本と人注釈範囲には限界があり、査読前です。固定環境、データ来歴、実行ログ、復旧、数値誤差、核心主張の人手確認を合わせて評価すべきです。