エージェントスキルが失敗を増やす「回帰税」約6千回の分析

新しいプレプリントは、スキル追加前に成功していた作業が失敗へ変わる回帰を分離した。入力の根拠付けと結果検証の弱化が主因となった。

調査内容

2026年7月24日のプレプリント The Regression Tax は、2つの業務自動化ベンチマークと3つのエージェントハーネスで約6千回を比較しました。スキルなしで成功し、追加後に失敗したものを「回帰」、両方で失敗したものを「残存失敗」と分けています。

3つの回帰

  1. スキル説明の浸透:呼び出されなくても文脈にあるだけで行動が変わります。
  2. グラウンディングの置換:定型手順が実際の入力解釈を上書きします。
  3. 検証の置換:手順が本来行うはずの結果確認を弱めます。

高性能スキルは新しい成功を増やすより、既存成功を壊しにくいため優位になる場合が多いと報告しています。平均成功率だけでは損失が隠れます。

評価方法の改善

新規成功、回帰、継続失敗を別々に記録し、入力根拠と手順後の独立確認を設ける必要があります。スキルを使わない作業も回帰セットへ入れ、モデル・ハーネス変更時に再試験します。

限界

査読前プレプリントで、2ベンチマーク・3ハーネスの結果は全エージェントへ直ちに一般化できません。回帰率はモデル、設計、作業分布で変わります。要点はスキル否定ではなく、純効果を分解して測ることです。

原文