何が起きたのか?
研究者はコードデバッグ、数学、パズルでAI教師の介入時点と方法を評価するInt-Benchを提案し、LLMが人より早く頻繁に介入すると報告しました。
正答率だけを最適化した教育AIは考える機会を奪いかねません。待機、段階的ヒント、利用者が助けの程度を選ぶ機能、長期学習の測定が必要です。
なぜ重要なのか?
すぐ答えるAIは目先の成功を高めても推論や長期学習を弱める可能性があり、教育AIの評価基準を問い直します。
誰にとって重要か?
教育者EdTech開発者AI研究者
AIZIGOOの見解
2026年7月23日提出のプレプリントであり、実際の学生の長期効果へ一般化するには追加検証が必要です。