小型AIの推論失敗を教師が一時的に救うRelay-OPD

学生が誤った推論へ進む点を検出し、教師が短く修正して再び学生へ渡す。1.7Bでは標準OPD比平均5.73%向上と報告した。

対象となる問題

7月28日のプレプリント Pass the Baton は、オンポリシー蒸留で学生が初期に誤ると後続も誤った方向へ進み、教師の監督が非効率になる問題を扱います。

Relay-OPDの方式

失敗した接頭部で教師と学生の進行が異なる瞬間をラベルなしの交代信号にします。教師が短い区間を修正し、限られた予算で学生が再開します。全軌跡を教師へ置き換えず学生方策からの乖離を抑えます。

公表結果

Qwen3-4B-Instruct-2507を教師、0.6B・1.7Bを学生として8つの数学推論評価を行い、1.7Bでは標準OPD比平均5.73%、FastOPD比1.49%高く、学習軌跡長は50%以上短いと報告しています。

限界

査読前で、数学と特定Qwen系に集中しています。コード、会話、ツール利用への転移と教師呼出しを含む総費用は未確定です。精度、教師トークン、時間、失敗型を同時に比較する必要があります。

原文