異なるトークナイザー間の蒸留、限定的な教師信号が有効
- •異なるトークナイザーを持つ3組の教師・生徒モデルで数学的推論とコード生成を検証
- •共有語彙の上位16トークンに絞った手法が全語彙と同等の精度を達成し、比較対象も上回る
- •不一致部分全体を対象にした学習は網羅性を得た一方、精度を下げ勾配も弱いか競合する傾向
ビンシー・ホウ(Bingxi Hou)、グオチャオ・ジアン(Guochao Jiang)、グオフェン・チュアン(Guofeng Quan)、ウェイチン・リー(Weiqing Li)、ウェンフェン・フォン(Wenfeng Feng)、グオホア・リウ(Guohua Liu)、ユエウェイ・ジャン(Yuewei Zhang)の研究者は、トークナイザーが異なる言語モデル間でも、信頼性の高い教師信号を優先すればオンポリシー蒸留が機能すると報告しました。論文は10月6日に公開され、10月7日にHugging Faceへ提出されました。研究では数学的推論とコード生成を対象に、教師・生徒モデルの3組を検証しました。蒸留前に抽出した生徒の応答では、厳密に対応するトークン位置が、語彙に大きな不一致があっても、教師と生徒の確率質量の平均でほぼ全てを保持しました。
厳密に対応する各位置で、逆KLダイバージェンス(確率分布同士の差を測る指標)を共有語彙から生徒が選んだ上位16トークンに限定したところ、共有語彙全体を使う場合と同程度の精度を達成しました。研究者が評価した異なるトークナイザー間の比較手法も上回りました。厳密な1対1対応のグループだけで、生徒が生成するトークンの大半をカバーしていたため、不一致部分へ教師信号を広げても効果は小さいと実験で示されました。
不一致部分全体の対数確率に平均二乗誤差の教師信号を加えると、全ての部分を網羅できましたが、精度は低下しました。厳密な損失だけで学習したチェックポイントでは、不一致部分の教師信号による勾配は、厳密な損失による勾配と方向が弱くしか一致しないか、逆向きになり、両者の相対的な大きさも増しました。著者らは、弱く対応する、または競合する学習信号を持ち込む広範な網羅より、厳密に対応する位置でのコンパクトな教師信号が有効だとしています。