解説ねえ智也、この論文のタイト…
TL;DR
U-OPSDは、外部の正解ラベルや教師モデルを使わずに、モデル自身の複数回の生成結果の多数決で擬似正解を作り、その正解を条件にした教師分布を、間違った応答の途中経過に蒸留する手法です。数学推論ベンチマークで、教師あり手法(OPSDやGRPO)と同等以上の性能を達成しました。
解説
ねえ智也くん、この論文のタイトル、『教師なし自己蒸留でLLM推論を改善』ってあるけど、自己蒸留って何?
自己蒸留っていうのは、モデル自身が生成した出力を使って自分自身を学習させることだよ。普通の蒸留は大きな教師モデルから小さな生徒モデルに知識を移すけど、自己蒸留は同じモデルを使うんだ。
へえ、じゃあこのU-OPSDってのは、その自己蒸留をどうやってやってるの?
U-OPSDは、モデルに同じ問題を複数回解かせて、その答えの多数決で擬似的な正解を作るんだ。それで、その正解を条件にした出力分布を、間違った応答の途中経過に蒸留するんだよ。
多数決で正解を作るって、まるでクラスのみんなで答え合わせしてるみたいだね。でも、間違った応答の途中経過に蒸留するってどういうこと?
例えば、モデルが間違った答えを出したとき、その途中の推論ステップに、正解に至るような確率分布を近づけるんだ。そうすることで、モデルが正しい推論の仕方を学べるんだよ。
なるほどね。でも、外部の正解ラベルを使わないってのがすごいね。どうやって評価したの?
数学推論のベンチマークで評価してるよ。GSM8KとかMATHとか。結果は、教師ありのOPSDやGRPOと同等かそれ以上の性能だったんだ。
へえ、教師ありの手法に勝っちゃうこともあるんだ!それってすごくない?
うん、特にデータが少ないときやラベルが得られないときに有効だと思う。ただ、多数決で擬似正解を作るから、モデルが系統的に間違えると正解も間違ってしまう可能性があるんだ。
ああ、確かに。みんなが同じ間違いをしてたら、多数決も間違っちゃうもんね。
そう。あと、複数回生成する分、計算コストがかかるのも課題だね。
でも、ラベルなしでここまでできるなら、実用化が進みそうだね。私もAIに詳しくなった気がする!
それはよかった。でも、まだまだ勉強することは多いよ。
わかってるよ。でも、今日はこの論文のおかげで、ちょっと賢くなれた気がする!
それはよかった。でも、その自信が過信にならないようにね。