TL;DRLLM-as-Jud…
TL;DR
従来のRLはLLM-as-a-Judgeの評価をスカラー報酬(1〜10点)に圧縮し、テキストフィードバックを捨てていました。Experiential Learning (EL) は評価モデルをLLM-as-a-Coachに変え、各応答から「経験知識」を抽出。これを教師モデルのコンテキストとして利用し、ポリシーに逆KLダイバージェンスで蒸留します。スカラー報酬の理論最大3.3ビットに対し、ELは17,600ビットもの情報を伝達可能。実験では、Qwen3-8BとOLMo-3-7Bの両方で、WildChatやAlpacaEvalなど複数ベンチマークにおいてRLを上回り、未学習タスクへの汎化も向上。報酬ハッキングも軽減します。
解説
ねえ智也くん、この論文のタイトル見てびっくりしたよ。「スカラー報酬より5000倍の情報量」って、そんなことありえるの?
ああ、実際にありえるんだ。従来のRLはLLMの評価を1〜10点のスカラーに圧縮してて、せいぜい3.3ビットの情報しか伝えられない。でもELはテキストフィードバックをそのまま使うから、理論上17,600ビットも伝達できるんだよ。
え、ビットって情報量の単位だよね?それって単純にテキストの文字数が多いってこと?
そう。スカラー報酬はたった1つの数字だけど、ELでは評価モデルが「ここが良くて、ここが悪い」って具体的な文章で教えてくれる。その分、モデルが学べることが格段に増えるんだ。
なるほどね。でも、どうやってそのテキストフィードバックを学習に使うの?普通のRLみたいに報酬として使うんじゃないんでしょ?
ELでは「経験知識」っていう形で抽出して、教師モデルのコンテキストとして使うんだ。そして、その教師モデルの出力を生徒モデルに逆KLダイバージェンスで蒸留する。つまり、良い応答の仕方を直接教え込むイメージだね。
へえ、それって人間の学習に近い感じがする。先生が「ここ直そうね」って具体的に教えてくれるみたい。で、実際にどれくらい効果があったの?
Qwen3-8BとOLMo-3-7Bの両方で、WildChatやAlpacaEvalとか複数のベンチマークでRLを上回った。特に面白いのは、学習してないタスクへの汎化も向上してて、報酬ハッキングも減ったこと。
報酬ハッキングって、モデルが報酬を最大化しようとして変な行動をとることだよね?ELだとそれが起きにくいのは、スカラー報酬じゃなくてちゃんとしたフィードバックだから?
その通り。スカラー報酬だと「点数を上げる」ことだけを目的にしがちだけど、ELは具体的な改善点を教えるから、モデルが本質的な学習をするんだと思う。
でも、欠点とか限界はないの?何でも完璧ってわけにはいかないでしょ?
そうだね。まず、評価モデル自体の質に依存するから、コーチが下手だと効果が落ちる。それと、テキストフィードバックを生成する分、計算コストが増える。あと、今回の実験は8Bと7Bのモデルだけだから、もっと大きなモデルでも同じ効果が出るかはわからない。
なるほどね。でも、スカラー報酬より5000倍も情報量が多いって聞くと、もうスカラー報酬には戻れない気がするよ。まるで、成績表の数字だけ見るのと、先生に直接アドバイスもらうのとの違いだね!
まあ、でも成績表の数字も簡潔でわかりやすいっていう良さはあるから、使い分けかもしれないね。
あ、智也くんが急に現実的なこと言い出した!でも、私はEL派かな。だって、コーチに教えてもらう方が絶対楽しいもん!
君が楽しいかどうかは、モデルの学習には関係ないと思うけどね。