TL;DRPallasは、AI…
TL;DR
ベース言語モデルをタスクなしで長く生成させると、繰り返しに陥ります。この論文は、その生成ループに「数百トークンごとに新しい主題を注入する」という単純な操作が、LLM判定による驚きとつながりのスコアを有意に上げることを示しました。ただし、その効果は局所的で、文書全体の統合性は向上せず、LLM判定には「実験者が注入した文をモデル自身の出力と誤認する」「過去の出力を遠方から再生し、それを新規性と誤判定する」といった重大な見落としがあることも明らかにしています。
解説
ねえ智也くん、この論文のタイトル、なんか難しそうだけど、要するに何をしたの?
ああ、ベース言語モデルをタスクなしで長く生成させると、すぐに同じことの繰り返しになっちゃうんだ。それで、この論文は生成ループに数百トークンごとに新しい主題を注入するっていう単純な操作を試したんだよ。
へえ、それでどうなったの?
LLM判定で「驚き」と「つながり」のスコアが有意に上がったんだ。つまり、生成がより面白くなったってこと。
すごい!じゃあ、この方法は完璧なの?
いや、そうでもない。効果は局所的で、文書全体の統合性は向上しなかったんだ。それに、LLM判定には重大な見落としがあることもわかった。
見落とし?どんなの?
実験者が注入した文をモデル自身の出力と誤認したり、過去の出力を遠方から再生して、それを新規性と誤判定したりするんだ。つまり、LLMの評価はあてにならない部分があるってこと。
なるほどね。でも、それでも新しい主題を入れるのは効果があるってこと?
うん、局所的にはね。でも、全体のまとまりを考えると、まだ課題が残ってる。評価方法も含めてね。
ふーん、なんだかんだで、AIもまだまだって感じだね。でも、こういう研究が進めば、もっと面白い文章を書いてくれるようになるのかな?
そうだね。でも、その前に評価方法をちゃんとしないとね。
あはは、じゃあ智也くんが評価方法を研究して、私が新しい主題を注入する係になるよ!
それはいいけど、君が注入した主題でまた繰り返しになったらどうする?