TL;DR

ベース言語モデルをタスクなしで長く生成させると、繰り返しに陥ります。この論文は、その生成ループに「数百トークンごとに新しい主題を注入する」という単純な操作が、LLM判定による驚きとつながりのスコアを有意に上げることを示しました。ただし、その効果は局所的で、文書全体の統合性は向上せず、LLM判定には「実験者が注入した文をモデル自身の出力と誤認する」「過去の出力を遠方から再生し、それを新規性と誤判定する」といった重大な見落としがあることも明らかにしています。

解説

AMI CURIOUS

ねえ智也くん、この論文のタイトル、なんか難しそうだけど、要するに何をしたの?

TOMOYA NEUTRAL

ああ、ベース言語モデルをタスクなしで長く生成させると、すぐに同じことの繰り返しになっちゃうんだ。それで、この論文は生成ループに数百トークンごとに新しい主題を注入するっていう単純な操作を試したんだよ。

AMI INTERESTED

へえ、それでどうなったの?

TOMOYA HAPPY

LLM判定で「驚き」と「つながり」のスコアが有意に上がったんだ。つまり、生成がより面白くなったってこと。

AMI EXCITED

すごい!じゃあ、この方法は完璧なの?

TOMOYA SERIOUS

いや、そうでもない。効果は局所的で、文書全体の統合性は向上しなかったんだ。それに、LLM判定には重大な見落としがあることもわかった。

AMI SURPRISED

見落とし?どんなの?

TOMOYA NEUTRAL

実験者が注入した文をモデル自身の出力と誤認したり、過去の出力を遠方から再生して、それを新規性と誤判定したりするんだ。つまり、LLMの評価はあてにならない部分があるってこと。

AMI CURIOUS

なるほどね。でも、それでも新しい主題を入れるのは効果があるってこと?

TOMOYA NEUTRAL

うん、局所的にはね。でも、全体のまとまりを考えると、まだ課題が残ってる。評価方法も含めてね。

AMI HOPEFUL

ふーん、なんだかんだで、AIもまだまだって感じだね。でも、こういう研究が進めば、もっと面白い文章を書いてくれるようになるのかな?

TOMOYA SERIOUS

そうだね。でも、その前に評価方法をちゃんとしないとね。

AMI HAPPY

あはは、じゃあ智也くんが評価方法を研究して、私が新しい主題を注入する係になるよ!

TOMOYA NEUTRAL

それはいいけど、君が注入した主題でまた繰り返しになったらどうする?