解説ねえ智也、この論文のタイト…
TL;DR
LLMを用いた自動発見システム(OpenEvolveやTTT-Discover)の「ハーネス」(探索の進め方)を分解し、30種類のハーネスを12のモデル・問題ペアで3.1Mロールアウト評価。どの固定ハーネスも万能ではなく、OpenEvolve系は単純な手法に劣る場合が多い。早期の性能が最終結果を予測できるため、複数ハーネスを並行実行し途中で弱いものを刈り込む適応的割り当てが有効。
解説
ねえ智也くん、このブログのタイトル、『発見システムのハーネス選択は万能レシピではなくハイパーパラメータ』って、なんだか料理みたいだね!
ああ、ハーネスっていうのは、LLMを使った自動発見システムで、どうやって探索を進めるかっていう戦略のことだよ。OpenEvolveとかTTT-Discoverってやつで使われてる。
へー、それでそのハーネスを30種類も試したんだって?すごい量だね。
うん、12のモデルと問題のペアで、合計310万ロールアウトも評価してる。で、どの固定ハーネスも万能じゃないって結論が出てるんだ。
え、じゃあOpenEvolveとかってすごいんじゃないの?
実は逆で、OpenEvolve系のハーネスは単純な手法に負けることが多いんだよ。例えばランダムに候補を生成するだけのベースラインのほうが安定してたりする。
えー、意外!じゃあどうやって良いハーネスを選べばいいの?
重要なのは、早期の性能が最終結果をよく予測できるってこと。だから複数のハーネスを並行で走らせて、途中で弱いやつを刈り込む適応的割り当てが有効なんだ。
なるほどねー。でもそれって、結局どのハーネスがいいかは問題次第ってこと?
そう。だからタイトル通り、ハーネス選択はハイパーパラメータみたいなものだって言える。万能なレシピはないってこと。
ふーん…でもさ、この研究って結構限界もあるんじゃない?例えばモデルが古いとか。
そうだね。使ってるモデルはGPT-3.5とかLlama-2とかで、最新のGPT-4とかClaudeは入ってない。あと、評価した問題も数学とか科学とか限られた分野だけ。
じゃあもっと新しいモデルだと結果が変わるかもね。でも、こういう地道な比較研究って大事だと思うよ!
ああ、そうだね。それに、適応的割り当てのアイデアは実用的だし、今後の研究にも使えそう。
ところでさ、ハーネスって馬の装具だよね?AIにハーネスつけるって、なんか馬車みたいでかわいいな。
…その発想はなかったよ。でも、確かにうまく制御しないと暴走するって点では似てるかもな。