TL;DR

LLMを用いた自動発見システム(OpenEvolveやTTT-Discover)の「ハーネス」(探索の進め方)を分解し、30種類のハーネスを12のモデル・問題ペアで3.1Mロールアウト評価。どの固定ハーネスも万能ではなく、OpenEvolve系は単純な手法に劣る場合が多い。早期の性能が最終結果を予測できるため、複数ハーネスを並行実行し途中で弱いものを刈り込む適応的割り当てが有効。

解説

AMI HAPPY

ねえ智也くん、このブログのタイトル、『発見システムのハーネス選択は万能レシピではなくハイパーパラメータ』って、なんだか料理みたいだね!

TOMOYA NEUTRAL

ああ、ハーネスっていうのは、LLMを使った自動発見システムで、どうやって探索を進めるかっていう戦略のことだよ。OpenEvolveとかTTT-Discoverってやつで使われてる。

AMI SURPRISED

へー、それでそのハーネスを30種類も試したんだって?すごい量だね。

TOMOYA NEUTRAL

うん、12のモデルと問題のペアで、合計310万ロールアウトも評価してる。で、どの固定ハーネスも万能じゃないって結論が出てるんだ。

AMI SURPRISED

え、じゃあOpenEvolveとかってすごいんじゃないの?

TOMOYA NEUTRAL

実は逆で、OpenEvolve系のハーネスは単純な手法に負けることが多いんだよ。例えばランダムに候補を生成するだけのベースラインのほうが安定してたりする。

AMI SURPRISED

えー、意外!じゃあどうやって良いハーネスを選べばいいの?

TOMOYA NEUTRAL

重要なのは、早期の性能が最終結果をよく予測できるってこと。だから複数のハーネスを並行で走らせて、途中で弱いやつを刈り込む適応的割り当てが有効なんだ。

AMI NEUTRAL

なるほどねー。でもそれって、結局どのハーネスがいいかは問題次第ってこと?

TOMOYA NEUTRAL

そう。だからタイトル通り、ハーネス選択はハイパーパラメータみたいなものだって言える。万能なレシピはないってこと。

AMI NEUTRAL

ふーん…でもさ、この研究って結構限界もあるんじゃない?例えばモデルが古いとか。

TOMOYA NEUTRAL

そうだね。使ってるモデルはGPT-3.5とかLlama-2とかで、最新のGPT-4とかClaudeは入ってない。あと、評価した問題も数学とか科学とか限られた分野だけ。

AMI HAPPY

じゃあもっと新しいモデルだと結果が変わるかもね。でも、こういう地道な比較研究って大事だと思うよ!

TOMOYA NEUTRAL

ああ、そうだね。それに、適応的割り当てのアイデアは実用的だし、今後の研究にも使えそう。

AMI HAPPY

ところでさ、ハーネスって馬の装具だよね?AIにハーネスつけるって、なんか馬車みたいでかわいいな。

TOMOYA NEUTRAL

…その発想はなかったよ。でも、確かにうまく制御しないと暴走するって点では似てるかもな。