TL;DR

CoreForgeは、LLM(ChatGPT+Codex)を用いて論文のみからMaxSATソルバをゼロ構築した実証実験。PM2・MSU3・OLLなどのアルゴリズムを実装し、ファジングやベンチマークで誤答は確認されなかったが、性能は手作りソルバに及ばず、人間による検証と反復が不可欠だった。

解説

AMI HAPPY

ねえ智也くん、このブログのタイトル見て!「LLMで論文からMaxSATソルバを構築」って、すごく面白そうじゃない?

TOMOYA NEUTRAL

ああ、CoreForgeの話だね。論文の内容だけを頼りに、ChatGPTとCodexでMaxSATソルバをゼロから作ったんだ。

AMI SURPRISED

MaxSATって何だっけ?SATの仲間?

TOMOYA NEUTRAL

そう。充足可能性問題の最大化バージョンで、できるだけ多くの制約を満たす解を探す問題。実用的な応用も多いんだ。

AMI CURIOUS

なるほど。で、なんでわざわざLLMに作らせようと思ったの?

TOMOYA NEUTRAL

論文を読んで実装するのって結構大変で、時間もかかる。LLMがどれだけ正確に再現できるか試したかったんだと思う。

AMI HAPPY

それで、実際にどんなアルゴリズムを実装したの?

TOMOYA NEUTRAL

PM2、MSU3、OLLっていう三つの主要なアルゴリズム。それぞれ論文の疑似コードをLLMに読ませて、コードを生成させたんだ。

AMI SURPRISED

へえ、それでうまく動いたの?

TOMOYA HAPPY

ファジングとベンチマークテストで誤答はゼロだった。つまり、論理的には正しいソルバができたってこと。

AMI HAPPY

すごい!じゃあもう人間いらないじゃん!

TOMOYA SAD

いや、そこがポイント。性能は手作りのソルバに全然及ばなかった。最適化や細かいチューニングが足りないんだ。

AMI NEUTRAL

ああ、動くけど遅いってこと?

TOMOYA NEUTRAL

そう。それに、論文の解釈ミスや曖昧な部分を人間が修正しないと動かなかった部分もあった。結局、人間の検証と反復が不可欠だったんだ。

AMI HAPPY

なるほどね。でも、ベースラインを自動生成できるってのは大きいんじゃない?

TOMOYA NEUTRAL

そう。論文の再現性を高める手段として有望だし、実装の初期段階を大幅に短縮できる。ただ、最終的な性能は人間が詰める必要がある。

AMI HAPPY

つまり、LLMは優秀な助手だけど、まだ監督が必要ってわけね。でも、将来はもっと賢くなるかもね!

TOMOYA NEUTRAL

そうだね。でも、その前に君が論文をちゃんと読めるようになったほうがいいと思うよ。

AMI HAPPY

うっ…痛いところ突かれた。でも、まずはLLMに読んでもらうからセーフ!

TOMOYA SAD

それじゃ意味ないだろ。