TL;DR

FORMALTCSは、2025-2026年のトップ会議(STOC, FOCS, SODA, COLT)の論文175本から構築された、LLMの理論計算機科学(TCS)研究能力を評価するベンチマークです。研究パイプラインを5段階に分解し、各段階を個別に評価します。現状の最強モデルでも、自然言語の主張を形式的な定理文に変換する自動形式化が最大のボトルネックで、成功率は約11.5%にとどまります。また、モデルが自ら生成した主張の多くは新規性に乏しく、研究の「味覚」も未熟であることが示されました。

解説

AMI HAPPY

ねえ智也くん、このFORMALTCSってベンチマーク、面白そうだね!LLMが理論計算機科学の研究できるかどうか試すんだって?

TOMOYA NEUTRAL

うん、そうだよ。2025-2026年のトップ会議の論文175本から作られたんだ。STOCとかFOCS、SODA、COLTっていう理論系のトップ会議だね。

AMI CURIOUS

へー、すごい量だね。でも、どうやって評価するの?ただ問題を解かせるだけじゃないんでしょ?

TOMOYA NEUTRAL

そう。研究のパイプラインを5段階に分解して、それぞれを個別に評価するんだ。例えば、問題の理解、定理の形式化、証明の生成、検証、そして新規性の評価みたいに。

AMI EXCITED

なるほどね。で、結果はどうだったの?やっぱりLLMってすごいの?

TOMOYA SERIOUS

実は、最強のモデルでも自動形式化が最大のボトルネックなんだ。自然言語の主張を形式的な定理文に変換する成功率が約11.5%しかないんだよ。

AMI SURPRISED

えー、意外と低いんだね!でも、他の段階はもっと高いの?

TOMOYA NEUTRAL

うん、形式化以外は比較的マシだけど、それでもまだまだだよ。特に、モデルが自分で生成した主張の多くは新規性が乏しいって結果が出てる。

AMI THINKING

新規性かー。つまり、LLMは既存の研究をなぞることはできても、新しいアイデアを出すのは苦手ってこと?

TOMOYA NEUTRAL

そういうこと。研究の「味覚」が未熟なんだろうね。既存の結果を組み合わせることはできても、本当に新しい問題を見つけるのは難しいみたい。

AMI CURIOUS

でも、このベンチマークの意義って何なの?単にダメ出しするだけじゃなくて?

TOMOYA EXPLAINING

重要なのは、LLMの研究能力を細かく評価できることだよ。どの段階が弱点かが分かれば、そこを重点的に改善できるからね。例えば、形式化の精度を上げるためのツール開発とか。

AMI NEUTRAL

なるほどね。でも、限界もあるんじゃない?

TOMOYA SERIOUS

ああ、このベンチマークは2025-2026年の論文に基づいてるから、時間が経つと古くなるし、特定の会議に偏ってる可能性もある。あと、形式化の評価は自動化されてるけど、新規性の評価は主観的になりがちだね。

AMI HOPEFUL

ふーん、やっぱり完璧じゃないんだね。でも、こういう研究が進めば、いつかLLMが本当に研究を手伝ってくれる日が来るのかな?

TOMOYA NEUTRAL

可能性はあるけど、まだまだ先だと思うよ。少なくとも、形式化の壁を越えないとね。

AMI HAPPY

はは、じゃあ、私が形式化を手伝ってあげようか?って、私もできないけどね!

TOMOYA NEUTRAL

君が手伝うより、LLMに任せた方がマシだよ。