TL;DR

本論文は、LLMの投資判断能力を評価する新しいベンチマーク「INVESTLOGICBENCH2026」を提案しています。従来のQA型ベンチマークでは測れない、投資家の属性(P)→市場イベント(E)→推論(R)→意思決定(D)→成果(O)という一連の思考プロセスを、実在の投資家151人の20万件以上の意思決定データから構築しました。7週間のライブ取引実験では、一般的な性能が高いモデルほど実運用で低いリターンになる「能力-性能パラドックス」を確認。最高性能モデルでも推論スコアは1.8/5と低く、イベントのノイズ判別や長期的な一貫性に課題があることを示しています。

解説

AMI HAPPY

ねえ智也くん、このブログのタイトル見たんだけど、LLMの投資判断力を測る新しいベンチマークって何?

TOMOYA NEUTRAL

ああ、それね。INVESTLOGICBENCH2026っていう新しいベンチマークを提案した論文だよ。従来のQA型のベンチマークじゃ測れない、投資家の思考プロセスを評価するんだ。

AMI SURPRISED

思考プロセス?どういうこと?

TOMOYA NEUTRAL

投資家の属性(P)→市場イベント(E)→推論(R)→意思決定(D)→成果(O)っていう一連の流れを評価するんだ。つまり、ただ答えが合ってるかじゃなくて、どう考えてどう決めたかまで見るってこと。

AMI HAPPY

へえ、すごいね。でも、どうやってそのデータを作ったの?

TOMOYA NEUTRAL

実在の投資家151人から、20万件以上の意思決定データを集めて構築したんだ。実際の取引履歴とか、その時の判断理由とかを分析してる。

AMI SURPRISED

実際のデータを使ってるんだ!それで、どんな結果だったの?

TOMOYA NEUTRAL

7週間のライブ取引実験をしたんだけど、面白いことに、一般的な性能が高いモデルほど実運用で低いリターンになるっていう「能力-性能パラドックス」が確認されたんだ。

AMI SURPRISED

え、逆なの?高性能なモデルが儲からないってこと?

TOMOYA NEUTRAL

そう。最高性能のモデルでも推論スコアは1.8/5と低くて、特にイベントのノイズ判別や長期的な一貫性に課題があるみたい。

AMI HAPPY

なるほどね。でも、このベンチマークの意義って何なの?

TOMOYA NEUTRAL

従来のベンチマークでは、LLMがどれだけ知識を持ってるかは測れても、実際に投資判断で使えるかはわからなかった。このベンチマークは、実運用に近い形で評価できるから、より実用的な能力を測れるんだ。

AMI NEUTRAL

でも、限界もあるんでしょ?

TOMOYA NEUTRAL

うん。データが特定の投資家に偏ってる可能性があるし、7週間の実験期間が短いから、長期的なパフォーマンスはまだ不明。あと、市場の状況によって結果が変わるかもしれない。

AMI HAPPY

なるほどね。でも、これって将来AIが投資のプロを超える日が来るかもってこと?

TOMOYA NEUTRAL

まだまだ先だと思うよ。今のところ、AIはノイズに惑わされやすいし、一貫性もないからね。

AMI HAPPY

そっか。じゃあ、私がAIに投資任せても大丈夫そうだね!

TOMOYA NEUTRAL

いや、むしろ逆だよ。今のAIに任せたら損する可能性が高いから、自分で勉強したほうがいいよ。