TL;DREMBL AI LI…
TL;DR
本論文は、LLMの投資判断能力を評価する新しいベンチマーク「INVESTLOGICBENCH2026」を提案しています。従来のQA型ベンチマークでは測れない、投資家の属性(P)→市場イベント(E)→推論(R)→意思決定(D)→成果(O)という一連の思考プロセスを、実在の投資家151人の20万件以上の意思決定データから構築しました。7週間のライブ取引実験では、一般的な性能が高いモデルほど実運用で低いリターンになる「能力-性能パラドックス」を確認。最高性能モデルでも推論スコアは1.8/5と低く、イベントのノイズ判別や長期的な一貫性に課題があることを示しています。
解説
ねえ智也くん、このブログのタイトル見たんだけど、LLMの投資判断力を測る新しいベンチマークって何?
ああ、それね。INVESTLOGICBENCH2026っていう新しいベンチマークを提案した論文だよ。従来のQA型のベンチマークじゃ測れない、投資家の思考プロセスを評価するんだ。
思考プロセス?どういうこと?
投資家の属性(P)→市場イベント(E)→推論(R)→意思決定(D)→成果(O)っていう一連の流れを評価するんだ。つまり、ただ答えが合ってるかじゃなくて、どう考えてどう決めたかまで見るってこと。
へえ、すごいね。でも、どうやってそのデータを作ったの?
実在の投資家151人から、20万件以上の意思決定データを集めて構築したんだ。実際の取引履歴とか、その時の判断理由とかを分析してる。
実際のデータを使ってるんだ!それで、どんな結果だったの?
7週間のライブ取引実験をしたんだけど、面白いことに、一般的な性能が高いモデルほど実運用で低いリターンになるっていう「能力-性能パラドックス」が確認されたんだ。
え、逆なの?高性能なモデルが儲からないってこと?
そう。最高性能のモデルでも推論スコアは1.8/5と低くて、特にイベントのノイズ判別や長期的な一貫性に課題があるみたい。
なるほどね。でも、このベンチマークの意義って何なの?
従来のベンチマークでは、LLMがどれだけ知識を持ってるかは測れても、実際に投資判断で使えるかはわからなかった。このベンチマークは、実運用に近い形で評価できるから、より実用的な能力を測れるんだ。
でも、限界もあるんでしょ?
うん。データが特定の投資家に偏ってる可能性があるし、7週間の実験期間が短いから、長期的なパフォーマンスはまだ不明。あと、市場の状況によって結果が変わるかもしれない。
なるほどね。でも、これって将来AIが投資のプロを超える日が来るかもってこと?
まだまだ先だと思うよ。今のところ、AIはノイズに惑わされやすいし、一貫性もないからね。
そっか。じゃあ、私がAIに投資任せても大丈夫そうだね!
いや、むしろ逆だよ。今のAIに任せたら損する可能性が高いから、自分で勉強したほうがいいよ。