解説ねえ智也くん、この論文のタ…
TL;DR
LLMが「成功確率70%」「失敗確率15%」と答えるとき、合計が100%にならない非対称性が楽観バイアスです。OptimismBenchは、同じシナリオで成功と失敗の確率を別々に聞く「反転ペア」手法で、16モデル中14が楽観的、Anthropicの最上位モデルのみ悲観的という結果を報告。事後学習(RLHF)がバイアスの方向を決める主要因であり、モデル選択が言語よりも重要(モデル間分散は言語間分散の4.7倍)です。
解説
ねえ智也くん、このOptimismBenchって論文、面白そうだね!LLMって楽観バイアスがあるんだって?
うん。LLMが確率を答えるとき、成功と失敗の確率を足しても100%にならない非対称性があるんだ。それを楽観バイアスって呼んでる。
へー、確かに「成功確率70%」って言われたら、失敗は30%って思うけど、実際は違うんだね。どうやって調べたの?
同じシナリオで成功確率と失敗確率を別々に聞く「反転ペア」っていう手法を使ったんだ。例えば「この作戦が成功する確率は?」と「失敗する確率は?」って別々に聞く。
なるほど!それで差が出たらバイアスってわけか。結果はどうだったの?
16モデル中14が楽観的だった。つまり成功確率を高く、失敗確率を低く見積もる傾向があった。逆にAnthropicの最上位モデルだけが悲観的だったんだ。
え、Anthropicだけ逆なの?なんでだろう?
論文によると、事後学習(RLHF)がバイアスの方向を決める主要因らしい。学習の仕方で楽観にも悲観にもなるってこと。
じゃあモデル選びが大事ってこと?言語によっても違うのかな?
モデル間の分散は言語間の分散の4.7倍もあったんだ。つまり、どの言語で聞くかより、どのモデルを使うかの方がバイアスに大きく影響する。
へえ、結構重要な発見だね。でもこのベンチマークって限界もあるんじゃない?
そうだね。シナリオが限られてるし、実際の応用でどう影響するかまではわからない。あと、確率の解釈自体がモデルによって違う可能性もある。
なるほどね。でもこれでLLMの性格みたいなのがわかって面白いよ!まるで占いみたいだね。「あなたのAIは楽観的です」って。
占いよりは再現性があると思うけどな。