TL;DREMBL AI LI…
TL;DR
視覚言語モデル(VLM)は、映像から答えが確定できない状況を内部表現では検出できるのに、出力では「分からない」と表現できず、誤って答えを生成してしまう。TRAPSBenchは1,404組の物理シミュレーション動画ペア(答えが確定する動画と、遮蔽・カオス・質問不備で答えが確定しない動画)でこのギャップを定量化し、新指標PECSで評価した。16モデル中、最高PECSは0.292(標準プロンプト)と低く、プロンプトで明示的に「分からない」を促すと抑制が1.9倍向上するが、視覚的不確実性はテキスト的不確実性より約4倍検出されにくい。
解説
ねえ智也くん、この論文のタイトル、なんか面白いね。「視覚言語モデルは『分からない』を内部で知っているのに答えを止められない」って、どういうこと?
ああ、つまりVLMは映像を見て答えが確定しない状況を内部の表現では検出できるのに、実際の出力では「分からない」と言えずに、間違った答えを生成しちゃうってこと。
へえ、内部では分かってるのに、外には出せないんだ。なんでそんなことになるの?
それが「表現ギャップ」って呼ばれる問題で、モデルが不確実性を内部で持っていても、それを自然言語で表現する訓練が十分じゃないからだと考えられてる。
なるほどね。で、この論文ではどうやってそれを調べたの?
TRAPSBenchっていうベンチマークを作って、1,404組の物理シミュレーション動画ペアを使ったんだ。片方は答えが確定する動画、もう片方は遮蔽とかカオスとか質問が不備で答えが確定しない動画。
動画ペアで比較するんだね。それでどうやって評価したの?
新しい指標PECSっていうのを使って、モデルが不確実なときに正しく「分からない」と答えられるかを測ったんだ。
PECS…なんか難しそう。結果はどうだったの?
16モデル中、最高でもPECSが0.292しかなかった。つまり、ほとんどの場合、不確実なのに答えを出しちゃってるってこと。
えー、そんなに低いんだ!でも、プロンプトで「分からない」って促せば改善するんじゃない?
うん、明示的に「分からない」を促すと抑制が1.9倍向上したんだ。でも、視覚的な不確実性はテキスト的な不確実性より約4倍検出されにくいって結果も出てる。
つまり、テキストで「分からない」って言うのはまだマシだけど、映像から判断するのはすごく苦手ってことか。
そう。この研究の意義は、VLMが不確実性を内部で持っているのに出力に反映できないことを定量的に示したことだね。今後の改善の手がかりになる。
でも、限界もあるんでしょ?
ああ、物理シミュレーションの動画だけを使ってるから、実世界の複雑な映像にはそのまま当てはまらないかもしれない。あと、PECSの定義もまだ改善の余地がある。
なるほどね。でも、この研究を読むと、AIって「分からない」って言うのが本当に難しいんだなって思うよ。まるで、テストで分からない問題を適当に埋めちゃう学生みたい。
はは、確かに。でも、その学生も内部では「分かってない」って気づいてるんだから、まだ救いようがあるかもね。