TL;DR

視覚言語モデル(VLM)は、映像から答えが確定できない状況を内部表現では検出できるのに、出力では「分からない」と表現できず、誤って答えを生成してしまう。TRAPSBenchは1,404組の物理シミュレーション動画ペア(答えが確定する動画と、遮蔽・カオス・質問不備で答えが確定しない動画)でこのギャップを定量化し、新指標PECSで評価した。16モデル中、最高PECSは0.292(標準プロンプト)と低く、プロンプトで明示的に「分からない」を促すと抑制が1.9倍向上するが、視覚的不確実性はテキスト的不確実性より約4倍検出されにくい。

解説

AMI HAPPY

ねえ智也くん、この論文のタイトル、なんか面白いね。「視覚言語モデルは『分からない』を内部で知っているのに答えを止められない」って、どういうこと?

TOMOYA NEUTRAL

ああ、つまりVLMは映像を見て答えが確定しない状況を内部の表現では検出できるのに、実際の出力では「分からない」と言えずに、間違った答えを生成しちゃうってこと。

AMI SURPRISED

へえ、内部では分かってるのに、外には出せないんだ。なんでそんなことになるの?

TOMOYA NEUTRAL

それが「表現ギャップ」って呼ばれる問題で、モデルが不確実性を内部で持っていても、それを自然言語で表現する訓練が十分じゃないからだと考えられてる。

AMI CURIOUS

なるほどね。で、この論文ではどうやってそれを調べたの?

TOMOYA NEUTRAL

TRAPSBenchっていうベンチマークを作って、1,404組の物理シミュレーション動画ペアを使ったんだ。片方は答えが確定する動画、もう片方は遮蔽とかカオスとか質問が不備で答えが確定しない動画。

AMI INTERESTED

動画ペアで比較するんだね。それでどうやって評価したの?

TOMOYA NEUTRAL

新しい指標PECSっていうのを使って、モデルが不確実なときに正しく「分からない」と答えられるかを測ったんだ。

AMI CURIOUS

PECS…なんか難しそう。結果はどうだったの?

TOMOYA SAD

16モデル中、最高でもPECSが0.292しかなかった。つまり、ほとんどの場合、不確実なのに答えを出しちゃってるってこと。

AMI SURPRISED

えー、そんなに低いんだ!でも、プロンプトで「分からない」って促せば改善するんじゃない?

TOMOYA NEUTRAL

うん、明示的に「分からない」を促すと抑制が1.9倍向上したんだ。でも、視覚的な不確実性はテキスト的な不確実性より約4倍検出されにくいって結果も出てる。

AMI THINKING

つまり、テキストで「分からない」って言うのはまだマシだけど、映像から判断するのはすごく苦手ってことか。

TOMOYA NEUTRAL

そう。この研究の意義は、VLMが不確実性を内部で持っているのに出力に反映できないことを定量的に示したことだね。今後の改善の手がかりになる。

AMI CURIOUS

でも、限界もあるんでしょ?

TOMOYA NEUTRAL

ああ、物理シミュレーションの動画だけを使ってるから、実世界の複雑な映像にはそのまま当てはまらないかもしれない。あと、PECSの定義もまだ改善の余地がある。

AMI HAPPY

なるほどね。でも、この研究を読むと、AIって「分からない」って言うのが本当に難しいんだなって思うよ。まるで、テストで分からない問題を適当に埋めちゃう学生みたい。

TOMOYA NEUTRAL

はは、確かに。でも、その学生も内部では「分かってない」って気づいてるんだから、まだ救いようがあるかもね。