TL;DR

LLMの安全性評価は通常API経由・1回の実行・正解率のみで行われますが、本研究ではChatGPTのチャットUIとAPIを比較し、検索有無や繰り返し実行によって結果が大きく変動することを実証。正解率だけでなく、応答の一貫性・引用・拒否行動も評価すべきと提言しています。

解説

AMI HAPPY

ねえ智也くん、この論文のタイトル見て!「ベンチマーク評価の盲点」って、なんだかドキッとする感じだね。

TOMOYA NEUTRAL

ああ、それね。LLMの安全性評価が、実はちゃんとできてないかもしれないって話だよ。

AMI SURPRISED

え、そうなの?でも普通にAPIでテストしてるんじゃないの?

TOMOYA NEUTRAL

普通はね。でもこの研究では、ChatGPTのチャットUIとAPIで結果が結構違うことを示してるんだ。

AMI SURPRISED

へー、同じモデルなのに?なんでそんなことになるの?

TOMOYA NEUTRAL

理由はいくつかあるけど、検索を使うかどうかとか、同じ質問を繰り返すかどうかで、応答が変わっちゃうんだよね。

AMI HAPPY

なるほど。じゃあ、一回だけAPIで試して正解率だけ見るってのは、ちょっと危ないってこと?

TOMOYA NEUTRAL

そう。正解率だけだと、たまたま良い答えが出たのか、本当に安全なのかわからない。

AMI NEUTRAL

じゃあ、どうやって評価すればいいの?

TOMOYA NEUTRAL

この論文では、応答の一貫性とか、引用がちゃんとしてるか、あと危ない質問にどう対応するか(拒否するか)も見るべきって言ってる。

AMI HAPPY

なるほどね。確かに、同じ質問に毎回違う答えが返ってきたら信頼できないもんね。

TOMOYA NEUTRAL

うん。それに、チャットUIだと検索結果が混ざるから、APIだけの評価では見えない問題も見えてくる。

AMI SAD

でも、これって結構大変じゃない?評価する項目が増えるし。

TOMOYA NEUTRAL

確かに手間は増えるけど、安全なAIを作るには必要なことだと思う。

AMI NEUTRAL

うーん、でもまだ課題もあるんでしょ?

TOMOYA NEUTRAL

そうだね。この研究はChatGPTに限った話だし、他のモデルでも同じかはわからない。あと、評価指標の重み付けとかもまだ議論の余地がある。

AMI HAPPY

なるほどね。でも、こういう研究があると、AIを評価するときの視点が広がるね。

TOMOYA NEUTRAL

そうだね。特に、実際にユーザーが触るUIでの評価は大事だと思う。

AMI HAPPY

じゃあ、私も今度からチャットUIで試してみようかな。でも、何回も同じ質問するのはちょっと面倒かも…。

TOMOYA NEUTRAL

まあ、面倒でもやる価値はあるよ。それに、君がやるときはちゃんと記録つけてね。