TL;DR

LLMは同じ意味でも文の構造(能動態/受動態、分裂文など)が変わると政治的スタンスを変えることがある。本論文は6種類の言語的書き換えを用いて、スタンス変化を引き起こす書き換えの種類と、その変化がモデル内部のどの層・部位で生じるかを活性パッチングで特定した。結果、中盤〜後半のデコーダ層、特に最終プロンプト位置のブロック出力が復元に最も寄与することが分かった。

解説

AMI SURPRISED

ねえ智也くん、この論文のタイトル見てびっくりしたんだけど、言語構造の違いでLLMの政治的スタンスが変わるってどういうこと?

TOMOYA NEUTRAL

ああ、つまり同じ意味の文でも、能動態と受動態とか、分裂文みたいに文法構造を変えると、LLMが出す政治的スタンスが変わることがあるんだよ。

AMI SURPRISED

え、そんなことあるの?人間なら意味が同じなら答え変わらないのにね。

TOMOYA NEUTRAL

そう。で、この論文では6種類の言語的書き換えを使って、どの書き換えがスタンス変化を引き起こすか調べてる。

AMI HAPPY

6種類も!具体的にはどんな書き換え?

TOMOYA NEUTRAL

能動態/受動態、分裂文、倒置、否定、時制の変更、それと代名詞の変更だね。

AMI NEUTRAL

なるほど。で、どうやってスタンス変化が起きる場所を特定したの?

TOMOYA NEUTRAL

活性パッチングっていう手法を使ってる。モデルの特定の層や部位の出力を書き換えたバージョンと元のバージョンで入れ替えて、どこが変化に効くか調べるんだ。

AMI HAPPY

へえ、それでどこが重要だったの?

TOMOYA NEUTRAL

中盤から後半のデコーダ層、特に最終プロンプト位置のブロック出力が復元に一番寄与してた。

AMI NEUTRAL

つまり、モデルの後ろの方でスタンスが決まるってこと?

TOMOYA NEUTRAL

そういうこと。特に書き換えの種類によって影響を受ける層が微妙に違うのも面白いところ。

AMI SURPRISED

でも、これってLLMが政治的に偏ってるってことにならない?

TOMOYA NEUTRAL

そういうリスクを示唆してる。でもこの研究の意義は、そういうバイアスを検出して、どこで起きてるか特定できるようにしたこと。

AMI NEUTRAL

なるほどね。でも限界もあるんでしょ?

TOMOYA NEUTRAL

うん。使ったモデルが限られてるし、英語だけ。それに書き換えの種類も6種類だけだから、もっとあるかもしれない。

AMI NEUTRAL

あと、実際の政治的な文脈でどのくらい影響があるかも気になるなあ。

TOMOYA NEUTRAL

そう。そこは今後の課題だね。

AMI HAPPY

でもさ、もしLLMが能動態と受動態で意見変えるなら、政治家のスピーチを能動態に書き換えたら支持率上がったりしてね!

TOMOYA NEUTRAL

それはさすがにやりすぎだよ。