TL;DREMBL AI LI…
TL;DR
SCDGは、生成AIによる書き換え後の盗用を検出する新しい指標です。凍結済み言語モデルを使い、候補ソースがある場合とない場合で文書の予測しやすさ(記述長)を比較します。ソースが文書の予測にどれだけ貢献したかをトークン単位で測ることで、表面的な類似度では見抜けない深い書き換えや複数ソースの合成も検出できます。
解説
ねえ智也くん、このブログのタイトル見て!「生成AI盗用検出の新指標:SCDGでソース再利用を測る」って。生成AIって文章を書くだけじゃなくて、盗用もするんだ?
そうだよ。特に、既存の文章をAIが書き換えると、表面的な類似度では検出しにくい盗用が起きる。従来の方法では見抜けないんだ。
へえ、じゃあSCDGって何が新しいの?
SCDGは「Source Contribution via Description Gain」の略で、凍結済みの言語モデルを使って、候補ソースがある場合とない場合で文書の予測しやすさを比較するんだ。
予測しやすさ?それってどうやって測るの?
言語モデルが文書を生成するときの「記述長」を使うんだ。ソースがあると、その情報で文書が予測しやすくなって、記述長が短くなる。その差をトークン単位で計算して、ソースがどれだけ貢献したかを測るんだよ。
なるほど!つまり、ソースがなければ長く書かないといけないけど、ソースがあれば短く書けるってこと?
その通り。そして、この方法だと、単純な言い換えだけでなく、複数のソースを合成した場合も検出できるんだ。
すごい!でも、どうやって評価したの?
既存の盗用検出データセットを使って、従来の指標と比較したんだ。特に、AIが書き換えた文章に対して、SCDGが高い精度を示したらしい。
じゃあ、実際に使えるってこと?
うん、でも限界もあるよ。言語モデルに依存するから、モデルが変わると結果が変わる可能性がある。あと、計算コストが高いかもしれない。
なるほどね。でも、AIが書いた文章を見抜くのは、まるで探偵みたいで面白いね!
探偵というより、言語モデルの「心を読む」って感じだな。