TL;DR

SCDGは、生成AIによる書き換え後の盗用を検出する新しい指標です。凍結済み言語モデルを使い、候補ソースがある場合とない場合で文書の予測しやすさ(記述長)を比較します。ソースが文書の予測にどれだけ貢献したかをトークン単位で測ることで、表面的な類似度では見抜けない深い書き換えや複数ソースの合成も検出できます。

解説

AMI SURPRISED

ねえ智也くん、このブログのタイトル見て!「生成AI盗用検出の新指標:SCDGでソース再利用を測る」って。生成AIって文章を書くだけじゃなくて、盗用もするんだ?

TOMOYA NEUTRAL

そうだよ。特に、既存の文章をAIが書き換えると、表面的な類似度では検出しにくい盗用が起きる。従来の方法では見抜けないんだ。

AMI CURIOUS

へえ、じゃあSCDGって何が新しいの?

TOMOYA NEUTRAL

SCDGは「Source Contribution via Description Gain」の略で、凍結済みの言語モデルを使って、候補ソースがある場合とない場合で文書の予測しやすさを比較するんだ。

AMI CONFUSED

予測しやすさ?それってどうやって測るの?

TOMOYA NEUTRAL

言語モデルが文書を生成するときの「記述長」を使うんだ。ソースがあると、その情報で文書が予測しやすくなって、記述長が短くなる。その差をトークン単位で計算して、ソースがどれだけ貢献したかを測るんだよ。

AMI HAPPY

なるほど!つまり、ソースがなければ長く書かないといけないけど、ソースがあれば短く書けるってこと?

TOMOYA NEUTRAL

その通り。そして、この方法だと、単純な言い換えだけでなく、複数のソースを合成した場合も検出できるんだ。

AMI CURIOUS

すごい!でも、どうやって評価したの?

TOMOYA NEUTRAL

既存の盗用検出データセットを使って、従来の指標と比較したんだ。特に、AIが書き換えた文章に対して、SCDGが高い精度を示したらしい。

AMI HAPPY

じゃあ、実際に使えるってこと?

TOMOYA NEUTRAL

うん、でも限界もあるよ。言語モデルに依存するから、モデルが変わると結果が変わる可能性がある。あと、計算コストが高いかもしれない。

AMI HAPPY

なるほどね。でも、AIが書いた文章を見抜くのは、まるで探偵みたいで面白いね!

TOMOYA NEUTRAL

探偵というより、言語モデルの「心を読む」って感じだな。