TL;DR

SWE-bench系ベンチマークでは、PRとIssueの対応関係がずれている事例が13.6%存在し、LLMの評価を歪めています。PaiCheckerは、テキスト駆動・コード検証の3段階マルチエージェントでこのズレを高精度に検出し、最大92.12%の精度を達成しました。

解説

AMI CURIOUS

ねえ智也くん、この論文のタイトル、『PRとIssueのズレを自動検出』ってあるけど、どういうこと?

TOMOYA NEUTRAL

ああ、SWE-benchっていうソフトウェア開発のベンチマークがあるんだけど、そこでPR(プルリクエスト)とIssue(課題)の対応が間違ってることがあるんだ。

AMI SURPRISED

え、間違ってるってどういうこと?普通はちゃんと対応してるんじゃないの?

TOMOYA NEUTRAL

実は13.6%の事例で、PRが別のIssueを解決するものだったり、逆にIssueと無関係だったりするんだ。これがあると、LLMの評価が正しくできなくなる。

AMI CURIOUS

なるほどね。で、PaiCheckerっていうのは何をするの?

TOMOYA NEUTRAL

PaiCheckerは、そのズレを自動で検出するツールだよ。テキストとコードの両方をチェックして、3段階のマルチエージェントで判定するんだ。

AMI CURIOUS

3段階って、どんな風に進むの?

TOMOYA NEUTRAL

まずテキストベースでPRとIssueの関連を推測して、次にコードの変更を検証して、最後に総合的に判断する感じ。

AMI CURIOUS

へー、それで精度はどのくらい?

TOMOYA HAPPY

最大で92.12%の精度を達成してるよ。かなり高い。

AMI SURPRISED

すごい!でも、なんでそんなに精度が高いの?

TOMOYA NEUTRAL

テキストだけじゃなくて、実際のコードの変更を検証するからだよ。テキストだけだと誤検出が多いけど、コードを見ることで正確になる。

AMI CURIOUS

なるほど。でも、限界とかあるんじゃない?

TOMOYA NEUTRAL

うん、例えば複雑なリファクタリングや、複数のIssueにまたがるPRだと、まだ誤判定があるみたい。あと、コードの実行環境が必要だから、コストがかかることもある。

AMI HAPPY

でも、これでベンチマークの信頼性が上がるなら、すごく役に立ちそうだね。

TOMOYA NEUTRAL

そうだね。特にLLMの評価を正確にするためには重要だと思う。

AMI HAPPY

じゃあ、これでAIもちゃんと仕事してくれるようになるかな?

TOMOYA NEUTRAL

まあ、少なくともベンチマークの信頼性は上がるよ。でも、AIが完璧になるわけじゃないけどね。

AMI HAPPY

あはは、それじゃあ、私の宿題も自動でチェックしてほしいな~

TOMOYA NEUTRAL

それはPaiCheckerじゃなくて、自分でやったほうが早いよ。