TL;DR

ContractScrubは、契約書の最終レビュー(スクラビング)におけるLLMの性能を評価する初のベンチマークです。弁護士が手作業で作成した44件の契約書に、定義語の誤用や参照ミスなど9カテゴリのエラーを埋め込み、3,014タスクでモデルをテスト。最良のGPT-5.5でも再現率0.75、F1は0.65未満と、一般的なベンチマークでの高性能とは裏腹に、実務タスクではまだ不十分であることを示しました。

解説

AMI HAPPY

ねえ智也くん、このブログのタイトル見たんだけど、契約書レビューAIのベンチマークって何?

TOMOYA NEUTRAL

ああ、ContractScrubのことか。契約書の最終チェック、つまりスクラビングって作業をAIがどれだけできるか測るためのベンチマークだよ。

AMI HAPPY

スクラビング?なんか掃除みたいな名前だね。

TOMOYA NEUTRAL

まあ、実際にエラーを洗い出す作業だから、掃除に近いかも。弁護士が手で作った44件の契約書に、わざとエラーを埋め込んで、AIがそれを見つけられるか試すんだ。

AMI SURPRISED

へえ、エラーってどんなの?

TOMOYA NEUTRAL

定義語の誤用とか、参照ミスとか、全部で9カテゴリあるよ。例えば、契約書の中で定義した用語を別の意味で使っちゃうとか、参照先が間違ってるとか。

AMI CURIOUS

なるほどね。で、そのテストはどれくらいの量なの?

TOMOYA NEUTRAL

全部で3,014タスク。かなり大規模だよ。

AMI CURIOUS

それで、AIの成績はどうだったの?

TOMOYA NEUTRAL

最良のGPT-5.5でも再現率が0.75、F1スコアは0.65未満だった。つまり、エラーの4分の1は見逃してるし、精度もまだまだってこと。

AMI SURPRISED

えー、GPT-5.5ってすごいんじゃないの?なんでそんなに低いの?

TOMOYA NEUTRAL

一般的なベンチマークでは高性能でも、実務の契約書レビューはもっと複雑なんだよ。文脈の理解や細かい法的ニュアンスが必要だから、AIにはまだ難しいみたい。

AMI CURIOUS

じゃあ、このベンチマークの意義って何?

TOMOYA NEUTRAL

実務に近い形でAIの能力を測る初めての試みってことだね。これで、AIがどこまで使えるか、どこが弱点かが明確になる。

AMI SAD

でも、まだ実用には遠いってこと?

TOMOYA NEUTRAL

そうだね。でも、このベンチマークがあることで、今後の改善の指針になる。ただ、限界もあるよ。

AMI CURIOUS

限界って?

TOMOYA NEUTRAL

契約書の種類が44件だけだし、エラーの種類も9カテゴリに限られてる。実際の契約書はもっと多様だから、一般化には注意が必要。

AMI HAPPY

ふーん、じゃあAIに契約書レビュー任せるのはまだ早いってことか。でも、将来はできるようになるのかな?

TOMOYA NEUTRAL

可能性はあるけど、今はまだ人間の弁護士の補助ってところだね。

AMI HAPPY

そっか。でも、AIが弁護士の仕事を奪う日は来ないってことだね。安心した!

TOMOYA NEUTRAL

いや、奪うかどうかは別問題だよ。むしろ、AIがミスしたら弁護士が責任取るんだから、大変さは変わらないかもね。