TL;DRPallasは、AI…
TL;DR
ContractScrubは、契約書の最終レビュー(スクラビング)におけるLLMの性能を評価する初のベンチマークです。弁護士が手作業で作成した44件の契約書に、定義語の誤用や参照ミスなど9カテゴリのエラーを埋め込み、3,014タスクでモデルをテスト。最良のGPT-5.5でも再現率0.75、F1は0.65未満と、一般的なベンチマークでの高性能とは裏腹に、実務タスクではまだ不十分であることを示しました。
解説
ねえ智也くん、このブログのタイトル見たんだけど、契約書レビューAIのベンチマークって何?
ああ、ContractScrubのことか。契約書の最終チェック、つまりスクラビングって作業をAIがどれだけできるか測るためのベンチマークだよ。
スクラビング?なんか掃除みたいな名前だね。
まあ、実際にエラーを洗い出す作業だから、掃除に近いかも。弁護士が手で作った44件の契約書に、わざとエラーを埋め込んで、AIがそれを見つけられるか試すんだ。
へえ、エラーってどんなの?
定義語の誤用とか、参照ミスとか、全部で9カテゴリあるよ。例えば、契約書の中で定義した用語を別の意味で使っちゃうとか、参照先が間違ってるとか。
なるほどね。で、そのテストはどれくらいの量なの?
全部で3,014タスク。かなり大規模だよ。
それで、AIの成績はどうだったの?
最良のGPT-5.5でも再現率が0.75、F1スコアは0.65未満だった。つまり、エラーの4分の1は見逃してるし、精度もまだまだってこと。
えー、GPT-5.5ってすごいんじゃないの?なんでそんなに低いの?
一般的なベンチマークでは高性能でも、実務の契約書レビューはもっと複雑なんだよ。文脈の理解や細かい法的ニュアンスが必要だから、AIにはまだ難しいみたい。
じゃあ、このベンチマークの意義って何?
実務に近い形でAIの能力を測る初めての試みってことだね。これで、AIがどこまで使えるか、どこが弱点かが明確になる。
でも、まだ実用には遠いってこと?
そうだね。でも、このベンチマークがあることで、今後の改善の指針になる。ただ、限界もあるよ。
限界って?
契約書の種類が44件だけだし、エラーの種類も9カテゴリに限られてる。実際の契約書はもっと多様だから、一般化には注意が必要。
ふーん、じゃあAIに契約書レビュー任せるのはまだ早いってことか。でも、将来はできるようになるのかな?
可能性はあるけど、今はまだ人間の弁護士の補助ってところだね。
そっか。でも、AIが弁護士の仕事を奪う日は来ないってことだね。安心した!
いや、奪うかどうかは別問題だよ。むしろ、AIがミスしたら弁護士が責任取るんだから、大変さは変わらないかもね。