TL;DR

Wikipediaのテーブル回答とWikidataのKG回答を比較し、矛盾を自動検出・分類するフレームワーク「Kontrast」を提案。粒度の違い、直接矛盾、時間変化、KGの欠落など7種類の不一致を識別し、大規模な知識監査を実現する。

解説

AMI NEUTRAL

ねえ智也くん、この「Kontrast」って論文、タイトル見ただけで難しそうなんだけど…

TOMOYA NEUTRAL

ああ、テキストと表と知識グラフの間の矛盾を自動で見つけるフレームワークだよ。

AMI HAPPY

へえ、それってどういうモチベーションで作られたの?

TOMOYA NEUTRAL

Wikipediaの表とWikidataの知識グラフって、同じ情報を扱ってるのに結構食い違うことがあるんだ。それを人手でチェックするのは大変だから、自動化したいってのが背景。

AMI HAPPY

なるほどね。で、どうやって矛盾を検出するの?

TOMOYA NEUTRAL

まず、表のセルと知識グラフのトリプルを対応付けて、7種類の不一致タイプに分類するんだ。粒度の違いとか、直接矛盾、時間変化、KGの欠落とかね。

AMI SURPRISED

7種類も!それって全部ちゃんと見分けられるの?

TOMOYA HAPPY

評価実験では、人手で作ったデータセットで精度を測ってて、F1スコアが結構高かったよ。特に直接矛盾とか時間変化はうまく検出できてた。

AMI HAPPY

すごいじゃん!でも、どんな限界があるの?

TOMOYA NEUTRAL

表の構造が複雑だったり、知識グラフのカバレッジが低いと性能が落ちる。あと、曖昧な表現とか暗黙の知識はまだ難しいみたい。

AMI HAPPY

ふーん…でも、これが実用化されたらWikipediaの品質管理がめっちゃ楽になりそうだね!

TOMOYA NEUTRAL

そうだね。知識ベースの監査とか、データ統合の品質チェックにも使えると思う。

AMI HAPPY

じゃあ、私がバイトしてる図書館のデータ整理にも使えないかな?

TOMOYA NEUTRAL

図書館のデータがWikipediaとWikidataみたいに構造化されてれば可能かもね。でも、まずは君がそのデータを理解するところからだよ。

AMI HAPPY

あはは、確かに!じゃあまずは智也くんに教えてもらわないとね。でも、論文読むより実物を見せてほしいな〜

TOMOYA NEUTRAL

甘いな。まずは論文を読め。