TL;DR

TEDトークの評価表現(Appraisal理論のAttitude分類)を、訓練中の言語学者・熟練言語学者・LLM(GPT-3.5, GPT-4o, Gemini 1.0 Pro)で比較。LLMは熟練言語学者のアノテーションに最も近く、ファインチューニングでF1=0.77を達成。一方、訓練中の人間は一致率が低く、LLMが複雑なアノテーション作業を支援できる可能性を示唆。ただし、カテゴリ間の曖昧さや暗黙的評価の難しさは人間と共通する課題も残る。

解説

AMI HAPPY

ねえ智也くん、この論文のタイトル、『LLMは複雑な評価言語の分類で人間を超えられるか?』ってすごく気になるんだけど、要するに何を調べたの?

TOMOYA NEUTRAL

ああ、これはTEDトークの中の評価表現を、Appraisal理論のAttitude分類っていう枠組みで分類するタスクを、人間とLLMで比較した研究だよ。

AMI SURPRISED

Appraisal理論?初めて聞いた。どんな理論なの?

TOMOYA NEUTRAL

簡単に言うと、言語の中に込められた態度や評価を体系的に分析するための理論だよ。Attitude分類は、感情・判断・評価の3つの大きなカテゴリに分けて、さらに細かいサブカテゴリがあるんだ。

AMI NEUTRAL

なるほど。で、人間とLLMをどうやって比べたの?

TOMOYA NEUTRAL

訓練中の言語学者と熟練言語学者、それにGPT-3.5、GPT-4o、Gemini 1.0 Proの3つのLLMに、同じTEDトークのテキストを分類させて、その一致度を比較したんだ。

AMI CURIOUS

へえ、それで結果はどうだったの?

TOMOYA HAPPY

LLMは熟練言語学者のアノテーションに最も近い結果を示したんだ。特にファインチューニングしたモデルはF1スコア0.77を達成して、訓練中の人間よりも高いパフォーマンスだったよ。

AMI SURPRISED

え、訓練中の人間よりLLMの方が上手く分類できるってこと?すごいね!でも、それってちょっと悲しい気もするけど…

TOMOYA NEUTRAL

確かに、でもこれはLLMがアノテーション作業を支援できる可能性を示しているとも言えるよ。人間の負担を減らせるかもしれない。

AMI NEUTRAL

なるほどね。でも、何か課題とか限界もあるんでしょ?

TOMOYA NEUTRAL

うん。カテゴリ間の曖昧さや、暗黙的な評価表現の分類は人間でもLLMでも難しいみたい。特に、文脈に依存する評価は判断が分かれることがあるんだ。

AMI CURIOUS

ふーん、やっぱり完璧ではないんだね。でも、LLMがここまでできるなら、将来は言語学者の仕事も変わっていくのかな?

TOMOYA NEUTRAL

そうかもしれないね。でも、最終的な判断は人間が下すべきだと思うよ。LLMはあくまで支援ツールとして使うのがいいんじゃないかな。

AMI HAPPY

確かにね。でも、もしLLMが完璧に分類できるようになったら、言語学者は失業しちゃうかもね(笑)

TOMOYA NEUTRAL

それはないよ。むしろ、もっと複雑な分析に集中できるようになるから、仕事の質が上がると思うよ。