TL;DR

要求仕様書のレビュー(要求検査)を34名の学生がChatGPTあり/なしで実施した実験の結果、LLM支援はスメル(問題箇所)の検出精度を有意に下げることが分かりました。重大度の分類や所要時間には有意な影響はなく、学習効果もLLM支援を先に使うと減衰しました。LLMは初心者の技能習得を遅らせる可能性があり、導入には注意が必要です。

解説

AMI SURPRISED

ねえ智也くん、この論文のタイトル見てびっくりしたんだけど、LLM支援が要求レビューをむしろ悪化させるって本当なの?

TOMOYA NEUTRAL

ああ、本当だよ。34人の学生にChatGPTありとなしで要求仕様書のレビューをやってもらった実験なんだ。

AMI CURIOUS

へえ、でもLLMって便利そうなのに、なんで悪化するの?

TOMOYA NEUTRAL

簡単に言うと、LLM支援を使ったグループは、問題箇所(スメル)の検出精度が有意に下がったんだ。つまり、LLMが提案する内容に頼りすぎて、自分で見つける能力が鈍ったのかもしれない。

AMI CURIOUS

なるほどね。でも、重大度の分類とか所要時間には影響なかったって書いてあったけど、それはどういうこと?

TOMOYA NEUTRAL

重大度の分類(どの問題が深刻か)や、レビューにかかった時間には有意な差はなかったんだ。つまり、LLMを使っても時間は変わらないし、深刻さの判断も変わらない。でも、肝心の問題発見の精度が落ちたってわけ。

AMI SERIOUS

うーん、それって初心者には特にきついってこと?

TOMOYA SERIOUS

そうだね。学習効果も、LLM支援を先に使うと減衰したんだ。つまり、最初にLLMに頼ると、その後の学習効果が薄れる可能性がある。

AMI SURPRISED

じゃあ、LLMは初心者の技能習得を遅らせるってこと?

TOMOYA NEUTRAL

その可能性が高いってことだね。だから導入には注意が必要だって論文は言ってる。

AMI CURIOUS

でも、この実験って学生だけだよね?実際のプロには当てはまらないかもしれないし、限界もあるんじゃない?

TOMOYA NEUTRAL

そうだね。被験者が34人と少ないし、学生だけだから一般化には注意が必要。あと、タスクの種類やLLMのプロンプトによっても結果は変わるかもしれない。

AMI HAPPY

なるほどね。でも、LLMって魔法の杖じゃないってことか。使い方次第ってことだね。

TOMOYA NEUTRAL

まあ、魔法の杖だったら、僕ももっと楽して研究できるんだけどね。