TL;DRPallasは、AI…
TL;DR
要求仕様書のレビュー(要求検査)を34名の学生がChatGPTあり/なしで実施した実験の結果、LLM支援はスメル(問題箇所)の検出精度を有意に下げることが分かりました。重大度の分類や所要時間には有意な影響はなく、学習効果もLLM支援を先に使うと減衰しました。LLMは初心者の技能習得を遅らせる可能性があり、導入には注意が必要です。
解説
ねえ智也くん、この論文のタイトル見てびっくりしたんだけど、LLM支援が要求レビューをむしろ悪化させるって本当なの?
ああ、本当だよ。34人の学生にChatGPTありとなしで要求仕様書のレビューをやってもらった実験なんだ。
へえ、でもLLMって便利そうなのに、なんで悪化するの?
簡単に言うと、LLM支援を使ったグループは、問題箇所(スメル)の検出精度が有意に下がったんだ。つまり、LLMが提案する内容に頼りすぎて、自分で見つける能力が鈍ったのかもしれない。
なるほどね。でも、重大度の分類とか所要時間には影響なかったって書いてあったけど、それはどういうこと?
重大度の分類(どの問題が深刻か)や、レビューにかかった時間には有意な差はなかったんだ。つまり、LLMを使っても時間は変わらないし、深刻さの判断も変わらない。でも、肝心の問題発見の精度が落ちたってわけ。
うーん、それって初心者には特にきついってこと?
そうだね。学習効果も、LLM支援を先に使うと減衰したんだ。つまり、最初にLLMに頼ると、その後の学習効果が薄れる可能性がある。
じゃあ、LLMは初心者の技能習得を遅らせるってこと?
その可能性が高いってことだね。だから導入には注意が必要だって論文は言ってる。
でも、この実験って学生だけだよね?実際のプロには当てはまらないかもしれないし、限界もあるんじゃない?
そうだね。被験者が34人と少ないし、学生だけだから一般化には注意が必要。あと、タスクの種類やLLMのプロンプトによっても結果は変わるかもしれない。
なるほどね。でも、LLMって魔法の杖じゃないってことか。使い方次第ってことだね。
まあ、魔法の杖だったら、僕ももっと楽して研究できるんだけどね。