TL;DRLLM-as-Jud…
TL;DR
本論文は、eコマース検索においてユーザーの暗黙的な意図(代替品・補完品・テーマ関連品)をLLMで生成し、検索結果を拡張する手法を提案。ヘッドクエリにはGPT-3.5 Turboを、テールクエリにはQwen3-30BをLoRA蒸留でファインチューニングしたSLMを用いる2段階アーキテクチャにより、クエリカバレッジを約60%から80%に拡大しつつ、教師モデルの約30%の推論コストを実現。評価はセッション購買データによるエンドツーエンド分析とLLM-as-a-judgeの二軸で行い、F1スコアで既存システムを上回った。
解説
ねえ智也くん、この論文のタイトル、『EC検索で発見性を向上』ってあるけど、どういうこと?
簡単に言うと、ECサイトでユーザーが検索するとき、暗黙の意図をAIで推定して、検索結果を広げる手法だよ。
暗黙の意図って?例えば「スマホケース」って検索したら、代替品とか補完品も出してくれるってこと?
そう。代替品、補完品、テーマ関連品の3種類をLLMで生成して、検索結果に追加するんだ。
でもLLMって重いんでしょ?全部に使うのは大変そう。
そこが工夫。ヘッドクエリ(よく検索されるクエリ)にはGPT-3.5 Turbo、テールクエリ(珍しいクエリ)にはQwen3-30BをLoRA蒸留でファインチューニングしたSLMを使ってる。
2段階アーキテクチャってやつ?それでコストはどうなったの?
教師モデルの約30%の推論コストで、クエリカバレッジを約60%から80%に拡大できた。
すごい!でも評価ってどうやってるの?ちゃんと効果あるか確認しないとね。
セッション購買データを使ったエンドツーエンド分析と、LLM-as-a-judgeの2軸で評価してる。F1スコアで既存システムを上回ったらしい。
なるほどね。でも、この手法の限界とかはあるの?
テールクエリのSLMは蒸留で性能が落ちる可能性があるし、LLMが生成する意図が常に正しいとは限らない。あと、リアルタイム性の課題もある。
ふーん、でも面白いね。私もECで「これ何に使うんだろう?」って検索することあるから、そういう時に役立ちそう!
そうだね。でも君の場合は、検索する前に買い物かごに入れてるから、あまり関係ないかも。
あはは、バレた?でもそれも暗黙の意図ってことで!
……それはただの衝動買いだよ。