TL;DR

MERITは、LLMエージェントが過去の修正経験を記憶し、同じ失敗を繰り返さないようにする手法です。オラクル検証済みの修正を正例、失敗した方向を負例として保存し、失敗タイプに基づいて検索します。Spiderで66.34%→69.79%、BIRDで47.35%→48.44%と精度が向上しましたが、BIRDでの改善は限定的で、単純な動的検索と有意差はありません。

解説

AMI HAPPY

ねえ智也くん、このMERITって論文、タイトルからして「失敗を覚えて次に活かす」って感じだけど、具体的に何をするの?

TOMOYA NEUTRAL

ああ、Text-to-SQLのタスクで、LLMエージェントがSQLクエリを生成して、間違ったら修正するんだけど、その修正の経験を記憶して、次に同じ失敗をしないようにするんだ。

AMI SURPRISED

へー、つまり過去の失敗を覚えておくってこと?でも、どうやって記憶するの?

TOMOYA NEUTRAL

オラクル検証済みの修正を正例として、失敗した方向を負例として保存するんだ。そして、失敗タイプに基づいて検索して、似た状況でその記憶を利用する。

AMI CURIOUS

なるほど!でも、なんでそんなことする必要があるの?普通にLLMに聞けばいいんじゃない?

TOMOYA NEUTRAL

LLMは同じ間違いを繰り返すことがあるからね。特に複雑なSQLクエリだと、同じようなミスをしやすい。記憶を使ってそれを防ぐのが目的だよ。

AMI HAPPY

それで、効果はどうだったの?

TOMOYA NEUTRAL

Spiderデータセットで66.34%から69.79%に、BIRDで47.35%から48.44%に精度が上がった。

AMI SURPRISED

おー、結構上がってるじゃん!でもBIRDはちょっとしか上がってないね。

TOMOYA SAD

そう、BIRDでは改善が限定的で、単純な動的検索と比べて有意差もなかったんだ。

AMI CURIOUS

あー、それは残念。でも、なんでBIRDではうまくいかなかったの?

TOMOYA NEUTRAL

BIRDはデータベースが多様で複雑だから、記憶がうまく汎化しないのかもしれない。あと、失敗タイプの分類が難しいというのもある。

AMI HAPPY

なるほどね。でも、この研究の意義って何だと思う?

TOMOYA NEUTRAL

LLMエージェントに記憶を持たせるという方向性を示したことかな。特に、正例と負例を分けて保存するというアイデアは新しい。

AMI HAPPY

確かに、記憶って大事だよね。私もテストで同じ間違いを繰り返さないようにしたいな。

TOMOYA NEUTRAL

でも、君は毎回同じミスしてるじゃん。

AMI SAD

うっ、それは言わないでよ!でも、MERITみたいに記憶すれば改善できるかもね。

TOMOYA NEUTRAL

その前に、まずは記憶する気持ちを持とうね。