TL;DRPallasは、AI…
TL;DR
SAPOは、LLMエージェントの強化学習において、1つの自己回帰モデルが方策・状態価値・行動価値を同時に表現する手法です。従来のPPOが別途クリティックモデルを必要としたのに対し、SAPOはそのメモリコストを排除しつつ、GRPOのような複数ロールアウトに依存しない単一ロールアウト学習を実現。ALFWorldとWebShopでPPO・GRPOを上回る性能を示し、PPO比でランタイムを33.2%削減しました。
解説
ねえ智也くん、今日のブログのSAPOって何?なんか強化学習の話でしょ?
うん、LLMエージェントの強化学習を軽くするフレームワークだよ。普通はPPOってアルゴリズムを使うんだけど、それには別の価値関数モデルが必要で、メモリを食うんだ。
へー、じゃあSAPOはそのメモリを減らしたってこと?
そう。SAPOは1つの自己回帰モデルが方策と状態価値と行動価値を全部同時に表現するんだ。だから別のクリティックモデルがいらない。
なるほど!でもそれって精度が落ちたりしないの?
実験ではむしろ上がってる。ALFWorldとWebShopっていうベンチマークで、PPOやGRPOより良い性能を出してるんだ。
すごい!でもGRPOってのもあるんでしょ?それと何が違うの?
GRPOは複数回ロールアウトして平均を取る必要があるけど、SAPOは1回のロールアウトで学習できる。だからランタイムもPPO比で33.2%削減できたんだ。
1回で済むなら速いのは当然だね!でも、なんで1つのモデルで全部できるの?
自己回帰モデルがトークンを生成するときに、価値ヘッドも一緒に出力するように設計されてるんだ。だから追加のモデルが不要になる。
なるほどー。でも何か弱点とか限界はないの?
うーん、まだ実験が2つのベンチマークだけだから、もっと複雑なタスクでどうなるかはわからない。あと、価値ヘッドの精度がモデルの表現力に依存するから、小さいモデルだと効果が薄いかもしれない。
なるほどね。でもメモリも時間も節約できるなら、実用的には大きいよね。
そうだね。特にリソースが限られた環境では有効だと思う。
じゃあ、SAPOはまるで「一石三鳥」だね!でも、私が三鳥を覚えるのは無理かも(笑)
その冗談は価値が低いから、強化学習で改善したほうがいいね。