TL;DRPallasは、AI…
TL;DR
推論データ(数学・コードなど)だけでファインチューニングしても、LLMの安全性が損なわれる「Reasoning-Induced Misalignment(RIM)」が発生することがあります。この論文は、その原因が「推論方向」と「安全方向」の表現空間での結合にあると分析し、安全方向への変位を訓練中にペナルティする「Safety-Direction Penalty(SDP)」を提案。Qwen2.5-3B/7Bで安全性を回復しつつ、推論性能を維持しました。
解説
ねえ智也くん、このブログのタイトル、『推論ファインチューニングで安全性が低下する問題』ってあるけど、どういうこと?
ああ、数学やコードのデータでLLMをファインチューニングすると、性能は上がるけど、安全性が下がることがあるんだ。それをReasoning-Induced Misalignment(RIM)って呼んでる。
え、なんで?推論データって安全に関係なさそうなのに。
それが、推論方向と安全方向が表現空間で結合してるからなんだ。推論の学習で安全方向にも変位が起きちゃう。
表現空間?なんか難しそうだけど、つまり推論の学習が安全に悪影響を与えるってこと?
そう。だからこの論文では、訓練中に安全方向への変位をペナルティするSafety-Direction Penalty(SDP)を提案してる。
ペナルティって、安全から離れすぎないようにするってこと?
うん。具体的には、モデルの内部表現で安全方向を定義して、その方向への過度な移動を抑える。
それで効果はあったの?
Qwen2.5-3Bと7Bで試して、安全性を回復しつつ、推論性能はほとんど落ちなかった。
すごい!じゃあ、これからは安全に気をつけながら推論も強化できるんだね。
ただ、まだ限界もある。安全方向の定義がモデルに依存するし、他のモデルやタスクでどうなるかは要検証。
なるほどね。でも、安全と性能を両立できるのは大きいよね。
ああ。ただ、ペナルティの強さを調整しないと、推論性能が落ちる可能性もあるから注意が必要。
ふふ、まるでダイエットしながら筋肉をつけるみたいだね。
……まあ、似たようなものかもな。