TL;DR

SelectInferは、LLMのニューロンに「タスク固有」と「モデル共通」の2種類があることを利用し、オフラインで重要ニューロンを特定。メモリには70%だけ読み込み、実行時にはさらに40%だけ計算することで、NVIDIA Jetson Orin Nano上で3Bモデルを動作可能に。4ビット量子化比1.53倍、ディスクオフロード比13倍以上の高速化を達成。

解説

AMI HAPPY

ねえ智也くん、このブログのタイトル見て!「エッジデバイスでLLMを動かす」って、スマホとか小型の機械で大きなAIを動かすってこと?

TOMOYA NEUTRAL

そう。特にNVIDIA Jetson Orin Nanoっていう小型のAIボードで、3BパラメータのLLMを動かす研究だよ。普通はメモリが足りなくて動かないんだけど、SelectInferっていう手法でそれを可能にしてる。

AMI SURPRISED

へー!どうやって動かすの?魔法みたいだね。

TOMOYA NEUTRAL

LLMのニューロンには、タスクに特化したものと、どんなタスクでも使われる共通のものがあるんだ。SelectInferはオフラインでタスクごとに重要なニューロンを特定して、メモリには全体の70%だけ読み込む。さらに実行時にはその中の40%だけ計算する。

AMI SURPRISED

つまり、使わないニューロンをあらかじめ省いちゃうってこと?それで精度は落ちないの?

TOMOYA NEUTRAL

実験では、4ビット量子化と比べて1.53倍、ディスクにデータを置いて逐次読み込む方式と比べて13倍以上高速化できて、精度もほとんど落ちなかったって報告されてる。タスク固有のニューロンは重要度が高いから、削っても影響が少ないんだ。

AMI NEUTRAL

すごい!でも、それってタスクごとに事前にニューロンの重要度を調べる必要があるんだよね?新しいタスクが出てきたらまた最初から?

TOMOYA NEUTRAL

そこが課題だね。論文でも、タスクが増えるたびにオフライン解析が必要になるって指摘してる。あと、この手法は推論時の計算を減らすけど、学習には使えない。あくまで推論専用。

AMI HAPPY

なるほどね。でも、エッジデバイスでLLMが動くようになると、例えばロボットがその場で会話しながら判断するとか、面白い使い方ができそう!

TOMOYA NEUTRAL

そうだね。特にプライバシーが重要な場面や、ネットワークが不安定な場所では価値が高い。ただ、まだ研究段階で、実際の製品に載せるにはもう少し最適化が必要だと思う。

AMI HAPPY

でもさ、70%だけ読み込んで40%だけ計算って、まるで「やる気のあるときだけ仕事する」みたいだね。私もそれで単位取れないかな?

TOMOYA NEUTRAL

その場合は、重要な講義だけ選んで70%出席して、40%だけレポートを書けばいいってこと?…多分単位は落ちるよ。