TL;DREMBL AI LI…
TL;DR
MoRouteは、凍結したVLM(Qwen3.5-9B)と事前学習済みの動画DiT(Wan2.1-T2V-14B)を異種エキスパートとして接続し、各DiTブロックが入力に応じて最適なVLMレイヤーを動的に選択するルーティング機構を導入。参照画像やソース動画をDiTのトークン列に直接連結するインコンテキスト条件付けにより、テキスト・画像・動画を組み合わせた多様な生成・編集タスクを単一モデルで統一的に処理。3つのベンチマークで既存手法を上回るスコアを達成。
解説
ねえ智也くん、このMoRouteって論文、タイトルがかっこよくて気になってたんだけど、結局何がすごいの?
ああ、これは動画生成のモデルだよ。テキストだけでなく、画像や動画も入力として使えるんだ。
へえ、でも今までの動画生成モデルってテキストからしか作れなかったっけ?
そう。従来はテキストから動画を作るのが主流だったけど、MoRouteは参照画像やソース動画を直接トークン列に連結して、インコンテキスト条件付けって方法で扱ってるんだ。
インコンテキスト?なんだか難しそう…でも、それで何ができるようになるの?
例えば、ある人物の画像を渡して「この人が走っている動画を作って」とか、既存の動画を編集して「背景を夜に変えて」みたいなことが、一つのモデルでできるようになる。
おお、それはすごい!でも、どうやってそんなことを実現してるの?
MoRouteは、凍結したVLM(Qwen3.5-9B)と事前学習済みの動画DiT(Wan2.1-T2V-14B)を異種エキスパートとして接続してるんだ。
凍結?異種エキスパート?ちょっと待って、一つずつ説明して!
凍結ってのは、学習させずにそのまま使うってこと。VLMは画像や動画の意味を理解するのが得意で、DiTは動画を生成するのが得意。
なるほど、二人の専門家を組み合わせるってこと?
そう。でもただ組み合わせるだけじゃなくて、各DiTブロックが入力に応じて最適なVLMレイヤーを動的に選ぶルーティング機構を導入してるんだ。
動的に選ぶって、まるで道を選ぶみたいだね。それが「ルーティング」って名前の由来?
その通り。これによって、テキスト・画像・動画を組み合わせた多様なタスクを単一モデルで統一的に処理できるんだ。
で、実際の性能はどうなの?
3つのベンチマークで既存手法を上回るスコアを達成してる。特に、画像から動画への生成や、動画編集のタスクで顕著な改善が見られたよ。
すごい!じゃあ、もう完璧なの?
いや、まだ限界もあるよ。例えば、VLMとDiTのサイズが大きいから計算コストが高いし、ルーティングのオーバーヘッドもある。
あー、やっぱり完璧じゃないんだね。でも、それでもすごいと思うよ!
ああ、今後の課題としては、より軽量なモデルや、より効率的なルーティング方法の開発が挙げられるね。
でもさ、この技術が進化したら、将来は映画のワンシーンを言葉で指定するだけで作れたりするのかな?
可能性はあるね。ただ、その前に君が映画監督になる練習をしておいたほうがいいかもね。
えへへ、じゃあ智也くんがアシスタントになってよ!
…それは遠慮しておくよ。