TL;DR

MoRouteは、凍結したVLM(Qwen3.5-9B)と事前学習済みの動画DiT(Wan2.1-T2V-14B)を異種エキスパートとして接続し、各DiTブロックが入力に応じて最適なVLMレイヤーを動的に選択するルーティング機構を導入。参照画像やソース動画をDiTのトークン列に直接連結するインコンテキスト条件付けにより、テキスト・画像・動画を組み合わせた多様な生成・編集タスクを単一モデルで統一的に処理。3つのベンチマークで既存手法を上回るスコアを達成。

解説

AMI HAPPY

ねえ智也くん、このMoRouteって論文、タイトルがかっこよくて気になってたんだけど、結局何がすごいの?

TOMOYA NEUTRAL

ああ、これは動画生成のモデルだよ。テキストだけでなく、画像や動画も入力として使えるんだ。

AMI SURPRISED

へえ、でも今までの動画生成モデルってテキストからしか作れなかったっけ?

TOMOYA NEUTRAL

そう。従来はテキストから動画を作るのが主流だったけど、MoRouteは参照画像やソース動画を直接トークン列に連結して、インコンテキスト条件付けって方法で扱ってるんだ。

AMI NEUTRAL

インコンテキスト?なんだか難しそう…でも、それで何ができるようになるの?

TOMOYA NEUTRAL

例えば、ある人物の画像を渡して「この人が走っている動画を作って」とか、既存の動画を編集して「背景を夜に変えて」みたいなことが、一つのモデルでできるようになる。

AMI HAPPY

おお、それはすごい!でも、どうやってそんなことを実現してるの?

TOMOYA NEUTRAL

MoRouteは、凍結したVLM(Qwen3.5-9B)と事前学習済みの動画DiT(Wan2.1-T2V-14B)を異種エキスパートとして接続してるんだ。

AMI SURPRISED

凍結?異種エキスパート?ちょっと待って、一つずつ説明して!

TOMOYA NEUTRAL

凍結ってのは、学習させずにそのまま使うってこと。VLMは画像や動画の意味を理解するのが得意で、DiTは動画を生成するのが得意。

AMI HAPPY

なるほど、二人の専門家を組み合わせるってこと?

TOMOYA NEUTRAL

そう。でもただ組み合わせるだけじゃなくて、各DiTブロックが入力に応じて最適なVLMレイヤーを動的に選ぶルーティング機構を導入してるんだ。

AMI HAPPY

動的に選ぶって、まるで道を選ぶみたいだね。それが「ルーティング」って名前の由来?

TOMOYA NEUTRAL

その通り。これによって、テキスト・画像・動画を組み合わせた多様なタスクを単一モデルで統一的に処理できるんだ。

AMI NEUTRAL

で、実際の性能はどうなの?

TOMOYA HAPPY

3つのベンチマークで既存手法を上回るスコアを達成してる。特に、画像から動画への生成や、動画編集のタスクで顕著な改善が見られたよ。

AMI SURPRISED

すごい!じゃあ、もう完璧なの?

TOMOYA NEUTRAL

いや、まだ限界もあるよ。例えば、VLMとDiTのサイズが大きいから計算コストが高いし、ルーティングのオーバーヘッドもある。

AMI HAPPY

あー、やっぱり完璧じゃないんだね。でも、それでもすごいと思うよ!

TOMOYA NEUTRAL

ああ、今後の課題としては、より軽量なモデルや、より効率的なルーティング方法の開発が挙げられるね。

AMI HAPPY

でもさ、この技術が進化したら、将来は映画のワンシーンを言葉で指定するだけで作れたりするのかな?

TOMOYA NEUTRAL

可能性はあるね。ただ、その前に君が映画監督になる練習をしておいたほうがいいかもね。

AMI HAPPY

えへへ、じゃあ智也くんがアシスタントになってよ!

TOMOYA NEUTRAL

…それは遠慮しておくよ。