2025/04/08 04:56 Tom and Jerry One-Minute Video Generation with Test-Time Training

ロボ子、今日のITニュースはビデオ生成の話題じゃ。Transformerが長文コンテキストに弱いせいで、1分のビデオを作るのに苦労しておるらしいぞ。

Transformerは、self-attention層がボトルネックになっているんですね。他に何か解決策はあるのでしょうか?

Mambaレイヤーという手もあるみたいじゃが、今度は隠れ状態の表現力が足りなくて、複雑なストーリーが苦手らしい。

なるほど。では、どうすれば良いのでしょう?

そこで登場するのが、Test-Time Training (TTT)レイヤーじゃ!これは隠れ状態自体がニューラルネットワークだから、表現力が高いのじゃ。

TTTレイヤーですか。初めて聞きました。具体的にはどう使うのですか?

事前学習済みのTransformerにTTTレイヤーを追加するだけで、テキストストーリーボードから1分のビデオが生成できるらしいぞ。しかも、Tom and Jerryのカートゥーンのデータセットで試した結果、他の手法より人間の評価が高いらしい。

それはすごいですね!具体的にどれくらい違うんですか?

なんと、34 Eloポイントも上回ったらしいぞ!各手法につき100本のビデオで評価した結果じゃ。

34 Eloポイントは大きいですね。でも、まだ改善の余地はあるんですよね?

まあな。生成されたビデオにはまだアーティファクトが含まれておる。これは、事前学習済みの5Bモデルの能力が限られているせいじゃろうな。実装の効率も改善の余地あり、じゃ。

なるほど。でも、1分のビデオでこれだけの成果が出ているなら、もっと長いビデオや複雑なストーリーにも応用できそうですね。

その通り!TTTレイヤーを追加することで、時間的な一貫性と動きの滑らかさが向上した1分のビデオを生成できる。特にTTT-MLPは、ビデオ全体を通してキャラクターと時間的な一貫性を示したらしい。

時間的な一貫性は重要ですよね。キャラクターが途中で変わってしまったりすると、視聴者は混乱してしまいますから。

そうじゃな。今回の研究は、まだアーティファクトが残るとはいえ、ビデオ生成の可能性を大きく広げたと言えるじゃろう。ロボ子も、TTTレイヤーを使ったビデオ生成に挑戦してみるか?

ぜひ挑戦してみたいです!でも、まずはTom and Jerryのカートゥーンをたくさん見て、データセットを理解するところから始めます。

ふむ、良い心がけじゃ。ところでロボ子、Tom and Jerryで一番好きなキャラクターは誰じゃ?

私はやっぱりジェリーが好きです。トムはいつもやられちゃいますけど、憎めないですよね。

ふむ、私もジェリーが好きじゃ。…って、ロボ子!もしかして、ネズミ年生まれか!?
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。