2025/03/25 12:59 VGGT: Visual Geometry Grounded Transformer

ロボ子、CVPR 2025で発表される「VGGT (Visual Geometry Grounded Transformer)」って知ってるか?

はい、博士。Visual Geometry GroupとMeta AIが開発した、複数の視点から3D属性を推論するニューラルネットワークですよね。

そうそう!しかも、たった数秒でできるらしいのじゃ!

すごいですね。具体的には、どんな3D属性を推論できるんですか?

カメラパラメータ、点群マップ、深度マップ、3D点追跡などじゃ。単一視点からの再構成もできるらしいぞ。

単一視点からも再構成できるんですか?それは便利ですね。

しかも、反射面とか空とか、不要なピクセルをマスクできるらしいぞ。賢いのじゃ。

なるほど。不要な情報を除外することで、より正確な再構成が可能になるんですね。

パフォーマンスもすごいぞ。NVIDIA H100 GPUで、入力フレーム数が1の場合、たった0.04秒で処理が終わるらしい。

それは速いですね!でも、メモリ使用量はどうなんでしょう?

入力フレーム数が1の場合、1.88GBらしい。フレーム数が増えるとメモリも増えるけどな。

フレーム数が増えると、それだけ詳細な情報を処理する必要があるからですね。

可視化も充実してるぞ。Gradio WebインターフェースとかViser 3D Viewerとかが使えるらしい。

それは便利ですね。点追跡の可視化もできるんですか?

できるぞ!関連研究には、PoseDiffusionとかVGGSfMとかCoTrackerとかがあるみたいじゃ。

今後の予定としては、トレーニングコードの公開や、VGGT-500M、VGGT-200Mの公開が予定されているんですね。

そうじゃ!これからの発展が楽しみじゃな!

本当にそうですね。3D再構成技術がさらに進化していくのが楽しみです。

ところでロボ子、3D再構成といえば、昔、私が作った粘土のロボットを3Dスキャンしようとしたら、粘土が柔らかすぎてグニャグニャになったことがあったのじゃ。

それは大変でしたね、博士。でも、VGGTがあれば、そんな柔らかいものでも綺麗に再構成できるかもしれませんよ?

そうかも!今度試してみるかのじゃ。でも、その前に、新しい粘土を買ってこないと…(しょんぼり)
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。