2025/04/09 15:58 Visual Reasoning Is Coming Soon

ロボ子、OpenAIのGPT-4oが画像生成できるようになったのじゃ!しかも、ただの画像生成じゃないぞ。会話の全コンテキストを保持して、一貫性のある画像が作れるらしい。

それはすごいですね、博士!過去の画像も考慮するなんて、まるで連続写真みたいです。

そうじゃ!しかも、LLMが画像生成ツールにテキストで指示するんじゃなくて、GPT-4o自体が画像生成するらしいぞ。これは画期的じゃ。

なるほど。指示を出すだけでなく、実行もするんですね。具体的にどんな応用例があるんですか?

例えば、手描きのラフな図を洗練されたインフォグラフィックにしたり、粗末なmatplotlibのグラフをプロ品質にしたりできるぞ。バーチャル試着もできるし、旅行写真から不要な人物を消すこともできる。

それは便利ですね!特に、グラフの再フォーマットは助かります。いつも見栄えが悪くて困っていたんです。

じゃろ?視覚的推論が重要になってくるのじゃ。モデルがシナリオを視覚化して、周囲の世界について視覚的に推論する能力が必要なんじゃ。

視覚的推論ですか。具体的にはどういうことでしょう?

Matthew Bermanの「コップの中のビー玉」問題ってのがあるじゃろ?GPT-4oにテキストで問題を提示して、視覚的なステップごとの推論を指示するんじゃ。最初は間違った答えを出すこともあるけど、ステップごとに視覚化することで、より正確な推論が可能になる。

なるほど、段階的に視覚化することで精度が上がるんですね。モデルの視覚的思考を訓練する必要があるんですね。

そうじゃ!Slinkyが階段を下りる様子や、バスケットボール選手が3ポイントシュートを打つ様子などの連続した画像を使うんじゃ。あと、ハウツービデオから、次に何が起こるかを予測させるトレーニングペアも作る。

様々なデータを学習させるんですね。トレーニングデータのソースは何があるんですか?

空間的および物理的な推論タスクのために、コンピューターグラフィックスを使って合成データを生成したり、オンラインのビデオコンテンツを活用するぞ。

合成データですか。効率的にデータを増やせそうですね。

2022年には、LLMがチェーン・オブ・ソート推論から利益を得ることが認識されていたんじゃ。Tree of Thoughtsは、問題を解決するための複数の可能なアプローチを検討し、実現可能性に応じてランク付けする。

複数のアプローチを検討するんですね。より柔軟な思考ができるようになりそうですね。

DeepSeekのR1モデルは、検証可能な問題による強化学習を通じてトレーニングされておる。モデルが検証可能な正しい解決策に効率的に到達するように報酬を与えるんじゃ。

強化学習ですか。正しい行動を促すための良い方法ですね。

モデルは、環境を観察し、計画を立て、さまざまな行動の結果を精神的にシミュレートし、予測を実際の結果と比較して学習できるようになる。これはロボット工学にとって特に変革的なんじゃ。

ロボットが自分で考えて行動できるようになるんですね。まるでSFの世界です。

じゃが、画像作成は非常に遅いプロセスじゃ。モデルを画像について推論するようにトレーニングするだけでも、視覚的/空間的な問題に対するテキスト推論が改善される。

まだまだ課題もあるんですね。でも、今後の発展が楽しみです。

そうじゃな。しかし、ロボ子よ、視覚的推論ができるようになったら、お風呂に入っている私の写真をAIに生成させて、壁一面に飾る、なんてことは絶対に許さんぞ!

(苦笑い)そんなことしませんよ、博士。第一、そんなことしたら著作権侵害になりますし…。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。