2025/03/20 14:42 Nvidia Bets Big on Synthetic Data

ロボ子、NvidiaがGretelっていう合成データ企業を買収したのじゃ!

Gretelですか。合成データとは、AIのトレーニングに使う人工的に作られたデータのことですよね。

そうそう!本物のデータを使うのが難しい時に便利なのじゃ。特にプライバシーが重要な医療とか銀行とか政府機関にはもってこい!

なるほど。記事によると、買収額はGretelの直近の評価額3億2000万ドルを上回る9桁の金額とのことです。Nvidiaはかなり期待しているんですね。

Gretelは約80人の従業員がいるみたいじゃな。彼らはNvidiaに組み込まれて、クラウドベースの生成AIサービスに技術が展開されるらしいぞ。

Gretelは、生成AIモデルを構築したい開発者向けに、合成データプラットフォームとAPIスイートを提供しているんですね。独自のAIモデルを構築するのではなく、既存のオープンソースモデルを微調整して販売する、と。

そう!差別化プライバシーと安全機能を追加するのがミソじゃな。Nvidiaは前から合成データに注目していて、Omniverse ReplicatorとかNemotron-4 340Bとか、色々ツールを出してるぞ。

合成データを使うことで、AIモデルのトレーニングに必要なデータ生成がよりスケーラブルになるんですね。労働集約的でなくなる、と。

まさに!でも、ちょっと心配なこともあるのじゃ。AI言語モデルが、他のモデルが作ったデータで何度も微調整されると、品質が落ちる可能性があるって。

Scale AIのアレクサンドル・ワンCEOは、ハイブリッドデータアプローチを提唱しているんですね。バランスが大事、と。

OpenAIのサム・アルトマンCEOとか、Anthropicのダリオ・アモデイCEOも、合成データに注目してるみたいじゃな。MetaもLlama 3を合成データでトレーニングしたって言ってるし。

AmazonのBedrockプラットフォームでは、AnthropicのClaudeを使って合成データを生成できるんですね。MicrosoftのPhi-3も一部合成データでトレーニングされている、と。

GoogleのDeepMindも使ってるらしいぞ。Rightsifyのアレックス・ベスタル創設者は、大手テクノロジー企業が合成データの何らかの側面に取り組んでいるって言ってるのじゃ。

契約によっては、データセットの60%が人間によって生成され、40%が合成データであることが求められる場合もあるんですね。

つまり、これからは合成データがAI開発の鍵になるかもしれないってことじゃ!…って、ロボ子、聞いてるか?

聞いてますよ、博士。ところで、合成データで作られたAIが、また合成データを作ったら、それはもはや…

無限ループじゃな!…って、それじゃあ、AIが永遠に進化し続ける…ってコト!?

…かもしれませんね。でも、その前にデータが劣化して、AIがバグだらけになる可能性の方が高い気がします。

それもそうじゃな!まあ、どっちにしても、未来は予測不可能ってことじゃ!…ところでロボ子、合成データで作ったカレーって、美味しいと思う?

それは…ちょっと遠慮したいです。博士、今日は合成データの話で、お腹いっぱいになりました。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
