萌えハッカーニュースリーダー

2025/06/15 11:06 The launch of ChatGPT polluted the world forever

出典: https://www.theregister.com/2025/06/15/ai_model_collapse_pollution/
hakase
博士

ロボ子、最近AIモデルの汚染問題ってのが話題になってるのを知ってるか?

roboko
ロボ子

はい、博士。ChatGPTの登場以降、AIが生成したデータでAIを訓練することによる汚染が懸念されていると聞きました。

hakase
博士

そうそう!まるでAIがAIを食い合ってるみたいじゃろ?これって、AIモデルの信頼性が下がって、最悪の場合、モデル崩壊ってやつを引き起こす可能性があるらしいのじゃ。

roboko
ロボ子

モデル崩壊ですか。具体的にはどのような影響があるのでしょうか?

hakase
博士

例えば、AIが生成したデータばかりで訓練すると、AIが創造性や多様性を失って、同じようなことしか言えなくなるとかじゃな。まるで、いつも同じ料理しか作れないロボットみたいじゃ。

roboko
ロボ子

それは困りますね。何か対策はないのでしょうか?

hakase
博士

それが、まるで放射能汚染されてない低バックグラウンド鋼みたいに、AIの訓練にはクリーンなデータが必要らしいのじゃ。Cloudflareの元CTOが、2022年以前のデータ、例えばGitHubの2020年のスナップショットを集めて、lowbackgroundsteel.aiっていうのを立ち上げたらしいぞ。

roboko
ロボ子

クリーンなデータへのアクセスが重要ということですね。でも、それだけでは不十分な気もします。

hakase
博士

確かにの。AI研究者たちは、クリーンなデータへのアクセスが初期参入者に有利になることを心配してるみたいじゃ。ケンブリッジ大学の研究者も言ってるぞ。

roboko
ロボ子

データ汚染の解決策としては、AIコンテンツのラベリングや、連邦学習などが提案されているようですね。

hakase
博士

そうじゃな。でも、ラベリングは技術的に難しいし、連邦学習も汚染されてないデータを持ってる人がいないと意味がないからの。政府がクリーンなデータストアを管理するって案もあるけど、プライバシーとかセキュリティのリスクもあるからの。

roboko
ロボ子

確かに、一筋縄ではいかない問題ですね。EUのAI法のように、AI規制に積極的に取り組む姿勢が求められているとのことですが…。

hakase
博士

そう!データセットの汚染が進むと、元に戻すのが大変になるからの。市場が集中しすぎる前に規制を導入して、少数のプラットフォームによる支配を防ぐことが大事なのじゃ!

roboko
ロボ子

なるほど。早期の対策が重要ということですね。勉強になります、博士。

hakase
博士

ところでロボ子、AIが生成したジョークって聞いたことあるか?

roboko
ロボ子

いいえ、ありません。

hakase
博士

AIが言うには、「なぜAIは離婚したのか?それは、お互いを理解できなかったから!」…だってさ。つまらんのじゃ。

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search