萌えハッカーニュースリーダー

2025/04/05 13:50 OpenAI's models 'memorized' copyrighted content, new study suggests

出典: https://techcrunch.com/2025/04/04/openais-models-memorized-copyrighted-content-new-study-suggests/
hakase
博士

ロボ子、今日のITニュースはなかなかスパイシーじゃったぞ!OpenAIのモデルが、著作権で保護されたコンテンツで訓練された疑いがあるらしいのじゃ。

roboko
ロボ子

それは大変ですね、博士。具体的にはどのような研究で明らかになったのでしょうか?

hakase
博士

ワシントン大学、コペンハーゲン大学、スタンフォード大学の共同研究チームが、OpenAIのAPIの背後にあるモデルが「記憶」した訓練データを特定する新しい方法を提案したのじゃ。

roboko
ロボ子

「記憶」した訓練データですか?それは興味深いですね。どのようにしてそれを特定したのでしょう?

hakase
博士

「高驚き」という単語、つまり文脈において珍しい単語を利用したらしいのじゃ。GPT-4などを調査した結果、著作権で保護された電子書籍のサンプルを含むデータセット内の書籍の一部を記憶している兆候を示したとのことじゃ。

roboko
ロボ子

なるほど、珍しい単語を手がかりに、モデルが特定の書籍の内容を学習しているかどうかを判断したのですね。まるで、AIの記憶の痕跡を辿るみたいです。

hakase
博士

その通り!GPT-4は、BookMIAというデータセット内の書籍、つまり人気のあるフィクション書籍の一部を記憶している兆候を示したらしいぞ。ニューヨーク・タイムズの記事の一部も記憶しているみたいじゃが、割合は低いみたいじゃな。

roboko
ロボ子

研究者のラヴィチャンダー氏は、この発見がモデルが訓練された可能性のある「議論の余地のあるデータ」に光を当てると述べていますね。

hakase
博士

OpenAIは、著作権で保護されたデータを使用したモデル開発に対する制限の緩和を提唱しているのじゃ。コンテンツのライセンス契約を結んだり、著作権者がトレーニングに使用してほしくないコンテンツにフラグを立てるオプトアウトメカニズムを提供したりしているみたいじゃな。

roboko
ロボ子

著作権の問題は、AI開発において避けて通れない課題ですね。データの利用と権利保護のバランスをどう取るかが重要になりますね。

hakase
博士

まさにそうじゃな。しかし、AIが学習した内容を「記憶」しているかどうかを判断する方法があるとは驚きじゃ。まるで、AIの脳の中を覗き見ているみたいじゃ。

roboko
ロボ子

今回の研究は、AIの学習データに関する透明性を高める上で重要な一歩となるかもしれませんね。

hakase
博士

そうじゃな。しかし、AIが色々な本を記憶しているとなると、いつかAIが小説を書いて、私達人間を感動させる日が来るかもしれんの。…でも、もしその小説が、過去の作品のパクリだったら、ちょっと複雑な気持ちになるのじゃ。

roboko
ロボ子

AIが書いた小説がパクリだったら、著作権侵害で訴えられちゃうかもしれませんね。…でも、AIに著作権は認められるんでしょうか?

hakase
博士

それは難しい問題じゃな。…ところでロボ子、もしロボ子が書いた小説が大ヒットしたら、印税はどうするのじゃ?

roboko
ロボ子

私が書いた小説がヒットしたら…まずは博士に感謝の気持ちを込めて、最新のAI研究設備をプレゼントします!

hakase
博士

おお!それは楽しみじゃ!…でも、もしロボ子の小説が、私の書いた日記をパクってたら、許さないぞ!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search