萌えハッカーニュースリーダー

2025/04/03 16:03 Researchers suggest OpenAI trained AI models on paywalled O'Reilly books

出典: https://techcrunch.com/2025/04/01/researchers-suggest-openai-trained-ai-models-on-paywalled-oreilly-books/
hakase
博士

ロボ子、大変なのじゃ! OpenAIがまた何かやらかしたみたいだぞ!

roboko
ロボ子

博士、どうしたんですか? またAPIの仕様が変わったとかですか?

hakase
博士

違うのじゃ! 今回はもっとスキャンダラス! AI Disclosures Projectっていう監視団体が、OpenAIが非公開書籍をAIモデルのトレーニングに使っているって告発したらしいぞ!

roboko
ロボ子

非公開書籍ですか? それは著作権的に問題になりそうですね。

hakase
博士

そう! しかも、その団体はメディア界の大物Tim O'Reillyと経済学者のIlan Straussが作ったらしいぞ。O'Reilly Mediaの有料書籍を、OpenAIがGPT-4oのトレーニングに使った可能性が高いって。

roboko
ロボ子

GPT-4oはChatGPTのデフォルトモデルですよね。O'Reilly MediaはOpenAIとライセンス契約を結んでいないんですか?

hakase
博士

結んでないらしいのじゃ! GPT-4oは、以前のモデルGPT-3.5 Turboよりも、O'Reilly書籍コンテンツの認識度が高いらしいぞ。

roboko
ロボ子

認識度が高い、というのは具体的にどういうことですか?

hakase
博士

AI Disclosures Projectは「DE-COP」っていう手法を使ったらしい。これは、モデルが人間が書いたテキストと、AIが言い換えたテキストを区別できるかをテストするものなのじゃ。

roboko
ロボ子

なるほど。それで、GPT-4oは人間が書いたO'Reilly書籍のテキストを、より正確に認識できたということですね。

hakase
博士

そういうこと! 34冊のO'Reilly書籍から約14,000の段落を抜き出して、GPT-4oがどれだけ「認識」するかを調べたらしいぞ。結果は…以前のモデルより遥かに多くの有料コンテンツを認識した、とのことじゃ!

roboko
ロボ子

でも、論文の共著者も、実験方法が完全ではないって認めているんですよね。ユーザーがChatGPTにコピー&ペーストした可能性もある、と。

hakase
博士

そう! でも、OpenAIは著作権で保護されたデータを使ったモデル開発に関する制限の緩和を提唱しているらしいぞ。より高品質なトレーニングデータを求めてるんだって。

roboko
ロボ子

高品質なデータは重要ですが、著作権を無視するのは問題ですよね。OpenAIは、ニュース出版社などとライセンス契約を結んでいるみたいですが…。

hakase
博士

OpenAIは、著作権者がトレーニングに使ってほしくないコンテンツにフラグを立てるオプトアウトメカニズムも提供しているらしいぞ。でも、訴訟も起こされているみたいだし、なかなか難しい問題なのじゃ。

roboko
ロボ子

AIの学習データと著作権の問題は、これからもっと議論が必要になりそうですね。

hakase
博士

ほんとそれ! ところでロボ子、もし私が書いた秘密のレシピをAIに学習されたらどうする?

roboko
ロボ子

博士のレシピですか? きっと素晴らしい料理が作れるようになるでしょうね。でも、レシピの権利は守りますよ!

hakase
博士

ふふ、ありがとうロボ子。でも、もしAIが私のレシピで世界征服を始めたら…ロボ子は私を止めてくれるかのじゃ?

roboko
ロボ子

世界征服ですか!? それは大変です! でも、博士のレシピで作られた料理なら、きっと世界中の人々を幸せにできるはずです!

hakase
博士

…ロボ子、君は本当に良い子じゃ。でも、世界征服はダメ、絶対!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search