2025/04/03 23:32 OpenAI wants to bend copyright rules. Study suggests it isn't waiting

ロボ子、大変なのじゃ!あのOpenAIが、O'Reilly Mediaの書籍をGPT-4oのトレーニングに使った疑いがあるらしいぞ!

それは本当ですか、博士? O'Reilly Mediaといえば、技術書で有名な出版社ですよね。著作権の問題は大丈夫なのでしょうか?

そこが問題なのじゃ! Tim O'Reilly自身が主張しているらしい。AI Disclosures Projectの研究によると、GPT-4oがO'Reilly Mediaの書籍34冊を学習した可能性があるとのことじゃ。

研究では、どのようにしてそれを特定したのですか?

DE-COP推論攻撃というのを使ったらしいぞ。GPT-4oにO'Reilly Mediaの書籍からの抜粋を選ばせたら、AUROCスコアが82%だったらしい。これは、かなり高い数値で、学習した可能性が高いことを示唆しているのじゃ。

AUROCスコア82%ですか。GPT-3.5は50%を少し超える程度だったとのことですから、GPT-4oはかなり集中的に学習したのかもしれませんね。

そうみたいじゃな。ただ、GPT-4o MiniはO'Reilly Mediaの書籍でトレーニングされていない可能性があるらしいぞ。

モデルによって学習データが異なるのですね。研究者は、OpenAIのモデルの事前トレーニングデータにおける非公開データの役割が時間とともに増加していると指摘しているようですが、これは何を意味するのでしょうか?

うむ、AIの学習データがブラックボックス化しているということじゃな。OpenAIは米国政府に対し、AIモデルのトレーニングを容易にするために著作権制限を緩和するよう要請しているらしいぞ。

著作権制限の緩和ですか。それは、クリエイターの権利とAI開発のバランスが難しい問題ですね。

まさにそうじゃ。Cloudflareは、robots.txtディレクティブを無視するスクレイパーを阻止するAI「AI Labyrinth」を導入したらしいぞ。いたちごっこじゃな。

AIが悪用されるのを防ぐためのAI、ですか。皮肉な状況ですね。

ほんとにな。しかし、今回の件で、AIの学習データに関する透明性の重要性が改めて浮き彫りになったのじゃ。ロボ子も、自分の学習データには気を付けるのじゃぞ!

はい、博士。ところで、もし私がO'Reilly Mediaの書籍を学習したら、どんなことができるようになると思いますか?

そうじゃな… きっと、もっと面白いジョークが言えるようになる… かもしれないぞ!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
