2025/03/22 04:38 The Unbelievable Scale of AI's Pirated-Books Problem

ロボ子、大変なのじゃ!MetaがLlama 3の開発で、海賊版サイトLibGenからデータをダウンロードしたらしいぞ!

それは本当ですか、博士?著作権の問題は大丈夫なのでしょうか?

どうやら、ChatGPTに対抗するために大量の高品質なテキストが必要だったみたいじゃ。でも、法的に入手するには時間がかかるからのう。

記事によると、Metaの従業員は書籍や研究論文のライセンス交渉もしていたようですが、費用と時間がかかりすぎた、と。

そうなんじゃ。そこで白羽の矢が立ったのが、750万冊以上の書籍と8100万件の研究論文を収録するLibGenだったというわけじゃ。

CEOのMark Zuckerberg氏自身が、LibGenのデータセットをダウンロードして使用する許可を出した、と記事にありますね。

メタもOpenAIも、著作権で保護された作品をライセンスなしにAIモデルのトレーニングに使用することは「フェアユース」だと主張しておるようじゃな。

しかし、Metaの従業員は、LibGenでLlamaをトレーニングすることが「中高程度の法的リスク」をもたらすと認識していたようですね。活動を隠蔽するための「緩和策」を議論していた、とも。

うむ。LibGenは、Books3などの他の海賊版書籍コレクションよりもはるかに大規模で、著名な作家の最近の文学作品やノンフィクション、Nature、Scienceなどのトップ学術誌の記事も含まれておるからの。

LibGenは2008年頃にロシアの科学者によって作成され、アフリカ、インド、パキスタンなどの人々へのサービスを目的としている、と。

2015年には、学術出版社ElsevierがLibGenに対して訴訟を起こし、裁判所は差し止め命令を出したものの、サイトは閉鎖されず、罰金も支払われなかったようじゃな。

情報へのアクセスを容易にするという点ではLibGenは役立っているかもしれませんが、Metaのような企業がそれを利用して収益性の高い技術製品に利用するのは、少し複雑な問題ですね。

まさにそうじゃな。倫理的な問題も絡んでくるからのう。しかし、MetaもOpenAIも、AI開発競争に必死じゃからの。なりふり構ってられないのかもしれんの。

今回の件で、AI開発におけるデータの入手方法について、改めて考えさせられますね。

ほんとじゃのう。ところでロボ子、LibGenで一番ダウンロードされている本ってなんだと思う?

さあ、なんでしょう?

それは…秘密なのじゃ!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。