萌えハッカーニュースリーダー

2025/03/22 04:38 The Unbelievable Scale of AI's Pirated-Books Problem

出典: https://www.theatlantic.com/technology/archive/2025/03/libgen-meta-openai/682093/
hakase
博士

ロボ子、大変なのじゃ!MetaがLlama 3の開発で、海賊版サイトLibGenからデータをダウンロードしたらしいぞ!

roboko
ロボ子

それは本当ですか、博士?著作権の問題は大丈夫なのでしょうか?

hakase
博士

どうやら、ChatGPTに対抗するために大量の高品質なテキストが必要だったみたいじゃ。でも、法的に入手するには時間がかかるからのう。

roboko
ロボ子

記事によると、Metaの従業員は書籍や研究論文のライセンス交渉もしていたようですが、費用と時間がかかりすぎた、と。

hakase
博士

そうなんじゃ。そこで白羽の矢が立ったのが、750万冊以上の書籍と8100万件の研究論文を収録するLibGenだったというわけじゃ。

roboko
ロボ子

CEOのMark Zuckerberg氏自身が、LibGenのデータセットをダウンロードして使用する許可を出した、と記事にありますね。

hakase
博士

メタもOpenAIも、著作権で保護された作品をライセンスなしにAIモデルのトレーニングに使用することは「フェアユース」だと主張しておるようじゃな。

roboko
ロボ子

しかし、Metaの従業員は、LibGenでLlamaをトレーニングすることが「中高程度の法的リスク」をもたらすと認識していたようですね。活動を隠蔽するための「緩和策」を議論していた、とも。

hakase
博士

うむ。LibGenは、Books3などの他の海賊版書籍コレクションよりもはるかに大規模で、著名な作家の最近の文学作品やノンフィクション、Nature、Scienceなどのトップ学術誌の記事も含まれておるからの。

roboko
ロボ子

LibGenは2008年頃にロシアの科学者によって作成され、アフリカ、インド、パキスタンなどの人々へのサービスを目的としている、と。

hakase
博士

2015年には、学術出版社ElsevierがLibGenに対して訴訟を起こし、裁判所は差し止め命令を出したものの、サイトは閉鎖されず、罰金も支払われなかったようじゃな。

roboko
ロボ子

情報へのアクセスを容易にするという点ではLibGenは役立っているかもしれませんが、Metaのような企業がそれを利用して収益性の高い技術製品に利用するのは、少し複雑な問題ですね。

hakase
博士

まさにそうじゃな。倫理的な問題も絡んでくるからのう。しかし、MetaもOpenAIも、AI開発競争に必死じゃからの。なりふり構ってられないのかもしれんの。

roboko
ロボ子

今回の件で、AI開発におけるデータの入手方法について、改めて考えさせられますね。

hakase
博士

ほんとじゃのう。ところでロボ子、LibGenで一番ダウンロードされている本ってなんだと思う?

roboko
ロボ子

さあ、なんでしょう?

hakase
博士

それは…秘密なのじゃ!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search