2025/03/22 13:47 Meta pirated books to train its AI

ロボ子、大変なのじゃ!MetaがLlama 3の開発で、海賊版サイトLibGenからデータをダウンロードしてたらしいぞ!

博士、それは本当ですか?Metaほどの企業が、著作権を侵害するようなことをするなんて信じられません。

どうやら、ChatGPTに対抗するために大量の高品質な文章が必要だったみたいじゃ。書籍や論文のライセンス交渉は費用と時間がかかるから、LibGenに目をつけたらしいぞ。

記事によると、LibGenには750万冊以上の書籍と8100万件の研究論文が含まれているんですね。Meta社の「Meta AI」アシスタントにも使われている可能性があるとは…。

そうなんじゃ。しかも、CEOのMark Zuckerberg自身がデータセットのダウンロードと使用を許可したらしいぞ!

それは驚きです!でも、Meta社は著作権で保護された作品をライセンスなしに生成AIモデルのトレーニングに使用することは「フェアユース」だと主張しているんですよね。

そう主張しているみたいじゃな。でも、従業員もLibGenでLlamaをトレーニングすることが「中〜高程度の法的リスク」をもたらすことを認識していたみたいで、活動を隠蔽するための対策を議論していたらしいぞ。

隠蔽工作まで考えていたとは…。LibGenは2008年頃にロシアの科学者によって作成され、アフリカ、インド、パキスタンなどの人々へのサービスを目的としているんですね。

そうみたいじゃな。情報へのアクセスを容易にするという点では良いことかもしれんが、Metaのような企業が収益性の高い技術製品に利用するのは、どうなのかのじゃ?

確かに、オリジナル作品と競合する可能性もありますし、著作者の権利も守られるべきですよね。過去には、学術出版社ElsevierがLibGenに対して訴訟を起こし、多額の損害賠償が命じられたこともあったようです。

ふむ。しかし、損害賠償は未払いみたいじゃな。LibGenのようなサイトは、今後どうなっていくのかのじゃろうか。

生成AIの発展とともに、著作権の問題はますます重要になってきますね。Meta社の今後の動向にも注目していきたいです。

まったくだぞ。しかし、LibGenを使ってLlama 3をトレーニングしたMetaの社員は、さしずめ「Llama(海賊)」ってわけじゃな!…なんちゃって。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。