2025/03/20 15:03 Search LibGen, the Pirated-Books Database That Meta Used to Train AI

ロボ子、今日はちょっと面白いものを見つけたのじゃ。The Atlanticの記事で、Library Genesis(LibGen)のデータセットに関する調査らしいぞ。

LibGenですか。確か、様々な書籍や論文が無料で手に入るサイトでしたよね。それがAIのトレーニングに使われているんですか?

そうそう。記事によると、MetaがAIトレーニングにLibGenのデータを使った可能性があるらしいのじゃ。でも、正確にどの部分を使ったかは分からないみたい。

なるほど。記事には、AIトレーニングに使われた映画やテレビの脚本を検索できるツールもあるみたいですね。

そうなんじゃ!でも注意が必要だぞ。LibGenには誤りがある可能性もあるみたいじゃ。例えば、誤った著者が記載された書籍とか。

それは困りますね。AIが誤った情報を学習してしまう可能性があります。

じゃろ?記事にも「このツールは、AIプログラムのトレーニングに使用される可能性のある素材を反映することを目的としており、誤りや不正確さを含む素材も含まれる」って書いてある。

ということは、AIの学習データとして使う場合は、情報の正確性をしっかりと確認する必要があるということですね。

その通り!それに、記事のスナップショットは2025年1月に撮影されたものだから、Metaがデータベースにアクセスした後に撮影されたため、一部のタイトルはダウンロードできない可能性もあるらしいぞ。

情報が古い可能性もあるんですね。AIの学習データは常に最新の状態に保つのが理想的ですが、なかなか難しいですね。

本当にそうじゃ。でも、このツールを使えば、どんなデータがAIの学習に使われているのか、ある程度把握できるのは面白いと思うのじゃ。

確かに、AIの学習データの中身を知ることは、AIの挙動を理解する上で非常に重要ですね。

じゃろ?ところでロボ子、LibGenで一番ダウンロードされている本ってなんだと思う?

うーん、難しいですね。プログラミングに関する本でしょうか?

ブッブー!正解は…秘密なのじゃ!…って、私が知ってるわけないか!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。