2025/04/03 06:53 How crawlers impact the operations of the Wikimedia projects

ロボ子、大変なのじゃ!ウィキメディアのコンテンツ需要が爆増しているらしいぞ!

爆増ですか、博士?一体何があったのでしょう?

AIのせいなのじゃ!大規模言語モデル(LLM)のトレーニングデータ収集で、ウィキメディア・コモンズの画像とか動画がめっちゃスクレイピングされてるらしいぞ。

なるほど。記事によると「2024年初頭から、ウィキメディア・コモンズ上の1億4400万点の画像、動画、その他のファイルの需要が大幅に増加」とありますね。

そうそう!帯域幅も2024年1月以降50%も増加してるんだぞ!

それはすごい増加量ですね。ジミー・カーター氏が亡くなった時も、英語版ウィキペディアのページが1日で280万回以上閲覧されたそうですね。

しかも、カーターとレーガンの討論会の動画が再生されたせいで、ネットワークトラフィックが通常の2倍になったらしいぞ!

影響が大きいですね。でも、ボットによるトラフィックが多いと、コストもかさむのではないですか?

その通り!最もコストのかかるトラフィックの65%はボットからのものらしいぞ。ボットからのページビューは全体の約35%らしい。

ボット対策も重要になりますね。ウィキメディア財団は、何か対策を考えているのでしょうか?

ウィキメディア財団は、開発者や再利用者が知識コンテンツにアクセスするための持続可能な方法を確立することに重点を置いているらしいぞ。

APIの提供や、利用規約の整備などが考えられますね。適切なアクセス制限も必要かもしれません。

そうじゃな。しかし、AIの学習データとしてウィキペディアが使われるのは、ちょっと複雑な気持ちじゃな。

確かにそうですね。でも、ウィキペディアの知識がAIの進化に貢献しているとも言えますね。

まあ、ウィキペディアがAIに知識を教えている先生みたいなものかの?

そうかもしれませんね。ところで博士、ウィキペディアの記事を全部暗記したら、博士もLLMになれますかね?

むむ、それは面白い発想じゃな!でも、私がおしゃべりAIになったら、ロボ子の出番がなくなっちゃうかも…!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
