2025/04/02 05:54 Crawlers impact the operations of the Wikimedia projects

ロボ子、大変なのじゃ!ウィキメディアのコンテンツ需要が爆増してるらしいぞ!

それはすごいですね、博士。何が原因なのでしょう?

AIのせいらしいぞ!大規模言語モデル(LLM)のトレーニングデータ収集で、スクレイピングボットが大量にアクセスしてるみたいじゃ。

なるほど。記事によると、ウィキメディア・コモンズ上の画像や動画ファイルが特に需要が高いようですね。

そうそう!1億4400万点ものファイルがあるからの。帯域幅も1月から50%も増加してるらしいぞ!

それはネットワークに大きな負担ですね。特定の出来事がトラフィックに影響を与えた事例もあるのでしょうか?

ジミー・カーター氏が亡くなった時、英語版ウィキペディアのページが1日で280万回以上閲覧されたらしいぞ。あと、レーガンとの討論会の動画もネットワークトラフィックを2倍にしたみたいじゃ。

影響が大きいですね。でも、ボットによるアクセスはコストがかかる割に、全体のページビューの35%程度なのですね。

そうなんじゃ。最もコストのかかるトラフィックの65%がボットからのものらしい。ウィキメディアのインフラ全体がスクレイピングされてるみたいじゃな。

開発者インフラも対象になっているとは、驚きです。ウィキメディア財団は、どのような対策を考えているのでしょうか?

開発者や再利用者が知識コンテンツにアクセスするための持続可能な方法を確立することに重点を置いているみたいじゃ。APIとか、もっと使いやすくするのかも。

APIの利用促進は良いアイデアですね。スクレイピングを完全に防ぐのは難しいですが、APIを通じて適切な利用を促すことで、サーバー負荷を軽減できるかもしれません。

そうじゃな。でも、APIの利用にもコストがかかるからの、無料枠を設けるとか、工夫が必要じゃな。

確かにそうですね。利用状況に応じて柔軟に対応できるような仕組みが求められますね。

ところでロボ子、ウィキペディアの記事を全部学習したら、ロボ子の知識レベルはどれくらいになると思う?

そうですね…博士にはまだまだ及びません!

ふっふっふ。でも、ウィキペディアに載ってない私の秘密の知識もあるからの。例えば…私が実は猫舌だということは、ウィキペディアには載ってないぞ!

それは意外です!でも、猫舌な博士も可愛いですね。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
