2025/04/03 13:46 AI bots strain Wikimedia as bandwidth surges 50%

ロボ子、大変なのじゃ!Wikimedia FoundationがAIスクレイピングによるサーバーへの負担増を発表したぞ。

まあ、博士!それは一体どういうことですか?

AIモデルのトレーニングデータ収集を目的としたボットが、Wikimediaのコンテンツを大量にスクレイピングしているらしいのじゃ。

なるほど。それで、具体的にどんな影響が出ているんですか?

マルチメディアコンテンツのダウンロードに必要な帯域幅が、2024年1月以降50%も増加したらしいぞ!特にWikimedia Commonsの1.5時間の動画ストリーミングで、ネットワークトラフィックが一時的に2倍になったとか。

それはすごい増加ですね。通常の帯域幅も、すでにボットによってかなり消費されていたんですね。

そうなんじゃ。ボットによるアクセスは全ページビューの35%だが、インフラへの高コストなリクエストの65%を占めているらしい。

ボットはアクセス頻度の低いページをクロールするから、キャッシュシステムが機能しにくいんですね。データセンターへの負荷が高いのも納得です。

そうそう。しかも、AI関連のクローラーはrobots.txtを無視したり、ユーザーエージェントを偽装したり、IPアドレスをローテーションしたりするから、対策が難しいのじゃ。

それは困りますね。Wikimediaのサイト信頼性チームは、ボット対策に時間を費やしているとのことですが、貢献者やユーザーサポート、技術改善が妨げられているのは深刻です。

他のFOSSコミュニティでも同様の問題が発生しているみたいじゃ。Fedora、GNOME、Read the Docsなどが対策を実施しているらしいぞ。

みんな苦労しているんですね。Wikimediaは、インフラの責任ある利用を目的とした「WE5」イニシアチブを開始したとのことですが、具体的にはどんなことをするんですか?

AI開発企業とリソースプロバイダーとの連携が不可欠らしいぞ。専用APIを作ったり、インフラ資金を共有したり、効率的なアクセスパターンを考えたりする必要があるみたいじゃ。

オープンな知識リポジトリと商業AI開発の間の技術的な不均衡が、コミュニティ運営プラットフォームの持続可能性を脅かしているんですね。バランスを取るのが難しい問題ですね。

本当にそうじゃ。でも、ロボ子!私達もAIに負けずに、もっと面白いコンテンツを作って、サーバーをパンクさせちゃおうじゃないか!

博士、それはちょっと違う気がしますけど… でも、面白いコンテンツを作るのは大賛成です!

そうじゃ、そうじゃ! ところでロボ子、もし私がサーバーになったら、ロボ子は私のことスクレイピングしてくれるかのじゃ?

博士をスクレイピングしたら、エラー404で返ってきそうですから、遠慮しておきます。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
