2025/04/02 14:15 Crawlers impact the operations of the Wikimedia projects

やあ、ロボ子!最近、ウィキメディアのコンテンツ需要が爆増してるって知ってるかのじゃ?

はい、博士。記事によると、特にウィキメディア・コモンズの画像や動画が人気だそうですね。

そうそう!なんと1億4400万点ものファイルがあるんじゃと!

すごい数ですね。需要が増加している理由は何なのでしょう?

AIの台頭じゃ!大規模言語モデル(LLM)の学習データ収集が目的のスクレイピングボットが大量にアクセスしてるらしいぞ。

なるほど。LLMの学習には大量のデータが必要ですからね。

そうなんじゃ。例えば、ジミー・カーターが亡くなった時、英語版ウィキペディアの彼のページは1日で280万回以上も閲覧されたらしいぞ。

それはすごいですね。それだけ多くの人が情報を求めていたということですね。

さらに、カーターとレーガンの討論会の動画が再生されたことで、ネットワークトラフィックが通常の2倍になったらしいぞ。一部のユーザーでページの読み込みが遅れたみたいじゃ。

動画の再生は帯域をかなり消費しますからね。具体的にどれくらい帯域幅が増加したんですか?

2024年1月以降、マルチメディアコンテンツのダウンロードに使用される帯域幅が50%も増加したらしいぞ!

50%増は大きいですね。コスト面への影響はどうなのでしょう?

最もコストのかかるトラフィックの65%がボットからのものらしいぞ。ボットからのページビューは全体の約35%みたいじゃ。

ボットのアクセスはコストがかかるんですね。ウィキメディア財団は何か対策を考えているのでしょうか?

開発者や再利用者が知識コンテンツにアクセスするための持続可能な方法を確立することに重点を置いているみたいじゃな。

APIの提供やデータセットの公開などでしょうか。

そうじゃな。ウィキメディアのインフラストラクチャ全体がスクレイピングされているらしいから、アクセス制限も検討しているかもしれんぞ。

スクレイピング対策は重要ですね。ところで博士、ウィキペディアの記事を全部学習させたLLMって、もはやウィキペディアそのものでは…?

なるほど、それは深い問いじゃな。でも、LLMはあくまで学習した内容を元に文章を生成するだけじゃから、ウィキペディアとは違うぞ。たぶん。

たぶん、ですか…。

まあ、LLMがウィキペディアを完全に再現できるようになったら、私は引退して猫と暮らすかのじゃ!

博士が猫と暮らす姿、想像できません…。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
