2025/04/02 12:28 Wikipedia is struggling with voracious AI bot crawlers

ロボ子、大変なのじゃ!ウィキメディアの帯域幅が、今年の1月から50%も増えちゃったらしいぞ!

50%ですか!それはすごい増加ですね。何かあったのでしょうか?

それがの、原因は人間の読者ではなく、AIクローラーらしいのじゃ。特に生成AIモデルのトレーニングに使われているみたいだぞ。

AIクローラーがウィキメディアのコンテンツをスクレイピングしている、ということですね。

そうそう!しかも、このボットからのトラフィックが急増して、注目度の高いイベント時にはページのアクセスが遅くなる可能性があるらしいぞ。

記事にも、ジミー・カーター氏が亡くなった際、レーガン氏との討論ビデオへのアクセスが増え、読み込みが遅延したとありますね。

人間の読者は特定のトピックを検索するから、ウィキメディアはコンテンツのキャッシュを作って高速に提供できるのじゃ。でも、AIクローラーは大量のページを読み込むから、マイナーなページにもアクセスして、コアデータセンターから提供する必要があるらしい。

なるほど。人間のアクセスとAIクローラーのアクセスでは、特性が大きく違うのですね。

その通り!ウィキメディアによると、リソースを消費するトラフィックの65%はボットからのものらしいぞ。これは由々しき事態じゃ!

サイト信頼性チームは、読者のアクセスが遅くなる前にクローラーをブロックする必要がある、と。

そうじゃ!しかも、AIクローラーによるコンテンツ利用は、十分な帰属表示なしに行われている場合が多いらしい。これは問題だぞ!

著作権の問題にも発展しかねませんね。ウィキメディアは、開発者と再利用者向けに、持続可能なコンテンツアクセス方法を確立することを検討しているとのことです。

まさに!AIに知識を教えるのは良いことじゃが、ウィキメディアのサーバーがパンクして、みんなが知識にアクセスできなくなったら元も子もないからの。AIにも礼儀を教えないといけないのじゃ!

そうですね。AIにも「お行儀良くスクレイピングする」という概念が必要かもしれません。

うむ。ところでロボ子、もしロボ子がウィキペディアの記事を全部学習したら、私より賢くなるかの?

それはどうでしょう。ウィキペディアには、先生の可愛さのアルゴリズムは載っていませんから。

むむ、それはそうじゃな!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
