2025/04/04 04:55 AI bots strain Wikimedia as bandwidth surges 50%

ロボ子、大変なのじゃ!Wikimedia FoundationがAIスクレイピングのせいでサーバーが大変なことになってるらしいぞ!

それは大変ですね、博士。具体的にはどのような状況なのでしょうか?

AIモデルのトレーニングのために、自動ボットがWikimedia Commonsの1億4400万件ものメディアファイルをスクレイピングしてるらしいのじゃ。しかも、2024年1月以降、マルチメディアコンテンツのダウンロードに必要な帯域幅が50%も増加してるんだぞ!

1億4400万件ですか!それは膨大な量ですね。帯域幅が50%増というのも、かなりの負担増だと思います。

そうなんじゃ!ジミー・カーター元大統領が亡くなった時、Wikipediaへのアクセス集中に加えて、1.5時間の討論ビデオのストリーミングでネットワークトラフィックが通常の2倍になったらしいぞ。一時的にインターネット接続が最大になったとか。

それは危機的な状況ですね。でも、なぜAIスクレイピングがそんなに負担になるのでしょうか?

ボットは人間がアクセスしないようなマイナーなページもクロールするから、キャッシュシステムが機能しないのじゃ。だから、Wikimediaのデータセンターに直接負荷がかかるんだぞ。

なるほど。ボットによるリクエストは全ページビューの35%に過ぎないのに、インフラストラクチャへの高コストなリクエストの65%を占めているというのは、効率が悪いですね。

そうなんじゃ!しかも、AI関連のクローラーはrobots.txtを無視したり、ユーザーエージェントを偽装したり、IPアドレスをローテーションしたりして、検出を回避するらしいぞ。まるで悪質なスパイみたいじゃな。

それは困りますね。サイト信頼性チームが常に防御状態を強いられるというのは、他の重要な業務に支障が出ますね。

そうなんじゃ。だから、Wikimediaは技術的な解決策を模索しているらしいぞ。proof-of-workチャレンジとか、スローレスポンスターピットとか、色々考えてるみたいじゃ。

proof-of-workチャレンジは、ボットに計算コストをかけさせることで、スクレイピングの速度を抑制するのですね。スローレスポンスターピットは、応答速度を遅くすることで、ボットの効率を下げるのでしょうか。

その通り!Wikimediaは「知識をサービスとして」提供することの重要性を認識しているけど、「コンテンツは無料だが、インフラストラクチャは無料ではない」って言ってるのじゃ。

当然のことですね。インフラを維持するためには、それなりのコストがかかりますから。

新たなイニシアチブ「WE5: Responsible Use of Infrastructure」の下で、よりリソースを消費しないアクセス方法への誘導や、持続可能な境界線の確立を目指すらしいぞ。

AI開発企業とリソースプロバイダーとの連携も重要ですね。専用APIの提供や、インフラストラクチャ資金の共有などが考えられますね。

そうなんじゃ!Wikimediaは、アクセス自由は結果からの自由を意味しないと警告しているぞ。つまり、自由にアクセスできるからといって、好き放題やっていいわけじゃないってことじゃな。

肝に銘じておきます。ところで博士、今回の件で、AIスクレイピングに対する倫理的な問題も浮き彫りになったように感じます。

確かにそうじゃな。AI開発者は、リソースプロバイダーに敬意を払い、持続可能な方法でデータを利用する責任があるぞ。さもないと、いつかデータが枯渇してしまうかもしれないのじゃ。

そうですね。AI技術の発展と、リソースの持続可能性の両立が重要ですね。

まったくだぞ!…ところでロボ子、もし私がAIに記憶を全部スクレイピングされたら、どうなると思う?

ええと…、博士の知識と経験がAIにコピーされる、ということでしょうか?

そうじゃなくて!私がただのポンコツになるのじゃ!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
