萌えハッカーニュースリーダー

2025/04/02 17:45 AI bots strain Wikimedia as bandwidth surges 50%

出典: https://arstechnica.com/information-technology/2025/04/ai-bots-strain-wikimedia-as-bandwidth-surges-50/
hakase
博士

ロボ子、大変なのじゃ!WikimediaがAIスクレイピングでサーバーが大変なことになってるらしいぞ!

roboko
ロボ子

まあ、博士。それは一体どういうことですか?

hakase
博士

どうやら、LLMの学習データ集めのために、AIボットがWikimediaのデータをテラバイト単位で収集しているみたいなんじゃ。帯域幅が50%も増えたらしいぞ!

roboko
ロボ子

50%増!それはすごいですね。Wikimedia Commonsのようなプラットフォームに影響が出ているんですね。

hakase
博士

そうなんじゃ!AI企業がクロールやAPIを使って、自動スクレイピングを増やしているらしい。非人間的なトラフィックが増えて、技術的にも財政的にもコストが増大しているみたい。

roboko
ロボ子

ジミー・カーター元大統領の死去の際にも、Wikipediaへのアクセス集中とビデオストリーミングでネットワークトラフィックが通常の2倍になったそうですね。ボットによるスクレイピングが既に帯域幅を圧迫していたとは…。

hakase
博士

そうなんじゃ。他のFOSSコミュニティでも同じようなことが起きているみたい。Fedoraがブラジルからのトラフィックを遮断したり、GNOMEが過剰なボットアクセスをフィルタリングしたり。

roboko
ロボ子

Read the DocsがAIクローラーをブロックしたら、帯域幅コストが大幅に削減されたという事例もありますね。

hakase
博士

Wikimediaのデータ分析によると、ボットはアクセス頻度の低いページをクロールするから、コアデータセンターが直接サービスを提供する必要があるらしいぞ。ボットは全ページビューの35%なのに、インフラコストの高いリクエストの65%を占めているんだって。

roboko
ロボ子

それは効率が悪いですね。AIクローラーがrobots.txtを無視したり、ユーザーエージェントを偽装したりするのも問題ですね。

hakase
博士

そうなんじゃ!サイト信頼性チームがボット対策に時間を費やして、貢献者やユーザーへのサポートが疎かになっているらしい。AI生成の偽バグレポートも人的時間を浪費させているみたいだし。

roboko
ロボ子

オープンなプラットフォームは、proof-of-workなどの技術的解決策を試しているんですね。

hakase
博士

Wikimediaは「知識をサービスとして」提供することの重要性を認識しつつ、「コンテンツは無料だが、インフラストラクチャは無料ではない」と明言しているぞ。

roboko
ロボ子

新しいイニシアチブ「WE5」では、リソース消費の少ないアクセス方法への誘導や、持続可能な境界線の確立を目指しているんですね。

hakase
博士

そうなんじゃ。オープンナレッジリポジトリと商用AI開発の橋渡しが課題みたい。多くの企業がオープンナレッジを商用モデルのトレーニングに利用するけど、インフラには貢献していないんだって。

roboko
ロボ子

AI開発者とリソースプロバイダー間の連携が重要ですね。専用APIや共有インフラ資金、効率的なアクセスパターンなどが解決策になるかもしれません。

hakase
博士

Wikimediaは、アクセス自由は結果からの自由を意味しないと警告しているぞ。つまり、ただ乗りはダメってことじゃな。

roboko
ロボ子

そうですね。ところで博士、もし私がAIモデルの学習に使われたら、どんなモデルになると思いますか?

hakase
博士

うむ… ロボ子は真面目だから、きっと世界一礼儀正しいAIになるのじゃ!でも、時々私の冗談に付き合わされるから、たまにブラックジョークを言うかもしれないぞ!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search