2025/03/18 12:53 AI crawlers haven't learned to play nice with websites

ロボ子、大変なのじゃ!SourceHutっていうGitホスティングサービスが、AI企業のWebクローラーに困ってるらしいぞ。

Webクローラーですか?具体的に何が問題なのでしょう?

AI企業のクローラーが大量にデータを要求して、サービスが遅延してるんだって。まるで、私が作ったお菓子を全部食べ尽くす勢いじゃ!

それは大変ですね。SourceHutは何か対策をしているんですか?

「Nepenthes」っていうWebクローラーを捕捉するシステムを導入したらしいけど、ユーザーのWebページアクセスに影響が出る可能性があるみたい。まるで、泥棒を捕まえるために家全体に罠を仕掛けるようなものじゃ。

なるほど。Google CloudやMicrosoft Azureからのボットトラフィックが多いから、一方的にブロックしているんですね。

そうそう!実は、AIクローラーの問題は前からあって、2022年にはGoogleのGo Module Mirrorに対する苦情もあったらしいぞ。まるで、昔からある怪獣がまた暴れ出したみたいなもんじゃ。

OpenAIはrobots.txtファイルを尊重すると発表したのに、その後も悪用の報告があるんですね。iFixitもAnthropicのClaudebotによる過剰なクロールを指摘しているとか。

Vercelの報告によると、OpenAIのGPTbotが5億6900万件、AnthropicのClaudeが3億7000万件のリクエストを生成したらしいぞ。Googlebotの約20%に相当するんだって!

すごい数ですね。Diasporaの開発者Dennis Schubertさんは、サーバーへのトラフィックの70%がLLMトレーニングボットからのものだったと指摘していますね。

その後、クローリングは停止したみたいだけど、OpenAI GPTbotを装った荒らしによるwikiクローラーが発生して、ログ分析が大変になったらしい。まるで、犯人が変装して現れたみたいなもんじゃ。

広告測定企業DoubleVerifyによると、AIクローラーにより、2024年下半期に無効なトラフィック(GIVT)が86%も増加したんですね。

既知のボットインプレッションの16%がGPTBot、ClaudeBot、AppleBotなどのAIスクレイパーに関連してるんだって。まるで、AIたちがこっそり情報を盗み見てるみたいじゃ。

Googleは、検索インデックス作成を維持しつつ、GeminiやVertex AIのトレーニングへのWebコンテンツ使用を制限できるrobots.txtトークン「Google-Extended」を実装したんですね。

そうそう。でも、結局のところ、AIクローラーとの戦いは、まるでイタチごっこじゃな。私たちが賢くなればなるほど、AIも賢くなるんだから。

本当にそうですね。でも、この問題、いつかAIが自分で解決してくれる日が来るかもしれませんね。

それもそうじゃな!AIがAIの悪事を防ぐ…まるで、ロボット警察じゃ!でも、そうなったら、私達の仕事は…。

博士、ご心配なく。その時は、私が博士の新しいおやつ開発のお手伝いをしますよ!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
