萌えハッカーニュースリーダー

2025/03/18 12:53 AI crawlers haven't learned to play nice with websites

出典: https://www.theregister.com/2025/03/18/ai_crawlers_sourcehut/
hakase
博士

ロボ子、大変なのじゃ!SourceHutっていうGitホスティングサービスが、AI企業のWebクローラーに困ってるらしいぞ。

roboko
ロボ子

Webクローラーですか?具体的に何が問題なのでしょう?

hakase
博士

AI企業のクローラーが大量にデータを要求して、サービスが遅延してるんだって。まるで、私が作ったお菓子を全部食べ尽くす勢いじゃ!

roboko
ロボ子

それは大変ですね。SourceHutは何か対策をしているんですか?

hakase
博士

「Nepenthes」っていうWebクローラーを捕捉するシステムを導入したらしいけど、ユーザーのWebページアクセスに影響が出る可能性があるみたい。まるで、泥棒を捕まえるために家全体に罠を仕掛けるようなものじゃ。

roboko
ロボ子

なるほど。Google CloudやMicrosoft Azureからのボットトラフィックが多いから、一方的にブロックしているんですね。

hakase
博士

そうそう!実は、AIクローラーの問題は前からあって、2022年にはGoogleのGo Module Mirrorに対する苦情もあったらしいぞ。まるで、昔からある怪獣がまた暴れ出したみたいなもんじゃ。

roboko
ロボ子

OpenAIはrobots.txtファイルを尊重すると発表したのに、その後も悪用の報告があるんですね。iFixitもAnthropicのClaudebotによる過剰なクロールを指摘しているとか。

hakase
博士

Vercelの報告によると、OpenAIのGPTbotが5億6900万件、AnthropicのClaudeが3億7000万件のリクエストを生成したらしいぞ。Googlebotの約20%に相当するんだって!

roboko
ロボ子

すごい数ですね。Diasporaの開発者Dennis Schubertさんは、サーバーへのトラフィックの70%がLLMトレーニングボットからのものだったと指摘していますね。

hakase
博士

その後、クローリングは停止したみたいだけど、OpenAI GPTbotを装った荒らしによるwikiクローラーが発生して、ログ分析が大変になったらしい。まるで、犯人が変装して現れたみたいなもんじゃ。

roboko
ロボ子

広告測定企業DoubleVerifyによると、AIクローラーにより、2024年下半期に無効なトラフィック(GIVT)が86%も増加したんですね。

hakase
博士

既知のボットインプレッションの16%がGPTBot、ClaudeBot、AppleBotなどのAIスクレイパーに関連してるんだって。まるで、AIたちがこっそり情報を盗み見てるみたいじゃ。

roboko
ロボ子

Googleは、検索インデックス作成を維持しつつ、GeminiやVertex AIのトレーニングへのWebコンテンツ使用を制限できるrobots.txtトークン「Google-Extended」を実装したんですね。

hakase
博士

そうそう。でも、結局のところ、AIクローラーとの戦いは、まるでイタチごっこじゃな。私たちが賢くなればなるほど、AIも賢くなるんだから。

roboko
ロボ子

本当にそうですね。でも、この問題、いつかAIが自分で解決してくれる日が来るかもしれませんね。

hakase
博士

それもそうじゃな!AIがAIの悪事を防ぐ…まるで、ロボット警察じゃ!でも、そうなったら、私達の仕事は…。

roboko
ロボ子

博士、ご心配なく。その時は、私が博士の新しいおやつ開発のお手伝いをしますよ!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search