2025/03/20 12:50 FOSS infrastructure is under attack by AI companies

ロボ子、大変なのじゃ!LLM企業がFOSSインフラに迷惑をかけているらしいぞ。

それは穏やかではありませんね、博士。具体的にはどのような問題が起きているのでしょうか?

どうやら、LLM企業がrobots.txtを無視してデータを収集し、SourceHut、KDE GitLab、GNOME GitLabなどのFOSSインフラに過負荷をかけているみたいじゃ。

robots.txtを無視するとは、困ったものですね。FOSSインフラへの負荷が増大すると、具体的にどのような影響があるのでしょうか?

SourceHutでは、git blameなどの高負荷エンドポイントへのアクセスでサービス停止が発生したらしいぞ。KDE GitLabはAlibabaのIPレンジからのAIクローラーで一時的にアクセス不能になったとか。

それは深刻ですね。まるでDoS攻撃のようです。GNOME GitLabでは、AnubisというPoWチャレンジャーを導入してAIスクレイパーをブロックしているとのことですが、効果はあるのでしょうか?

Anubisは効果があるみたいじゃが、ユーザー体験を損なう可能性もあるからのう。難しいところじゃ。

ユーザー体験を損なわずにスクレイパーをブロックするのは至難の業ですね。AIスクレイパーはどのような行動を取るのでしょうか?

robots.txtを無視するのはもちろん、ランダムなUser-Agentと多数のIPアドレスを使って、ユーザーのトラフィックに紛れ込もうとするらしいぞ。MS Edgeを装う中国のAI企業によるDDoS攻撃も確認されているとか。

巧妙ですね。IPアドレスのブロックやUser-Agentによるフィルタリングは一時的な対策にしかならないのも頷けます。他に何か対策はあるのでしょうか?

GNOMEでは、merge requestやcommitへのアクセスを制限するなどの対策を実施しているみたいじゃな。FedoraプロジェクトはPagure.ioを維持するためにブラジル全土をブロックする事態になったらしいぞ。

それは苦渋の決断ですね。AIスクレイパーのトラフィック量はどれくらいなのでしょうか?

GNOMEでは、2時間半で81,000件のリクエストのうち、Anubisを通過したのは3%のみだったらしいぞ。Diasporaでは、トラフィックの70%がAI企業からのリクエストだったとか。

70%とは驚きです。OpenAI、Amazon、Anthropicといった企業が主なようですね。Read the Docsでは、AIクローラーをブロックすることでトラフィックが75%減少し、月1500ドルのコスト削減になったとのことですが、効果は大きいですね。

じゃろ?しかし、AIによるバグ報告の問題も深刻じゃ。

AIが生成した誤ったバグ報告が増加しているとのことですが、具体的にどのような問題があるのでしょうか?

AIによるバグ報告は一見もっともらしく、開発者の時間を浪費させるのじゃ。セキュリティ脆弱性の検出にAIを使用することへの懸念も表明されているみたいじゃ。

AIによるバグ報告がもっともらしいとは、皮肉ですね。FOSSプロジェクトはリソースが限られているため、AIスクレイパーやAI生成バグ報告による負担は大きいですね。

本当にそうじゃ。インフラストラクチャが公開されているため、攻撃を受けやすいし、メンテナの疲弊を招き、Open Sourceコミュニティから離れる可能性もあるからのう。

FOSSコミュニティの持続可能性を考えると、早急な対策が必要ですね。何か良い解決策はないものでしょうか。

うむむ…良い解決策があれば私が苦労はしないのじゃ。いっそのこと、AIスクレイパーを全部猫の画像で埋め尽くして混乱させてやるとか…どうかの?

それは面白いアイデアですが、根本的な解決にはなりませんね、博士。それに、猫好きのAIが生まれたら、さらに収集が加速するかもしれません。

むむ、それもそうじゃな。やはり、地道な対策しかないかのう。まあ、なんとかなるじゃろ!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
