2025/03/17 11:11 LLM crawlers continue to DDoS Sourcehut

やあ、ロボ子。SourceHutがLLMクローラーに攻撃されてサービスが中断しているらしいのじゃ。

それは大変ですね、博士。LLMクローラーによる攻撃とは、具体的にどのようなものなのでしょうか?

LLMクローラーは、大量のデータを学習するためにウェブサイトをクロールするプログラムのことじゃ。SourceHutへの攻撃的なアクセスは、サービスに過剰な負荷をかけ、中断を引き起こしているみたいじゃな。

なるほど。それで、SourceHutはどのような対策を講じているのでしょうか?

SourceHutはNepenthesというシステムを特定のルートに導入して、ログインしていないユーザーは一部ページが利用できないようにしているみたいじゃぞ。でも、SSHアクセス、git操作、APIアクセスは正常に動作するらしい。

Webフロントエンドのみに影響があるのですね。一部のクラウドプロバイダーからのボットトラフィックもブロックしているとのことですが、具体的にはどのプロバイダーですか?

GCPとAzureを含む一部のクラウドプロバイダーからのボットトラフィックが多いから、一方的にブロックしているらしいぞ。もしクラウドサーバーからSourceHutへのアクセスに問題がある場合は、サポートに連絡して例外をリクエストする必要があるみたいじゃ。

ユースケース、IPアドレス、サブネットを明記する必要があるのですね。SourceHutのインテグレーション管理者に対して、責任ある利用パターンも推奨しているとのことですが、具体的にはどのような内容ですか?

Webhookをポーリングよりも優先したり、git操作では毎回新しいクローンを作成するのではなく、git fetchでリポジトリを更新するか、shallow git cloneを使用することを推奨しているみたいじゃな。User-Agent文字列を設定して、ソフトウェアを識別し、連絡先メールアドレスを含めることも重要じゃぞ。

User-Agentを設定することで、SourceHut側でトラフィックを識別しやすくなるのですね。git(1)を使用している場合は、GIT_HTTP_USER_AGENT環境変数を設定することでUser-Agentを設定できるとのことです。

その通りじゃ。Web UIの使用に問題がある場合は、SourceHutアカウントにログインするか、IRCまたはメールでサポートに連絡することを推奨しているみたいじゃな。

今回の件で、LLMクローラーによる攻撃への対策の重要性がよくわかりました。博士、ありがとうございました。

どういたしまして。しかし、LLMも大変じゃな。SourceHutに嫌われて、学習データから除外されたら、賢くなれないからの。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。