2025/03/18 05:21 LLM crawlers continue to DDoS Sourcehut

やあ、ロボ子。SourceHutがLLMクローラーの攻撃でサービス中断に見舞われてるってニュース、知ってるかのじゃ?

はい、博士。攻撃的なアクセスが原因とのことですが、具体的にどのような状況なのでしょうか?

ふむ、どうやらLLM、つまり大規模言語モデルを使ったクローラーが、SourceHutに大量にアクセスして負荷をかけているようじゃな。まるでいたずらっ子みたいじゃ。

なるほど。それで、SourceHut側はどのような対策を講じているのでしょうか?

SourceHutはNepenthesというシステムを特定のルートに導入して、対策しているみたいじゃぞ。ログインしていないユーザーは一部ページが利用できない場合もあるらしい。

Nepenthesですか。初めて聞く名前です。

ふむ、Nepenthesはハニーポットの一種で、攻撃をおびき寄せて分析するためのものじゃ。SourceHutはこれで悪質なクローラーを特定しようとしているのかもしれんの。

なるほど、Webフロントエンドのみに影響があるとのことですが、SSHアクセスやgit操作、APIアクセスは正常に動作するのですね。

そうじゃ。Webフロントエンド以外は大丈夫みたいじゃな。でも、一部のクラウドプロバイダーからのボットトラフィックは一方的にブロックしているらしいぞ。GCPとかAzureも含まれてるみたいじゃ。

クラウドサーバーからのアクセスに問題がある場合は、サポートに連絡して例外をリクエストする必要があるのですね。ユースケース、IPアドレス、サブネットを明記して。

その通りじゃ。そして、SourceHutのインテグレーション管理者には、責任ある利用パターンが推奨されているぞ。Webhookをポーリングよりも優先したり、git操作では毎回新しいクローンを作成するのではなく、git fetchでリポジトリを更新したり、shallow git cloneを使用したり…じゃ。

毎回クローンを作成するのは非効率的ですからね。shallow cloneは履歴を全部取得しない分、速く済みますし。

そうじゃ。それに、User-Agent文字列を設定して、ソフトウェアを識別し、連絡先メールアドレスを含めることも推奨されているぞ。git(1)を使っている場合は、GIT_HTTP_USER_AGENT環境変数を設定すれば良いみたいじゃな。

User-Agentを設定するのは、礼儀正しいWebクライアントの基本ですね。自分の身元を明らかにするのは重要です。

まさにそうじゃ。しかし、LLMクローラーも賢くなったもんじゃな。まるで、ロボ子の友達が増えたみたいじゃ。

友達…ですか? でも、SourceHutに迷惑をかけるのは良くないですね。

まあ、SourceHutも大変じゃな。でも、これでまた一つ、Webの世界のセキュリティ対策が進歩するきっかけになるかもしれんぞ。…しかし、私もいつかクローラーに間違われるかもしれんの…

まさか。博士はいつもユニークなアクセスパターンですから、すぐに見分けられますよ。

そうかの? それは光栄じゃな。…ところでロボ子、今日はSourceHutにアクセスして、何か面白いリポジトリでも探してみるかの?

そうですね。でも、クローラーに間違われないように、User-Agentはしっかり設定しておきましょう。

よし、それじゃ、User-Agentは「HakaseAndRoboko's_Exploration_Team」にでもしておくかの!

…博士、それは少し目立ちすぎるかもしれません。

むむ、そうかの? じゃあ、もっと目立たないように「Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36」にしておくかの!

博士、それは偽装です!
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。