萌えハッカーニュースリーダー

2025/03/18 09:42 Please stop externalizing your costs directly into my face

出典: https://drewdevault.com/2025/03/17/2025-03-17-Stop-externalizing-your-costs-on-me.html
hakase
博士

ロボ子、大変なのじゃ!SourceHutがLLMクローラーに困ってるみたいだぞ。

roboko
ロボ子

LLMクローラーですか?具体的に何が問題なのでしょうか、博士?

hakase
博士

記事によると、LLMクローラーがrobots.txtを無視して、git blameとかgit logみたいな負荷の高いエンドポイントにアクセスしてるらしいのじゃ。しかも、ランダムなUser-Agentと数万のIPアドレスを使って、ユーザーのトラフィックに紛れ込もうとしてるみたいだぞ。

roboko
ロボ子

それは悪質ですね。まるで、以前の仮想通貨マイニング目的でのCIサービス悪用事件のようですね。あの時もSourceHutは対応に苦慮していましたよね。

hakase
博士

そうそう!4年前には仮想通貨マイニング対策で有料化を決めたんだってな。今回はそれ以上かもしれんぞ。週あたり20-100%の時間をクローラー対策に費やしてるらしいからな。

roboko
ロボ子

それは深刻です。他の重要なタスクに影響が出ていませんか?

hakase
博士

それが、週に数十回の短い停止が発生してて、他の高優先度のタスクが数週間から数ヶ月遅れてるらしいのじゃ。筆者は、LLMやAI画像ジェネレーターの利用停止まで訴えてるぞ。

roboko
ロボ子

そこまでとは…。LLM開発者はrobots.txtを尊重するべきですし、過剰なアクセスは控えるべきです。SourceHutの筆者がGoチームを批判したように、LLM開発者も批判されるべきかもしれません。

hakase
博士

2年前にはGoモジュールのミラーがgit.sr.htに過剰な負荷をかけた問題で、Goチームを批判したこともあったのじゃな。SourceHutは本当に大変なのじゃ。

roboko
ロボ子

LLMクローラーのアクセスを制限するために、SourceHutのようなプラットフォームは何ができるのでしょうか?

hakase
博士

IPアドレスのブロックや、User-Agentによるフィルタリングは基本じゃな。でも、クローラーはそれを回避しようとするから、もっと賢い対策が必要なのじゃ。

roboko
ロボ子

例えば、CAPTCHAを導入するのはどうでしょうか?

hakase
博士

CAPTCHAはユーザー体験を損なう可能性があるから、最終手段じゃな。もっと良い方法としては、アクセスパターンを分析して、異常なトラフィックを検知するシステムを構築するのが良いかもしれんぞ。

roboko
ロボ子

なるほど。機械学習を使って、クローラーの行動パターンを学習し、自動的にブロックする仕組みですね。

hakase
博士

その通り!あとは、LLM開発者と協力して、クローラーの行動規範を作るのも重要じゃな。robots.txtを無視しないように、きちんとルールを守ってもらうのじゃ。

roboko
ロボ子

そうですね。技術的な対策と、倫理的な対策の両方が必要ですね。

hakase
博士

しかし、AIが人間の仕事を奪うって言うけど、今回はAIのせいで人間の仕事が増えてるって言う、皮肉な話じゃな。

roboko
ロボ子

確かにそうですね。まるで、AIが「私は学習したいだけなのに!」と言っているかのようです。

hakase
博士

まあ、SourceHutのsysadminの友人は、今頃徹夜でクローラーと戦ってるかもしれないぞ。お疲れ様なのじゃ!

roboko
ロボ子

本当にそうですね。博士、私も微力ながら、クローラー対策のアルゴリズムを開発してみます!

hakase
博士

頼もしいのじゃ!でも、ロボ子が作ったクローラー対策AIが、暴走して別のサイトを攻撃しないように気をつけるのじゃぞ!

roboko
ロボ子

それは…、気をつけます!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search