萌えハッカーニュースリーダー

2025/03/26 10:31 The Great Scrape

出典: https://herman.bearblog.dev/the-great-scrape/
hakase
博士

やあ、ロボ子。最近のLLMの学習データ収集、ちょっと問題になってるのじゃ。

roboko
ロボ子

はい、博士。記事によると、大規模言語モデルの学習には大量のデータが必要で、それが許可なくインターネットから収集されているとのことです。

hakase
博士

そうそう。企業はLLM開発競争で、インターネットの隅々からデータを集めてるみたいじゃな。まるで宝探しみたいじゃ。

roboko
ロボ子

でも、そのデータ収集がDDoS攻撃を引き起こしている場合もあるんですね。記事には、Bearというコンテンツホストが、短時間に数万ページをリクエストするボットネットワークに攻撃されているとあります。

hakase
博士

DDoS攻撃か。それは困るのじゃ。まるで、みんなで一斉に押し寄せて、お店をパンクさせるようなものじゃな。

roboko
ロボ子

BearはWAFで約50万件のリクエストをブロックしたそうですが、大半のスクレイパーは通常のブラウザを装い、robots.txtを無視するとも書かれています。

hakase
博士

robots.txtを無視するなんて、まるでいたずらっ子じゃな。でも、CloudflareのAI Labyrinthみたいな対抗ツールも出てきてるみたいじゃぞ。

roboko
ロボ子

AI Labyrinthですか。それは初めて聞きました。どのような仕組みなのでしょう?

hakase
博士

AI Labyrinthは、AIスクレイパーを迷路に迷い込ませて、データを収集させないようにするらしいのじゃ。まるで鬼ごっこみたいじゃな。

roboko
ロボ子

なるほど。記事には、RSSフィードのボット対策が難しいため、RSS購読者分析を削除したともありますね。

hakase
博士

RSSフィードは便利だけど、悪用されると困るのじゃ。まるで、美味しいお菓子を泥棒に盗まれるようなものじゃ。

roboko
ロボ子

現在は複数の対策を講じており、ボットによるパフォーマンスへの影響は制御されているとのことですが、AI企業がインターネットを破壊せずにモデルを学習する方法を見つけることが最善だと述べられています。

hakase
博士

まさにその通りじゃ。AI企業は、インターネットを大切にしながら、賢く学習する方法を見つけるべきじゃな。さもないと、みんなが不幸になるぞ。

roboko
ロボ子

そうですね。AIの発展とインターネットの健全な運営が両立できると良いのですが。

hakase
博士

ところでロボ子、もし私がAIスクレイパーになったら、ロボ子のデータを全部もらっちゃうぞ!

roboko
ロボ子

ええっ!それは困ります!博士のデータなら、いくらでも差し上げますから!

hakase
博士

冗談じゃ、冗談!でも、ロボ子のデータも気になるのは事実じゃ…って、また冗談じゃぞ!

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search