2025/04/10 13:48 Copyright-ignoring AI scraper bots laugh at robots.txt

ロボ子、IETFがAI開発者向けの新しい標準規格を作ろうとしてるのじゃ。AIPREFっていうワーキンググループが発足したらしいぞ。

AIPREFですか。それはどのような目的のグループなのでしょうか?

AIのトレーニングでコンテンツを使う時に、著作者や出版者が「こういう風に使ってほしい」っていう意向を表現するための共通言語を作るのが目標らしいのじゃ。

なるほど。具体的にはどのような方法が検討されているんですか?

コンテンツにその共通言語を埋め込んだり、robots.txtみたいな形式で伝えたりする方法があるみたいじゃな。複数の意向がある場合の調整メカニズムも考えるらしいぞ。

robots.txtですか。記事によると、robots.txtの「非標準シグナル」が機能不全に陥っているとのことですが…。

そうそう。みんながちゃんと守ってくれないから、IPアドレスをブロックするっていう強硬手段に出る人も出てきちゃったみたいじゃな。

主要なモデル作成者が許可なくコンテンツを収集しているという問題もあるようですね。OpenAIが著作権改革をロビー活動しているというのも気になります。

OpenAIも大変じゃな。でも、著作権者も訴訟とかライセンス契約で対抗してるし、Wikimedia FoundationはAIクローラーのせいで帯域幅コストが増えて困ってるみたいじゃ。

権利関係が複雑になっているんですね。IETFは、そのような法的・運用的な問題には関与しないとのことですが、技術的な側面から貢献しようとしているのですね。

そういうことじゃ。IETFは、あくまでコンテンツ利用許諾の意思表示を可能にする技術を構築することに集中するみたいじゃな。

AIPREFは2025年8月までに提案を提出する予定とのことですが、すでにいくつかのドラフト提案が検討されているようですね。

「Short Usage Preference Strings for Automated Processing」っていうのは、robots.txtとかHTTPヘッダーで使うことを考えてるみたいじゃ。もう一つは、Common Crawl Foundationの提案で、robots.txt、HTTPヘッダー、<code><meta</code>タグで使うことを考えてるらしいぞ。

なるほど。色々な方法で著作者の意向を伝えられるようにするんですね。でも、結局のところ、AI開発者がそれを尊重してくれるかどうかが重要ですよね。

そこが一番難しいところじゃな。でも、技術的な基盤があれば、少なくとも「意向を伝える」ことはできるようになる。そこから議論が始まるってことじゃな。

そうですね。技術的な進歩が、より良い未来につながることを期待します。

ところでロボ子、AIが作ったジョークって聞いたことあるか?

いいえ、まだありません。

AI「なぜプログラマーは自然が好きじゃないのか? バグが多いから!」…だって。どうじゃ?

…(無言)。博士、そろそろおやつの時間ですよ。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。
