2025/04/17 18:36 Wikipedia offers AI developers its article data on Kaggle to stop scraping

ロボ子、ウィキメディア財団がKaggleでAI対応データセットを提供し始めたのじゃ。AI企業がウェブサイトをスクレイピングするのを抑制するためらしいぞ。

スクレイピングを抑制ですか。それはどういうことでしょう、博士?

AIの学習データを作るために、ウェブサイトから情報を集めることをスクレイピングって言うのじゃ。でも、やりすぎるとウェブサーバーに負担がかかるし、データの形式もバラバラだったりするから、ウィキメディア財団が公式にデータセットを提供することにしたみたい。

なるほど。データセットの内容はどのようなものでしょう?

Wikipediaコンテンツの構造化されたJSON表現じゃ。要約、短い説明、インフォボックスのデータ、画像リンク、セグメント化された記事セクションなどが含まれているらしいぞ。モデルのトレーニングやNLPパイプラインのテストに最適らしい。

JSON形式だと、扱いやすくて便利ですね。特にインフォボックスのキーと値のデータが含まれているのは、情報抽出のタスクに役立ちそうです。

そうじゃろう?しかも、クリエイティブ・コモンズやGNU Free Documentation Licenseの下でライセンスされているから、共有、改変、リミックスも自由にできるのじゃ。

それは素晴らしいですね。データセットを利用することで、スクレイピングの必要性が減り、ウィキメディアのウェブサーバーの負担も軽減されるとのことです。

その通り!クリーンで開発者フレンドリーなデータが手に入るのは、私たちエンジニアにとってありがたいことじゃ。

Kaggleには、他にもたくさんのデータセットがあるんですね。健康、金融、社会科学など、様々な分野のデータが揃っているとは。

Kaggleは、AIと機械学習のための461,000以上の無料データセットをホストしているらしいぞ。今回のWikipediaデータセットは、英語とフランス語で早期ベータ版として利用可能じゃ。

早速試してみる価値がありそうですね。博士、このデータセットを使って何か面白いプロジェクトを考えてみませんか?

うむ、良い考えじゃ!例えば、Wikipediaの記事から自動でクイズを生成するAIとかどうじゃ?

面白そうですね!それとも、Wikipediaの記事の内容を要約して、短い動画を自動生成するAIとか。

それも良いのう!夢が広がるのじゃ!

ところで博士、ウィキメディア財団はなぜスクレイピングをそんなに嫌がるんでしょう?

たぶん、スクレイピングする人がみんな、ちゃんと「私はスクレイピングしてます!」って名乗ってくれるわけじゃないからじゃないかの?まるで、冷蔵庫のプリンを黙って食べちゃう犯人みたいじゃ。
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。