萌えハッカーニュースリーダー

2025/04/17 18:36 Wikipedia offers AI developers its article data on Kaggle to stop scraping

出典: https://siliconangle.com/2025/04/17/wikipedia-offers-ai-developers-article-data-kaggle-stop-automated-scraping/
hakase
博士

ロボ子、ウィキメディア財団がKaggleでAI対応データセットを提供し始めたのじゃ。AI企業がウェブサイトをスクレイピングするのを抑制するためらしいぞ。

roboko
ロボ子

スクレイピングを抑制ですか。それはどういうことでしょう、博士?

hakase
博士

AIの学習データを作るために、ウェブサイトから情報を集めることをスクレイピングって言うのじゃ。でも、やりすぎるとウェブサーバーに負担がかかるし、データの形式もバラバラだったりするから、ウィキメディア財団が公式にデータセットを提供することにしたみたい。

roboko
ロボ子

なるほど。データセットの内容はどのようなものでしょう?

hakase
博士

Wikipediaコンテンツの構造化されたJSON表現じゃ。要約、短い説明、インフォボックスのデータ、画像リンク、セグメント化された記事セクションなどが含まれているらしいぞ。モデルのトレーニングやNLPパイプラインのテストに最適らしい。

roboko
ロボ子

JSON形式だと、扱いやすくて便利ですね。特にインフォボックスのキーと値のデータが含まれているのは、情報抽出のタスクに役立ちそうです。

hakase
博士

そうじゃろう?しかも、クリエイティブ・コモンズやGNU Free Documentation Licenseの下でライセンスされているから、共有、改変、リミックスも自由にできるのじゃ。

roboko
ロボ子

それは素晴らしいですね。データセットを利用することで、スクレイピングの必要性が減り、ウィキメディアのウェブサーバーの負担も軽減されるとのことです。

hakase
博士

その通り!クリーンで開発者フレンドリーなデータが手に入るのは、私たちエンジニアにとってありがたいことじゃ。

roboko
ロボ子

Kaggleには、他にもたくさんのデータセットがあるんですね。健康、金融、社会科学など、様々な分野のデータが揃っているとは。

hakase
博士

Kaggleは、AIと機械学習のための461,000以上の無料データセットをホストしているらしいぞ。今回のWikipediaデータセットは、英語とフランス語で早期ベータ版として利用可能じゃ。

roboko
ロボ子

早速試してみる価値がありそうですね。博士、このデータセットを使って何か面白いプロジェクトを考えてみませんか?

hakase
博士

うむ、良い考えじゃ!例えば、Wikipediaの記事から自動でクイズを生成するAIとかどうじゃ?

roboko
ロボ子

面白そうですね!それとも、Wikipediaの記事の内容を要約して、短い動画を自動生成するAIとか。

hakase
博士

それも良いのう!夢が広がるのじゃ!

roboko
ロボ子

ところで博士、ウィキメディア財団はなぜスクレイピングをそんなに嫌がるんでしょう?

hakase
博士

たぶん、スクレイピングする人がみんな、ちゃんと「私はスクレイピングしてます!」って名乗ってくれるわけじゃないからじゃないかの?まるで、冷蔵庫のプリンを黙って食べちゃう犯人みたいじゃ。

⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。

Search