ウィキペディアはAI開発者にボットスクレーパーをかわすためにデータを提供しています

ウィキペディアのAIデータスクレイピング管理のための新戦略
ウィキペディアは、ウィキメディア財団を通じて、AIデータスクレイピングがサーバーに与える影響を管理するための積極的な措置を講じています。水曜日、彼らはGoogleが所有し、データサイエンスと機械学習に特化したプラットフォームであるKaggleと協力して、ベータデータセットを公開すると発表しました。このデータセットには「英語とフランス語の構造化されたウィキペディアコンテンツ」が含まれており、AIトレーニング目的に特化して設計されています。
Kaggleで公開されているこのデータセットは、AI開発者を念頭に置いて作成されており、機械可読な記事データへのアクセスプロセスを簡素化します。これには、研究概要、短い説明、画像リンク、インフォボックスデータ、さまざまな記事セクションなどが含まれます。重要なのは、このデータがオープンライセンスであり、参照や音声ファイルなどの非テキスト要素を含まないため、モデリング、ファインチューニング、ベンチマークなどのAIユースケースに最適化されている点です。
ウィキメディアのアプローチは、ウィキペディアのコンテンツを構造化されたJSON形式で提供するもので、従来の記事テキストのスクレイピングや解析に比べて、AI開発者にとってより魅力的な選択肢となることを期待しています。この動きは、AIボットが帯域幅を消費することでウィキペディアのサーバーに負担をかけていることへの対応でもあります。
すでにウィキメディアは、Googleやインターネットアーカイブなどの大手とコンテンツ共有契約を結んでいます。しかし、Kaggleとのパートナーシップにより、このデータは中小企業や独立したデータサイエンティストにとってよりアクセスしやすくなり、ウィキペディアのコンテンツの活用範囲と有用性が広がることが期待されています。
Kaggleがもたらすもの
Kaggleのパートナーシップ責任者であるブレンダ・フリン氏は、ウィキメディアのデータをホストすることに熱意を示しました。「機械学習コミュニティがツールやテストを求めて集まる場所として、Kaggleはウィキメディア財団のデータをホストできることに非常に興奮しています」と彼女は述べました。Kaggleの役割は、このデータをアクセス可能にするだけでなく、機械学習コミュニティにとって関連性が高く有用なものに保つ上で重要です。
ウィキペディアのこの戦略的な動きは、サーバーの負荷を軽減するだけでなく、AIおよび機械学習コミュニティとのより構造化された有益な関係を育むことを目指しています。
関連記事
ワーナーミュージックがAI帰属分析スタートアップのSureel AIを買収
ワーナー・ミュージック・グループ(WMG)は水曜日、人工知能(AI)の帰属情報スタートアップであるSureel AIを買収すると発表した。Sureelの独自技術は、楽曲に対して「AI DNA」を生成し、構成要素に分解して、AIモデルがこれらの要素をどのように利用するかを追跡する。今回の買収を通じて、WMGは、アーティストやソングライターの作品がAI生成コンテンツで利用されたり、AIモデルの学習に使用されたりする状況を監視する能力を強化する目的である。「SureelをWMGに統合することで、保
Amazonは、Alexa for Shoppingを導入しつつ、Rufusを後回しにしている
Amazonは、RufusショッピングチャットボットとAlexa+をアプリ、ウェブサイト、Echo Showデバイス全体で統合した「Alexa for Shopping」をリリースした。このアシスタントは商品の問い合わせに応じ、アイテムの比較、価格追跡、ショッピングリマインダーをサポートする。また、スケジュールされたショッピングアクションや対象となる自動購入も処理する。同社によると、「Alexa for Shopping」はRufusの商品専門知識とAlexa+のパーソナライズされたアシスタ
マイクロソフト、Azure、AI技術がカリフォルニアの山火事リスク対策に貢献
マイクロソフトはAIを活用した山火事検知技術に投資しており、CVP兼チーフデータサイエンティストのフアン・ラビスタ・フェレス氏が、環境被害を軽減するための戦略について語っている。NASAによると、気候変動は地球上のすべての人々に影響を及ぼしており、気温の上昇、降雨パターンの変化、海面上昇といった形で現れている。NASAは、地球がかつてない速度で温暖化しており、その主な要因は人間の活動であるという明
関連特集おすすめ
コメント (3)
0/500
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️

ウィキペディアのAIデータスクレイピング管理のための新戦略
ウィキペディアは、ウィキメディア財団を通じて、AIデータスクレイピングがサーバーに与える影響を管理するための積極的な措置を講じています。水曜日、彼らはGoogleが所有し、データサイエンスと機械学習に特化したプラットフォームであるKaggleと協力して、ベータデータセットを公開すると発表しました。このデータセットには「英語とフランス語の構造化されたウィキペディアコンテンツ」が含まれており、AIトレーニング目的に特化して設計されています。
Kaggleで公開されているこのデータセットは、AI開発者を念頭に置いて作成されており、機械可読な記事データへのアクセスプロセスを簡素化します。これには、研究概要、短い説明、画像リンク、インフォボックスデータ、さまざまな記事セクションなどが含まれます。重要なのは、このデータがオープンライセンスであり、参照や音声ファイルなどの非テキスト要素を含まないため、モデリング、ファインチューニング、ベンチマークなどのAIユースケースに最適化されている点です。
ウィキメディアのアプローチは、ウィキペディアのコンテンツを構造化されたJSON形式で提供するもので、従来の記事テキストのスクレイピングや解析に比べて、AI開発者にとってより魅力的な選択肢となることを期待しています。この動きは、AIボットが帯域幅を消費することでウィキペディアのサーバーに負担をかけていることへの対応でもあります。
すでにウィキメディアは、Googleやインターネットアーカイブなどの大手とコンテンツ共有契約を結んでいます。しかし、Kaggleとのパートナーシップにより、このデータは中小企業や独立したデータサイエンティストにとってよりアクセスしやすくなり、ウィキペディアのコンテンツの活用範囲と有用性が広がることが期待されています。
Kaggleがもたらすもの
Kaggleのパートナーシップ責任者であるブレンダ・フリン氏は、ウィキメディアのデータをホストすることに熱意を示しました。「機械学習コミュニティがツールやテストを求めて集まる場所として、Kaggleはウィキメディア財団のデータをホストできることに非常に興奮しています」と彼女は述べました。Kaggleの役割は、このデータをアクセス可能にするだけでなく、機械学習コミュニティにとって関連性が高く有用なものに保つ上で重要です。
ウィキペディアのこの戦略的な動きは、サーバーの負荷を軽減するだけでなく、AIおよび機械学習コミュニティとのより構造化された有益な関係を育むことを目指しています。
ワーナーミュージックがAI帰属分析スタートアップのSureel AIを買収
ワーナー・ミュージック・グループ(WMG)は水曜日、人工知能(AI)の帰属情報スタートアップであるSureel AIを買収すると発表した。Sureelの独自技術は、楽曲に対して「AI DNA」を生成し、構成要素に分解して、AIモデルがこれらの要素をどのように利用するかを追跡する。今回の買収を通じて、WMGは、アーティストやソングライターの作品がAI生成コンテンツで利用されたり、AIモデルの学習に使用されたりする状況を監視する能力を強化する目的である。「SureelをWMGに統合することで、保
マイクロソフト、Azure、AI技術がカリフォルニアの山火事リスク対策に貢献
マイクロソフトはAIを活用した山火事検知技術に投資しており、CVP兼チーフデータサイエンティストのフアン・ラビスタ・フェレス氏が、環境被害を軽減するための戦略について語っている。NASAによると、気候変動は地球上のすべての人々に影響を及ぼしており、気温の上昇、降雨パターンの変化、海面上昇といった形で現れている。NASAは、地球がかつてない速度で温暖化しており、その主な要因は人間の活動であるという明
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️





家






