EleutherAIがAIトレーニング用の大規模ライセンステキストデータセットを公開

EleutherAI、主要なAI研究グループは、AIモデルトレーニング用の最大規模のライセンスおよびオープンドメインテキストのコレクションを公開しました。
Common Pile v0.1と名付けられたこの8テラバイトのデータセットは、AIスタートアップのPoolside、Hugging Face、およびさまざまな学術機関と協力して2年間で開発されました。このデータセットは、EleutherAIの新しいモデルComma v0.1-1TおよびComma v0.1-2Tのトレーニングに使用され、組織はこれらのモデルが無許可の著作権付きデータでトレーニングされたモデルと同等の性能を発揮すると主張しています。
OpenAIを含むAI企業は、著作権付きの本やジャーナルを含むウェブスクレイピングデータを使用したモデルトレーニングに関する法的挑戦に直面しています。一部はコンテンツプロバイダーとライセンス契約を結んでいますが、多くは米国のフェアユース原則に依存して、許可なく著作権付き素材でトレーニングを行っています。
EleutherAIは、これらの訴訟がAI業界の透明性を大幅に低下させ、モデルの機能や弱点への洞察を制限し、広範な研究コミュニティに悪影響を及ぼしていると主張しています。
「法的挑戦はモデルトレーニングのデータ調達慣行を大きく変えていませんが、AI企業の公開性を劇的に減らしました」と、EleutherAIのエグゼクティブディレクターであるステラ・ビダーマンは、金曜日のHugging Faceのブログ投稿で述べました。「我々が話した一部の企業の研究者は、訴訟を理由にデータ中心の研究を共有できないと述べています。」
Common Pile v0.1は、Hugging FaceのAIプラットフォームおよびGitHubで利用可能で、法律相談を受けて開発され、米国議会図書館やインターネットアーカイブによってデジタル化された30万冊の公共ドメインの本などのソースが含まれています。EleutherAIはまた、OpenAIのWhisperモデルを使用してオーディオコンテンツを文字起こししました。
EleutherAIは、Comma v0.1-1TおよびComma v0.1-2TがCommon Pile v0.1の品質を示し、開発者が独自システムと競争力のあるモデルを作成できると主張しています。両モデルは、70億のパラメータを持ち、データセットの一部でトレーニングされ、Metaの元のLlamaモデルとコーディング、画像理解、数学ベンチマークで競合します。
TechCrunch All Stage Passで200ドル以上節約
よりスマートに革新。より早く成長。より深くネットワーク。Precursor Ventures、NEA、Index Ventures、Underscore VCなどのビジョナリーとつながり、洞察、ワークショップ、貴重なコネクションの1日を過ごしましょう。
TechCrunch All Stage Passで200ドル以上節約
よりスマートに革新。より早く成長。より深くネットワーク。Precursor Ventures、NEA、Index Ventures、Underscore VCなどのビジョナリーとつながり、洞察、ワークショップ、貴重なコネクションの1日を過ごしましょう。
ボストン、MA | 7月15日 いますぐ登録パラメータ、しばしばウェイトと呼ばれるものは、AIモデルの動作や応答を形作る内部要素です。
「無許可のテキストが高性能に不可欠だという考えは根拠がありません」とビダーマンは投稿で述べました。「公開ライセンスや公共ドメインのデータがよりアクセスしやすくなるにつれて、そのようなコンテンツでトレーニングされたモデルが大幅に改善すると予想しています。」
Common Pile v0.1は、EleutherAIの過去の論争の一部に対処しています。数年前、グループは著作権付き素材を含むオープンデータセットThe Pileを公開し、AIトレーニングでの使用に対して批判と法的精査を受けました。
EleutherAIは、研究およびインフラのパートナーと協力して、オープンデータセットをより定期的に公開することを約束しています。
太平洋時間午前9:48更新: ビダーマンはXで、EleutherAIがデータセットとモデルの公開に貢献し、トロント大学などのパートナーが研究を共同主導したと述べました。
関連記事
AppleのスマートグラスはWWDC27でデビューする可能性があり、プライバシー保護を強調している
Bloombergのマーク・ガーマン氏によると、Appleのスマートグラス(コードネームN50)は2027年6月のWWDC27で初公開され、2027年秋に小売店での発売が予定されている。当初は今年後半から2027年初頭にかけての発売が目標だったが、製品のさらなる洗練とプライバシー保護プロトコルの強化を可能にするため、発売時期が延期された。プライバシーはAppleのスマートグラス戦略の中核的な柱である。Metaなどの競合他社をめぐるプライバシー論争から教訓を得て、Appleは堅牢な機能とポリシー
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
関連特集おすすめ
コメント (2)
0/500
Наконец-то качественные данные для обучения ИИ! 😄 Но интересно, как это повлияет на конкуренцию между OpenAI и другими компаниями. Может, скоро увидим более умные модели?
Wow, 8 terabytes of legally licensed text is a game-changer! It's fantastic to see more high-quality, transparent data becoming available. This should really help push open-source AI models forward and maybe even challenge some of the big players who rely on murkier data sources. Hopefully, it leads to more reliable and ethically-sound systems. Can't wait to see what gets built on this! 🚀

EleutherAI、主要なAI研究グループは、AIモデルトレーニング用の最大規模のライセンスおよびオープンドメインテキストのコレクションを公開しました。
Common Pile v0.1と名付けられたこの8テラバイトのデータセットは、AIスタートアップのPoolside、Hugging Face、およびさまざまな学術機関と協力して2年間で開発されました。このデータセットは、EleutherAIの新しいモデルComma v0.1-1TおよびComma v0.1-2Tのトレーニングに使用され、組織はこれらのモデルが無許可の著作権付きデータでトレーニングされたモデルと同等の性能を発揮すると主張しています。
OpenAIを含むAI企業は、著作権付きの本やジャーナルを含むウェブスクレイピングデータを使用したモデルトレーニングに関する法的挑戦に直面しています。一部はコンテンツプロバイダーとライセンス契約を結んでいますが、多くは米国のフェアユース原則に依存して、許可なく著作権付き素材でトレーニングを行っています。
EleutherAIは、これらの訴訟がAI業界の透明性を大幅に低下させ、モデルの機能や弱点への洞察を制限し、広範な研究コミュニティに悪影響を及ぼしていると主張しています。
「法的挑戦はモデルトレーニングのデータ調達慣行を大きく変えていませんが、AI企業の公開性を劇的に減らしました」と、EleutherAIのエグゼクティブディレクターであるステラ・ビダーマンは、金曜日のHugging Faceのブログ投稿で述べました。「我々が話した一部の企業の研究者は、訴訟を理由にデータ中心の研究を共有できないと述べています。」
Common Pile v0.1は、Hugging FaceのAIプラットフォームおよびGitHubで利用可能で、法律相談を受けて開発され、米国議会図書館やインターネットアーカイブによってデジタル化された30万冊の公共ドメインの本などのソースが含まれています。EleutherAIはまた、OpenAIのWhisperモデルを使用してオーディオコンテンツを文字起こししました。
EleutherAIは、Comma v0.1-1TおよびComma v0.1-2TがCommon Pile v0.1の品質を示し、開発者が独自システムと競争力のあるモデルを作成できると主張しています。両モデルは、70億のパラメータを持ち、データセットの一部でトレーニングされ、Metaの元のLlamaモデルとコーディング、画像理解、数学ベンチマークで競合します。
TechCrunch All Stage Passで200ドル以上節約
よりスマートに革新。より早く成長。より深くネットワーク。Precursor Ventures、NEA、Index Ventures、Underscore VCなどのビジョナリーとつながり、洞察、ワークショップ、貴重なコネクションの1日を過ごしましょう。
TechCrunch All Stage Passで200ドル以上節約
よりスマートに革新。より早く成長。より深くネットワーク。Precursor Ventures、NEA、Index Ventures、Underscore VCなどのビジョナリーとつながり、洞察、ワークショップ、貴重なコネクションの1日を過ごしましょう。
ボストン、MA | 7月15日 いますぐ登録パラメータ、しばしばウェイトと呼ばれるものは、AIモデルの動作や応答を形作る内部要素です。
「無許可のテキストが高性能に不可欠だという考えは根拠がありません」とビダーマンは投稿で述べました。「公開ライセンスや公共ドメインのデータがよりアクセスしやすくなるにつれて、そのようなコンテンツでトレーニングされたモデルが大幅に改善すると予想しています。」
Common Pile v0.1は、EleutherAIの過去の論争の一部に対処しています。数年前、グループは著作権付き素材を含むオープンデータセットThe Pileを公開し、AIトレーニングでの使用に対して批判と法的精査を受けました。
EleutherAIは、研究およびインフラのパートナーと協力して、オープンデータセットをより定期的に公開することを約束しています。
太平洋時間午前9:48更新: ビダーマンはXで、EleutherAIがデータセットとモデルの公開に貢献し、トロント大学などのパートナーが研究を共同主導したと述べました。
AppleのスマートグラスはWWDC27でデビューする可能性があり、プライバシー保護を強調している
Bloombergのマーク・ガーマン氏によると、Appleのスマートグラス(コードネームN50)は2027年6月のWWDC27で初公開され、2027年秋に小売店での発売が予定されている。当初は今年後半から2027年初頭にかけての発売が目標だったが、製品のさらなる洗練とプライバシー保護プロトコルの強化を可能にするため、発売時期が延期された。プライバシーはAppleのスマートグラス戦略の中核的な柱である。Metaなどの競合他社をめぐるプライバシー論争から教訓を得て、Appleは堅牢な機能とポリシー
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
Наконец-то качественные данные для обучения ИИ! 😄 Но интересно, как это повлияет на конкуренцию между OpenAI и другими компаниями. Может, скоро увидим более умные модели?
Wow, 8 terabytes of legally licensed text is a game-changer! It's fantastic to see more high-quality, transparent data becoming available. This should really help push open-source AI models forward and maybe even challenge some of the big players who rely on murkier data sources. Hopefully, it leads to more reliable and ethically-sound systems. Can't wait to see what gets built on this! 🚀





家






