EleutherAI发布大规模许可文本数据集用于AI训练

EleutherAI,一个领先的AI研究组织,推出了一套最大的许可和开放领域文本集合,用于AI模型训练。
名为Common Pile v0.1的这个8TB数据集,经过两年时间与AI初创公司Poolside、Hugging Face以及多家学术机构合作开发。它被用来训练EleutherAI的两个新模型,Comma v0.1-1T和Comma v0.1-2T,该组织声称这些模型的性能可与使用未经许可的版权数据训练的模型相媲美。
包括OpenAI在内的AI公司,因使用网络抓取数据(包括版权书籍和期刊)进行模型训练而面临法律挑战。虽然一些公司与内容提供商达成许可协议,但许多公司依赖美国的合理使用原则,辩称无需许可即可使用版权材料进行训练。
EleutherAI认为,这些诉讼显著降低了AI行业的透明度,限制了对模型功能和弱点的洞察,损害了更广泛的研究社区。
“法律挑战并未显著改变模型训练的数据来源实践,但它们极大地降低了AI公司的开放性,”EleutherAI执行主任Stella Biderman在周五的Hugging Face博客文章中表示。“我们与一些公司研究人员交谈时,他们提到诉讼是他们无法分享数据中心研究的原因。”
Common Pile v0.1在Hugging Face的AI平台和GitHub上可用,经过法律咨询开发,包括国会图书馆和互联网档案馆数字化的30万本公共领域书籍等来源。EleutherAI还利用OpenAI的Whisper模型转录音频内容。
EleutherAI声称Comma v0.1-1T和Comma v0.1-2T展示了Common Pile v0.1的质量,使开发者能够创建与专有系统竞争的模型。这两个模型拥有70亿个参数,在数据集的一部分上训练,在编码、图像理解和数学基准测试中可与Meta的原始Llama模型媲美。
在TechCrunch全阶段通行证上节省超200美元
更智能地创新。更快地成长。更深入地建立网络。与来自Precursor Ventures、NEA、Index Ventures、Underscore VC等的远见者建立联系,享受一天的洞察、研讨会和宝贵联系。
在TechCrunch全阶段通行证上节省超200美元
更智能地创新。更快地成长。更深入地建立网络。与来自Precursor Ventures、NEA、Index Ventures、Underscore VC等的远见者建立联系,享受一天的洞察、研讨会和宝贵联系。
波士顿,马萨诸塞州 | 7月15日 立即注册参数,通常称为权重,是AI模型的内部元素,塑造其行为和响应。
“认为未经许可的文本对于高性能至关重要的观点是没有根据的,”Biderman在她的帖子中表示。“随着公开许可和公共领域数据的可访问性增加,我们预计基于此类内容训练的模型将显著改进。”
Common Pile v0.1部分解决了EleutherAI过去的争议。几年前,该组织发布了包含版权材料的开放数据集The Pile,因其在AI训练中的使用而引发批评和法律审查。
EleutherAI承诺将更定期发布开放数据集,与研究和基础设施合作伙伴合作。
太平洋时间上午9:48更新: Biderman在X上表示,EleutherAI为数据集和模型发布做出了贡献,来自多伦多大学等合作伙伴的参与尤为重要,共同领导了研究。
相关文章
印度科技巨头投资3000万美元,打造微软Office的AI竞争对手
连续创业者 Bhavin Turakhia 正投入 3000 万美元自有资金,押注企业 AI 领域仍有新玩家的空间。他最新的创业项目 Neo 基于一个核心信念:传统的职场软件不能仅靠聊天机器人进行修补,而需要进行彻底的架构重构。46 岁的 Turakhia 有着支持雄心勃勃的企业科技项目的历史。在过去二十年中,他联合创立了 Directi、Radix、Titan 和 Zeta,在寻求外部投资之前,主要使用个人资本为这些项目提供资金。他正将同样的自力更生策略应用于 Neo。Turakhia 向
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
相关专题推荐
评论 (2)
0/500
Наконец-то качественные данные для обучения ИИ! 😄 Но интересно, как это повлияет на конкуренцию между OpenAI и другими компаниями. Может, скоро увидим более умные модели?
Wow, 8 terabytes of legally licensed text is a game-changer! It's fantastic to see more high-quality, transparent data becoming available. This should really help push open-source AI models forward and maybe even challenge some of the big players who rely on murkier data sources. Hopefully, it leads to more reliable and ethically-sound systems. Can't wait to see what gets built on this! 🚀

EleutherAI,一个领先的AI研究组织,推出了一套最大的许可和开放领域文本集合,用于AI模型训练。
名为Common Pile v0.1的这个8TB数据集,经过两年时间与AI初创公司Poolside、Hugging Face以及多家学术机构合作开发。它被用来训练EleutherAI的两个新模型,Comma v0.1-1T和Comma v0.1-2T,该组织声称这些模型的性能可与使用未经许可的版权数据训练的模型相媲美。
包括OpenAI在内的AI公司,因使用网络抓取数据(包括版权书籍和期刊)进行模型训练而面临法律挑战。虽然一些公司与内容提供商达成许可协议,但许多公司依赖美国的合理使用原则,辩称无需许可即可使用版权材料进行训练。
EleutherAI认为,这些诉讼显著降低了AI行业的透明度,限制了对模型功能和弱点的洞察,损害了更广泛的研究社区。
“法律挑战并未显著改变模型训练的数据来源实践,但它们极大地降低了AI公司的开放性,”EleutherAI执行主任Stella Biderman在周五的Hugging Face博客文章中表示。“我们与一些公司研究人员交谈时,他们提到诉讼是他们无法分享数据中心研究的原因。”
Common Pile v0.1在Hugging Face的AI平台和GitHub上可用,经过法律咨询开发,包括国会图书馆和互联网档案馆数字化的30万本公共领域书籍等来源。EleutherAI还利用OpenAI的Whisper模型转录音频内容。
EleutherAI声称Comma v0.1-1T和Comma v0.1-2T展示了Common Pile v0.1的质量,使开发者能够创建与专有系统竞争的模型。这两个模型拥有70亿个参数,在数据集的一部分上训练,在编码、图像理解和数学基准测试中可与Meta的原始Llama模型媲美。
在TechCrunch全阶段通行证上节省超200美元
更智能地创新。更快地成长。更深入地建立网络。与来自Precursor Ventures、NEA、Index Ventures、Underscore VC等的远见者建立联系,享受一天的洞察、研讨会和宝贵联系。
在TechCrunch全阶段通行证上节省超200美元
更智能地创新。更快地成长。更深入地建立网络。与来自Precursor Ventures、NEA、Index Ventures、Underscore VC等的远见者建立联系,享受一天的洞察、研讨会和宝贵联系。
波士顿,马萨诸塞州 | 7月15日 立即注册参数,通常称为权重,是AI模型的内部元素,塑造其行为和响应。
“认为未经许可的文本对于高性能至关重要的观点是没有根据的,”Biderman在她的帖子中表示。“随着公开许可和公共领域数据的可访问性增加,我们预计基于此类内容训练的模型将显著改进。”
Common Pile v0.1部分解决了EleutherAI过去的争议。几年前,该组织发布了包含版权材料的开放数据集The Pile,因其在AI训练中的使用而引发批评和法律审查。
EleutherAI承诺将更定期发布开放数据集,与研究和基础设施合作伙伴合作。
太平洋时间上午9:48更新: Biderman在X上表示,EleutherAI为数据集和模型发布做出了贡献,来自多伦多大学等合作伙伴的参与尤为重要,共同领导了研究。
印度科技巨头投资3000万美元,打造微软Office的AI竞争对手
连续创业者 Bhavin Turakhia 正投入 3000 万美元自有资金,押注企业 AI 领域仍有新玩家的空间。他最新的创业项目 Neo 基于一个核心信念:传统的职场软件不能仅靠聊天机器人进行修补,而需要进行彻底的架构重构。46 岁的 Turakhia 有着支持雄心勃勃的企业科技项目的历史。在过去二十年中,他联合创立了 Directi、Radix、Titan 和 Zeta,在寻求外部投资之前,主要使用个人资本为这些项目提供资金。他正将同样的自力更生策略应用于 Neo。Turakhia 向
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
Наконец-то качественные данные для обучения ИИ! 😄 Но интересно, как это повлияет на конкуренцию между OpenAI и другими компаниями. Может, скоро увидим более умные модели?
Wow, 8 terabytes of legally licensed text is a game-changer! It's fantastic to see more high-quality, transparent data becoming available. This should really help push open-source AI models forward and maybe even challenge some of the big players who rely on murkier data sources. Hopefully, it leads to more reliable and ethically-sound systems. Can't wait to see what gets built on this! 🚀





首页






