研究人员声称

Openai未经允许培训其AI模型,面临着众多使用受版权保护的材料的指控。 AI披露项目的最新研究是由媒体大亨蒂姆·奥莱利(Tim O'Reilly)和经济学家伊兰·斯特劳斯(Ilan Strauss)于2024年成立的非营利组织,这表明Openai可能使用O'Reilly Media的非公开书籍来培训其更高级的模型GPT-4O。 AI模型,本质上是复杂的预测引擎,在包括书籍,电影和电视节目在内的大量数据集上进行了培训。他们学习模式并根据这些模式产生响应,而不是创造任何真正的新事物,而是从他们广泛的知识库中近似。随着像公共网络这样的现实数据源变得筋疲力尽,包括OpenAI在内的一些AI实验室已经开始使用AI生成的数据进行培训,尽管由于降低模型性能的风险,很少有人完全放弃了现实世界中的数据。 AI披露项目的论文声称,与较早的GPT-3.5 Turbo Model不同,OpenAI的GPT-4O模型是CHATGPT中的默认模型,显示了对Paywalled O'Reilly Books的内容的强烈认可。该论文表明,尽管O'Reilly Media没有与OpenAI达成许可协议,但GPT-4O可能接受了这些非公共书籍的培训。该研究采用了一种名为DE-COP的方法,该方法于2024年引入,以检测AI培训数据中受版权保护的内容。这种“成员推理攻击”测试了模型是否可以区分人类作者的文本和AI生成的释义,这表明文本可靠地了解文本。研究人员使用34本O'Reilly书籍中的13,962段摘录测试了GPT-4O,GPT-3.5 Turbo和其他OpenAI模型,发现GPT-4O与较旧模型相比,GPT-4O认识到的收费内容要多得多。虽然作者承认他们的方法不是万无一失,并且用户复制并粘贴到chatgpt中可能引入了付费内容,但这些发现引发了有关OpenAI数据实践的疑问。该研究没有评估OpenAI的最新模型,例如GPT-4.5和O3-Mini和O1等推理模型,因此打开了可能未接受相同数据培训的可能性。 Openai一直在推动有关AI培训数据的更轻松的版权法,并一直在寻求更高质量的数据源。该公司甚至雇用了记者来完善其模型的产出,这是在AI行业看到的这种做法,在该行业中,招募了各个领域的专家以增强AI系统。 OpenAI确实为其某些培训数据付费,与各种内容提供商达成许可协议,并为版权所有者提供退出机制。但是,由于该公司在其数据实践方面面临法律挑战,因此O'Reilly Paper的发现对其运营产生了阴影。 Openai没有回应对该研究发表评论的请求。
相关文章
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本
在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率
正在加载播放器…今年早些时候,“token最大化”(tokenmaxxing)在硅谷占据主导地位,首席执行官们敦促员工最大限度地利用人工智能。然而,这种热情很快遭遇了现实。据报道,Uber在几个月内就超出了其年度人工智能预算,一些公司跨部门削减了Claude许可证,而Meta则取消了内部绩效排名。NEA合伙人蒂芙尼·拉克(Tiffany Luck)每天都在应对这种兴奋与实际回报之间的差距。她此前曾成功说服企业电子商务是未来,如今她完全专注于人工智能,特别是其为消费者创造“神奇时刻”的潜力。
相关专题推荐
评论 (42)
0/500
This is wild! OpenAI sneaking in paywalled books to train their AI? Sounds like a plot twist from a sci-fi novel. Curious how they'll dodge this one—ethics in AI is getting messier by the day! 😅

在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本
在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率
正在加载播放器…今年早些时候,“token最大化”(tokenmaxxing)在硅谷占据主导地位,首席执行官们敦促员工最大限度地利用人工智能。然而,这种热情很快遭遇了现实。据报道,Uber在几个月内就超出了其年度人工智能预算,一些公司跨部门削减了Claude许可证,而Meta则取消了内部绩效排名。NEA合伙人蒂芙尼·拉克(Tiffany Luck)每天都在应对这种兴奋与实际回报之间的差距。她此前曾成功说服企业电子商务是未来,如今她完全专注于人工智能,特别是其为消费者创造“神奇时刻”的潜力。
This is wild! OpenAI sneaking in paywalled books to train their AI? Sounds like a plot twist from a sci-fi novel. Curious how they'll dodge this one—ethics in AI is getting messier by the day! 😅





首页






