研究人員聲稱

Openai未經允許培訓其AI模型,面臨著眾多使用受版權保護的材料的指控。 AI披露項目的最新研究是由媒體大亨蒂姆·奧萊利(Tim O'Reilly)和經濟學家伊蘭·斯特勞斯(Ilan Strauss)於2024年成立的非營利組織,這表明Openai可能使用O'Reilly Media的非公開書籍來培訓其更高級的模型GPT-4O。 AI模型,本質上是複雜的預測引擎,在包括書籍,電影和電視節目在內的大量數據集上進行了培訓。他們學習模式並根據這些模式產生響應,而不是創造任何真正的新事物,而是從他們廣泛的知識庫中近似。隨著像公共網絡這樣的現實數據源變得筋疲力盡,包括OpenAI在內的一些AI實驗室已經開始使用AI生成的數據進行培訓,儘管由於降低模型性能的風險,很少有人完全放棄了現實世界中的數據。 AI披露項目的論文聲稱,與較早的GPT-3.5 Turbo Model不同,OpenAI的GPT-4O模型是CHATGPT中的默認模型,顯示了對Paywalled O'Reilly Books的內容的強烈認可。該論文表明,儘管O'Reilly Media沒有與OpenAI達成許可協議,但GPT-4O可能接受了這些非公共書籍的培訓。該研究採用了一種名為DE-COP的方法,該方法於2024年引入,以檢測AI培訓數據中受版權保護的內容。這種“成員推理攻擊”測試了模型是否可以區分人類作者的文本和AI生成的釋義,這表明文本可靠地了解文本。研究人員使用34本O'Reilly書籍中的13,962段摘錄測試了GPT-4O,GPT-3.5 Turbo和其他OpenAI模型,發現GPT-4O與較舊模型相比,GPT-4O認識到的收費內容要多得多。雖然作者承認他們的方法不是萬無一失,並且用戶複製並粘貼到chatgpt中可能引入了付費內容,但這些發現引發了有關OpenAI數據實踐的疑問。該研究沒有評估OpenAI的最新模型,例如GPT-4.5和O3-Mini和O1等推理模型,因此打開了可能未接受相同數據培訓的可能性。 Openai一直在推動有關AI培訓數據的更輕鬆的版權法,並一直在尋求更高質量的數據源。該公司甚至僱用了記者來完善其模型的產出,這是在AI行業看到的這種做法,在該行業中,招募了各個領域的專家以增強AI系統。 OpenAI確實為其某些培訓數據付費,與各種內容提供商達成許可協議,並為版權所有者提供退出機制。但是,由於該公司在其數據實踐方面面臨法律挑戰,因此O'Reilly Paper的發現對其運營產生了陰影。 Openai沒有回應對該研究發表評論的請求。
相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
相關專題推薦
評論 (42)
0/500
This is wild! OpenAI sneaking in paywalled books to train their AI? Sounds like a plot twist from a sci-fi novel. Curious how they'll dodge this one—ethics in AI is getting messier by the day! 😅

OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
This is wild! OpenAI sneaking in paywalled books to train their AI? Sounds like a plot twist from a sci-fi novel. Curious how they'll dodge this one—ethics in AI is getting messier by the day! 😅





首頁






