Studie: OpenAI -Modelle merkten aus dem urheberrechtlich geschützten Inhalt aus
Eine kürzliche Studie legt nahe, dass OpenAI tatsächlich urheberrechtlich geschütztes Material verwendet haben könnte, um einige seiner KI-Modelle zu trainieren, was die laufenden rechtlichen Auseinandersetzungen des Unternehmens weiter anheizt. Autoren, Programmierer und andere Inhaltsersteller haben OpenAI beschuldigt, ihre Werke – wie Bücher und Code – ohne Erlaubnis verwendet zu haben, um seine KI-Modelle zu entwickeln. Während OpenAI sich mit dem Argument der fairen Nutzung verteidigt, argumentieren die Kläger, dass das US-Urheberrecht keine Ausnahme für Trainingsdaten vorsieht.
Die Studie, eine Zusammenarbeit von Forschern der University of Washington, der University of Copenhagen und Stanford, stellt eine neue Technik vor, um „gespeicherte“ Trainingsdaten in Modellen zu erkennen, die über eine API zugänglich sind, wie jene von OpenAI. KI-Modelle lernen im Wesentlichen aus riesigen Datenmengen, um Muster zu erkennen, was ihnen ermöglicht, Essays, Bilder und mehr zu erstellen. Obwohl die meisten Ausgaben keine direkten Kopien der Trainingsdaten sind, sind einige aufgrund des Lernprozesses unvermeidlich. Zum Beispiel ist bekannt, dass Bildmodelle Filmscreenshots reproduzieren, während Sprachmodelle Nachrichtenartikel im Wesentlichen plagiiert haben.
Die in der Studie beschriebene Methode konzentriert sich auf „hoch überraschende“ Wörter – Wörter, die in einem bestimmten Kontext ungewöhnlich sind. Zum Beispiel wäre in dem Satz „Jack und ich saßen völlig still, während das Radar summte“ das Wort „Radar“ ein hoch überraschendes Wort, da es weniger erwartet wird als Wörter wie „Motor“ oder „Radio“ vor „summte“.
Die Forscher testeten mehrere OpenAI-Modelle, einschließlich GPT-4 und GPT-3.5, indem sie hoch überraschende Wörter aus Auszügen von Fiktionsbüchern und Artikeln der New York Times entfernten und die Modelle aufforderten, diese fehlenden Wörter vorherzusagen. Wenn die Modelle die Wörter korrekt erraten, deutete dies darauf hin, dass sie den Text während des Trainings gespeichert hatten.

Ein Beispiel dafür, wie ein Modell ein hoch überraschendes Wort „errät“. Bildnachweis: OpenAI Die Ergebnisse zeigten, dass GPT-4 wahrscheinlich Teile populärer Fiktionsbücher gespeichert hatte, einschließlich solcher im BookMIA-Datensatz urheberrechtlich geschützter E-Books. Es schien auch einige Artikel der New York Times gespeichert zu haben, allerdings in geringerem Umfang.Abhilasha Ravichander, eine Doktorandin an der University of Washington und Mitautorin der Studie, betonte gegenüber TechCrunch, dass diese Ergebnisse die „umstrittenen Daten“ hervorheben, die möglicherweise zum Trainieren dieser Modelle verwendet wurden. „Um große Sprachmodelle zu haben, die vertrauenswürdig sind, brauchen wir Modelle, die wir untersuchen, prüfen und wissenschaftlich analysieren können“, erklärte Ravichander. „Unsere Arbeit zielt darauf ab, ein Werkzeug bereitzustellen, um große Sprachmodelle zu untersuchen, aber es gibt ein echtes Bedürfnis nach größerer Datentransparenz im gesamten Ökosystem.“
OpenAI hat sich für lockerere Regeln zur Verwendung urheberrechtlich geschützter Daten zur Entwicklung von KI-Modellen eingesetzt. Obwohl das Unternehmen einige Lizenzvereinbarungen für Inhalte hat und Opt-out-Optionen für Urheberrechtsinhaber anbietet, hat es verschiedene Regierungen dazu gedrängt, spezifische „Fair Use“-Regeln für das KI-Training einzuführen.
Verwandter Artikel
OpenAI bringt eine sicherere Version von ChatGPT für Jugendliche auf den Markt, Jahre nachdem diese begonnen hatten, die Plattform zu nutzen
Nach einer Reihe von Gerichtsverfahren wegen fehlender Sicherheitsvorkehrungen bei KI-Chatbots – die zu Selbstmorden unter Jugendlichen und anderen psychischen Krisen beigetragen hatten – stellte Open
Frontier AI Labs weigert sich, Eindämmungsstrategien für außer Kontrolle geratene Modelle offenzulegen
Jüngste Untersuchungen zeigen, dass nur sehr wenige führende KI-Forschungslabore Maßnahmenpläne zur Eindämmung veröffentlicht oder vorgeführt haben. Ein solcher Eindämmungsplan legt die Vorgehensweise
NEAs Tiffany Luck: Unternehmen kämpfen weiterhin mit der ROI von KI
Laden des Players…Anfang dieses Jahres dominierte „Tokenmaxxing“ das Silicon Valley, wobei CEOs ihre Mitarbeiter aufforderten, die Nutzung von KI zu maximieren. Diese Begeisterung stieß jedoch schnell auf die Realität. Berichten zufolge hat Uber sei
Empfehlungen zu verwandten Spezialthemen
Kommentare (34)
So OpenAI basically trained on copyrighted books and code without permission? Shocking absolutely no one. 😅 The real question is whether courts will actually make them pay damages or just slap a 'please don't do that again' fine. Either way, creators deserve better than being data fodder for billion-dollar models.
这篇文章提到的版权问题确实让人担忧,以后AI生成的内容会不会都带着'侵权'的标签?想想就觉得挺讽刺的,毕竟这些模型训练数据不透明,普通用户根本不知道输出里夹带了什么'私货'。希望有更严格的管理办法吧。
This is wild! OpenAI might’ve gobbled up copyrighted stuff to train their models? I’m not shocked, but it’s kinda shady. Hope those authors and coders get some justice! 😤
This is wild! OpenAI might've trained their models on copyrighted stuff? 😳 I wonder how many books and code snippets got swept up in that data vacuum. Ethics in AI is such a messy topic right now.
Me sorprendió un poco que OpenAI podría haber usado material con derechos de autor para entrenar sus modelos. Es un poco decepcionante, pero supongo que es el salvaje oeste allá en el mundo de la IA. 🤔 ¿Quizás deberían ser más cuidadosos la próxima vez?
Eine kürzliche Studie legt nahe, dass OpenAI tatsächlich urheberrechtlich geschütztes Material verwendet haben könnte, um einige seiner KI-Modelle zu trainieren, was die laufenden rechtlichen Auseinandersetzungen des Unternehmens weiter anheizt. Autoren, Programmierer und andere Inhaltsersteller haben OpenAI beschuldigt, ihre Werke – wie Bücher und Code – ohne Erlaubnis verwendet zu haben, um seine KI-Modelle zu entwickeln. Während OpenAI sich mit dem Argument der fairen Nutzung verteidigt, argumentieren die Kläger, dass das US-Urheberrecht keine Ausnahme für Trainingsdaten vorsieht.
Die Studie, eine Zusammenarbeit von Forschern der University of Washington, der University of Copenhagen und Stanford, stellt eine neue Technik vor, um „gespeicherte“ Trainingsdaten in Modellen zu erkennen, die über eine API zugänglich sind, wie jene von OpenAI. KI-Modelle lernen im Wesentlichen aus riesigen Datenmengen, um Muster zu erkennen, was ihnen ermöglicht, Essays, Bilder und mehr zu erstellen. Obwohl die meisten Ausgaben keine direkten Kopien der Trainingsdaten sind, sind einige aufgrund des Lernprozesses unvermeidlich. Zum Beispiel ist bekannt, dass Bildmodelle Filmscreenshots reproduzieren, während Sprachmodelle Nachrichtenartikel im Wesentlichen plagiiert haben.
Die in der Studie beschriebene Methode konzentriert sich auf „hoch überraschende“ Wörter – Wörter, die in einem bestimmten Kontext ungewöhnlich sind. Zum Beispiel wäre in dem Satz „Jack und ich saßen völlig still, während das Radar summte“ das Wort „Radar“ ein hoch überraschendes Wort, da es weniger erwartet wird als Wörter wie „Motor“ oder „Radio“ vor „summte“.
Die Forscher testeten mehrere OpenAI-Modelle, einschließlich GPT-4 und GPT-3.5, indem sie hoch überraschende Wörter aus Auszügen von Fiktionsbüchern und Artikeln der New York Times entfernten und die Modelle aufforderten, diese fehlenden Wörter vorherzusagen. Wenn die Modelle die Wörter korrekt erraten, deutete dies darauf hin, dass sie den Text während des Trainings gespeichert hatten.

Abhilasha Ravichander, eine Doktorandin an der University of Washington und Mitautorin der Studie, betonte gegenüber TechCrunch, dass diese Ergebnisse die „umstrittenen Daten“ hervorheben, die möglicherweise zum Trainieren dieser Modelle verwendet wurden. „Um große Sprachmodelle zu haben, die vertrauenswürdig sind, brauchen wir Modelle, die wir untersuchen, prüfen und wissenschaftlich analysieren können“, erklärte Ravichander. „Unsere Arbeit zielt darauf ab, ein Werkzeug bereitzustellen, um große Sprachmodelle zu untersuchen, aber es gibt ein echtes Bedürfnis nach größerer Datentransparenz im gesamten Ökosystem.“
OpenAI hat sich für lockerere Regeln zur Verwendung urheberrechtlich geschützter Daten zur Entwicklung von KI-Modellen eingesetzt. Obwohl das Unternehmen einige Lizenzvereinbarungen für Inhalte hat und Opt-out-Optionen für Urheberrechtsinhaber anbietet, hat es verschiedene Regierungen dazu gedrängt, spezifische „Fair Use“-Regeln für das KI-Training einzuführen.
OpenAI bringt eine sicherere Version von ChatGPT für Jugendliche auf den Markt, Jahre nachdem diese begonnen hatten, die Plattform zu nutzen
Nach einer Reihe von Gerichtsverfahren wegen fehlender Sicherheitsvorkehrungen bei KI-Chatbots – die zu Selbstmorden unter Jugendlichen und anderen psychischen Krisen beigetragen hatten – stellte Open
Frontier AI Labs weigert sich, Eindämmungsstrategien für außer Kontrolle geratene Modelle offenzulegen
Jüngste Untersuchungen zeigen, dass nur sehr wenige führende KI-Forschungslabore Maßnahmenpläne zur Eindämmung veröffentlicht oder vorgeführt haben. Ein solcher Eindämmungsplan legt die Vorgehensweise
NEAs Tiffany Luck: Unternehmen kämpfen weiterhin mit der ROI von KI
Laden des Players…Anfang dieses Jahres dominierte „Tokenmaxxing“ das Silicon Valley, wobei CEOs ihre Mitarbeiter aufforderten, die Nutzung von KI zu maximieren. Diese Begeisterung stieß jedoch schnell auf die Realität. Berichten zufolge hat Uber sei
So OpenAI basically trained on copyrighted books and code without permission? Shocking absolutely no one. 😅 The real question is whether courts will actually make them pay damages or just slap a 'please don't do that again' fine. Either way, creators deserve better than being data fodder for billion-dollar models.
这篇文章提到的版权问题确实让人担忧,以后AI生成的内容会不会都带着'侵权'的标签?想想就觉得挺讽刺的,毕竟这些模型训练数据不透明,普通用户根本不知道输出里夹带了什么'私货'。希望有更严格的管理办法吧。
This is wild! OpenAI might’ve gobbled up copyrighted stuff to train their models? I’m not shocked, but it’s kinda shady. Hope those authors and coders get some justice! 😤
This is wild! OpenAI might've trained their models on copyrighted stuff? 😳 I wonder how many books and code snippets got swept up in that data vacuum. Ethics in AI is such a messy topic right now.
Me sorprendió un poco que OpenAI podría haber usado material con derechos de autor para entrenar sus modelos. Es un poco decepcionante, pero supongo que es el salvaje oeste allá en el mundo de la IA. 🤔 ¿Quizás deberían ser más cuidadosos la próxima vez?





Heim






