Option
Heim
Nachricht
Neue Studie enthüllt, wie viel Daten LLMs tatsächlich speichern

Neue Studie enthüllt, wie viel Daten LLMs tatsächlich speichern

6. Juli 2025
188

Neue Studie enthüllt, wie viel Daten LLMs tatsächlich speichern

Wie viel speichern AI-Modelle tatsächlich? Neue Forschung enthüllt überraschende Erkenntnisse

Wir alle wissen, dass große Sprachmodelle (LLMs) wie ChatGPT, Claude und Gemini auf riesigen Datensätzen trainiert werden – Billionen von Wörtern aus Büchern, Websites, Code und sogar Multimedia wie Bildern und Audio. Aber was passiert genau mit all diesen Daten? Verstehen diese Modelle Sprache wirklich oder geben sie nur gespeicherte Textfragmente wieder?

Eine bahnbrechende neue Studie von Meta, Google DeepMind, Cornell und NVIDIA liefert endlich konkrete Antworten – und die Ergebnisse könnten Sie überraschen.

Die große Frage: Speicherung vs. Verallgemeinerung

Im Kern funktionieren LLMs, indem sie statistische Muster in der Sprache erkennen. Wenn Sie ChatGPT nach Äpfeln fragen, „weiß“ es nicht, was ein Apfel im menschlichen Sinne ist – stattdessen erkennt es, dass das Wort „Apfel“ häufig neben Begriffen wie „Frucht“, „rot“, „Obstgarten“ oder sogar „iPhone“ vorkommt. Dieses statistische Verständnis ist in Milliarden von Parametern (im Wesentlichen einstellbaren Einstellungen im neuronalen Netzwerk der KI) codiert.

Doch hier ist die Millionen-Dollar-Frage: Wie viel des Wissens eines LLMs stammt aus verallgemeinertem Lernen und wie viel ist nur wörtliche Speicherung?

Dies ist nicht nur akademisch – es hat reale rechtliche Auswirkungen. Wenn KI-Modelle große Teile urheberrechtlich geschützter Texte kopieren, könnten Klagen von Künstlern, Autoren und Verlagen an Fahrt gewinnen. Aber wenn sie tatsächlich Muster lernen statt exakter Inhalte, könnten KI-Unternehmen stärkere Argumente für eine faire Nutzung haben.

Die Antwort: 3,6 Bits pro Parameter

Die Studie ergab, dass LLMs eine feste Speicherkapazität von etwa 3,6 Bits pro Parameter haben. Was bedeutet das in der Praxis?

  • Ein Bit ist die kleinste digitale Einheit (0 oder 1).
  • 3,6 Bits können etwa 12 verschiedene Werte speichern – wie die Auswahl eines Monats im Jahr oder das Würfeln mit einem 12-seitigen Würfel.
  • Es reicht nicht aus, um einen vollständigen englischen Buchstaben zu speichern (der ~4,7 Bits benötigt), aber es könnte einen Buchstaben aus einem reduzierten Satz von 10 häufigen Buchstaben codieren.
  • In Bytes sind 3,6 Bits nur 0,45 Bytes – weniger als die Hälfte eines standardmäßigen ASCII-Zeichens.

Entscheidend ist, dass diese Zahl bei verschiedenen Modellgrößen, Architekturen und sogar Präzisionsstufen konstant blieb (wobei vollpräzise Modelle etwas höher bei 3,83 Bits/Parameter lagen).

Die große Überraschung: Mehr Daten = Weniger Speicherung

Hier wird es wirklich interessant: Training mit mehr Daten erhöht die Speicherung nicht – es reduziert sie tatsächlich.

Wie der Haupforscher Jack Morris erklärte:

„Training mit mehr Daten zwingt Modelle, weniger pro Datenpunkt zu speichern.“

Stellen Sie es sich so vor: Wenn eine KI ein festes „Speicherbudget“ hat, bedeutet das Verteilen über einen größeren Datensatz, dass jede einzelne Information weniger dedizierten Speicherplatz erhält. Also fördern größere Datensätze die Verallgemeinerung statt bloßes Abschreiben – was Bedenken über das Wiedergeben urheberrechtlich geschützter oder sensibler Inhalte lindern könnte.

Wie haben die Forscher dies gemessen?

Um Speicherung von Verallgemeinerung zu isolieren, trainierten sie Modelle auf komplett zufälligen Bitfolgen – Daten ohne jegliche Muster oder Struktur.

Warum? Weil, wenn ein Modell eine zufällige Zeichenfolge rekonstruiert, es sie gespeichert haben muss – es gibt keine zugrunde liegende Logik, die man ableiten könnte.

Dieser Ansatz erlaubte es ihnen:
✔ Reines Speichern zu messen, getrennt von erlernten Mustern.
✔ Zu bestätigen, dass Speicherung vorhersehbar mit der Modellgröße skaliert.
✔ Zu zeigen, dass Verallgemeinerung einsetzt, wenn Datensätze größer werden.

Reale Auswirkungen

  • Kleinere Datensätze führen zu mehr Speicherung.
  • Größere Datensätze drängen Modelle zur Verallgemeinerung (mit einem vorübergehenden „Double Descent“-Leistungsabfall).
  • Höhere Präzision (z. B. float32 vs. bfloat16) erhöht die Speicherkapazität leicht (von 3,51 auf 3,83 Bits/Parameter).

Einzigartige Daten werden eher gespeichert

Während die Studie sich auf Durchschnittswerte konzentriert, besonders einzigartige oder stilisierte Inhalte (wie seltene Codeschnipsel oder markantes Schreiben) könnten anfälliger für Speicherung sein.

Allerdings werden Mitgliedschafts-Inferenzangriffe (der Versuch, festzustellen, ob bestimmte Daten im Trainingssatz waren) unzuverlässig, wenn Datensätze wachsen – was die Idee unterstützt, dass groß angelegtes Training Datenschutzrisiken reduziert.

In Perspektive gesetzt

  • Ein 500K-Parameter-Modell kann etwa 225 KB Daten speichern.
  • Ein 1,5B-Parameter-Modell kann etwa 675 MB speichern.
  • Das reicht nicht, um ganze Bücher oder Bilder zu reproduzieren, aber es erklärt verteilte textuelle Muster.

Rechtliche Folgen?

Diese Forschung könnte eine Schlüsselrolle in laufenden KI-Urheberrechtsklagen spielen. Wenn Gerichte erkennen, dass LLMs hauptsächlich verallgemeinern statt kopieren, könnten KI-Unternehmen stärkere Argumente für faire Nutzung haben.

Das Fazit

Mehr Daten = sicherere, verallgemeinerte KI. Anstatt große Datensätze zu fürchten, könnten wir sie tatsächlich wollen – weil sie Modelle zum Verstehen statt zum Speichern drängen.

Diese Studie vertieft nicht nur unser Verständnis von KI – sie könnte die Art und Weise, wie wir diese mächtigen Systeme regulieren, entwickeln und ihnen vertrauen, grundlegend verändern.

Verwandter Artikel
OpenAI bringt eine sicherere Version von ChatGPT für Jugendliche auf den Markt, Jahre nachdem diese begonnen hatten, die Plattform zu nutzen OpenAI bringt eine sicherere Version von ChatGPT für Jugendliche auf den Markt, Jahre nachdem diese begonnen hatten, die Plattform zu nutzen Nach einer Reihe von Gerichtsverfahren wegen fehlender Sicherheitsvorkehrungen bei KI-Chatbots – die zu Selbstmorden unter Jugendlichen und anderen psychischen Krisen beigetragen hatten – stellte Open
Google führt eine Funktion zur Erkennung gefälschter Anrufe ein, um vor Betrugsversuchen durch Deepfakes mit KI zu schützen Google führt eine Funktion zur Erkennung gefälschter Anrufe ein, um vor Betrugsversuchen durch Deepfakes mit KI zu schützen Google gab am Dienstag bekannt, dass Android eine Funktion zur Erkennung gefälschter Anrufe einführt, um vor Betrugsversuchen durch KI-Deepfakes zu schützen. Die Funktion wird diesen Monat weltweit in
Frontier AI Labs weigert sich, Eindämmungsstrategien für außer Kontrolle geratene Modelle offenzulegen Frontier AI Labs weigert sich, Eindämmungsstrategien für außer Kontrolle geratene Modelle offenzulegen Jüngste Untersuchungen zeigen, dass nur sehr wenige führende KI-Forschungslabore Maßnahmenpläne zur Eindämmung veröffentlicht oder vorgeführt haben. Ein solcher Eindämmungsplan legt die Vorgehensweise
Empfehlungen zu verwandten Spezialthemen
Musikkomposition Die besten KI-Tools zum Komponieren von Melodien für Songentwürfe
Die besten KI-Tools zum Komponieren von Melodien für Songentwürfe

2026 Neueste Besten Top-Bewerteten KI-Melodie-Schreibtools für Songentwürfe! XIX.AI hat eine hochleistungsfähige, bahnbrechende Kollektion zusammengestellt, die strengen Praxistests unterzogen wurde, um das beste Schreiberlebnis zu liefern. Sie finden detaillierte kostenlose versus kostenpflichtige Vergleiche, präzise Ranglisten und unbedingt auszuprobierende Optionen, die darauf ausgelegt sind, Ihnen zu helfen, beeindruckende Songentwürfe mühelos zu erstellen und Ihre kreative Produktivität erheblich zu steigern. Entdecken Sie jetzt Ihr perfektes Tool!

8 Tools
xix.ai
Chatbot Die besten KI-gestützten Gesprächstrainingstools für Vorstellungsgesprächspraxis
Die besten KI-gestützten Gesprächstrainingstools für Vorstellungsgesprächspraxis

2026 Neueste Besten Top-bewerteten KI-Konversationstrainer-Tools für Vorstellungsgesprächspraxis sind hier auf XIX.AI! Diese kuratierte Sammlung enthält leistungsstarke, bahnbrechende Tools, die strengen Praxistests unterzogen wurden, um präzises Feedback zu liefern. Sie finden einen Vergleich zwischen kostenlosen und kostenpflichtigen Optionen sowie detaillierte Rankings, die Ihnen helfen, die empfehlenswerte Option zu wählen, die Ihr Selbstvertrauen und Ihre Fähigkeiten verbessert. Entdecken Sie jetzt Ihr perfektes Tool für den Erfolg im Vorstellungsgespräch!

12 Tools
xix.ai
Design & Kunst Die besten KI-Tools für den Stiltransfer für kreative Experimente
Die besten KI-Tools für den Stiltransfer für kreative Experimente

Die besten und am besten bewerteten KI-Tools für den Stiltransfer im Jahr 2026 – ideal für kreative Experimente! XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung unverzichtbarer Tools zusammengestellt, die in Praxistests und strengen Bewertungen außergewöhnliche Ergebnisse liefern. Diese Top-Lösungen helfen Kreativen dabei, ihre Produktivität deutlich zu steigern, indem sie die Erstellung von Inhalten beschleunigen und unendliche kreative Möglichkeiten eröffnen. Entdecken Sie jetzt Ihr perfektes Tool und legen Sie noch heute los!

9 Tools
xix.ai
Comic-Erstellung Die besten KI-Tools für Sprechblasen zum visuellen Geschichtenerzählen
Die besten KI-Tools für Sprechblasen zum visuellen Geschichtenerzählen

Die besten und am besten bewerteten KI-Tools für Sprechblasen zum visuellen Storytelling des Jahres 2026 finden Sie hier auf XIX.AI! Diese sorgfältig zusammengestellte Sammlung umfasst leistungsstarke, bahnbrechende Tools, die Kreativen dabei helfen, ihre Produktivität zu steigern und kreative Blockaden zu überwinden. Holen Sie sich einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, sehen Sie sich Praxistests an und werfen Sie einen Blick auf die aktuellen Rankings, um die unverzichtbaren Lösungen zu finden, die sich perfekt für die Gestaltung fesselnder visueller Erzählungen eignen. Stöbern Sie jetzt und entdecken Sie Ihr ideales Tool!

10 Tools
xix.ai
Besprechungsassistent Die besten Tools zur Zusammenfassung von KI-Meetings: Entscheidungen und Folgemaßnahmen übersichtlich nachverfolgen
Die besten Tools zur Zusammenfassung von KI-Meetings: Entscheidungen und Folgemaßnahmen übersichtlich nachverfolgen

Die besten und am besten bewerteten KI-Tools zur Zusammenfassung von Besprechungen im Jahr 2026 für eine übersichtliche Nachverfolgung von Entscheidungen und müheloses Follow-up. Diese sorgfältig zusammengestellte Liste präsentiert leistungsstarke, bahnbrechende Lösungen, die die Produktivität drastisch steigern, indem sie Besprechungsnotizen automatisieren, wichtige Aktionspunkte identifizieren und die Teamkoordination projektübergreifend optimieren. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten sowie Praxistests und wöchentlich aktualisierte Rankings, die Ihnen helfen, das perfekte Tool zu finden. Entdecken Sie es jetzt und nutzen Sie Ihren KI-Vorteil!

9 Tools
xix.ai
Datenanalyse Die besten Tools für die KI-gestützte Datenreinigung: Fehlende Werte und Duplikate schnell beheben
Die besten Tools für die KI-gestützte Datenreinigung: Fehlende Werte und Duplikate schnell beheben

2026 – Die neuesten, besten und am höchsten bewerteten Tools für die Reinigung von KI-Daten, um fehlende Werte sowie Duplikate schnell zu beheben. Diese sorgfältig zusammengestellte Liste präsentiert leistungsstarke Lösungen, die die Produktivität erheblich steigern. Jedes Tool wurde in der Praxis gründlich getestet, um seine Zuverlässigkeit zu gewährleisten. Holen Sie sich einen kostenlosen Vergleich zwischen kostenloser und kostenpflichtiger Variante und entdecken Sie das für Ihre Bedürfnisse beste Tool. Entdecken Sie es jetzt auf XIX.AI, um Ihren Vorteil in der KI-Branche zu erlangen.

11 Tools
xix.ai
Kommentare (2)
0/500
LawrenceWilliams
LawrenceWilliams 24. August 2025 05:01:17 MESZ

This study on LLMs memorizing data is wild! 🤯 I’m kinda spooked thinking about how much these models might 'remember' from the web. Could they accidentally spill sensitive info one day?

EdwardYoung
EdwardYoung 10. August 2025 01:01:00 MESZ

This study on LLMs memorizing data is wild! 😮 I wonder how much of my old Reddit posts are stuck in these models’ brains. Kinda creepy but fascinating!

OR