Long Context Windows verstehen: wichtige Erkenntnisse
Gestern haben wir unseren neuesten Durchbruch in der KI-Technologie mit dem Gemini 1.5 Modell vorgestellt. Diese neue Version bringt erhebliche Verbesserungen in Geschwindigkeit und Effizienz, aber die wahre Innovation ist das neuartige lange Kontextfenster. Diese Funktion ermöglicht es dem Modell, eine beispiellose Anzahl von Token — den grundlegenden Einheiten, die Wörter, Bilder oder Videos ausmachen — gleichzeitig zu verarbeiten. Um Licht in diesen Fortschritt zu bringen, haben wir uns an das Projektteam von Google DeepMind gewandt, um Einblicke in lange Kontextfenster und deren revolutionäre Auswirkungen auf die Arbeit von Entwicklern zu erhalten.
Das Verständnis langer Kontextfenster ist entscheidend, da sie KI-Modelle in die Lage versetzen, Informationen während einer Sitzung zu behalten und abzurufen. Stellen Sie sich vor, Sie versuchen, sich an einen Namen zu erinnern, der gerade erst in einem Gespräch erwähnt wurde, oder eilen, eine Telefonnummer aufzuschreiben, bevor sie Ihnen entfällt. KI-Modelle stehen vor ähnlichen Herausforderungen und „vergessen“ oft Details nach wenigen Interaktionen. Lange Kontextfenster lösen dieses Problem, indem sie dem Modell ermöglichen, mehr Informationen in seinem „Gedächtnis“ zu behalten.
Zuvor konnte das Gemini-Modell bis zu 32.000 Token gleichzeitig verarbeiten. Mit der Veröffentlichung von 1.5 Pro für frühe Tests haben wir die Grenzen auf erstaunliche 1 Million Token verschoben — das größte Kontextfenster aller bisherigen großskaligen Basismodelle. Unsere Forschung ist sogar noch weiter gegangen und hat erfolgreich bis zu 10 Millionen Token getestet. Je größer das Kontextfenster, desto vielfältiger und umfangreicher die Daten — Text, Bilder, Audio, Code oder Video — die das Modell verarbeiten kann.
Nikolay Savinov, ein Forschungswissenschaftler bei Google DeepMind und einer der Leiter des Projekts für lange Kontextfenster, erklärte: „Unser ursprüngliches Ziel war es, 128.000 Token zu erreichen, aber ich dachte, ein höheres Ziel wäre vorteilhaft, also schlug ich 1 Million Token vor. Und jetzt hat unsere Forschung das Zehnfache davon übertroffen.“
Um diesen Sprung zu erreichen, waren eine Reihe von Innovationen im Bereich des tiefen Lernens erforderlich. Die frühen Erkundungen von Pranav Shyam lieferten entscheidende Erkenntnisse, die unsere Forschung leiteten. Denis Teplyashin, ein Ingenieur bei Google DeepMind, erklärte: „Jeder Durchbruch führte zu einem weiteren und eröffnete neue Möglichkeiten. Als diese Innovationen kombiniert wurden, waren wir von den Ergebnissen begeistert, die von 128.000 Token auf 512.000, dann 1 Million und kürzlich 10 Millionen Token in unserer internen Forschung skalierten.“
Die erweiterte Kapazität von 1.5 Pro eröffnet aufregende neue Anwendungen. Anstelle eines Dokuments, das Dutzende von Seiten lang ist, zu summarisieren, kann es nun Dokumente verarbeiten, die Tausende von Seiten umfassen. Während das frühere Modell Tausende von Codezeilen analysieren konnte, kann 1.5 Pro nun Zehntausende von Zeilen gleichzeitig verarbeiten.
Machel Reid, ein weiterer Forschungswissenschaftler bei Google DeepMind, teilte einige faszinierende Testergebnisse mit: „In einem Test haben wir den gesamten Codebestand in das Modell eingegeben, und es hat eine umfassende Dokumentation dafür erstellt, was unglaublich war. In einem anderen hat es nach dem ‚Ansehen‘ des gesamten 45-minütigen Films Sherlock Jr. von 1924 präzise Fragen dazu beantwortet.“
1.5 Pro zeichnet sich auch durch das Schließen von Schlussfolgerungen über Daten innerhalb einer Eingabeaufforderung aus. Machel hob ein Beispiel mit der seltenen Sprache Kalamang hervor, die von weniger als 200 Menschen weltweit gesprochen wird. „Das Modell kann nicht von selbst in Kalamang übersetzen, aber mit dem langen Kontextfenster konnten wir das gesamte Grammatikhandbuch und Beispielsätze einfügen. Das Modell lernte dann, von Englisch in Kalamang zu übersetzen, auf einem Niveau, das mit jemandem vergleichbar ist, der aus demselben Material lernt.“
Gemini 1.5 Pro kommt mit einem standardmäßigen Kontextfenster von 128.000 Token, aber eine ausgewählte Gruppe von Entwicklern und Unternehmenskunden kann über AI Studio und Vertex AI in einer privaten Vorschau auf ein Kontextfenster von 1 Million Token zugreifen. Die Verwaltung eines so großen Kontextfensters ist rechenintensiv, und wir arbeiten aktiv an Optimierungen, um die Latenzzeit bei der Skalierung zu reduzieren.
Der Blick in die Zukunft richtet sich darauf, das Modell schneller und effizienter zu machen, wobei Sicherheit oberste Priorität hat. Außerdem werden Möglichkeiten erforscht, das lange Kontextfenster weiter zu erweitern, zugrunde liegende Architekturen zu verbessern und neue Hardware-Verbesserungen zu nutzen. Nikolay bemerkte: „10 Millionen Token auf einmal nähern sich der thermischen Grenze unserer Tensor Processing Units. Wir sind uns noch nicht sicher, wo die Grenze liegt, und das Modell könnte mit der Weiterentwicklung der Hardware noch mehr leisten.“
Das Team ist gespannt darauf, die innovativen Anwendungen zu sehen, die Entwickler und die breitere Gemeinschaft mit diesen neuen Fähigkeiten schaffen werden. Machel reflektierte: „Als ich zum ersten Mal sah, dass wir eine Million Token im Kontext haben, fragte ich mich: ‚Wofür nutzt man das überhaupt?‘ Aber jetzt glaube ich, dass die Vorstellungskraft der Menschen wachsen wird, was zu kreativeren Anwendungen dieser neuen Fähigkeiten führt.“
[ttpp][yyxx]

Verwandter Artikel
Warner Music übernimmt das KI-Zuschreibungsstart-up Sureel AI
Warner Music Group (WMG) hat am Mittwoch bestätigt, dass es Sureel AI, ein Startup für KI-gestützte Attribution, übernimmt. Die proprietäre Technologie von Sureel generiert „AI-DNA“ für Musikstücke, indem sie diese in ihre Bestandteile zerlegt, um na
Amazon führt Alexa für den Einkauf ein und schiebt Rufus in den Hintergrund
Amazon hat Alexa for Shopping eingeführt, indem es den Rufus-Shopping-Chatbot mit Alexa+ in der App, auf der Website und auf Echo Show-Geräten zusammenführt.Der Assistent beantwortet Produktanfragen, vergleicht Artikel, verfolgt Preise und unterstüt
Microsoft, Azure und KI-Technologie bekämpfen die Risiken von Waldbränden in Kalifornien
Microsoft investiert in die KI-gestützte Erkennung von Waldbränden. Juan Lavista Ferres, CVP und Chief Data Scientist, erörtert Strategien zur Eindämmung von Umweltschäden.Laut der NASA betrifft der K
Empfehlungen zu verwandten Spezialthemen
Kommentare (31)
So they're finally trying to catch up with the long context trend? I mean, it's cool and all, but how many people actually need to process a million tokens in one go? Feels like a spec war more than a practical feature. Still, if it reduces the need for chunking tricks, I'm all for it.
すごい!長文コンテキストの機能が実用化されたら、研究やビジネス文書の分析が一気に楽になりそう🤩。でもこれ、倫理面でどうなんだろう?膨大なデータを読み込むということは、プライバシー問題も発生しそうで少し不安…。他社は今後どう追従するのか気になるなぁ。開発スピード速すぎて置いていかれそう!
Super cool to see Gemini 1.5's long context window in action! 😎 Makes me wonder how it'll handle massive datasets compared to older models.
Wow, the long context window in Gemini 1.5 sounds like a game-changer! I'm curious how it'll handle massive datasets in real-world apps. Excited to see where this takes AI! 🚀
Gestern haben wir unseren neuesten Durchbruch in der KI-Technologie mit dem Gemini 1.5 Modell vorgestellt. Diese neue Version bringt erhebliche Verbesserungen in Geschwindigkeit und Effizienz, aber die wahre Innovation ist das neuartige lange Kontextfenster. Diese Funktion ermöglicht es dem Modell, eine beispiellose Anzahl von Token — den grundlegenden Einheiten, die Wörter, Bilder oder Videos ausmachen — gleichzeitig zu verarbeiten. Um Licht in diesen Fortschritt zu bringen, haben wir uns an das Projektteam von Google DeepMind gewandt, um Einblicke in lange Kontextfenster und deren revolutionäre Auswirkungen auf die Arbeit von Entwicklern zu erhalten.
Das Verständnis langer Kontextfenster ist entscheidend, da sie KI-Modelle in die Lage versetzen, Informationen während einer Sitzung zu behalten und abzurufen. Stellen Sie sich vor, Sie versuchen, sich an einen Namen zu erinnern, der gerade erst in einem Gespräch erwähnt wurde, oder eilen, eine Telefonnummer aufzuschreiben, bevor sie Ihnen entfällt. KI-Modelle stehen vor ähnlichen Herausforderungen und „vergessen“ oft Details nach wenigen Interaktionen. Lange Kontextfenster lösen dieses Problem, indem sie dem Modell ermöglichen, mehr Informationen in seinem „Gedächtnis“ zu behalten.
Zuvor konnte das Gemini-Modell bis zu 32.000 Token gleichzeitig verarbeiten. Mit der Veröffentlichung von 1.5 Pro für frühe Tests haben wir die Grenzen auf erstaunliche 1 Million Token verschoben — das größte Kontextfenster aller bisherigen großskaligen Basismodelle. Unsere Forschung ist sogar noch weiter gegangen und hat erfolgreich bis zu 10 Millionen Token getestet. Je größer das Kontextfenster, desto vielfältiger und umfangreicher die Daten — Text, Bilder, Audio, Code oder Video — die das Modell verarbeiten kann.
Nikolay Savinov, ein Forschungswissenschaftler bei Google DeepMind und einer der Leiter des Projekts für lange Kontextfenster, erklärte: „Unser ursprüngliches Ziel war es, 128.000 Token zu erreichen, aber ich dachte, ein höheres Ziel wäre vorteilhaft, also schlug ich 1 Million Token vor. Und jetzt hat unsere Forschung das Zehnfache davon übertroffen.“
Um diesen Sprung zu erreichen, waren eine Reihe von Innovationen im Bereich des tiefen Lernens erforderlich. Die frühen Erkundungen von Pranav Shyam lieferten entscheidende Erkenntnisse, die unsere Forschung leiteten. Denis Teplyashin, ein Ingenieur bei Google DeepMind, erklärte: „Jeder Durchbruch führte zu einem weiteren und eröffnete neue Möglichkeiten. Als diese Innovationen kombiniert wurden, waren wir von den Ergebnissen begeistert, die von 128.000 Token auf 512.000, dann 1 Million und kürzlich 10 Millionen Token in unserer internen Forschung skalierten.“
Die erweiterte Kapazität von 1.5 Pro eröffnet aufregende neue Anwendungen. Anstelle eines Dokuments, das Dutzende von Seiten lang ist, zu summarisieren, kann es nun Dokumente verarbeiten, die Tausende von Seiten umfassen. Während das frühere Modell Tausende von Codezeilen analysieren konnte, kann 1.5 Pro nun Zehntausende von Zeilen gleichzeitig verarbeiten.
Machel Reid, ein weiterer Forschungswissenschaftler bei Google DeepMind, teilte einige faszinierende Testergebnisse mit: „In einem Test haben wir den gesamten Codebestand in das Modell eingegeben, und es hat eine umfassende Dokumentation dafür erstellt, was unglaublich war. In einem anderen hat es nach dem ‚Ansehen‘ des gesamten 45-minütigen Films Sherlock Jr. von 1924 präzise Fragen dazu beantwortet.“
1.5 Pro zeichnet sich auch durch das Schließen von Schlussfolgerungen über Daten innerhalb einer Eingabeaufforderung aus. Machel hob ein Beispiel mit der seltenen Sprache Kalamang hervor, die von weniger als 200 Menschen weltweit gesprochen wird. „Das Modell kann nicht von selbst in Kalamang übersetzen, aber mit dem langen Kontextfenster konnten wir das gesamte Grammatikhandbuch und Beispielsätze einfügen. Das Modell lernte dann, von Englisch in Kalamang zu übersetzen, auf einem Niveau, das mit jemandem vergleichbar ist, der aus demselben Material lernt.“
Gemini 1.5 Pro kommt mit einem standardmäßigen Kontextfenster von 128.000 Token, aber eine ausgewählte Gruppe von Entwicklern und Unternehmenskunden kann über AI Studio und Vertex AI in einer privaten Vorschau auf ein Kontextfenster von 1 Million Token zugreifen. Die Verwaltung eines so großen Kontextfensters ist rechenintensiv, und wir arbeiten aktiv an Optimierungen, um die Latenzzeit bei der Skalierung zu reduzieren.
Der Blick in die Zukunft richtet sich darauf, das Modell schneller und effizienter zu machen, wobei Sicherheit oberste Priorität hat. Außerdem werden Möglichkeiten erforscht, das lange Kontextfenster weiter zu erweitern, zugrunde liegende Architekturen zu verbessern und neue Hardware-Verbesserungen zu nutzen. Nikolay bemerkte: „10 Millionen Token auf einmal nähern sich der thermischen Grenze unserer Tensor Processing Units. Wir sind uns noch nicht sicher, wo die Grenze liegt, und das Modell könnte mit der Weiterentwicklung der Hardware noch mehr leisten.“
Das Team ist gespannt darauf, die innovativen Anwendungen zu sehen, die Entwickler und die breitere Gemeinschaft mit diesen neuen Fähigkeiten schaffen werden. Machel reflektierte: „Als ich zum ersten Mal sah, dass wir eine Million Token im Kontext haben, fragte ich mich: ‚Wofür nutzt man das überhaupt?‘ Aber jetzt glaube ich, dass die Vorstellungskraft der Menschen wachsen wird, was zu kreativeren Anwendungen dieser neuen Fähigkeiten führt.“
[ttpp][yyxx]

Warner Music übernimmt das KI-Zuschreibungsstart-up Sureel AI
Warner Music Group (WMG) hat am Mittwoch bestätigt, dass es Sureel AI, ein Startup für KI-gestützte Attribution, übernimmt. Die proprietäre Technologie von Sureel generiert „AI-DNA“ für Musikstücke, indem sie diese in ihre Bestandteile zerlegt, um na
Microsoft, Azure und KI-Technologie bekämpfen die Risiken von Waldbränden in Kalifornien
Microsoft investiert in die KI-gestützte Erkennung von Waldbränden. Juan Lavista Ferres, CVP und Chief Data Scientist, erörtert Strategien zur Eindämmung von Umweltschäden.Laut der NASA betrifft der K
So they're finally trying to catch up with the long context trend? I mean, it's cool and all, but how many people actually need to process a million tokens in one go? Feels like a spec war more than a practical feature. Still, if it reduces the need for chunking tricks, I'm all for it.
すごい!長文コンテキストの機能が実用化されたら、研究やビジネス文書の分析が一気に楽になりそう🤩。でもこれ、倫理面でどうなんだろう?膨大なデータを読み込むということは、プライバシー問題も発生しそうで少し不安…。他社は今後どう追従するのか気になるなぁ。開発スピード速すぎて置いていかれそう!
Super cool to see Gemini 1.5's long context window in action! 😎 Makes me wonder how it'll handle massive datasets compared to older models.
Wow, the long context window in Gemini 1.5 sounds like a game-changer! I'm curious how it'll handle massive datasets in real-world apps. Excited to see where this takes AI! 🚀





Heim






