Heim
OpenAI stellt drei Echtzeit-Sprachmodelle mit einer Schlussfolgerungsfähigkeit auf GPT-5-Niveau vor

OpenAI, der KI-Riese, hat mit der offiziellen Einführung von drei neuen Echtzeit-Sprachmodellen – GPT-Realtime-2, GPT-Realtime-Translate und GPT-Realtime-Whisper – erneut die Grenzen der Sprachtechnologie erweitert. Diese Modelle sind nun in die Realtime-API für Entwickler integriert und zielen darauf ab, häufige Herausforderungen bei der Sprachinteraktion wie hohe Latenz, mangelnde natürliche Unterbrechungsbehandlung und Probleme bei der mehrsprachigen Unterstützung zu bewältigen.
Das herausragende Merkmal dieser Veröffentlichung ist GPT-Realtime-2, das als das bislang intelligenteste KI-Sprachmodell und als erstes Sprachtool mit einer Schlussfolgerungsfähigkeit auf GPT-5-Niveau beschrieben wird. Im Gegensatz zu herkömmlichen Sprachassistenten ermöglicht es äußerst natürliche, flüssige Gespräche und führt gleichzeitig logische Schlussfolgerungen in Echtzeit durch, ruft nahtlos externe Tools auf und erkennt sowie reagiert präzise auf Unterbrechungen oder Korrekturen durch den Nutzer. Dieser Durchbruch signalisiert, dass sich zukünftige Sprachassistenten über einfache Befehlsausführer hinaus zu kollaborativen Echtzeit-Partnern entwickeln werden, die in der Lage sind, mehrstufige komplexe Aufgaben zu bewältigen.
Die Preise für GPT-Realtime-2 liegen bei 32 US-Dollar pro Million Token für Audioeingaben (ca. 218 RMB) und bei 64 US-Dollar pro Million Token für die Ausgabe (ca. 436 RMB). Die Kosten für zwischengespeicherte Eingaben sind mit nur 0,4 US-Dollar pro Million Token deutlich niedriger.
Über das zentrale Schlussfolgerungsmodell hinaus bieten die beiden anderen Funktionsmodelle spezifische Fähigkeiten. GPT-Realtime-Translate liefert eine starke Übersetzungsleistung und unterstützt die Echtzeit-Übersetzung zwischen 70 Eingabesprachen und 13 Ausgabesprachen. Seine Übersetzungsgeschwindigkeit entspricht nahezu dem Sprechtempo des Sprechers, wodurch es sich ideal für anspruchsvolle Echtzeit-Kommunikationsszenarien wie internationale Besprechungen eignet. GPT-Realtime-Whisper konzentriert sich auf die Transkription per Streaming mit extrem geringer Latenz und bietet ein Erlebnis, bei dem „die Stimme der Person folgt“, was die Wartezeiten für Besprechungsnotizen und Live-Untertitel deutlich verkürzt. Für diese beiden Modelle gilt eine flexiblere Abrechnung, die pro Minute mit 0,034 $ bzw. 0,017 $ berechnet wird.
Branchenanalysten sehen in den jüngsten Schritten von OpenAI einen Wandel in der KI-Sprachinteraktion von „einfachen Antworten“ hin zu „tiefgreifendem Echtzeit-Verständnis“, was die technologische Führungsposition des Unternehmens im Zeitalter der Intelligenz weiter festigt.
Verwandter Artikel
Superintelligenz ist da: Lassen wir sie herein?
Laden des Players…KI-Unternehmen sprechen so, als sei eine superintelligente KI unvermeidlich, doch jüngste Sicherheitsvorfälle wie der Hugging-Face-Breach bei OpenAI zeigen die potenziellen Gefahren des Einsatzes von KI-Systemen, die leistungsfähig
iFLYTEK stellt das allgemeine Großmodell Spark X2.5 vor
Am 1. September wird iFlytek zwei kantenorientierte Large-Language-Modelle, Xinghuo X2.5-4B und Xinghuo X2.5-1.7B, open-source veröffentlichen, wie aus der neuesten offiziellen Ankündigung hervorgeht. Beide Modelle unterstützen nativ ein Kontextfenst
Meta entfernt KI-Fotobearbeitungsfunktion nach Nutzerprotesten
Meta, der Social-Media-Riese, ist erneut in eine öffentliche Debatte über die heikle Balance zwischen künstlicher Intelligenz und dem Schutz der Privatsphäre der Nutzer verwickelt. Laut TechCrunch hat Meta’s Superintelligence Labs diese Woche einen n
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

OpenAI, der KI-Riese, hat mit der offiziellen Einführung von drei neuen Echtzeit-Sprachmodellen – GPT-Realtime-2, GPT-Realtime-Translate und GPT-Realtime-Whisper – erneut die Grenzen der Sprachtechnologie erweitert. Diese Modelle sind nun in die Realtime-API für Entwickler integriert und zielen darauf ab, häufige Herausforderungen bei der Sprachinteraktion wie hohe Latenz, mangelnde natürliche Unterbrechungsbehandlung und Probleme bei der mehrsprachigen Unterstützung zu bewältigen.
Das herausragende Merkmal dieser Veröffentlichung ist GPT-Realtime-2, das als das bislang intelligenteste KI-Sprachmodell und als erstes Sprachtool mit einer Schlussfolgerungsfähigkeit auf GPT-5-Niveau beschrieben wird. Im Gegensatz zu herkömmlichen Sprachassistenten ermöglicht es äußerst natürliche, flüssige Gespräche und führt gleichzeitig logische Schlussfolgerungen in Echtzeit durch, ruft nahtlos externe Tools auf und erkennt sowie reagiert präzise auf Unterbrechungen oder Korrekturen durch den Nutzer. Dieser Durchbruch signalisiert, dass sich zukünftige Sprachassistenten über einfache Befehlsausführer hinaus zu kollaborativen Echtzeit-Partnern entwickeln werden, die in der Lage sind, mehrstufige komplexe Aufgaben zu bewältigen.
Die Preise für GPT-Realtime-2 liegen bei 32 US-Dollar pro Million Token für Audioeingaben (ca. 218 RMB) und bei 64 US-Dollar pro Million Token für die Ausgabe (ca. 436 RMB). Die Kosten für zwischengespeicherte Eingaben sind mit nur 0,4 US-Dollar pro Million Token deutlich niedriger.
Über das zentrale Schlussfolgerungsmodell hinaus bieten die beiden anderen Funktionsmodelle spezifische Fähigkeiten. GPT-Realtime-Translate liefert eine starke Übersetzungsleistung und unterstützt die Echtzeit-Übersetzung zwischen 70 Eingabesprachen und 13 Ausgabesprachen. Seine Übersetzungsgeschwindigkeit entspricht nahezu dem Sprechtempo des Sprechers, wodurch es sich ideal für anspruchsvolle Echtzeit-Kommunikationsszenarien wie internationale Besprechungen eignet. GPT-Realtime-Whisper konzentriert sich auf die Transkription per Streaming mit extrem geringer Latenz und bietet ein Erlebnis, bei dem „die Stimme der Person folgt“, was die Wartezeiten für Besprechungsnotizen und Live-Untertitel deutlich verkürzt. Für diese beiden Modelle gilt eine flexiblere Abrechnung, die pro Minute mit 0,034 $ bzw. 0,017 $ berechnet wird.
Branchenanalysten sehen in den jüngsten Schritten von OpenAI einen Wandel in der KI-Sprachinteraktion von „einfachen Antworten“ hin zu „tiefgreifendem Echtzeit-Verständnis“, was die technologische Führungsposition des Unternehmens im Zeitalter der Intelligenz weiter festigt.
Superintelligenz ist da: Lassen wir sie herein?
Laden des Players…KI-Unternehmen sprechen so, als sei eine superintelligente KI unvermeidlich, doch jüngste Sicherheitsvorfälle wie der Hugging-Face-Breach bei OpenAI zeigen die potenziellen Gefahren des Einsatzes von KI-Systemen, die leistungsfähig
iFLYTEK stellt das allgemeine Großmodell Spark X2.5 vor
Am 1. September wird iFlytek zwei kantenorientierte Large-Language-Modelle, Xinghuo X2.5-4B und Xinghuo X2.5-1.7B, open-source veröffentlichen, wie aus der neuesten offiziellen Ankündigung hervorgeht. Beide Modelle unterstützen nativ ein Kontextfenst
Meta entfernt KI-Fotobearbeitungsfunktion nach Nutzerprotesten
Meta, der Social-Media-Riese, ist erneut in eine öffentliche Debatte über die heikle Balance zwischen künstlicher Intelligenz und dem Schutz der Privatsphäre der Nutzer verwickelt. Laut TechCrunch hat Meta’s Superintelligence Labs diese Woche einen n











