Heim
Upgrade der OpenAI Voice API: Höhere Transkriptionsgenauigkeit, 40 % schnellere Agenten-Geschwindigkeit
OpenAI hat kürzlich zwei wichtige API-Updates für Entwickler weltweit vorgestellt, die darauf abzielen, die Leistung von KI-Agenten bei Sprachinteraktionen und komplexen Arbeitsabläufen deutlich zu steigern.
Im Bereich der Modelle wurden das neue Echtzeitmodell „gpt-realtime-1.5“ und das dazugehörige Audiomodell offiziell veröffentlicht. Ihr vorrangiges Ziel ist es, die Zuverlässigkeit von Sprachbefehlen zu verbessern. Laut internen Testdaten von OpenAI verbessert das neue Modell die Transkriptionsgenauigkeit bei Zahlen und Buchstaben um etwa 10 %, steigert die Genauigkeit bei logischen Audioaufgaben um 5 % und erhöht die Genauigkeit bei der Ausführung von Anweisungen um 7%. Damit werden Probleme wirksam behoben, bei denen KI Schlüsselphrasen falsch interpretiert oder Schwierigkeiten mit komplexen Sprachbefehlen hat.

Architektonisch unterstützt die Responses-API nun das WebSocket-Protokoll, was einen bedeutenden Wandel in der KI-Kommunikation darstellt. Im Gegensatz zu früheren Methoden, bei denen bei jeder Anfrage der gesamte Kontext erneut übertragen werden musste, ermöglicht WebSocket Entwicklern den Aufbau einer dauerhaften Verbindung, wobei das System nur inkrementelle Daten sendet, wenn neue Informationen generiert werden.
OpenAI wies darauf hin, dass diese Verbesserung besonders wichtig für komplexe KI-Agenten ist, die häufig zahlreiche Tools aufrufen, da sie deren Betriebsgeschwindigkeit direkt um 20 % bis 40 % steigern kann.
Verwandter Artikel
DeepMind-CEO Hassabis: Ich schlafe sechs Stunden pro Tag und fühle mich normalerweise gegen 1 Uhr nachts energiegeladen.
Fortune hat kürzlich ein Interview mit Demis Hassabis, dem CEO von Google DeepMind, veröffentlicht, das seinen unkonventionellen Ansatz zu Erholung und Produktivität offenbart. Hassabis gab bekannt, dass er sehr wenig schläft und seine wachen Stunden
OpenAI und Anthropic kämpfen trotz Umsatzrückgängen um Marktanteile
Obwohl jüngste Berichte darauf hindeuten, dass OpenAI seine Umsatzziele verfehlt hat, was an diesem Dienstag Druck auf die Technologieaktien ausübte, zeigen sich private Investoren in KI-Labore weiter
Einhaltung der Vorschriften für autonome Fahrzeuge in Kalifornien: Eine neue Ära von Bußgeldern, Geofences und 1 Million Meilen
Guident betreibt einen AuveTech-Shuttle in Südflorida und verwaltet mithilfe seiner Fernüberwachungstechnologie eine vier Meilen lange Strecke in West Palm Beach sowie eine eine Meile lange Strecke in
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
OpenAI hat kürzlich zwei wichtige API-Updates für Entwickler weltweit vorgestellt, die darauf abzielen, die Leistung von KI-Agenten bei Sprachinteraktionen und komplexen Arbeitsabläufen deutlich zu steigern.
Im Bereich der Modelle wurden das neue Echtzeitmodell „gpt-realtime-1.5“ und das dazugehörige Audiomodell offiziell veröffentlicht. Ihr vorrangiges Ziel ist es, die Zuverlässigkeit von Sprachbefehlen zu verbessern. Laut internen Testdaten von OpenAI verbessert das neue Modell die Transkriptionsgenauigkeit bei Zahlen und Buchstaben um etwa 10 %, steigert die Genauigkeit bei logischen Audioaufgaben um 5 % und erhöht die Genauigkeit bei der Ausführung von Anweisungen um 7%. Damit werden Probleme wirksam behoben, bei denen KI Schlüsselphrasen falsch interpretiert oder Schwierigkeiten mit komplexen Sprachbefehlen hat.

Architektonisch unterstützt die Responses-API nun das WebSocket-Protokoll, was einen bedeutenden Wandel in der KI-Kommunikation darstellt. Im Gegensatz zu früheren Methoden, bei denen bei jeder Anfrage der gesamte Kontext erneut übertragen werden musste, ermöglicht WebSocket Entwicklern den Aufbau einer dauerhaften Verbindung, wobei das System nur inkrementelle Daten sendet, wenn neue Informationen generiert werden.
OpenAI wies darauf hin, dass diese Verbesserung besonders wichtig für komplexe KI-Agenten ist, die häufig zahlreiche Tools aufrufen, da sie deren Betriebsgeschwindigkeit direkt um 20 % bis 40 % steigern kann.
DeepMind-CEO Hassabis: Ich schlafe sechs Stunden pro Tag und fühle mich normalerweise gegen 1 Uhr nachts energiegeladen.
Fortune hat kürzlich ein Interview mit Demis Hassabis, dem CEO von Google DeepMind, veröffentlicht, das seinen unkonventionellen Ansatz zu Erholung und Produktivität offenbart. Hassabis gab bekannt, dass er sehr wenig schläft und seine wachen Stunden
OpenAI und Anthropic kämpfen trotz Umsatzrückgängen um Marktanteile
Obwohl jüngste Berichte darauf hindeuten, dass OpenAI seine Umsatzziele verfehlt hat, was an diesem Dienstag Druck auf die Technologieaktien ausübte, zeigen sich private Investoren in KI-Labore weiter











