OpenAI stellt fortschrittliche Sprachmodelle für natürlichere Echtzeit-Gespräche vor

OpenAI hat neue Dialogmodelle eingeführt: GPT-Live-1 und GPT-Live-1 mini. Diese sind darauf ausgelegt, natürlicher zu klingen und den Gesprächsablauf effektiver zu gestalten. Diese Vollduplex-Modelle können gleichzeitig sprechen und zuhören, sodass Nutzer auf natürliche Weise unterbrechen können und Funktionen wie Live-Übersetzungen möglich sind.
Das Unternehmen führt außerdem GPT-Live-1 mini als standardmäßigen Ersatz für den aktuellen „Advanced Voice Mode“ in ChatGPT ein. Nutzer der kostenpflichtigen Tarife erhalten Zugang zum größeren Modell GPT-Live-1. Bisher stützte sich das System auf eine Kombination aus einem Sprach-zu-Text-Modell, einem großen Sprachmodell zur Generierung von Antworten und einem Text-zu-Sprache-Modell, um die endgültige Ausgabe zu erzeugen.
Während einer Pressekonferenz erklärte OpenAI, dass die neuen Modelle Probleme wie das Unterbrechen von Nutzern während des Sprechens und mangelnde Intelligenz bei der Beantwortung von Fragen beheben. Die aktualisierten Modelle leiten Anfragen zur Suche, zum logischen Schlussfolgern oder für agentische Aufgaben an die neuesten Textmodelle wie GPT-5.5 weiter, während der Gesprächsfluss aufrechterhalten bleibt.
OpenAI demonstrierte zudem, dass das Modell über längere Zeiträume schweigen und den Gesprächskontext aufnehmen kann, bis es angesprochen wird. Da der neue Sprachmodus zudem in neuere GPT-Modelle integriert ist, kann er Informationen visuell darstellen. Andere Start-ups wie Monogram – das 40 Millionen US-Dollar Startkapital von DST und Lux Capital eingeworben hat – konzentrieren sich ebenfalls auf visuelle Antworten, um Assistenten interaktiver zu gestalten.
Das Unternehmen wies darauf hin, dass der neue Sprachmodus in ChatGPT für längere Gespräche ausgelegt ist. Bei der Pressekonferenz erwähnte Atty Eleti, Produktleiter von ChatGPT Voice, dass er während Spaziergängen 30- bis 40-minütige Gespräche mit der Sprachfunktion führe.
OpenAI ist der Ansicht, dass Sprache zur primären Schnittstelle für komplexe Rechenaufgaben werden könnte. Berichten zufolge könnte das Unternehmen noch in diesem Jahr KI-fähige Ohrhörer auf den Markt bringen, allerdings wurden keine Details zu den Hardwareprodukten genannt.
„Wir glauben, dass dies im Laufe der Zeit auch die Möglichkeit eröffnen wird, die Sprache als eine Art primäre Schnittstelle zur Datenverarbeitung zu nutzen und zunehmend komplexe, lang andauernde, agentenbasierte Aufgaben zu bewältigen. Angesichts der erstaunlichen Anwendungsfälle, die Menschen mit Codex und ChatGPT realisieren, glauben wir, dass die Sprache die zukünftige Schnittstelle für alle Arten von Arbeit sein kann“, sagte Eleti.
OpenAI hat in den letzten Jahren die sprachbasierten Funktionen weiterentwickelt, um den Sprachmodus von ChatGPT natürlicher klingen zu lassen. Das Unternehmen berichtet, dass über 150 Millionen Menschen die Sprach- und Diktatfunktionen nutzen, um mit ChatGPT zu kommunizieren.
Auch die Konkurrenz arbeitet daran, ihre Assistenten ausdrucksstärker zu gestalten.
Sowohl Apple als auch Amazon haben ihre Assistenten aktualisiert, um sie dialogorientierter zu gestalten und die Kontextverarbeitung zu verbessern. Startups wie Sesame, das von Oculus-Mitbegründer Brendan Iribe und Ankit Kumar gemeinsam gegründet wurde, haben KI-Assistenten auf den Markt gebracht, die natürlichere Gespräche führen und gleichzeitig Hintergrundaufgaben erledigen.
OpenAI verfolgt einen ähnlichen Ansatz und strebt an, Nutzern eine längere freihändige Interaktion mit seinem Assistenten zu ermöglichen. Obwohl das Unternehmen behauptet, der neue Sprachmodus klinge natürlicher, betonte es, dass dieser nicht als KI-Begleiter konzipiert sei. Es wies darauf hin, dass die neuen Modelle Sicherheitsvorkehrungen enthalten, um Teenagern altersgerechte Antworten zu geben und Hilfsangebote bereitzustellen, falls Gespräche Themen wie Selbstverletzung berühren.
Der neue Sprachmodus ist noch verbesserungsfähig. Bei einer Demo der Live-Übersetzungsfunktion für Hindi sprach der Assistent mit starkem amerikanischen Akzent und verwendete unnatürliches, leicht gestelztes Hindi. Das Unternehmen erklärte, der Modus sei für die „meistgesprochenen Sprachen“ optimiert, nannte jedoch keine konkreten Beispiele.
Verwandter Artikel
Amazon startet kostenloses Alexa+ auf Fire TV ohne Prime-Mitgliedschaft
Die KI macht sich auf den Weg in Ihren Fernseher, ob Sie bereit dafür sind oder nicht.Am Mittwoch kündigte Amazon an, dass sein KI-Assistent Alexa+ ab sofort kostenlos auf allen kompatiblen Fire TV-Geräten in den USA verfügbar sein wird, unabhängig
Warner Music übernimmt das KI-Zuschreibungsstart-up Sureel AI
Warner Music Group (WMG) hat am Mittwoch bestätigt, dass es Sureel AI, ein Startup für KI-gestützte Attribution, übernimmt. Die proprietäre Technologie von Sureel generiert „AI-DNA“ für Musikstücke, indem sie diese in ihre Bestandteile zerlegt, um na
Amazon führt Alexa für den Einkauf ein und schiebt Rufus in den Hintergrund
Amazon hat Alexa for Shopping eingeführt, indem es den Rufus-Shopping-Chatbot mit Alexa+ in der App, auf der Website und auf Echo Show-Geräten zusammenführt.Der Assistent beantwortet Produktanfragen, vergleicht Artikel, verfolgt Preise und unterstüt
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

OpenAI hat neue Dialogmodelle eingeführt: GPT-Live-1 und GPT-Live-1 mini. Diese sind darauf ausgelegt, natürlicher zu klingen und den Gesprächsablauf effektiver zu gestalten. Diese Vollduplex-Modelle können gleichzeitig sprechen und zuhören, sodass Nutzer auf natürliche Weise unterbrechen können und Funktionen wie Live-Übersetzungen möglich sind.
Das Unternehmen führt außerdem GPT-Live-1 mini als standardmäßigen Ersatz für den aktuellen „Advanced Voice Mode“ in ChatGPT ein. Nutzer der kostenpflichtigen Tarife erhalten Zugang zum größeren Modell GPT-Live-1. Bisher stützte sich das System auf eine Kombination aus einem Sprach-zu-Text-Modell, einem großen Sprachmodell zur Generierung von Antworten und einem Text-zu-Sprache-Modell, um die endgültige Ausgabe zu erzeugen.
Während einer Pressekonferenz erklärte OpenAI, dass die neuen Modelle Probleme wie das Unterbrechen von Nutzern während des Sprechens und mangelnde Intelligenz bei der Beantwortung von Fragen beheben. Die aktualisierten Modelle leiten Anfragen zur Suche, zum logischen Schlussfolgern oder für agentische Aufgaben an die neuesten Textmodelle wie GPT-5.5 weiter, während der Gesprächsfluss aufrechterhalten bleibt.
OpenAI demonstrierte zudem, dass das Modell über längere Zeiträume schweigen und den Gesprächskontext aufnehmen kann, bis es angesprochen wird. Da der neue Sprachmodus zudem in neuere GPT-Modelle integriert ist, kann er Informationen visuell darstellen. Andere Start-ups wie Monogram – das 40 Millionen US-Dollar Startkapital von DST und Lux Capital eingeworben hat – konzentrieren sich ebenfalls auf visuelle Antworten, um Assistenten interaktiver zu gestalten.
Das Unternehmen wies darauf hin, dass der neue Sprachmodus in ChatGPT für längere Gespräche ausgelegt ist. Bei der Pressekonferenz erwähnte Atty Eleti, Produktleiter von ChatGPT Voice, dass er während Spaziergängen 30- bis 40-minütige Gespräche mit der Sprachfunktion führe.
OpenAI ist der Ansicht, dass Sprache zur primären Schnittstelle für komplexe Rechenaufgaben werden könnte. Berichten zufolge könnte das Unternehmen noch in diesem Jahr KI-fähige Ohrhörer auf den Markt bringen, allerdings wurden keine Details zu den Hardwareprodukten genannt.
„Wir glauben, dass dies im Laufe der Zeit auch die Möglichkeit eröffnen wird, die Sprache als eine Art primäre Schnittstelle zur Datenverarbeitung zu nutzen und zunehmend komplexe, lang andauernde, agentenbasierte Aufgaben zu bewältigen. Angesichts der erstaunlichen Anwendungsfälle, die Menschen mit Codex und ChatGPT realisieren, glauben wir, dass die Sprache die zukünftige Schnittstelle für alle Arten von Arbeit sein kann“, sagte Eleti.
OpenAI hat in den letzten Jahren die sprachbasierten Funktionen weiterentwickelt, um den Sprachmodus von ChatGPT natürlicher klingen zu lassen. Das Unternehmen berichtet, dass über 150 Millionen Menschen die Sprach- und Diktatfunktionen nutzen, um mit ChatGPT zu kommunizieren.
Auch die Konkurrenz arbeitet daran, ihre Assistenten ausdrucksstärker zu gestalten.
Sowohl Apple als auch Amazon haben ihre Assistenten aktualisiert, um sie dialogorientierter zu gestalten und die Kontextverarbeitung zu verbessern. Startups wie Sesame, das von Oculus-Mitbegründer Brendan Iribe und Ankit Kumar gemeinsam gegründet wurde, haben KI-Assistenten auf den Markt gebracht, die natürlichere Gespräche führen und gleichzeitig Hintergrundaufgaben erledigen.
OpenAI verfolgt einen ähnlichen Ansatz und strebt an, Nutzern eine längere freihändige Interaktion mit seinem Assistenten zu ermöglichen. Obwohl das Unternehmen behauptet, der neue Sprachmodus klinge natürlicher, betonte es, dass dieser nicht als KI-Begleiter konzipiert sei. Es wies darauf hin, dass die neuen Modelle Sicherheitsvorkehrungen enthalten, um Teenagern altersgerechte Antworten zu geben und Hilfsangebote bereitzustellen, falls Gespräche Themen wie Selbstverletzung berühren.
Der neue Sprachmodus ist noch verbesserungsfähig. Bei einer Demo der Live-Übersetzungsfunktion für Hindi sprach der Assistent mit starkem amerikanischen Akzent und verwendete unnatürliches, leicht gestelztes Hindi. Das Unternehmen erklärte, der Modus sei für die „meistgesprochenen Sprachen“ optimiert, nannte jedoch keine konkreten Beispiele.
Amazon startet kostenloses Alexa+ auf Fire TV ohne Prime-Mitgliedschaft
Die KI macht sich auf den Weg in Ihren Fernseher, ob Sie bereit dafür sind oder nicht.Am Mittwoch kündigte Amazon an, dass sein KI-Assistent Alexa+ ab sofort kostenlos auf allen kompatiblen Fire TV-Geräten in den USA verfügbar sein wird, unabhängig
Warner Music übernimmt das KI-Zuschreibungsstart-up Sureel AI
Warner Music Group (WMG) hat am Mittwoch bestätigt, dass es Sureel AI, ein Startup für KI-gestützte Attribution, übernimmt. Die proprietäre Technologie von Sureel generiert „AI-DNA“ für Musikstücke, indem sie diese in ihre Bestandteile zerlegt, um na





Heim






