Heim
Microsoft stellt das erste selbst entwickelte Vollduplex-KI-Sprachmodell vor, das in 16 Sprachen gleichzeitig zuhören und sprechen kann
Laut dem Technologie-Medium TestingCatalog testet Microsoft derzeit sein erstes natives Echtzeit-Sprachmodell, MAI Realtime. Das System unterstützt 16 Sprachen und zwei unterschiedliche Sprachstile und ermöglicht das gleichzeitige Zuhören und Sprechen, wodurch eine automatische Spracherkennung und ein Wechsel der Sprache während des Gesprächs möglich sind. Dank dieser Weiterentwicklung müssen Nutzer nicht mehr warten, bis die KI zu Ende gesprochen hat, bevor sie antworten können, was zu einem Gesprächserlebnis führt, das der natürlichen menschlichen Interaktion sehr nahekommt.

MAI Realtime nutzt einen bidirektionalen Vollduplex-Interaktionsansatz und durchbricht damit effektiv das traditionelle Muster von Sprachassistenten, bei dem Nutzer sprechen und das Modell sequenziell antwortet. Durch den Einsatz von Endpunkt-Erkennungstechnologie zur Identifizierung von Sprachbeginn, Pausen und Sprachende kann das System seine Ausgabe sofort anpassen, wenn Nutzer dazwischenreden, und so ein synchronisiertes Zuhören und Antworten erreichen. Dies stellt einen bedeutenden Meilenstein für die MAI-Sprachmodellfamilie von Microsoft dar, die damit den Übergang von der Einweg- zur Zweiwegkommunikation vollzieht. Frühere Modelle wie MAI-Voice-2 und MAI-Transcribe-1.5 waren auf Einwegaufgaben wie Sprachsynthese oder -erkennung beschränkt.
Zwei Sprachstile sorgen für mehr Natürlichkeit, allerdings sind Gesangsfunktionen noch nicht enthalten
Was die Sprachunterstützung angeht, unterstützt MAI Realtime 16 Sprachen, darunter Chinesisch, Englisch, Japanisch, Koreanisch, Französisch, Deutsch und Arabisch. Nutzer können entweder die Konversationssprache manuell festlegen oder die automatische Erkennung aktivieren, wodurch das Modell Sprachen während des Dialogs automatisch identifizieren und wechseln kann. Was die Sprachoptionen betrifft, so bietet die Testversion zwei Stimmen, „Victoria“ und „Grant“, die Berichten zufolge natürlicher klingen als der aktuelle Sprachmodus von Copilot.
Verwandter Artikel
Apple stellt iOS 27 vor: Lokale KI und Partnerschaft mit Google stärken Siri
„The Information“ hat kürzlich Apples strategischen Ansatz zur Integration künstlicher Intelligenz in das kommende Betriebssystem OS 27 beleuchtet. Durch die Nutzung des „Gemini“-Modells von Google zu
Perplexity Computer stellt „Hybrid Inference“ vor, um Datenschutz und Effizienz in Einklang zu bringen
Perplexity, ein Unternehmen im Bereich der künstlichen Intelligenz, hat Pläne bekannt gegeben, noch in diesem Sommer eine bedeutende Erweiterung seines „Perplexity Computer“-Agenten auf den Markt zu b
NexCOBOT überwindet physische Markthindernisse für KI und fördert das Wachstum
NexCOBOT, das auf dem Robotics Summit & Expo vorgestellt wurde, bietet eine vielfältige Auswahl an Steuerungen. Quelle: NexCOBOTUnternehmen aus den Bereichen humanoide Robotik und physikalische KI sic
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Laut dem Technologie-Medium TestingCatalog testet Microsoft derzeit sein erstes natives Echtzeit-Sprachmodell, MAI Realtime. Das System unterstützt 16 Sprachen und zwei unterschiedliche Sprachstile und ermöglicht das gleichzeitige Zuhören und Sprechen, wodurch eine automatische Spracherkennung und ein Wechsel der Sprache während des Gesprächs möglich sind. Dank dieser Weiterentwicklung müssen Nutzer nicht mehr warten, bis die KI zu Ende gesprochen hat, bevor sie antworten können, was zu einem Gesprächserlebnis führt, das der natürlichen menschlichen Interaktion sehr nahekommt.

MAI Realtime nutzt einen bidirektionalen Vollduplex-Interaktionsansatz und durchbricht damit effektiv das traditionelle Muster von Sprachassistenten, bei dem Nutzer sprechen und das Modell sequenziell antwortet. Durch den Einsatz von Endpunkt-Erkennungstechnologie zur Identifizierung von Sprachbeginn, Pausen und Sprachende kann das System seine Ausgabe sofort anpassen, wenn Nutzer dazwischenreden, und so ein synchronisiertes Zuhören und Antworten erreichen. Dies stellt einen bedeutenden Meilenstein für die MAI-Sprachmodellfamilie von Microsoft dar, die damit den Übergang von der Einweg- zur Zweiwegkommunikation vollzieht. Frühere Modelle wie MAI-Voice-2 und MAI-Transcribe-1.5 waren auf Einwegaufgaben wie Sprachsynthese oder -erkennung beschränkt.
Zwei Sprachstile sorgen für mehr Natürlichkeit, allerdings sind Gesangsfunktionen noch nicht enthalten
Was die Sprachunterstützung angeht, unterstützt MAI Realtime 16 Sprachen, darunter Chinesisch, Englisch, Japanisch, Koreanisch, Französisch, Deutsch und Arabisch. Nutzer können entweder die Konversationssprache manuell festlegen oder die automatische Erkennung aktivieren, wodurch das Modell Sprachen während des Dialogs automatisch identifizieren und wechseln kann. Was die Sprachoptionen betrifft, so bietet die Testversion zwei Stimmen, „Victoria“ und „Grant“, die Berichten zufolge natürlicher klingen als der aktuelle Sprachmodus von Copilot.
Apple stellt iOS 27 vor: Lokale KI und Partnerschaft mit Google stärken Siri
„The Information“ hat kürzlich Apples strategischen Ansatz zur Integration künstlicher Intelligenz in das kommende Betriebssystem OS 27 beleuchtet. Durch die Nutzung des „Gemini“-Modells von Google zu
Perplexity Computer stellt „Hybrid Inference“ vor, um Datenschutz und Effizienz in Einklang zu bringen
Perplexity, ein Unternehmen im Bereich der künstlichen Intelligenz, hat Pläne bekannt gegeben, noch in diesem Sommer eine bedeutende Erweiterung seines „Perplexity Computer“-Agenten auf den Markt zu b
NexCOBOT überwindet physische Markthindernisse für KI und fördert das Wachstum
NexCOBOT, das auf dem Robotics Summit & Expo vorgestellt wurde, bietet eine vielfältige Auswahl an Steuerungen. Quelle: NexCOBOTUnternehmen aus den Bereichen humanoide Robotik und physikalische KI sic











