Qwen stellt das Echtzeit-Spracherkennungsmodell „Fun-ASR-Realtime“ vor

Die Sprachinteraktion erlebt derzeit einen neuen technologischen Durchbruch. Vor kurzem kündigte das Großmodell „Qwen“ eine Erweiterung seiner zentralen Audiofunktionen an und stellte ein neues Echtzeit-Spracherkennungsmodell namens „Fun-ASR-Realtime“ vor.
Das Modell erzielt bedeutende Leistungssprünge: Die Verzögerung bei der Erkennung des ersten Zeichens wird präzise im Bereich von hundert Millisekunden gehalten, was den Nutzern ein flüssiges Erlebnis bietet, bei dem sie „sprechen und sofort Feedback erhalten“. Seine Genauigkeit ist hervorragend und nähert sich dem Niveau branchenführender Offline-Modelle an, wodurch Echtzeitleistung und hohe Qualität effektiv kombiniert werden.
Um den vielfältigen Anwendungsanforderungen gerecht zu werden, bietet „Fun-ASR-Realtime“ eine umfassende Sprachabdeckung. Es unterstützt die Erkennung und Verarbeitung von bis zu 30 Sprachen und verfügt über spezielle Verbesserungen für das Verständnis chinesischer Dialekte – derzeit ist es in der Lage, komplexe Spracheingaben in 16 Dialekten zu verarbeiten.
Dieses Upgrade bietet nicht nur eine stärkere technische Grundlage für Echtzeit-Interaktionsszenarien wie Sprachassistenten und Besprechungsprotokolle, sondern erweitert auch die Anwendungsgrenzen allgemeiner großer Modelle in mehrsprachigen und multidialektalen Umgebungen. Mit der offiziellen Einführung des Modells können Entwickler und Unternehmensanwender leichter intelligente Sprachanwendungen mit hoher Empfindlichkeit und Genauigkeit erstellen, wodurch KI-Interaktionen natürlicher und menschenähnlicher werden.
Verwandter Artikel
DeepMind-CEO Hassabis: Ich schlafe sechs Stunden pro Tag und fühle mich normalerweise gegen 1 Uhr nachts energiegeladen.
Fortune hat kürzlich ein Interview mit Demis Hassabis, dem CEO von Google DeepMind, veröffentlicht, das seinen unkonventionellen Ansatz zu Erholung und Produktivität offenbart. Hassabis gab bekannt, dass er sehr wenig schläft und seine wachen Stunden
OpenAI und Anthropic kämpfen trotz Umsatzrückgängen um Marktanteile
Obwohl jüngste Berichte darauf hindeuten, dass OpenAI seine Umsatzziele verfehlt hat, was an diesem Dienstag Druck auf die Technologieaktien ausübte, zeigen sich private Investoren in KI-Labore weiter
Einhaltung der Vorschriften für autonome Fahrzeuge in Kalifornien: Eine neue Ära von Bußgeldern, Geofences und 1 Million Meilen
Guident betreibt einen AuveTech-Shuttle in Südflorida und verwaltet mithilfe seiner Fernüberwachungstechnologie eine vier Meilen lange Strecke in West Palm Beach sowie eine eine Meile lange Strecke in
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Die Sprachinteraktion erlebt derzeit einen neuen technologischen Durchbruch. Vor kurzem kündigte das Großmodell „Qwen“ eine Erweiterung seiner zentralen Audiofunktionen an und stellte ein neues Echtzeit-Spracherkennungsmodell namens „Fun-ASR-Realtime“ vor.
Das Modell erzielt bedeutende Leistungssprünge: Die Verzögerung bei der Erkennung des ersten Zeichens wird präzise im Bereich von hundert Millisekunden gehalten, was den Nutzern ein flüssiges Erlebnis bietet, bei dem sie „sprechen und sofort Feedback erhalten“. Seine Genauigkeit ist hervorragend und nähert sich dem Niveau branchenführender Offline-Modelle an, wodurch Echtzeitleistung und hohe Qualität effektiv kombiniert werden.
Um den vielfältigen Anwendungsanforderungen gerecht zu werden, bietet „Fun-ASR-Realtime“ eine umfassende Sprachabdeckung. Es unterstützt die Erkennung und Verarbeitung von bis zu 30 Sprachen und verfügt über spezielle Verbesserungen für das Verständnis chinesischer Dialekte – derzeit ist es in der Lage, komplexe Spracheingaben in 16 Dialekten zu verarbeiten.
Dieses Upgrade bietet nicht nur eine stärkere technische Grundlage für Echtzeit-Interaktionsszenarien wie Sprachassistenten und Besprechungsprotokolle, sondern erweitert auch die Anwendungsgrenzen allgemeiner großer Modelle in mehrsprachigen und multidialektalen Umgebungen. Mit der offiziellen Einführung des Modells können Entwickler und Unternehmensanwender leichter intelligente Sprachanwendungen mit hoher Empfindlichkeit und Genauigkeit erstellen, wodurch KI-Interaktionen natürlicher und menschenähnlicher werden.
DeepMind-CEO Hassabis: Ich schlafe sechs Stunden pro Tag und fühle mich normalerweise gegen 1 Uhr nachts energiegeladen.
Fortune hat kürzlich ein Interview mit Demis Hassabis, dem CEO von Google DeepMind, veröffentlicht, das seinen unkonventionellen Ansatz zu Erholung und Produktivität offenbart. Hassabis gab bekannt, dass er sehr wenig schläft und seine wachen Stunden
OpenAI und Anthropic kämpfen trotz Umsatzrückgängen um Marktanteile
Obwohl jüngste Berichte darauf hindeuten, dass OpenAI seine Umsatzziele verfehlt hat, was an diesem Dienstag Druck auf die Technologieaktien ausübte, zeigen sich private Investoren in KI-Labore weiter





Heim






