Heim
StepZen stellt die StepAudio 3-Serie der Sprachmodelle vor und sichert sich mehrere globale Erstveröffentlichungen

Am 15. September hat StepXingchen offiziell die neue Serie der Sprachgroßmodelle StepAudio3 veröffentlicht. Diese Veröffentlichung umfasst fünf verschiedene Produkte: StepAudio3Realtime, StepAudio3ASR, StepAudio3TTS, StepAudio3Gen und StepAudio3Music. Mehrere dieser Modelle haben in der autoritativen Auswertungsliste von Artificial Analysis den weltweit ersten Platz belegt. Diese fünf Modelle sind nun vollständig auf der offenen Plattform von StepXingchen verfügbar und decken fünf Kernanwendungsszenarien ab: realistische Sprachgenerierung, umfassende Audioinhaltscreation, Echtzeit-Sprachinteraktion, Sprachverständnis in komplexen Szenarien und Musikproduktion.
Für die Echtzeitinteraktion ist StepAudio3Realtime so konzipiert, dass es nativen Voll-Duplex-Gespräche ermöglicht. Es erreichte im Conversational Dynamics-Ranking von Artificial Analysis mit einem Gesamtscore von 98,9 % den ersten Platz weltweit und belegte auch im Speech Reasoning-Ranking von Artificial Analysis mit einer Genauigkeit von 99,7 % den ersten Platz. Das Modell erfasst präzise den Gesprächsrhythmus, verarbeitet Unterbrechungen und kontinuierliches Feedback der Nutzer und unterstützt das Verständnis von Semantik, Tonfall, Emotion, Paralinguistik und Umgebungsgeräuschen. Darüber hinaus ermöglicht es paralleles Reasoning und Sprachgenerierung sowie asynchrone Tool-Aufrufe (Tool Call) und lange Aufgaben, um unterbrechungsfreie Sprachkonversationen zu gewährleisten.
Bezüglich der Spracherkennung kombiniert StepAudio3ASR hochpräzise Transkription mit den Wissens-Reasoning-Fähigkeiten großer Sprachmodelle und übertrifft damit herkömmliche Methoden zur reinen Audio-Transkription. Es unterstützt vielfältige Szenarien, darunter Chinesisch, Englisch, Dialekte, gemischte Sprachen, lange Audiodateien und Fachgebiete. Das Modell glänzt in medizinischen, juristischen, finanziellen, automobiltechnischen und Programmierkontexten und bewältigt effektiv komplexe Eingabesituationen wie leise Lautstärke, hohe Sprechgeschwindigkeit, undeutliche Aussprache, Gesang und Hintergrundmusik. Die Wortfehlerquote (WER) der nicht-streamingbasierten Spracherkennung liegt bei lediglich 1,7 % und teilt sich den ersten Platz weltweit.
Bei der Sprachgenerierung ist StepAudio3TTS ein realistisches Modell, das für Echtzeitinteraktionen ausgelegt ist. Es stimmt perfekt mit natürlichen menschlichen Sprechmustern hinsichtlich Stimmgrund, Intonation, Rhythmus und Pausen überein. Das Modell reproduziert paralinguistische Ausdrücke wie Lachen, Zögern, Stottern, Wiederholungen und Korrekturen und kann emotionale Tonlagen autonom basierend auf semantischen Inhalten anpassen. Durch eine Streaming-Generierungsarchitektur synchronisiert das Modell Generierung und Wiedergabe.
Für die umfassende Audioinhaltsgenerierung vereinfacht StepAudio3Gen den traditionellen langen Produktions-, Bearbeitungs- und Mischprozess. Nutzer können Gesang, Soundeffekte, Umgebungsgeräusche und Hintergrundmusik gleichzeitig mithilfe natürlicher Sprachbeschreibungen und Referenzaudios generieren. Das Modell ermöglicht eine feine Steuerung paralinguistischer Merkmale wie Charakterstimme, Sprechstil, Emotion, Dialekte und Lachen. Es ermöglicht Nutzern auch, den Zeitpunkt und die Reihenfolge von Dialogen, Soundeffekten und Hintergrundmusik festzulegen, was direkt den gesamten Sounddesign- und Zeitablauf des Inhalts beeinflusst.
Bei der Musikproduktion unterstützt StepAudio3Music sowohl Zero-Shot-Generierung als auch mehrstufige interaktive Erstellung basierend auf ABC-Notation. Nutzer können Texte, A-cappella-Aufnahmen, Referenzlieder oder Notationen eingeben und natürliche Sprache verwenden, um Genre, Gesang, Melodie, Rhythmus, Instrumente und Emotionen zu steuern. Das Modell versteht tiefgreifend die Songstruktur, die melodische Entwicklung über Absätze hinweg und Energieverschiebungen. Besonders in Szenarien mit A-cappella-Begleitung kann ein einzelner A-cappella-Track automatisch Harmonien, Rhythmus, Instrumente und vollständige Arrangements generieren, was eine echte Musikproduktion erleichtert.
Verwandter Artikel
Kimi K3-Set für diesen Monat mit 2,5 Billionen Parametern
Die Landschaft der großen Modelle hat sich im zweiten Halbjahr 2026 verschärft. Neben DeepSeek V4 ist die Veröffentlichung von Moonshot AIs Kimi K3 für diesen Monat bestätigt.Obwohl spezifische Daten noch nicht bekannt sind, berichten Insider, dass
Jia Zhangkes „Dunhuang Mama“ Registriert: Alleinerziehende Mutter verliebt sich in KI, bereist China
Im Juli 2026 genehmigte die Nationale Filmverwaltung das Drehbuchkonzept für den kommenden Film von Jia Zhangke „Dunhuang Mama“. Die Handlung beschreibt eine zeitgenössische Geschichte einer alleinerziehenden Mutter in Dunhuang, die zunehmend auf kün
Deezer berichtet, dass über 50 % der täglichen Uploads aus KI-Musik bestehen, und plant, nicht abgespielte Inhalte nach sechs Monaten zu löschen
Deezer, ein großer Musik-Streaming-Dienst, hat kürzlich alarmierende Zahlen veröffentlicht: KI-generierte Titel machen mittlerweile mehr als die Hälfte der täglichen Uploads aus. Im Juni verzeichnete
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Am 15. September hat StepXingchen offiziell die neue Serie der Sprachgroßmodelle StepAudio3 veröffentlicht. Diese Veröffentlichung umfasst fünf verschiedene Produkte: StepAudio3Realtime, StepAudio3ASR, StepAudio3TTS, StepAudio3Gen und StepAudio3Music. Mehrere dieser Modelle haben in der autoritativen Auswertungsliste von Artificial Analysis den weltweit ersten Platz belegt. Diese fünf Modelle sind nun vollständig auf der offenen Plattform von StepXingchen verfügbar und decken fünf Kernanwendungsszenarien ab: realistische Sprachgenerierung, umfassende Audioinhaltscreation, Echtzeit-Sprachinteraktion, Sprachverständnis in komplexen Szenarien und Musikproduktion.
Für die Echtzeitinteraktion ist StepAudio3Realtime so konzipiert, dass es nativen Voll-Duplex-Gespräche ermöglicht. Es erreichte im Conversational Dynamics-Ranking von Artificial Analysis mit einem Gesamtscore von 98,9 % den ersten Platz weltweit und belegte auch im Speech Reasoning-Ranking von Artificial Analysis mit einer Genauigkeit von 99,7 % den ersten Platz. Das Modell erfasst präzise den Gesprächsrhythmus, verarbeitet Unterbrechungen und kontinuierliches Feedback der Nutzer und unterstützt das Verständnis von Semantik, Tonfall, Emotion, Paralinguistik und Umgebungsgeräuschen. Darüber hinaus ermöglicht es paralleles Reasoning und Sprachgenerierung sowie asynchrone Tool-Aufrufe (Tool Call) und lange Aufgaben, um unterbrechungsfreie Sprachkonversationen zu gewährleisten.
Bezüglich der Spracherkennung kombiniert StepAudio3ASR hochpräzise Transkription mit den Wissens-Reasoning-Fähigkeiten großer Sprachmodelle und übertrifft damit herkömmliche Methoden zur reinen Audio-Transkription. Es unterstützt vielfältige Szenarien, darunter Chinesisch, Englisch, Dialekte, gemischte Sprachen, lange Audiodateien und Fachgebiete. Das Modell glänzt in medizinischen, juristischen, finanziellen, automobiltechnischen und Programmierkontexten und bewältigt effektiv komplexe Eingabesituationen wie leise Lautstärke, hohe Sprechgeschwindigkeit, undeutliche Aussprache, Gesang und Hintergrundmusik. Die Wortfehlerquote (WER) der nicht-streamingbasierten Spracherkennung liegt bei lediglich 1,7 % und teilt sich den ersten Platz weltweit.
Bei der Sprachgenerierung ist StepAudio3TTS ein realistisches Modell, das für Echtzeitinteraktionen ausgelegt ist. Es stimmt perfekt mit natürlichen menschlichen Sprechmustern hinsichtlich Stimmgrund, Intonation, Rhythmus und Pausen überein. Das Modell reproduziert paralinguistische Ausdrücke wie Lachen, Zögern, Stottern, Wiederholungen und Korrekturen und kann emotionale Tonlagen autonom basierend auf semantischen Inhalten anpassen. Durch eine Streaming-Generierungsarchitektur synchronisiert das Modell Generierung und Wiedergabe.
Für die umfassende Audioinhaltsgenerierung vereinfacht StepAudio3Gen den traditionellen langen Produktions-, Bearbeitungs- und Mischprozess. Nutzer können Gesang, Soundeffekte, Umgebungsgeräusche und Hintergrundmusik gleichzeitig mithilfe natürlicher Sprachbeschreibungen und Referenzaudios generieren. Das Modell ermöglicht eine feine Steuerung paralinguistischer Merkmale wie Charakterstimme, Sprechstil, Emotion, Dialekte und Lachen. Es ermöglicht Nutzern auch, den Zeitpunkt und die Reihenfolge von Dialogen, Soundeffekten und Hintergrundmusik festzulegen, was direkt den gesamten Sounddesign- und Zeitablauf des Inhalts beeinflusst.
Bei der Musikproduktion unterstützt StepAudio3Music sowohl Zero-Shot-Generierung als auch mehrstufige interaktive Erstellung basierend auf ABC-Notation. Nutzer können Texte, A-cappella-Aufnahmen, Referenzlieder oder Notationen eingeben und natürliche Sprache verwenden, um Genre, Gesang, Melodie, Rhythmus, Instrumente und Emotionen zu steuern. Das Modell versteht tiefgreifend die Songstruktur, die melodische Entwicklung über Absätze hinweg und Energieverschiebungen. Besonders in Szenarien mit A-cappella-Begleitung kann ein einzelner A-cappella-Track automatisch Harmonien, Rhythmus, Instrumente und vollständige Arrangements generieren, was eine echte Musikproduktion erleichtert.
Kimi K3-Set für diesen Monat mit 2,5 Billionen Parametern
Die Landschaft der großen Modelle hat sich im zweiten Halbjahr 2026 verschärft. Neben DeepSeek V4 ist die Veröffentlichung von Moonshot AIs Kimi K3 für diesen Monat bestätigt.Obwohl spezifische Daten noch nicht bekannt sind, berichten Insider, dass
Jia Zhangkes „Dunhuang Mama“ Registriert: Alleinerziehende Mutter verliebt sich in KI, bereist China
Im Juli 2026 genehmigte die Nationale Filmverwaltung das Drehbuchkonzept für den kommenden Film von Jia Zhangke „Dunhuang Mama“. Die Handlung beschreibt eine zeitgenössische Geschichte einer alleinerziehenden Mutter in Dunhuang, die zunehmend auf kün
Deezer berichtet, dass über 50 % der täglichen Uploads aus KI-Musik bestehen, und plant, nicht abgespielte Inhalte nach sechs Monaten zu löschen
Deezer, ein großer Musik-Streaming-Dienst, hat kürzlich alarmierende Zahlen veröffentlicht: KI-generierte Titel machen mittlerweile mehr als die Hälfte der täglichen Uploads aus. Im Juni verzeichnete











