Heim
iFlytek Xinghuo stellt 0,65B Encoder-Sprachmodell mit 30B MoE vor, basierend auf vollständig inländischer Rechenleistung
iFLYTEK hat Spark-Audio-1.0-Preview vorgestellt, ein sprachbasiertes großes Grundmodell, das vollständig auf inländischer Recheninfrastruktur aufgebaut ist.
Bisherige Audioverarbeitung mit großen Modellen beruhte auf einer Kaskadenmethode: Zuerst wurde Sprache in Text umgewandelt und dann an das Modell zur Analyse übergeben. Dieser Ansatz weist zwei schwerwiegende Mängel auf: Informationsverlust, da Text Tonfall, Emotionen und Hintergrundgeräusche nicht erfassen kann, was zu einem unvollständigen Kontext führt; sowie fragmentierte Arbeitsabläufe, bei denen unabhängige Module für Transkription, Sprechererkennung und Übersetzung nacheinander ausgeführt werden, was zu Fehlerakkumulation, Latenz und einer schlechten Benutzererfahrung führt.

Über Transkription hinaus: Direktes Sprachverständnis
Dieses sprachbasierte Grundmodell geht über einfache Transkription hinaus und interpretiert Audio direkt. Es kann menschliche Stimmen, Umgebungsgeräusche und Musik unterscheiden sowie Semantik, Emotionen und kontextuelle Hinweise innerhalb des Tons erfassen.
Die erste Version von Spark-Audio-1.0-Preview verfügt über einen 0,65B-Audioencoder (Dichte Struktur) und ein 30B-A3B-großes Sprachmodell (MoE-Struktur). Geschult mit 13 Millionen Stunden Audio und umfangreichen Textdaten auf einem vollständig inländischen Rechencluster, akzeptiert das Modell sowohl Text- als auch Audioeingaben. Es unterstützt Aufgaben wie Sprachtranskription, mehrsprachige Übersetzung, Mehrdialekterkennung, Umgebungsgeräuschidentifikation, Sprechererkennung, Stimmungsanalyse und komplexe Audio-Fragen-Antworten, wodurch Maschinen vom „klaren Hören“ zum „Verstehen“ übergehen können. Ähnlich wie bei iFLYTEKs großem Sprachmodell „1+N“-System können Benutzer dieses sprachbasierte Grundmodell feinabstimmen, um spezialisierte Systeme für Spracherkennung, Echtzeitübersetzung und interaktive Sprachanwendungen zu erstellen.
Unterstützt 99 Sprachen und 202 Dialekte, hervorragend in komplexen Szenarien
L offiziellen Daten liefert Spark-Audio-1.0-Preview vergleichbare oder bessere Ergebnisse als Wettbewerber bei verschiedenen Sprachbewertungsaufgaben, insbesondere in herausfordernden realen Szenarien wie hohen Geräuschpegeln und leiser Sprache. Seine Leistung steht auch in engem Zusammenhang mit größeren, geschlossenen sprachbasierten Grundmodellen.
Das Modell unterstützt die Erkennung von 99 Sprachen und 202 Dialekten. Es zeigt eine überlegene durchschnittliche Leistung bei der mehrsprachigen und mehrdialektalen Spracherkennung im Vergleich zum ähnlich großen Qwen3.5-omni-flash (35B-A3B) und entspricht der Leistung des deutlich größeren Qwen3.5-omni-plus. In Bewertungen wie Fleurs, Kespeech und LibriSpeech für Chinesisch-Englisch, Mehrsprachigkeit und Mehrdialekt-Spracherkennung übertrifft es Gemini-3.1 Pro und erzielt SOTA auf dem Fleurs-Chinesisch-Testset.
iFLYTEK räumt ein, dass diese Version zwar starke Leistungen bei allgemeinen Wissens-, Mathematik- und Codierungsaufgaben aufweist, es jedoch Verbesserungspotenzial bei der Befolgung von Anweisungen, Dialogen und dem Audioverständnis gibt. Zukünftige Updates werden sich auf die Stärkung dieser Bereiche konzentrieren. Spark-Audio-1.0-Preview ist jetzt für öffentliche Erfahrungen verfügbar, wobei der API-Zugriff bald auf der iFLYTEK Open Platform freigegeben wird.
Verwandter Artikel
Suno stellt ein großes Update mit erweiterter Track-Trennung und Fahrzeugunterstützung vor
Suno hat erhebliche Updates für seine KI-Musikgenerierungsplattform veröffentlicht, die sowohl das Web- als auch das mobile Erlebnis verbessern, um die Erstellung zu vereinfachen und die Benutzerfreundlichkeit zu steigern. Die Plattform schreitet vor
Joëlle Pineau von Cohere über souveräne KI und Unternehmenssicherheit
Eine von Cohere in Auftrag gegebene IDC-Studie befasst sich mit „Sovereign AI“, wobei Chief AI Officer Joëlle Pineau wesentliche Strategien für die Cloud-Sicherheit und Daten-Governance in Unternehmen
Asiatische KI-Startups stellen Mythos-ähnliche Modelle vor, während das Exportverbot von Anthropic weiterhin gilt
Am Mittwoch berichtete das chinesische Cybersicherheitsunternehmen 360, es habe Tulongfeng vorgestellt, ein KI-Tool, das nach eigenen Angaben direkt mit Anthrims Mythos konkurrieren kann. Dabei handelt es sich um das auf Cybersicherheit spezialisiert
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
iFLYTEK hat Spark-Audio-1.0-Preview vorgestellt, ein sprachbasiertes großes Grundmodell, das vollständig auf inländischer Recheninfrastruktur aufgebaut ist.
Bisherige Audioverarbeitung mit großen Modellen beruhte auf einer Kaskadenmethode: Zuerst wurde Sprache in Text umgewandelt und dann an das Modell zur Analyse übergeben. Dieser Ansatz weist zwei schwerwiegende Mängel auf: Informationsverlust, da Text Tonfall, Emotionen und Hintergrundgeräusche nicht erfassen kann, was zu einem unvollständigen Kontext führt; sowie fragmentierte Arbeitsabläufe, bei denen unabhängige Module für Transkription, Sprechererkennung und Übersetzung nacheinander ausgeführt werden, was zu Fehlerakkumulation, Latenz und einer schlechten Benutzererfahrung führt.

Über Transkription hinaus: Direktes Sprachverständnis
Dieses sprachbasierte Grundmodell geht über einfache Transkription hinaus und interpretiert Audio direkt. Es kann menschliche Stimmen, Umgebungsgeräusche und Musik unterscheiden sowie Semantik, Emotionen und kontextuelle Hinweise innerhalb des Tons erfassen.
Die erste Version von Spark-Audio-1.0-Preview verfügt über einen 0,65B-Audioencoder (Dichte Struktur) und ein 30B-A3B-großes Sprachmodell (MoE-Struktur). Geschult mit 13 Millionen Stunden Audio und umfangreichen Textdaten auf einem vollständig inländischen Rechencluster, akzeptiert das Modell sowohl Text- als auch Audioeingaben. Es unterstützt Aufgaben wie Sprachtranskription, mehrsprachige Übersetzung, Mehrdialekterkennung, Umgebungsgeräuschidentifikation, Sprechererkennung, Stimmungsanalyse und komplexe Audio-Fragen-Antworten, wodurch Maschinen vom „klaren Hören“ zum „Verstehen“ übergehen können. Ähnlich wie bei iFLYTEKs großem Sprachmodell „1+N“-System können Benutzer dieses sprachbasierte Grundmodell feinabstimmen, um spezialisierte Systeme für Spracherkennung, Echtzeitübersetzung und interaktive Sprachanwendungen zu erstellen.
Unterstützt 99 Sprachen und 202 Dialekte, hervorragend in komplexen Szenarien
L offiziellen Daten liefert Spark-Audio-1.0-Preview vergleichbare oder bessere Ergebnisse als Wettbewerber bei verschiedenen Sprachbewertungsaufgaben, insbesondere in herausfordernden realen Szenarien wie hohen Geräuschpegeln und leiser Sprache. Seine Leistung steht auch in engem Zusammenhang mit größeren, geschlossenen sprachbasierten Grundmodellen.
Das Modell unterstützt die Erkennung von 99 Sprachen und 202 Dialekten. Es zeigt eine überlegene durchschnittliche Leistung bei der mehrsprachigen und mehrdialektalen Spracherkennung im Vergleich zum ähnlich großen Qwen3.5-omni-flash (35B-A3B) und entspricht der Leistung des deutlich größeren Qwen3.5-omni-plus. In Bewertungen wie Fleurs, Kespeech und LibriSpeech für Chinesisch-Englisch, Mehrsprachigkeit und Mehrdialekt-Spracherkennung übertrifft es Gemini-3.1 Pro und erzielt SOTA auf dem Fleurs-Chinesisch-Testset.
iFLYTEK räumt ein, dass diese Version zwar starke Leistungen bei allgemeinen Wissens-, Mathematik- und Codierungsaufgaben aufweist, es jedoch Verbesserungspotenzial bei der Befolgung von Anweisungen, Dialogen und dem Audioverständnis gibt. Zukünftige Updates werden sich auf die Stärkung dieser Bereiche konzentrieren. Spark-Audio-1.0-Preview ist jetzt für öffentliche Erfahrungen verfügbar, wobei der API-Zugriff bald auf der iFLYTEK Open Platform freigegeben wird.
Suno stellt ein großes Update mit erweiterter Track-Trennung und Fahrzeugunterstützung vor
Suno hat erhebliche Updates für seine KI-Musikgenerierungsplattform veröffentlicht, die sowohl das Web- als auch das mobile Erlebnis verbessern, um die Erstellung zu vereinfachen und die Benutzerfreundlichkeit zu steigern. Die Plattform schreitet vor
Joëlle Pineau von Cohere über souveräne KI und Unternehmenssicherheit
Eine von Cohere in Auftrag gegebene IDC-Studie befasst sich mit „Sovereign AI“, wobei Chief AI Officer Joëlle Pineau wesentliche Strategien für die Cloud-Sicherheit und Daten-Governance in Unternehmen
Asiatische KI-Startups stellen Mythos-ähnliche Modelle vor, während das Exportverbot von Anthropic weiterhin gilt
Am Mittwoch berichtete das chinesische Cybersicherheitsunternehmen 360, es habe Tulongfeng vorgestellt, ein KI-Tool, das nach eigenen Angaben direkt mit Anthrims Mythos konkurrieren kann. Dabei handelt es sich um das auf Cybersicherheit spezialisiert











