Heim
Fish Audio bringt S2 auf den Markt: Open-Source-Modell ermöglicht die Steuerung von Emotionen auf Wortebene

Fish Audio hat sein neues Text-to-Speech-Modell S2 offiziell vorgestellt, das einen bedeutenden Fortschritt in Sachen Ausdruckskraft und Steuerbarkeit für Open-Source-TTS-Technologie darstellt.
Das Modell mit dem Namen Fish Audio S2 legt den Schwerpunkt auf eine leistungsstarke emotionale Steuerung. Nutzer können Prosodie und Emotionen mithilfe von Befehlen in natürlicher Sprache feinabstimmen. Durch das Einfügen von Tags wie [laugh], [whisper] oder [super happy] oder sogar durch die Verwendung von frei formulierten Beschreibungen wie [professional broadcast tone] oder [pitch up] ermöglicht es eine präzise Steuerung auf Wortebene, um äußerst ausdrucksstarke und natürlich lebendige Sprache zu erzeugen.
Zu den wichtigsten Funktionen gehören:
Vollständig Open Source: Die Modellgewichte, der Code zur Feinabstimmung und die auf SGLang basierende Streaming-Inferenz-Engine sind alle öffentlich auf GitHub und Hugging Face verfügbar. S2-Pro ist die Flaggschiff-Version mit etwa 4,4 Milliarden Parametern. Extrem niedrige Latenz: Die Inferenzlatenz liegt unter 150 Millisekunden, was das Modell ideal für Echtzeitanwendungen wie Chatbots und virtuelle Streamer macht. Native Unterstützung für mehrere Sprecher: Es kann mehrere Sprecher in einer einzigen Inferenz verarbeiten und dabei Gesprächswechsel, Unterbrechungen und eine natürliche emotionale Wiedergabe bewältigen, während die Stimmqualität ohne zusätzliche Verarbeitung konsistent bleibt.Fish Audio berichtet, dass S2 mit rund 10 Millionen Stunden Audiodaten in fast 50 Sprachen trainiert wurde. Durch den Einsatz von Reinforcement Learning Alignment und einer dualen autoregressiven Architektur zeigt es in mehreren Benchmarks führende Natürlichkeit und Ausdruckskraft. Es gilt als eines der emotional intelligentesten TTS-Systeme auf dem Markt, egal ob Open-Source oder proprietär. „Wahre sprachliche Freiheit beginnt jetzt“, verkündete Fish Audio und läutete damit die Ära der KI-Sprache mit echten Emotionen und Persönlichkeit ein.
GitHub: https://github.com/fishaudio/fish-speech/
HuggingFace:https://huggingface.co/fishaudio/s2-pro/
Verwandter Artikel
Anthropic erweitert die Claude KI-Coding-Tools in Japan im Rahmen der Bemühungen um internationales Wachstum
Anthropic, ein führendes US-amerikalisches Unternehmen für künstliche Intelligenz, intensiviert seine globalen Outreach-Bemühungen. Am Mittwoch veranstaltete das Unternehmen in Tokio eine große Entwicklerkonferenz namens „Code with Claude“, an der kn
Indiens Software-Riese stellt weniger ein, verspricht aber keine Entlassungen, während KI-Agenten ausgebaut werden
Während die künstliche Intelligenz traditionelle, arbeitsintensive Geschäftsmodelle neu gestaltet, hat Tata Consultancy Services (TCS), ein führendes indisches Software-Outsourcing-Unternehmen, seine strategische Antwort vorgestellt. Während der jähr
China sperrt KI-Modelle während des Gaokam, um sofortige Hausaufgabenhilfe zu blockieren
Mit dem sich dem 2026-Gaokao schnell nähernden Termin haben Gerüchte über die Sperrung von KI-Tools während der Prüfungsphase eine intensive Online-Debatte entfacht. Als Reaktion auf die öffentlichen Bedenken haben große KI-Plattformen und Bildungs-A
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Fish Audio hat sein neues Text-to-Speech-Modell S2 offiziell vorgestellt, das einen bedeutenden Fortschritt in Sachen Ausdruckskraft und Steuerbarkeit für Open-Source-TTS-Technologie darstellt.
Das Modell mit dem Namen Fish Audio S2 legt den Schwerpunkt auf eine leistungsstarke emotionale Steuerung. Nutzer können Prosodie und Emotionen mithilfe von Befehlen in natürlicher Sprache feinabstimmen. Durch das Einfügen von Tags wie [laugh], [whisper] oder [super happy] oder sogar durch die Verwendung von frei formulierten Beschreibungen wie [professional broadcast tone] oder [pitch up] ermöglicht es eine präzise Steuerung auf Wortebene, um äußerst ausdrucksstarke und natürlich lebendige Sprache zu erzeugen.
Zu den wichtigsten Funktionen gehören:
Vollständig Open Source: Die Modellgewichte, der Code zur Feinabstimmung und die auf SGLang basierende Streaming-Inferenz-Engine sind alle öffentlich auf GitHub und Hugging Face verfügbar. S2-Pro ist die Flaggschiff-Version mit etwa 4,4 Milliarden Parametern. Extrem niedrige Latenz: Die Inferenzlatenz liegt unter 150 Millisekunden, was das Modell ideal für Echtzeitanwendungen wie Chatbots und virtuelle Streamer macht. Native Unterstützung für mehrere Sprecher: Es kann mehrere Sprecher in einer einzigen Inferenz verarbeiten und dabei Gesprächswechsel, Unterbrechungen und eine natürliche emotionale Wiedergabe bewältigen, während die Stimmqualität ohne zusätzliche Verarbeitung konsistent bleibt.Fish Audio berichtet, dass S2 mit rund 10 Millionen Stunden Audiodaten in fast 50 Sprachen trainiert wurde. Durch den Einsatz von Reinforcement Learning Alignment und einer dualen autoregressiven Architektur zeigt es in mehreren Benchmarks führende Natürlichkeit und Ausdruckskraft. Es gilt als eines der emotional intelligentesten TTS-Systeme auf dem Markt, egal ob Open-Source oder proprietär. „Wahre sprachliche Freiheit beginnt jetzt“, verkündete Fish Audio und läutete damit die Ära der KI-Sprache mit echten Emotionen und Persönlichkeit ein.
GitHub: https://github.com/fishaudio/fish-speech/
HuggingFace:https://huggingface.co/fishaudio/s2-pro/
Anthropic erweitert die Claude KI-Coding-Tools in Japan im Rahmen der Bemühungen um internationales Wachstum
Anthropic, ein führendes US-amerikalisches Unternehmen für künstliche Intelligenz, intensiviert seine globalen Outreach-Bemühungen. Am Mittwoch veranstaltete das Unternehmen in Tokio eine große Entwicklerkonferenz namens „Code with Claude“, an der kn
Indiens Software-Riese stellt weniger ein, verspricht aber keine Entlassungen, während KI-Agenten ausgebaut werden
Während die künstliche Intelligenz traditionelle, arbeitsintensive Geschäftsmodelle neu gestaltet, hat Tata Consultancy Services (TCS), ein führendes indisches Software-Outsourcing-Unternehmen, seine strategische Antwort vorgestellt. Während der jähr
China sperrt KI-Modelle während des Gaokam, um sofortige Hausaufgabenhilfe zu blockieren
Mit dem sich dem 2026-Gaokao schnell nähernden Termin haben Gerüchte über die Sperrung von KI-Tools während der Prüfungsphase eine intensive Online-Debatte entfacht. Als Reaktion auf die öffentlichen Bedenken haben große KI-Plattformen und Bildungs-A











