Maison
Fish Audio lance S2 : un modèle open source permettant de contrôler les émotions au niveau des mots

Fish Audio a officiellement lancé son nouveau modèle de synthèse vocale, S2, qui marque une avancée significative en matière d'expressivité et de contrôlabilité pour la technologie de synthèse vocale open source.
Baptisé Fish Audio S2, ce modèle met l'accent sur un contrôle émotionnel puissant. Les utilisateurs peuvent ajuster avec précision la prosodie et les émotions à l'aide d'instructions en langage naturel. En insérant des balises telles que [rire], [chuchotement] ou [super content], ou même en utilisant des descriptions libres telles que [ton de diffusion professionnel] ou [hausser le ton], il permet un contrôle précis au niveau des mots pour générer une parole très expressive et naturellement vivante.
Principales caractéristiques :
Entièrement open source : les poids du modèle, le code de réglage fin et le moteur d'inférence en streaming basé sur SGLang sont tous accessibles au public sur GitHub et Hugging Face. S2-Pro est la version phare avec environ 4,4 milliards de paramètres. Latence ultra-faible : la latence d'inférence est inférieure à 150 millisecondes, ce qui le rend idéal pour les applications en temps réel telles que les chatbots et les streamers virtuels. Prise en charge native de plusieurs locuteurs : il peut traiter plusieurs locuteurs en une seule inférence, gérant les tours de parole, les interruptions et l'expression émotionnelle naturelle tout en conservant une qualité vocale constante sans traitement supplémentaire.Fish Audio indique que S2 a été entraîné sur environ 10 millions d'heures de données audio couvrant près de 50 langues. Grâce à l'alignement par apprentissage par renforcement et à une architecture autorégressive double, il fait preuve d'un niveau de naturel et d'expressivité de pointe dans de nombreux benchmarks. Il est considéré comme l'un des systèmes de synthèse vocale les plus intelligents sur le plan émotionnel, qu'ils soient open source ou propriétaires. « La véritable liberté linguistique commence maintenant », a annoncé Fish Audio, marquant l'arrivée d'une synthèse vocale IA dotée d'émotions et d'une personnalité authentiques.
GitHub : https://github.com/fishaudio/fish-speech/
HuggingFace : https://huggingface.co/fishaudio/s2-pro/
Article connexe
Les lunettes intelligentes d’Apple pourraient être présentées lors de la WWDC27, mettant en avant la protection de la vie privée
Mark Gurman de Bloomberg rapporte que les lunettes intelligentes d’Apple, codifiées N50, sont prévues pour une présentation lors de la WWDC27 en juin 2027, avec un lancement commercial attendu à l’automne 2027. Initialement destinées à la fin de cett
À l’intérieur des détails révélés sur le prochain Gemini : une puissance de calcul mise à rude épreuve, des équipes internes en désaccord sur les priorités de développement et l’allocation des ressources
Les rapports indiquent que le lancement du modèle Gemini de nouvelle génération, tant attendu par Google, a été repoussé. Des désaccords internes concernant les priorités de développement et l'allocation des ressources, combinés à une capacité de cal
OpenAI rejette les inquiétudes concernant un ralentissement de la croissance, affirmant que plusieurs unités commerciales accélèrent
En réponse aux critiques externes concernant la décélération de la croissance des ventes et le non-respect des objectifs internes, le leader de l'IA, OpenAI, a publié une déclaration rassurante le mardi 28 avril. L'entreprise a précisé que ses produi
Recommandations de sujets spéciaux liés
commentaires (0)

Fish Audio a officiellement lancé son nouveau modèle de synthèse vocale, S2, qui marque une avancée significative en matière d'expressivité et de contrôlabilité pour la technologie de synthèse vocale open source.
Baptisé Fish Audio S2, ce modèle met l'accent sur un contrôle émotionnel puissant. Les utilisateurs peuvent ajuster avec précision la prosodie et les émotions à l'aide d'instructions en langage naturel. En insérant des balises telles que [rire], [chuchotement] ou [super content], ou même en utilisant des descriptions libres telles que [ton de diffusion professionnel] ou [hausser le ton], il permet un contrôle précis au niveau des mots pour générer une parole très expressive et naturellement vivante.
Principales caractéristiques :
Entièrement open source : les poids du modèle, le code de réglage fin et le moteur d'inférence en streaming basé sur SGLang sont tous accessibles au public sur GitHub et Hugging Face. S2-Pro est la version phare avec environ 4,4 milliards de paramètres. Latence ultra-faible : la latence d'inférence est inférieure à 150 millisecondes, ce qui le rend idéal pour les applications en temps réel telles que les chatbots et les streamers virtuels. Prise en charge native de plusieurs locuteurs : il peut traiter plusieurs locuteurs en une seule inférence, gérant les tours de parole, les interruptions et l'expression émotionnelle naturelle tout en conservant une qualité vocale constante sans traitement supplémentaire.Fish Audio indique que S2 a été entraîné sur environ 10 millions d'heures de données audio couvrant près de 50 langues. Grâce à l'alignement par apprentissage par renforcement et à une architecture autorégressive double, il fait preuve d'un niveau de naturel et d'expressivité de pointe dans de nombreux benchmarks. Il est considéré comme l'un des systèmes de synthèse vocale les plus intelligents sur le plan émotionnel, qu'ils soient open source ou propriétaires. « La véritable liberté linguistique commence maintenant », a annoncé Fish Audio, marquant l'arrivée d'une synthèse vocale IA dotée d'émotions et d'une personnalité authentiques.
GitHub : https://github.com/fishaudio/fish-speech/
HuggingFace : https://huggingface.co/fishaudio/s2-pro/
Les lunettes intelligentes d’Apple pourraient être présentées lors de la WWDC27, mettant en avant la protection de la vie privée
Mark Gurman de Bloomberg rapporte que les lunettes intelligentes d’Apple, codifiées N50, sont prévues pour une présentation lors de la WWDC27 en juin 2027, avec un lancement commercial attendu à l’automne 2027. Initialement destinées à la fin de cett
À l’intérieur des détails révélés sur le prochain Gemini : une puissance de calcul mise à rude épreuve, des équipes internes en désaccord sur les priorités de développement et l’allocation des ressources
Les rapports indiquent que le lancement du modèle Gemini de nouvelle génération, tant attendu par Google, a été repoussé. Des désaccords internes concernant les priorités de développement et l'allocation des ressources, combinés à une capacité de cal
OpenAI rejette les inquiétudes concernant un ralentissement de la croissance, affirmant que plusieurs unités commerciales accélèrent
En réponse aux critiques externes concernant la décélération de la croissance des ventes et le non-respect des objectifs internes, le leader de l'IA, OpenAI, a publié une déclaration rassurante le mardi 28 avril. L'entreprise a précisé que ses produi











