Hogar
Fish Audio lanza el S2: un modelo de código abierto que permite controlar las emociones a nivel de palabra

Fish Audio ha lanzado oficialmente su nuevo modelo de conversión de texto a voz, S2, que supone un importante avance en cuanto a expresividad y controlabilidad para la tecnología TTS de código abierto.
Bajo el nombre de Fish Audio S2, este modelo da prioridad a un potente control emocional. Los usuarios pueden realizar ajustes precisos en la prosodia y la emoción mediante instrucciones en lenguaje natural. Al insertar etiquetas como [risas], [susurro] o [superfeliz], o incluso utilizando descripciones libres como [tono de locución profesional] o [subir el tono], permite un control preciso a nivel de palabra para generar un habla muy expresiva y naturalmente vívida.
Las características principales incluyen:
Código completamente abierto: los pesos del modelo, el código de ajuste fino y el motor de inferencia de streaming basado en SGLang están disponibles públicamente en GitHub y Hugging Face. S2-Pro es la versión insignia con aproximadamente 4400 millones de parámetros. Latencia ultrabaja: la latencia de inferencia es inferior a 150 milisegundos, lo que lo hace ideal para aplicaciones en tiempo real como chatbots y streamers virtuales. Compatibilidad nativa con múltiples hablantes: puede procesar múltiples hablantes en una sola inferencia, gestionando los turnos de conversación, las interrupciones y la transmisión emocional natural, al tiempo que mantiene una calidad de voz consistente sin procesamiento adicional.Fish Audio informa de que S2 se entrenó con aproximadamente 10 millones de horas de datos de audio que abarcan casi 50 idiomas. Utilizando la alineación del aprendizaje por refuerzo y una arquitectura autorregresiva dual, demuestra una naturalidad y expresividad líderes en múltiples pruebas de rendimiento. Se considera uno de los sistemas TTS con mayor inteligencia emocional disponibles, tanto de código abierto como propietarios. «La verdadera libertad lingüística comienza ahora», anunció Fish Audio, marcando la llegada del habla con IA con emoción y personalidad genuinas.
GitHub: https://github.com/fishaudio/fish-speech/
HuggingFace:https://huggingface.co/fishaudio/s2-pro/
Artículo relacionado
Dentro de los detalles revelados sobre el Gemini de próxima generación: Potencia de cálculo limitada, los equipos internos discreparon sobre las prioridades de desarrollo y la asignación de recursos
Los informes indican que el lanzamiento del tan esperado modelo Gemini de próxima generación de Google ha sido pospuesto. Los desacuerdos internos sobre las prioridades de desarrollo y la asignación de recursos, combinados con una capacidad de comput
OpenAI descarta preocupaciones por la desaceleración del crecimiento y afirma que múltiples unidades de negocio están acelerando
En respuesta a la escrutinio externo sobre el desaceleramiento del crecimiento de las ventas y el incumplimiento de las metas internas, el líder en inteligencia artificial, OpenAI, emitió una declaración contundente el martes 28 de abril. La empresa
Copa Super de Alibaba: Qwen3.8-Max hace su debut con herramientas de codificación y oficina mejoradas
Alibaba ha presentado oficialmente Qwen3.8-Max, un modelo base de última generación con 2,4 billones de parámetros. Este importante avance en inteligencia artificial ofrece mejoras sustanciales en áreas clave como la programación y las tareas profesi
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

Fish Audio ha lanzado oficialmente su nuevo modelo de conversión de texto a voz, S2, que supone un importante avance en cuanto a expresividad y controlabilidad para la tecnología TTS de código abierto.
Bajo el nombre de Fish Audio S2, este modelo da prioridad a un potente control emocional. Los usuarios pueden realizar ajustes precisos en la prosodia y la emoción mediante instrucciones en lenguaje natural. Al insertar etiquetas como [risas], [susurro] o [superfeliz], o incluso utilizando descripciones libres como [tono de locución profesional] o [subir el tono], permite un control preciso a nivel de palabra para generar un habla muy expresiva y naturalmente vívida.
Las características principales incluyen:
Código completamente abierto: los pesos del modelo, el código de ajuste fino y el motor de inferencia de streaming basado en SGLang están disponibles públicamente en GitHub y Hugging Face. S2-Pro es la versión insignia con aproximadamente 4400 millones de parámetros. Latencia ultrabaja: la latencia de inferencia es inferior a 150 milisegundos, lo que lo hace ideal para aplicaciones en tiempo real como chatbots y streamers virtuales. Compatibilidad nativa con múltiples hablantes: puede procesar múltiples hablantes en una sola inferencia, gestionando los turnos de conversación, las interrupciones y la transmisión emocional natural, al tiempo que mantiene una calidad de voz consistente sin procesamiento adicional.Fish Audio informa de que S2 se entrenó con aproximadamente 10 millones de horas de datos de audio que abarcan casi 50 idiomas. Utilizando la alineación del aprendizaje por refuerzo y una arquitectura autorregresiva dual, demuestra una naturalidad y expresividad líderes en múltiples pruebas de rendimiento. Se considera uno de los sistemas TTS con mayor inteligencia emocional disponibles, tanto de código abierto como propietarios. «La verdadera libertad lingüística comienza ahora», anunció Fish Audio, marcando la llegada del habla con IA con emoción y personalidad genuinas.
GitHub: https://github.com/fishaudio/fish-speech/
HuggingFace:https://huggingface.co/fishaudio/s2-pro/
Dentro de los detalles revelados sobre el Gemini de próxima generación: Potencia de cálculo limitada, los equipos internos discreparon sobre las prioridades de desarrollo y la asignación de recursos
Los informes indican que el lanzamiento del tan esperado modelo Gemini de próxima generación de Google ha sido pospuesto. Los desacuerdos internos sobre las prioridades de desarrollo y la asignación de recursos, combinados con una capacidad de comput
OpenAI descarta preocupaciones por la desaceleración del crecimiento y afirma que múltiples unidades de negocio están acelerando
En respuesta a la escrutinio externo sobre el desaceleramiento del crecimiento de las ventas y el incumplimiento de las metas internas, el líder en inteligencia artificial, OpenAI, emitió una declaración contundente el martes 28 de abril. La empresa
Copa Super de Alibaba: Qwen3.8-Max hace su debut con herramientas de codificación y oficina mejoradas
Alibaba ha presentado oficialmente Qwen3.8-Max, un modelo base de última generación con 2,4 billones de parámetros. Este importante avance en inteligencia artificial ofrece mejoras sustanciales en áreas clave como la programación y las tareas profesi











