Mistral presenta un modelo de generación de voz de código abierto
La empresa francesa de IA Mistral presentó el jueves un nuevo modelo de código abierto de conversión de texto a voz, diseñado para asistentes de voz con IA y aplicaciones empresariales como la atención al cliente. El modelo permite a las empresas crear agentes de voz para ventas y la interacción con los clientes, lo que posiciona a Mistral como competidor directo de ElevenLabs, Deepgram y OpenAI.
Denominado Voxtral TTS, el modelo es compatible con nueve idiomas, entre los que se incluyen el inglés, el francés, el alemán, el español, el neerlandés, el portugués, el italiano, el hindi y el árabe.
«Nuestros clientes nos han estado pidiendo un modelo de voz. Así que hemos creado un modelo de voz de pequeño tamaño que cabe en un reloj inteligente, un smartphone, un portátil u otros dispositivos periféricos. Su coste es una fracción del de cualquier otro producto del mercado, pero ofrece un rendimiento de vanguardia», afirmó Pierre Stock, vicepresidente de operaciones científicas de Mistral AI, en una entrevista telefónica con TechCrunch.

Crédito de la imagen: Mistral
Mistral afirma que el nuevo modelo puede adaptarse a una voz personalizada utilizando una muestra de menos de cinco segundos, captando acentos sutiles, inflexiones, entonaciones e irregularidades en el flujo del habla. Basado en Mistral 3B, puede cambiar de idioma con fluidez al tiempo que conserva las características de la voz, lo que lo hace ideal para el doblaje o la traducción en tiempo real. Stock señaló que el objetivo de la empresa era que el modelo sonara humano, no robótico.
Según la empresa, el modelo está diseñado para funcionar en tiempo real. Su tiempo hasta el primer audio (TTFA) —el tiempo que transcurre entre la recepción de la entrada y el inicio de la «voz»— es de 90 ms para una muestra de 10 segundos de 500 caracteres. El modelo también alcanza un factor de tiempo real (RTF) de 6x, lo que significa que puede generar un clip de 10 segundos en aproximadamente 1,6 segundos.

Crédito de la imagen: Mistral AI
A principios de este año, Mistral lanzó dos modelos de transcripción: uno para el procesamiento por lotes a gran escala y otro para casos de uso en tiempo real de baja latencia. Con el nuevo modelo de voz, la empresa parece estar creando una suite completa de productos de voz para empresas.
Stock añadió: «Tenemos previsto crear una plataforma integral capaz de gestionar flujos de entrada multimodales —audio, texto e imagen— así como de salida. La ventaja clave es que un sistema agente integral que admita entrada y salida de audio proporciona una información mucho más rica».
Mistral posiciona su naturaleza de código abierto y sus capacidades de personalización como diferenciadores clave, lo que permite a las empresas adaptar el modelo a sus necesidades específicas, lo que lo hace preferible frente a las soluciones de la competencia.
Artículo relacionado
ElevenLabs presenta una IA musical capaz de cambiar de género en medio de la canción
ElevenLabs, una empresa especializada en inteligencia artificial para voz, ha lanzado Music v2, la versión más reciente de su modelo de generación musical, capaz de cambiar de género a lo largo de una canción. Este modelo está diseñado para manejar v
Google lanza las indicaciones por voz en Docs y Keep
En la conferencia de desarrolladores Google I/O, la empresa anunció que va a introducir la función de comandos de voz en aplicaciones de Workspace como Docs, Keep y Gmail. Estas funciones permiten a l
Exdirectivos de Goldman Sachs y los fundadores de Meta desarrollan una IA de voz para mercados desatendidos
La atención al cliente y los servicios de asistencia se encuentran entre los ámbitos más en boga actualmente en el campo de la IA de voz. Sin embargo, desarrollar un producto que suene humano y respon
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
I just tried out Mistral’s new open-source TTS model yesterday, and its pronunciation is way more natural than most free options I’ve used before. It’s super useful for companies that want to build their own voice assistants without spending tons on licensed services. Do you think this will change the game in the enterprise voice AI market?
La empresa francesa de IA Mistral presentó el jueves un nuevo modelo de código abierto de conversión de texto a voz, diseñado para asistentes de voz con IA y aplicaciones empresariales como la atención al cliente. El modelo permite a las empresas crear agentes de voz para ventas y la interacción con los clientes, lo que posiciona a Mistral como competidor directo de ElevenLabs, Deepgram y OpenAI.
Denominado Voxtral TTS, el modelo es compatible con nueve idiomas, entre los que se incluyen el inglés, el francés, el alemán, el español, el neerlandés, el portugués, el italiano, el hindi y el árabe.
«Nuestros clientes nos han estado pidiendo un modelo de voz. Así que hemos creado un modelo de voz de pequeño tamaño que cabe en un reloj inteligente, un smartphone, un portátil u otros dispositivos periféricos. Su coste es una fracción del de cualquier otro producto del mercado, pero ofrece un rendimiento de vanguardia», afirmó Pierre Stock, vicepresidente de operaciones científicas de Mistral AI, en una entrevista telefónica con TechCrunch.

Crédito de la imagen: Mistral
Mistral afirma que el nuevo modelo puede adaptarse a una voz personalizada utilizando una muestra de menos de cinco segundos, captando acentos sutiles, inflexiones, entonaciones e irregularidades en el flujo del habla. Basado en Mistral 3B, puede cambiar de idioma con fluidez al tiempo que conserva las características de la voz, lo que lo hace ideal para el doblaje o la traducción en tiempo real. Stock señaló que el objetivo de la empresa era que el modelo sonara humano, no robótico.
Según la empresa, el modelo está diseñado para funcionar en tiempo real. Su tiempo hasta el primer audio (TTFA) —el tiempo que transcurre entre la recepción de la entrada y el inicio de la «voz»— es de 90 ms para una muestra de 10 segundos de 500 caracteres. El modelo también alcanza un factor de tiempo real (RTF) de 6x, lo que significa que puede generar un clip de 10 segundos en aproximadamente 1,6 segundos.

Crédito de la imagen: Mistral AI
A principios de este año, Mistral lanzó dos modelos de transcripción: uno para el procesamiento por lotes a gran escala y otro para casos de uso en tiempo real de baja latencia. Con el nuevo modelo de voz, la empresa parece estar creando una suite completa de productos de voz para empresas.
Stock añadió: «Tenemos previsto crear una plataforma integral capaz de gestionar flujos de entrada multimodales —audio, texto e imagen— así como de salida. La ventaja clave es que un sistema agente integral que admita entrada y salida de audio proporciona una información mucho más rica».
Mistral posiciona su naturaleza de código abierto y sus capacidades de personalización como diferenciadores clave, lo que permite a las empresas adaptar el modelo a sus necesidades específicas, lo que lo hace preferible frente a las soluciones de la competencia.
ElevenLabs presenta una IA musical capaz de cambiar de género en medio de la canción
ElevenLabs, una empresa especializada en inteligencia artificial para voz, ha lanzado Music v2, la versión más reciente de su modelo de generación musical, capaz de cambiar de género a lo largo de una canción. Este modelo está diseñado para manejar v
Google lanza las indicaciones por voz en Docs y Keep
En la conferencia de desarrolladores Google I/O, la empresa anunció que va a introducir la función de comandos de voz en aplicaciones de Workspace como Docs, Keep y Gmail. Estas funciones permiten a l
Exdirectivos de Goldman Sachs y los fundadores de Meta desarrollan una IA de voz para mercados desatendidos
La atención al cliente y los servicios de asistencia se encuentran entre los ámbitos más en boga actualmente en el campo de la IA de voz. Sin embargo, desarrollar un producto que suene humano y respon
I just tried out Mistral’s new open-source TTS model yesterday, and its pronunciation is way more natural than most free options I’ve used before. It’s super useful for companies that want to build their own voice assistants without spending tons on licensed services. Do you think this will change the game in the enterprise voice AI market?





Hogar






