Hogar
La familia de IA VibeVoice de Microsoft pasa a ser de código abierto, gestiona diálogos de 90 minutos y supera las 27 000 estrellas en GitHub
Microsoft ha publicado recientemente como código abierto una familia de modelos de IA de voz de última generación denominada VibeVoice, que incluye funciones como el reconocimiento automático del habla (ASR) y la conversión de texto a voz (TTS). El proyecto ha captado rápidamente el interés de la comunidad de desarrolladores, gracias a su sólido procesamiento de audio de larga duración, la generación natural de diálogos entre varios interlocutores y su rendimiento en tiempo real con baja latencia. Ya ha obtenido alrededor de 27 000 estrellas en GitHub.
Lanzado como un marco de investigación de código abierto bajo la licencia MIT, VibeVoice admite la implementación local sin cuotas de suscripción a la nube, con el objetivo de fomentar la colaboración y la innovación en la síntesis de voz. La familia de modelos consta de tres miembros principales, cada uno de los cuales aborda retos específicos de la IA de voz tradicional, como el manejo de secuencias largas, la coherencia del hablante y la fluidez natural.

VibeVoice-ASR-7B: una potente herramienta para la conversión estructurada de voz a texto, capaz de gestionar hasta 60 minutos de audio
VibeVoice-ASR-7B es un modelo unificado de conversión de voz a texto capaz de procesar archivos de audio de hasta 60 minutos de duración en una sola pasada, generando directamente transcripciones estructuradas. El resultado identifica al hablante, proporciona marcas de tiempo precisas y detalla el contenido hablado, al tiempo que admite palabras clave personalizadas para mejorar la precisión en el caso de nombres propios o términos técnicos. Compatible con más de 50 idiomas, es ideal para situaciones complejas como grabaciones de reuniones largas y la transcripción de podcasts.
Los desarrolladores de la comunidad ya han creado herramientas prácticas basadas en este modelo, como un método de entrada de voz llamado Vibing para macOS y Windows. Los comentarios de los usuarios indican un gran rendimiento en cuanto a velocidad y precisión, lo que aumenta significativamente la eficiencia de la entrada de voz diaria.
VibeVoice-TTS-1.5B: generación de voz expresiva de hasta 90 minutos con múltiples hablantes
VibeVoice-TTS-1.5B es el modelo central de conversión de texto a voz, capaz de generar audio continuo de hasta 90 minutos de duración de una sola vez y compatible con hasta cuatro hablantes distintos para una simulación natural del diálogo. El habla sintetizada es expresiva, suena natural y fluida con pausas, énfasis y cambios emocionales realistas, lo que la hace ideal para podcasts, narraciones largas, audiolibros o diálogos con múltiples personajes.
A diferencia de muchos modelos TTS tradicionales limitados a 1-2 locutores, VibeVoice-TTS logra avances significativos en la coherencia de los formatos largos y con múltiples locutores. Su arquitectura combina un tokenizador de voz continua (acústico y semántico) con una baja frecuencia de fotogramas (7,5 Hz), lo que mejora considerablemente la eficiencia computacional para secuencias largas.
VibeVoice-Realtime-0.5B: TTS en tiempo real con una latencia de unos 300 milisegundos
VibeVoice-Realtime-0.5B está diseñado para aplicaciones en tiempo real, admitiendo la entrada de texto en streaming con una latencia del primer audio de aproximadamente 300 milisegundos, sin dejar de ser capaz de generar audio de hasta 10 minutos de duración. Este modelo es especialmente adecuado para aplicaciones interactivas que requieren una respuesta instantánea, como los asistentes de voz en tiempo real o el doblaje en streaming en directo.
Además, el proyecto introdujo compatibilidad experimental con locutores, incluyendo voz multilingüe y diversas variaciones del inglés, lo que ofrece a los desarrolladores mayores opciones de personalización.
Reseña de AIbase: La apertura del código fuente de VibeVoice por parte de Microsoft no solo reduce las barreras de entrada a la IA de voz de alto rendimiento, sino que también proporciona una solución completa de implementación local. El proyecto se retiró temporalmente debido a posibles riesgos de uso indebido, pero se relanzó tras implementar medidas de seguridad como marcas de agua de audio y avisos legales audibles, lo que refleja los principios de desarrollo responsable de la IA. Los desarrolladores ya pueden obtener los pesos de los modelos en GitHub y Hugging Face y probarlos rápidamente a través de plataformas como Colab.
Gracias a las continuas contribuciones de la comunidad de código abierto, incluidas las optimizaciones para Apple Silicon, VibeVoice está llamada a acelerar su adopción en la creación de contenidos, las herramientas de accesibilidad y la interacción por voz. Los desarrolladores interesados pueden visitar la página oficial del proyecto de Microsoft para obtener más información.
Dirección del proyecto: https://github.com/microsoft/VibeVoice
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Microsoft ha publicado recientemente como código abierto una familia de modelos de IA de voz de última generación denominada VibeVoice, que incluye funciones como el reconocimiento automático del habla (ASR) y la conversión de texto a voz (TTS). El proyecto ha captado rápidamente el interés de la comunidad de desarrolladores, gracias a su sólido procesamiento de audio de larga duración, la generación natural de diálogos entre varios interlocutores y su rendimiento en tiempo real con baja latencia. Ya ha obtenido alrededor de 27 000 estrellas en GitHub.
Lanzado como un marco de investigación de código abierto bajo la licencia MIT, VibeVoice admite la implementación local sin cuotas de suscripción a la nube, con el objetivo de fomentar la colaboración y la innovación en la síntesis de voz. La familia de modelos consta de tres miembros principales, cada uno de los cuales aborda retos específicos de la IA de voz tradicional, como el manejo de secuencias largas, la coherencia del hablante y la fluidez natural.

VibeVoice-ASR-7B: una potente herramienta para la conversión estructurada de voz a texto, capaz de gestionar hasta 60 minutos de audio
VibeVoice-ASR-7B es un modelo unificado de conversión de voz a texto capaz de procesar archivos de audio de hasta 60 minutos de duración en una sola pasada, generando directamente transcripciones estructuradas. El resultado identifica al hablante, proporciona marcas de tiempo precisas y detalla el contenido hablado, al tiempo que admite palabras clave personalizadas para mejorar la precisión en el caso de nombres propios o términos técnicos. Compatible con más de 50 idiomas, es ideal para situaciones complejas como grabaciones de reuniones largas y la transcripción de podcasts.
Los desarrolladores de la comunidad ya han creado herramientas prácticas basadas en este modelo, como un método de entrada de voz llamado Vibing para macOS y Windows. Los comentarios de los usuarios indican un gran rendimiento en cuanto a velocidad y precisión, lo que aumenta significativamente la eficiencia de la entrada de voz diaria.
VibeVoice-TTS-1.5B: generación de voz expresiva de hasta 90 minutos con múltiples hablantes
VibeVoice-TTS-1.5B es el modelo central de conversión de texto a voz, capaz de generar audio continuo de hasta 90 minutos de duración de una sola vez y compatible con hasta cuatro hablantes distintos para una simulación natural del diálogo. El habla sintetizada es expresiva, suena natural y fluida con pausas, énfasis y cambios emocionales realistas, lo que la hace ideal para podcasts, narraciones largas, audiolibros o diálogos con múltiples personajes.
A diferencia de muchos modelos TTS tradicionales limitados a 1-2 locutores, VibeVoice-TTS logra avances significativos en la coherencia de los formatos largos y con múltiples locutores. Su arquitectura combina un tokenizador de voz continua (acústico y semántico) con una baja frecuencia de fotogramas (7,5 Hz), lo que mejora considerablemente la eficiencia computacional para secuencias largas.
VibeVoice-Realtime-0.5B: TTS en tiempo real con una latencia de unos 300 milisegundos
VibeVoice-Realtime-0.5B está diseñado para aplicaciones en tiempo real, admitiendo la entrada de texto en streaming con una latencia del primer audio de aproximadamente 300 milisegundos, sin dejar de ser capaz de generar audio de hasta 10 minutos de duración. Este modelo es especialmente adecuado para aplicaciones interactivas que requieren una respuesta instantánea, como los asistentes de voz en tiempo real o el doblaje en streaming en directo.
Además, el proyecto introdujo compatibilidad experimental con locutores, incluyendo voz multilingüe y diversas variaciones del inglés, lo que ofrece a los desarrolladores mayores opciones de personalización.
Reseña de AIbase: La apertura del código fuente de VibeVoice por parte de Microsoft no solo reduce las barreras de entrada a la IA de voz de alto rendimiento, sino que también proporciona una solución completa de implementación local. El proyecto se retiró temporalmente debido a posibles riesgos de uso indebido, pero se relanzó tras implementar medidas de seguridad como marcas de agua de audio y avisos legales audibles, lo que refleja los principios de desarrollo responsable de la IA. Los desarrolladores ya pueden obtener los pesos de los modelos en GitHub y Hugging Face y probarlos rápidamente a través de plataformas como Colab.
Gracias a las continuas contribuciones de la comunidad de código abierto, incluidas las optimizaciones para Apple Silicon, VibeVoice está llamada a acelerar su adopción en la creación de contenidos, las herramientas de accesibilidad y la interacción por voz. Los desarrolladores interesados pueden visitar la página oficial del proyecto de Microsoft para obtener más información.
Dirección del proyecto: https://github.com/microsoft/VibeVoice
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











