Qwen presenta el modelo de reconocimiento de voz en tiempo real Fun-ASR-Realtime

La interacción por voz está experimentando un nuevo avance tecnológico. Recientemente, el modelo a gran escala Qwen ha anunciado una mejora de sus capacidades de audio básicas, con la introducción de un nuevo modelo de reconocimiento de voz en tiempo real denominado Fun-ASR-Realtime.
El modelo logra avances significativos en rendimiento, con un retraso en el reconocimiento del primer carácter controlado con precisión en el rango de los cien milisegundos, lo que proporciona a los usuarios una experiencia fluida de «hablar y recibir respuesta inmediata». Su precisión es excelente, acercándose al nivel de los modelos offline líderes del sector, y combina eficazmente el rendimiento en tiempo real con una alta calidad.
Para dar respuesta a las diversas necesidades de las aplicaciones, Fun-ASR-Realtime ofrece una amplia cobertura lingüística. Admite el reconocimiento y el procesamiento de hasta 30 idiomas, con mejoras especiales para la comprensión de los dialectos chinos; actualmente es capaz de gestionar entradas de voz complejas en 16 dialectos.
Esta actualización no solo proporciona un soporte subyacente más sólido para escenarios de interacción en tiempo real, como los asistentes de voz y las notas de reuniones, sino que también amplía los límites de aplicación de los grandes modelos generales en entornos multilingües y con múltiples dialectos. Con el lanzamiento oficial del modelo, los desarrolladores y los usuarios empresariales pueden crear más fácilmente aplicaciones de voz inteligentes con alta sensibilidad y precisión, lo que hace que las interacciones de IA sean más naturales y similares a las humanas.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

La interacción por voz está experimentando un nuevo avance tecnológico. Recientemente, el modelo a gran escala Qwen ha anunciado una mejora de sus capacidades de audio básicas, con la introducción de un nuevo modelo de reconocimiento de voz en tiempo real denominado Fun-ASR-Realtime.
El modelo logra avances significativos en rendimiento, con un retraso en el reconocimiento del primer carácter controlado con precisión en el rango de los cien milisegundos, lo que proporciona a los usuarios una experiencia fluida de «hablar y recibir respuesta inmediata». Su precisión es excelente, acercándose al nivel de los modelos offline líderes del sector, y combina eficazmente el rendimiento en tiempo real con una alta calidad.
Para dar respuesta a las diversas necesidades de las aplicaciones, Fun-ASR-Realtime ofrece una amplia cobertura lingüística. Admite el reconocimiento y el procesamiento de hasta 30 idiomas, con mejoras especiales para la comprensión de los dialectos chinos; actualmente es capaz de gestionar entradas de voz complejas en 16 dialectos.
Esta actualización no solo proporciona un soporte subyacente más sólido para escenarios de interacción en tiempo real, como los asistentes de voz y las notas de reuniones, sino que también amplía los límites de aplicación de los grandes modelos generales en entornos multilingües y con múltiples dialectos. Con el lanzamiento oficial del modelo, los desarrolladores y los usuarios empresariales pueden crear más fácilmente aplicaciones de voz inteligentes con alta sensibilidad y precisión, lo que hace que las interacciones de IA sean más naturales y similares a las humanas.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en





Hogar






