Hogar
El modelo de lenguaje grande de Alibaba encabeza las clasificaciones mundiales y se alza con la «triple corona» nacional en IA

El 28 de mayo de 2026, Artificial Analysis, una plataforma líder en evaluación de IA, publicó su última clasificación de Speech Arena. Alibaba logró un avance notable con su modelo de voz a gran escala Fun-Realtime-TTS-Preview, situándose en quinto lugar a nivel mundial y en primer lugar en China, con una puntuación Elo de 1190.
1. Liderazgo integral: a la cabeza en tres categorías clave de voz
En esta evaluación, el sistema de tecnología de voz de Alibaba mostró un sólido rendimiento general, situándose en primer lugar en China en tres categorías clave de IA de voz:
ASR (reconocimiento automático del habla): Alcanzó el primer puesto a nivel nacional en precisión y solidez en la conversión de voz a texto, lo que demuestra la capacidad de Alibaba para comprender entornos de audio complejos.
Chat (comprensión del habla y diálogo de extremo a extremo): obtuvo la primera posición a nivel nacional en fluidez, lógica y velocidad de respuesta en conversaciones de voz en tiempo real, lo que refleja las capacidades líderes del sector de Alibaba en la interacción con asistentes inteligentes.
TTS (conversión de texto a voz): en esta área competitiva fundamental, Fun-Realtime-TTS-Preview no solo estableció nuevos récords nacionales en naturalidad, expresión emocional y velocidad de reproducción, sino que también se convirtió en un referente mundial.
2. Avance tecnológico: avances en tiempo real con Fun-Realtime
El protagonista de esta clasificación—Fun-Realtime-TTS-Preview—supone un gran avance del equipo de voz de Alibaba en la síntesis de voz en tiempo real.
Anteriormente, la síntesis de voz solía tener dificultades para equilibrar un alto nivel de naturalidad con una respuesta rápida. Sin embargo, el modelo de Alibaba ha logrado generar una salida de voz con una entonación casi humana y una latencia del orden de los milisegundos gracias a una arquitectura profunda de extremo a extremo. Esta capacidad en tiempo real es fundamental para aplicaciones en las que el tiempo es un factor crítico, como las interacciones en coches inteligentes, las retransmisiones en directo con avatares digitales, la traducción en tiempo real y la atención al cliente.
3. Perspectivas del sector: la tecnología de voz de China avanza hacia la «inteligencia profunda»
Como pionera en el campo de la IA, Artificial Analysis emplea un sistema de puntuación muy riguroso que evalúa el rendimiento de los modelos en conjuntos de pruebas y, lo que es más importante, hace hincapié en la experiencia del usuario en situaciones reales. Los «tres campeonatos» de Alibaba van más allá de las meras puntuaciones y transmiten las siguientes conclusiones clave:
La IA del habla entra en la «era de los modelos a gran escala»: las tecnologías de voz anteriores dependían en gran medida de métodos estadísticos tradicionales o de modelos pequeños. El éxito de Alibaba demuestra que integrar el procesamiento del habla en una base de modelos a gran escala de aprendizaje profundo puede suponer un salto significativo en la calidad de la percepción.
La «velocidad china» en la implementación de escenarios: Con Alibaba a la cabeza tanto en la comprensión como en la generación del habla, el futuro hardware inteligente y los ecosistemas de modelos grandes en China adquirirán una mayor competitividad global en el ámbito clave de la «interacción por voz».
Ilustración de las capacidades de bucle cerrado: Desde el reconocimiento (ASR) hasta la comprensión (Chat) y, posteriormente, la síntesis (TTS), Alibaba ha construido un flujo de trabajo completo de interacción por voz, lo que proporciona una base sólida para desarrollar agentes de IA sin fisuras (Agentes).
A través del desarrollo técnico continuo de abajo arriba y la iteración de modelos en el ámbito de la voz, la IA en China está avanzando a un nivel más profundo, pasando de «ser capaz de reconocer» a «comprender las emociones humanas y la lógica de la interacción» a un nivel más profundo.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

El 28 de mayo de 2026, Artificial Analysis, una plataforma líder en evaluación de IA, publicó su última clasificación de Speech Arena. Alibaba logró un avance notable con su modelo de voz a gran escala Fun-Realtime-TTS-Preview, situándose en quinto lugar a nivel mundial y en primer lugar en China, con una puntuación Elo de 1190.
1. Liderazgo integral: a la cabeza en tres categorías clave de voz
En esta evaluación, el sistema de tecnología de voz de Alibaba mostró un sólido rendimiento general, situándose en primer lugar en China en tres categorías clave de IA de voz:
ASR (reconocimiento automático del habla): Alcanzó el primer puesto a nivel nacional en precisión y solidez en la conversión de voz a texto, lo que demuestra la capacidad de Alibaba para comprender entornos de audio complejos.
Chat (comprensión del habla y diálogo de extremo a extremo): obtuvo la primera posición a nivel nacional en fluidez, lógica y velocidad de respuesta en conversaciones de voz en tiempo real, lo que refleja las capacidades líderes del sector de Alibaba en la interacción con asistentes inteligentes.
TTS (conversión de texto a voz): en esta área competitiva fundamental, Fun-Realtime-TTS-Preview no solo estableció nuevos récords nacionales en naturalidad, expresión emocional y velocidad de reproducción, sino que también se convirtió en un referente mundial.
2. Avance tecnológico: avances en tiempo real con Fun-Realtime
El protagonista de esta clasificación—Fun-Realtime-TTS-Preview—supone un gran avance del equipo de voz de Alibaba en la síntesis de voz en tiempo real.
Anteriormente, la síntesis de voz solía tener dificultades para equilibrar un alto nivel de naturalidad con una respuesta rápida. Sin embargo, el modelo de Alibaba ha logrado generar una salida de voz con una entonación casi humana y una latencia del orden de los milisegundos gracias a una arquitectura profunda de extremo a extremo. Esta capacidad en tiempo real es fundamental para aplicaciones en las que el tiempo es un factor crítico, como las interacciones en coches inteligentes, las retransmisiones en directo con avatares digitales, la traducción en tiempo real y la atención al cliente.
3. Perspectivas del sector: la tecnología de voz de China avanza hacia la «inteligencia profunda»
Como pionera en el campo de la IA, Artificial Analysis emplea un sistema de puntuación muy riguroso que evalúa el rendimiento de los modelos en conjuntos de pruebas y, lo que es más importante, hace hincapié en la experiencia del usuario en situaciones reales. Los «tres campeonatos» de Alibaba van más allá de las meras puntuaciones y transmiten las siguientes conclusiones clave:
La IA del habla entra en la «era de los modelos a gran escala»: las tecnologías de voz anteriores dependían en gran medida de métodos estadísticos tradicionales o de modelos pequeños. El éxito de Alibaba demuestra que integrar el procesamiento del habla en una base de modelos a gran escala de aprendizaje profundo puede suponer un salto significativo en la calidad de la percepción.
La «velocidad china» en la implementación de escenarios: Con Alibaba a la cabeza tanto en la comprensión como en la generación del habla, el futuro hardware inteligente y los ecosistemas de modelos grandes en China adquirirán una mayor competitividad global en el ámbito clave de la «interacción por voz».
Ilustración de las capacidades de bucle cerrado: Desde el reconocimiento (ASR) hasta la comprensión (Chat) y, posteriormente, la síntesis (TTS), Alibaba ha construido un flujo de trabajo completo de interacción por voz, lo que proporciona una base sólida para desarrollar agentes de IA sin fisuras (Agentes).
A través del desarrollo técnico continuo de abajo arriba y la iteración de modelos en el ámbito de la voz, la IA en China está avanzando a un nivel más profundo, pasando de «ser capaz de reconocer» a «comprender las emociones humanas y la lógica de la interacción» a un nivel más profundo.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











