Hogar
iFlytek Xinghuo presenta un modelo de codificación de voz de 0.65B con 30B MoE, construido sobre potencia informática completamente nacional
iFLYTEK ha lanzado Spark-Audio-1.0-Preview, un modelo grande de base para audio construido íntegramente sobre infraestructura informática nacional.
Anteriormente, el procesamiento de audio con modelos grandes se basaba en un método en cascada: convertir primero el habla a texto y luego pasarlo al modelo para su análisis. Este enfoque presenta dos grandes defectos: pérdida de información, ya que el texto no logra capturar el tono, la emoción y los sonidos del entorno, lo que conduce a un contexto incompleto; y flujos de trabajo fragmentados, donde módulos independientes para la transcripción, la identificación del hablante y la traducción funcionan en serie, lo que provoca acumulación de errores, latencia y una mala experiencia de usuario.

Más allá de la transcripción: Comprensión directa del habla
Este modelo de base para el audio va más allá de la simple transcripción para interpretar directamente el audio. Puede distinguir las voces humanas, el ruido ambiental y la música, al tiempo que capta la semántica, las emociones y las señales contextuales dentro del sonido.
La versión inicial de Spark-Audio-1.0-Preview cuenta con un codificador de audio de 0,65B (estructura densa) y un modelo de lenguaje grande de 30B-A3B (estructura MoE). Entrenado con 13 millones de horas de audio y extensos datos de texto utilizando un clúster de computación completamente nacional, el modelo acepta entradas tanto de texto como de audio. Admite tareas como transcripción de voz, traducción multilingüe, reconocimiento de múltiples dialectos, identificación de sonidos ambientales, reconocimiento del hablante, análisis de sentimiento y preguntas y respuestas complejas sobre audio, permitiendo que las máquinas pasen de "oír claramente" a "comprender". De manera similar al sistema "1+N" de los modelos grandes de iFLYTEK, los usuarios pueden ajustar finamente este modelo de base para el audio y crear sistemas especializados para el reconocimiento de voz, la traducción en tiempo real y las aplicaciones interactivas de voz.
Soporte para 99 idiomas y 202 dialectos, con excelencia en escenarios complejos
Según los datos oficiales, Spark-Audio-1.0-Preview tiene un rendimiento comparable o superior al de la competencia en diversas tareas de evaluación de voz, especialmente en escenarios reales desafiantes como altos niveles de ruido y habla suave. Su rendimiento también está estrechamente alineado con el de modelos de base para el habla más grandes y de código cerrado.
El modelo admite el reconocimiento de 99 idiomas y 202 dialectos. Demuestra un rendimiento promedio superior en el reconocimiento de voz multilingüe y multidialectal en comparación con Qwen3.5-omni-flash (35B-A3B) de tamaño similar, y iguala el rendimiento de Qwen3.5-omni-plus, significativamente más grande. En evaluaciones como Fleurs, Kespeech y LibriSpeech para el reconocimiento de voz chino-inglés, multilingüe y multidialectal, supera a Gemini-3.1 Pro y alcanza el estado de la técnica (SOTA) en el conjunto de prueba chino de Fleurs.
iFLYTEK reconoce que, aunque esta versión mantiene un fuerte rendimiento en tareas de conocimiento general, matemáticas y programación, hay margen de mejora en el seguimiento de instrucciones, el diálogo y la comprensión del audio. Las futuras actualizaciones se centrarán en fortalecer estas áreas. Spark-Audio-1.0-Preview ya está disponible para la experiencia pública, y el acceso a la API se lanzará pronto en la Plataforma Abierta de iFLYTEK.
Artículo relacionado
Zoho ayuda a las empresas a implantar agentes de IA
El mercado está evolucionando rápidamente hacia los agentes basados en la inteligencia artificialZoho destaca que la IA avanza de forma exponencial, por lo que es fundamental que las empresas se adapt
Suno presenta una actualización importante con separación avanzada de pistas y soporte para coches
Suno ha lanzado actualizaciones significativas en su plataforma de generación de música con inteligencia artificial, mejorando tanto la experiencia web como la móvil para agilizar la creación y aumentar la usabilidad. La plataforma avanza hacia una e
Joëlle Pineau, de Cohere, habla sobre la IA soberana y la seguridad empresarial
Un estudio de IDC encargado por Cohere analiza la IA soberana, y la directora de IA, Joëlle Pineau, describe las estrategias esenciales para la seguridad en la nube empresarial y la gobernanza de dato
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
iFLYTEK ha lanzado Spark-Audio-1.0-Preview, un modelo grande de base para audio construido íntegramente sobre infraestructura informática nacional.
Anteriormente, el procesamiento de audio con modelos grandes se basaba en un método en cascada: convertir primero el habla a texto y luego pasarlo al modelo para su análisis. Este enfoque presenta dos grandes defectos: pérdida de información, ya que el texto no logra capturar el tono, la emoción y los sonidos del entorno, lo que conduce a un contexto incompleto; y flujos de trabajo fragmentados, donde módulos independientes para la transcripción, la identificación del hablante y la traducción funcionan en serie, lo que provoca acumulación de errores, latencia y una mala experiencia de usuario.

Más allá de la transcripción: Comprensión directa del habla
Este modelo de base para el audio va más allá de la simple transcripción para interpretar directamente el audio. Puede distinguir las voces humanas, el ruido ambiental y la música, al tiempo que capta la semántica, las emociones y las señales contextuales dentro del sonido.
La versión inicial de Spark-Audio-1.0-Preview cuenta con un codificador de audio de 0,65B (estructura densa) y un modelo de lenguaje grande de 30B-A3B (estructura MoE). Entrenado con 13 millones de horas de audio y extensos datos de texto utilizando un clúster de computación completamente nacional, el modelo acepta entradas tanto de texto como de audio. Admite tareas como transcripción de voz, traducción multilingüe, reconocimiento de múltiples dialectos, identificación de sonidos ambientales, reconocimiento del hablante, análisis de sentimiento y preguntas y respuestas complejas sobre audio, permitiendo que las máquinas pasen de "oír claramente" a "comprender". De manera similar al sistema "1+N" de los modelos grandes de iFLYTEK, los usuarios pueden ajustar finamente este modelo de base para el audio y crear sistemas especializados para el reconocimiento de voz, la traducción en tiempo real y las aplicaciones interactivas de voz.
Soporte para 99 idiomas y 202 dialectos, con excelencia en escenarios complejos
Según los datos oficiales, Spark-Audio-1.0-Preview tiene un rendimiento comparable o superior al de la competencia en diversas tareas de evaluación de voz, especialmente en escenarios reales desafiantes como altos niveles de ruido y habla suave. Su rendimiento también está estrechamente alineado con el de modelos de base para el habla más grandes y de código cerrado.
El modelo admite el reconocimiento de 99 idiomas y 202 dialectos. Demuestra un rendimiento promedio superior en el reconocimiento de voz multilingüe y multidialectal en comparación con Qwen3.5-omni-flash (35B-A3B) de tamaño similar, y iguala el rendimiento de Qwen3.5-omni-plus, significativamente más grande. En evaluaciones como Fleurs, Kespeech y LibriSpeech para el reconocimiento de voz chino-inglés, multilingüe y multidialectal, supera a Gemini-3.1 Pro y alcanza el estado de la técnica (SOTA) en el conjunto de prueba chino de Fleurs.
iFLYTEK reconoce que, aunque esta versión mantiene un fuerte rendimiento en tareas de conocimiento general, matemáticas y programación, hay margen de mejora en el seguimiento de instrucciones, el diálogo y la comprensión del audio. Las futuras actualizaciones se centrarán en fortalecer estas áreas. Spark-Audio-1.0-Preview ya está disponible para la experiencia pública, y el acceso a la API se lanzará pronto en la Plataforma Abierta de iFLYTEK.
Zoho ayuda a las empresas a implantar agentes de IA
El mercado está evolucionando rápidamente hacia los agentes basados en la inteligencia artificialZoho destaca que la IA avanza de forma exponencial, por lo que es fundamental que las empresas se adapt
Suno presenta una actualización importante con separación avanzada de pistas y soporte para coches
Suno ha lanzado actualizaciones significativas en su plataforma de generación de música con inteligencia artificial, mejorando tanto la experiencia web como la móvil para agilizar la creación y aumentar la usabilidad. La plataforma avanza hacia una e
Joëlle Pineau, de Cohere, habla sobre la IA soberana y la seguridad empresarial
Un estudio de IDC encargado por Cohere analiza la IA soberana, y la directora de IA, Joëlle Pineau, describe las estrategias esenciales para la seguridad en la nube empresarial y la gobernanza de dato











