Lar
A iFlytek Xinghuo revela modelo de fala codificador de 0,65B com MoE de 30B, construído sobre poder computacional totalmente nacional
A iFLYTEK lançou o Spark-Audio-1.0-Preview, um modelo de linguagem grande de base para áudio construído inteiramente sobre infraestrutura de computação nacional.
Anteriormente, o processamento de áudio com modelos de linguagem grande dependia de um método em cascata: converter primeiro a fala em texto e, em seguida, passá-lo ao modelo para análise. Essa abordagem apresenta duas falhas principais: perda de informação, pois o texto não consegue capturar tom, emoção e sons de fundo, levando a um contexto incompleto; e fluxos de trabalho fragmentados, nos quais módulos independentes para transcrição, identificação do locutor e tradução operam em série, causando acúmulo de erros, latência e uma experiência de usuário ruim.

Além da transcrição: Compreensão direta da fala
Este modelo de base para áudio vai além da simples transcrição para interpretar diretamente o áudio. Ele pode distinguir vozes humanas, ruído ambiente e música, ao mesmo tempo em que capta semântica, emoções e indicações contextuais presentes no som.
A versão inicial do Spark-Audio-1.0-Preview apresenta um codificador de áudio de 0,65B (estrutura densa) e um modelo de linguagem grande de 30B-A3B (estrutura MoE). Treinado em 13 milhões de horas de áudio e em extensos dados de texto, utilizando um cluster de computação totalmente nacional, o modelo aceita entradas de texto e áudio. Ele suporta tarefas como transcrição de fala, tradução multilíngue, reconhecimento de múltiplos dialetos, identificação de sons ambientais, reconhecimento do locutor, análise de sentimento e perguntas e respostas complexas sobre áudio, permitindo que as máquinas transicionem de "ouvir claramente" para "compreender". Semelhante ao sistema "1+N" do modelo grande Spark da iFLYTEK, os usuários podem ajustar finamente este modelo de base para áudio para criar sistemas especializados para reconhecimento de fala, tradução em tempo real e aplicações interativas de fala.
Suporta 99 idiomas e 202 dialetos, destacando-se em cenários complexos
De acordo com dados oficiais, o Spark-Audio-1.0-Preview tem desempenho comparável ou superior ao dos concorrentes em várias tarefas de avaliação de fala, particularmente em cenários do mundo real desafiadores, como altos níveis de ruído e fala suave. Seu desempenho também está estreitamente alinhado com modelos de base para áudio maiores e de código fechado.
O modelo suporta o reconhecimento de 99 idiomas e 202 dialetos. Ele demonstra desempenho médio superior no reconhecimento de fala multilíngue e multidialeto em comparação com o Qwen3.5-omni-flash (35B-A3B) de tamanho semelhante, e iguala o desempenho do significativamente maior Qwen3.5-omni-plus. Em avaliações como Fleurs, Kespeech e LibriSpeech para reconhecimento de fala chinês-inglesa, multilíngue e multidialeto, ele supera o Gemini-3.1 Pro e alcança o estado da arte (SOTA) no conjunto de testes chinês do Fleurs.
A iFLYTEK reconhece que, embora esta versão mantenha um desempenho forte em tarefas de conhecimento geral, matemática e programação, há espaço para melhoria na execução de instruções, diálogo e compreensão de áudio. As atualizações futuras focarão no fortalecimento dessas áreas. O Spark-Audio-1.0-Preview já está disponível para experiência pública, com acesso à API sendo lançado em breve na Plataforma Aberta da iFLYTEK.
Artigo relacionado
A Zoho ajuda as empresas a adotarem agentes de IA
O mercado está evoluindo rapidamente em direção a agentes baseados em IAA Zoho destaca que a IA está avançando exponencialmente, tornando crucial que as empresas se adaptem e repensem suas operaçõesO
Suno anuncia atualização importante com separação avançada de faixas e suporte para carros
A Suno lançou atualizações significativas em sua plataforma de geração de música por inteligência artificial, aprimorando as experiências na web e no mobile para simplificar a criação e aumentar a usabilidade. A plataforma avança para um estágio mais
Joëlle Pineau, da Cohere, fala sobre IA soberana e segurança corporativa
Uma pesquisa da IDC encomendada pela Cohere explora a IA soberana, com a diretora de IA, Joëlle Pineau, apresentando estratégias essenciais para a segurança na nuvem corporativa e a governança de dado
Recomendações de tópicos especiais relacionados
Comentários (0)
A iFLYTEK lançou o Spark-Audio-1.0-Preview, um modelo de linguagem grande de base para áudio construído inteiramente sobre infraestrutura de computação nacional.
Anteriormente, o processamento de áudio com modelos de linguagem grande dependia de um método em cascata: converter primeiro a fala em texto e, em seguida, passá-lo ao modelo para análise. Essa abordagem apresenta duas falhas principais: perda de informação, pois o texto não consegue capturar tom, emoção e sons de fundo, levando a um contexto incompleto; e fluxos de trabalho fragmentados, nos quais módulos independentes para transcrição, identificação do locutor e tradução operam em série, causando acúmulo de erros, latência e uma experiência de usuário ruim.

Além da transcrição: Compreensão direta da fala
Este modelo de base para áudio vai além da simples transcrição para interpretar diretamente o áudio. Ele pode distinguir vozes humanas, ruído ambiente e música, ao mesmo tempo em que capta semântica, emoções e indicações contextuais presentes no som.
A versão inicial do Spark-Audio-1.0-Preview apresenta um codificador de áudio de 0,65B (estrutura densa) e um modelo de linguagem grande de 30B-A3B (estrutura MoE). Treinado em 13 milhões de horas de áudio e em extensos dados de texto, utilizando um cluster de computação totalmente nacional, o modelo aceita entradas de texto e áudio. Ele suporta tarefas como transcrição de fala, tradução multilíngue, reconhecimento de múltiplos dialetos, identificação de sons ambientais, reconhecimento do locutor, análise de sentimento e perguntas e respostas complexas sobre áudio, permitindo que as máquinas transicionem de "ouvir claramente" para "compreender". Semelhante ao sistema "1+N" do modelo grande Spark da iFLYTEK, os usuários podem ajustar finamente este modelo de base para áudio para criar sistemas especializados para reconhecimento de fala, tradução em tempo real e aplicações interativas de fala.
Suporta 99 idiomas e 202 dialetos, destacando-se em cenários complexos
De acordo com dados oficiais, o Spark-Audio-1.0-Preview tem desempenho comparável ou superior ao dos concorrentes em várias tarefas de avaliação de fala, particularmente em cenários do mundo real desafiadores, como altos níveis de ruído e fala suave. Seu desempenho também está estreitamente alinhado com modelos de base para áudio maiores e de código fechado.
O modelo suporta o reconhecimento de 99 idiomas e 202 dialetos. Ele demonstra desempenho médio superior no reconhecimento de fala multilíngue e multidialeto em comparação com o Qwen3.5-omni-flash (35B-A3B) de tamanho semelhante, e iguala o desempenho do significativamente maior Qwen3.5-omni-plus. Em avaliações como Fleurs, Kespeech e LibriSpeech para reconhecimento de fala chinês-inglesa, multilíngue e multidialeto, ele supera o Gemini-3.1 Pro e alcança o estado da arte (SOTA) no conjunto de testes chinês do Fleurs.
A iFLYTEK reconhece que, embora esta versão mantenha um desempenho forte em tarefas de conhecimento geral, matemática e programação, há espaço para melhoria na execução de instruções, diálogo e compreensão de áudio. As atualizações futuras focarão no fortalecimento dessas áreas. O Spark-Audio-1.0-Preview já está disponível para experiência pública, com acesso à API sendo lançado em breve na Plataforma Aberta da iFLYTEK.
A Zoho ajuda as empresas a adotarem agentes de IA
O mercado está evoluindo rapidamente em direção a agentes baseados em IAA Zoho destaca que a IA está avançando exponencialmente, tornando crucial que as empresas se adaptem e repensem suas operaçõesO
Suno anuncia atualização importante com separação avançada de faixas e suporte para carros
A Suno lançou atualizações significativas em sua plataforma de geração de música por inteligência artificial, aprimorando as experiências na web e no mobile para simplificar a criação e aumentar a usabilidade. A plataforma avança para um estágio mais
Joëlle Pineau, da Cohere, fala sobre IA soberana e segurança corporativa
Uma pesquisa da IDC encomendada pela Cohere explora a IA soberana, com a diretora de IA, Joëlle Pineau, apresentando estratégias essenciais para a segurança na nuvem corporativa e a governança de dado











