Lar
Modelo de linguagem de grande porte do Alibaba lidera os rankings globais e conquista a “tríplice coroa” nacional em IA

Em 28 de maio de 2026, a Artificial Analysis, uma plataforma líder em avaliação de IA, publicou seu mais recente ranking da Speech Arena. A Alibaba alcançou um avanço notável com seu grande modelo de voz Fun-Realtime-TTS-Preview, conquistando o quinto lugar globalmente e o primeiro na China, com uma pontuação Elo de 1.190.
1. Liderança abrangente: liderança em três categorias principais de voz
Nesta avaliação, o sistema de tecnologia de voz da Alibaba apresentou um forte desempenho geral, ficando em primeiro lugar na China em três categorias-chave de IA de voz:
ASR (Reconhecimento Automático de Fala): Alcançou a primeira colocação nacional em precisão e robustez na conversão de fala em texto, demonstrando a capacidade da Alibaba de compreender ambientes de áudio complexos.
Chat (Compreensão de Fala e Diálogo de Ponta a Ponta): Obteve a primeira colocação nacional em fluência, lógica e velocidade de resposta em conversas de voz em tempo real, refletindo as capacidades líderes do setor da Alibaba na interação com assistentes inteligentes.
TTS (Text-to-Speech): Nesta área competitiva essencial, o Fun-Realtime-TTS-Preview não apenas estabeleceu novos recordes nacionais em naturalidade, expressão emocional e velocidade de renderização, mas também se tornou uma referência global.
2. Avanço tecnológico: avanços em tempo real com o Fun-Realtime
O principal destaque neste ranking —o Fun-Realtime-TTS-Preview— marca um grande avanço da equipe de voz do Alibaba na síntese de fala em tempo real.
Anteriormente, a síntese de fala frequentemente enfrentava dificuldades para equilibrar alta naturalidade com resposta rápida. O modelo da Alibaba, no entanto, conseguiu produzir saídas de fala com entonação quase humana e latência na ordem de milissegundos por meio de uma arquitetura profunda de ponta a ponta. Essa capacidade em tempo real é fundamental para aplicações em que o tempo é essencial, como interações em carros inteligentes, transmissões ao vivo com humanos digitais, tradução em tempo real e atendimento ao cliente.
3. Perspectivas do setor: a tecnologia de voz da China avança em direção à “inteligência profunda”
Como pioneira no campo da IA, a Artificial Analysis emprega um sistema de pontuação altamente rigoroso que avalia o desempenho do modelo em conjuntos de teste e, mais importante ainda, enfatiza a experiência do usuário em cenários do mundo real. Os “três campeonatos” da Alibaba vão além de meras pontuações, transmitindo as seguintes percepções-chave:
A IA de fala entra na “era dos grandes modelos”: as tecnologias de fala anteriores dependiam em grande parte de métodos estatísticos tradicionais ou de modelos pequenos. O sucesso da Alibaba demonstra que incorporar o processamento de fala a uma base de grandes modelos de aprendizado profundo pode proporcionar um salto significativo na qualidade da percepção.
“Velocidade chinesa” na implementação de cenários: Com a Alibaba liderando tanto na compreensão quanto na geração de fala, os futuros ecossistemas de hardware inteligente e de grandes modelos na China ganharão maior competitividade global na área central da “interação por voz”.
Ilustração das capacidades de ciclo fechado: Do reconhecimento (ASR) à compreensão (Chat) e, em seguida, à síntese (TTS), a Alibaba construiu um fluxo completo de interação por voz, fornecendo uma base sólida para o desenvolvimento de agentes de IA integrados (Agentes).
Por meio do desenvolvimento técnico contínuo de baixo para cima e da iteração de modelos no domínio da voz, a IA na China está avançando para águas mais profundas — passando de “ser capaz de reconhecer” para “compreender as emoções humanas e a lógica da interação” em um nível mais profundo.
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (0)

Em 28 de maio de 2026, a Artificial Analysis, uma plataforma líder em avaliação de IA, publicou seu mais recente ranking da Speech Arena. A Alibaba alcançou um avanço notável com seu grande modelo de voz Fun-Realtime-TTS-Preview, conquistando o quinto lugar globalmente e o primeiro na China, com uma pontuação Elo de 1.190.
1. Liderança abrangente: liderança em três categorias principais de voz
Nesta avaliação, o sistema de tecnologia de voz da Alibaba apresentou um forte desempenho geral, ficando em primeiro lugar na China em três categorias-chave de IA de voz:
ASR (Reconhecimento Automático de Fala): Alcançou a primeira colocação nacional em precisão e robustez na conversão de fala em texto, demonstrando a capacidade da Alibaba de compreender ambientes de áudio complexos.
Chat (Compreensão de Fala e Diálogo de Ponta a Ponta): Obteve a primeira colocação nacional em fluência, lógica e velocidade de resposta em conversas de voz em tempo real, refletindo as capacidades líderes do setor da Alibaba na interação com assistentes inteligentes.
TTS (Text-to-Speech): Nesta área competitiva essencial, o Fun-Realtime-TTS-Preview não apenas estabeleceu novos recordes nacionais em naturalidade, expressão emocional e velocidade de renderização, mas também se tornou uma referência global.
2. Avanço tecnológico: avanços em tempo real com o Fun-Realtime
O principal destaque neste ranking —o Fun-Realtime-TTS-Preview— marca um grande avanço da equipe de voz do Alibaba na síntese de fala em tempo real.
Anteriormente, a síntese de fala frequentemente enfrentava dificuldades para equilibrar alta naturalidade com resposta rápida. O modelo da Alibaba, no entanto, conseguiu produzir saídas de fala com entonação quase humana e latência na ordem de milissegundos por meio de uma arquitetura profunda de ponta a ponta. Essa capacidade em tempo real é fundamental para aplicações em que o tempo é essencial, como interações em carros inteligentes, transmissões ao vivo com humanos digitais, tradução em tempo real e atendimento ao cliente.
3. Perspectivas do setor: a tecnologia de voz da China avança em direção à “inteligência profunda”
Como pioneira no campo da IA, a Artificial Analysis emprega um sistema de pontuação altamente rigoroso que avalia o desempenho do modelo em conjuntos de teste e, mais importante ainda, enfatiza a experiência do usuário em cenários do mundo real. Os “três campeonatos” da Alibaba vão além de meras pontuações, transmitindo as seguintes percepções-chave:
A IA de fala entra na “era dos grandes modelos”: as tecnologias de fala anteriores dependiam em grande parte de métodos estatísticos tradicionais ou de modelos pequenos. O sucesso da Alibaba demonstra que incorporar o processamento de fala a uma base de grandes modelos de aprendizado profundo pode proporcionar um salto significativo na qualidade da percepção.
“Velocidade chinesa” na implementação de cenários: Com a Alibaba liderando tanto na compreensão quanto na geração de fala, os futuros ecossistemas de hardware inteligente e de grandes modelos na China ganharão maior competitividade global na área central da “interação por voz”.
Ilustração das capacidades de ciclo fechado: Do reconhecimento (ASR) à compreensão (Chat) e, em seguida, à síntese (TTS), a Alibaba construiu um fluxo completo de interação por voz, fornecendo uma base sólida para o desenvolvimento de agentes de IA integrados (Agentes).
Por meio do desenvolvimento técnico contínuo de baixo para cima e da iteração de modelos no domínio da voz, a IA na China está avançando para águas mais profundas — passando de “ser capaz de reconhecer” para “compreender as emoções humanas e a lógica da interação” em um nível mais profundo.
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri











