Lar
A NVIDIA apresenta o modelo de inteligência unificada de áudio Nemotron-Labs-Audex-30B-A3B

As grandes modelos multimodais evoluem rapidamente, as capacidades de processamento de áudio são frequentemente comprometidas — muitos modelos melhoram a compreensão de áudio em detrimento da lógica textual. Para resolver isso, pesquisadores da NVIDIA apresentaram o Nemotron-Labs-Audex-30B-A3B (Audex), um grande modelo de linguagem unificado de áudio-texto projetado para preencher essa lacuna.
O Audex emprega um design simplificado e eficiente, construído sobre uma arquitetura robusta de Mistura de Especialistas (MoE) puramente textual. Ao utilizar um único decodificador Transformer, ele processa tokens de texto e tokens de áudio quantizados simultaneamente. Essa abordagem projeta as entradas de áudio no espaço de incorporação de texto, garantindo integração perfeita com a infraestrutura existente de LLMs para tarefas multimodais e alcançando uma integração profunda verdadeira.
O treinamento envolveu conjuntos de dados extensos compostos por 157,4 bilhões de tokens de áudio e 320,5 bilhões de tokens de texto. Através de treinamento supervisionado em múltiplas etapas, Aprendizado por Reforço em Cascata puramente textual e destilação de conhecimento em política de múltiplos domínios, o Audex alcança desempenho líder na indústria em compreensão de áudio, reconhecimento de fala, tradução e geração. Crucialmente, ele preserva as capacidades principais do LLM original em raciocínio, alinhamento, recuperação de conhecimento e processamento de texto longo com degradação mínima.
Como um modelo de código aberto, o Audex marca um marco significativo para o setor de tecnologia de voz. Indo além da pesquisa teórica, ele oferece uma solução madura para que desenvolvedores avaliem e implantem diretamente. Para aqueles que gerenciam interações de áudio complexas, o Audex fornece uma opção equilibrada que melhora o desempenho enquanto abre novas vias para a pesquisa de inteligência multimodal.
Artigo relacionado
A Fireworks AI apresenta o FireRouter com Opus: reduz os custos de codificação em 57% com uma queda mínima na precisão
A Fireworks AI apresentou o FireRouter com Opus, o primeiro sistema de roteamento consciente de cache do setor, desenvolvido especificamente para a série Claude Opus. Agora disponível por meio de um endpoint serverless, este modelo de roteamento inde
Como corrigir as Core Web Vitals para o SEO móvel
Impulsione o SEO Local: Construa Pilhas de Nuvem de Entidades do Google DriveSumário:IntroduçãoCompreendendo o Empilhamento de Nuvem de Entidades do GooglePrincipais Benefícios do Empilhamento de Nuvem de Entidades do GoogleComeçando com Pilhas
A Moonshot AI do Kimi arrecada mais de US$ 3,5 bilhões na Série F, atingindo uma avaliação de US$ 35 bilhões
A Kimi da Moonshot AI concluiu com sucesso sua rodada de financiamento Série F, garantindo mais de US$ 3,5 bilhões e alcançando uma avaliação pós-investimento de US$ 35 bilhões, conforme relatado pelo Sci-Tech Daily.Impulsionada pela demanda por ass
Recomendações de tópicos especiais relacionados
Comentários (0)

As grandes modelos multimodais evoluem rapidamente, as capacidades de processamento de áudio são frequentemente comprometidas — muitos modelos melhoram a compreensão de áudio em detrimento da lógica textual. Para resolver isso, pesquisadores da NVIDIA apresentaram o Nemotron-Labs-Audex-30B-A3B (Audex), um grande modelo de linguagem unificado de áudio-texto projetado para preencher essa lacuna.
O Audex emprega um design simplificado e eficiente, construído sobre uma arquitetura robusta de Mistura de Especialistas (MoE) puramente textual. Ao utilizar um único decodificador Transformer, ele processa tokens de texto e tokens de áudio quantizados simultaneamente. Essa abordagem projeta as entradas de áudio no espaço de incorporação de texto, garantindo integração perfeita com a infraestrutura existente de LLMs para tarefas multimodais e alcançando uma integração profunda verdadeira.
O treinamento envolveu conjuntos de dados extensos compostos por 157,4 bilhões de tokens de áudio e 320,5 bilhões de tokens de texto. Através de treinamento supervisionado em múltiplas etapas, Aprendizado por Reforço em Cascata puramente textual e destilação de conhecimento em política de múltiplos domínios, o Audex alcança desempenho líder na indústria em compreensão de áudio, reconhecimento de fala, tradução e geração. Crucialmente, ele preserva as capacidades principais do LLM original em raciocínio, alinhamento, recuperação de conhecimento e processamento de texto longo com degradação mínima.
Como um modelo de código aberto, o Audex marca um marco significativo para o setor de tecnologia de voz. Indo além da pesquisa teórica, ele oferece uma solução madura para que desenvolvedores avaliem e implantem diretamente. Para aqueles que gerenciam interações de áudio complexas, o Audex fornece uma opção equilibrada que melhora o desempenho enquanto abre novas vias para a pesquisa de inteligência multimodal.
A Fireworks AI apresenta o FireRouter com Opus: reduz os custos de codificação em 57% com uma queda mínima na precisão
A Fireworks AI apresentou o FireRouter com Opus, o primeiro sistema de roteamento consciente de cache do setor, desenvolvido especificamente para a série Claude Opus. Agora disponível por meio de um endpoint serverless, este modelo de roteamento inde
Como corrigir as Core Web Vitals para o SEO móvel
Impulsione o SEO Local: Construa Pilhas de Nuvem de Entidades do Google DriveSumário:IntroduçãoCompreendendo o Empilhamento de Nuvem de Entidades do GooglePrincipais Benefícios do Empilhamento de Nuvem de Entidades do GoogleComeçando com Pilhas
A Moonshot AI do Kimi arrecada mais de US$ 3,5 bilhões na Série F, atingindo uma avaliação de US$ 35 bilhões
A Kimi da Moonshot AI concluiu com sucesso sua rodada de financiamento Série F, garantindo mais de US$ 3,5 bilhões e alcançando uma avaliação pós-investimento de US$ 35 bilhões, conforme relatado pelo Sci-Tech Daily.Impulsionada pela demanda por ass











