A OpenAI prepara um novo modelo de voz bidirecional GPT-Bidi-1
A OpenAI estaria preparando o lançamento do GPT-Bidi-1, um modelo de áudio bidirecional de próxima geração projetado para revolucionar as capacidades de voz do ChatGPT. Ao adotar uma arquitetura bidirecional, este avanço elimina as limitações da comunicação simplex tradicional, permitindo que o sistema ouça e fale simultaneamente. Isso possibilita a captura em tempo real de interrupções do usuário e ajustes semânticos dinâmicos sem gagueira, melhorando significativamente o fluxo natural das interações de voz ao vivo.

O progresso do desenvolvimento indica que a OpenAI já integrou o código base deste modelo nas plataformas web e móveis. O novo recurso coexistirá com o Advanced Voice Mode existente, oferecendo aos usuários a flexibilidade de alternar para o modo "Bidi" atualizado conforme sua conveniência. Além disso, o modelo introduz três níveis distintos de desempenho — Alto, Médio e Instantâneo — permitindo que os usuários equilibrem a profundidade da interação contra a velocidade de resposta com base em suas necessidades específicas.

Este salto tecnológico vai além de meras melhorias na qualidade do áudio, servindo como um componente crítico da estratégia multimodal mais ampla da OpenAI.
Embora os modelos de texto da OpenAI tenham avançado para o GPT-5.5 com raciocínio aprimorado, suas capacidades de voz ficaram para trás, criando uma disparidade na experiência multimodal geral. A introdução do GPT-Bidi-1 aborda essa lacuna, destacando a visão estratégica da OpenAI de posicionar a voz como uma interface primária para a IA de próxima geração. Este avanço também estabelece uma base técnica vital para dispositivos de hardware futuros focados em áudio e ferramentas de suporte a voz de nível empresarial.
Artigo relacionado
A Anthropic confirma que a conta do Claude foi hackeada após os usuários perderem o acesso
Múltiplos usuários do Claude relataram recentemente nas redes sociais que as cotas de suas contas estavam sendo esgotadas rapidamente sem qualquer uso ativo. A investigação da Anthropic revelou que hackers obtiveram acesso não autorizado às contas de
A OpenAI Lança Grupo Consultivo de Matemática e IA; Modelo Misterioso Resolve 100 Problemas de Nível Mundial em 24 Dias
Em 22 de setembro, a OpenAI anunciou a formação de um “Grupo Consultivo sobre Matemática e Inteligência Artificial”. Com sede no Instituto de Estudos Avançados de Princeton, este órgão independente é composto por nove matemáticos que atuam separadame
Senspeech X2.5 Twin Stars: Primeiro contexto de um milhão de tokens na borda, totalmente treinado com poder computacional nacional
No dia 1º de setembro, a subsidiária integral da iFLYTEK, Ciyuan Xinghuo, lançou oficialmente e disponibilizou como código aberto dois grandes modelos gerais de borda: Xinghuo X2.5-4B e Xinghuo X2.5-1.7B. Estes modelos são os primeiros do seu gênero
Recomendações de tópicos especiais relacionados
Comentários (0)
A OpenAI estaria preparando o lançamento do GPT-Bidi-1, um modelo de áudio bidirecional de próxima geração projetado para revolucionar as capacidades de voz do ChatGPT. Ao adotar uma arquitetura bidirecional, este avanço elimina as limitações da comunicação simplex tradicional, permitindo que o sistema ouça e fale simultaneamente. Isso possibilita a captura em tempo real de interrupções do usuário e ajustes semânticos dinâmicos sem gagueira, melhorando significativamente o fluxo natural das interações de voz ao vivo.

O progresso do desenvolvimento indica que a OpenAI já integrou o código base deste modelo nas plataformas web e móveis. O novo recurso coexistirá com o Advanced Voice Mode existente, oferecendo aos usuários a flexibilidade de alternar para o modo "Bidi" atualizado conforme sua conveniência. Além disso, o modelo introduz três níveis distintos de desempenho — Alto, Médio e Instantâneo — permitindo que os usuários equilibrem a profundidade da interação contra a velocidade de resposta com base em suas necessidades específicas.

Este salto tecnológico vai além de meras melhorias na qualidade do áudio, servindo como um componente crítico da estratégia multimodal mais ampla da OpenAI.
Embora os modelos de texto da OpenAI tenham avançado para o GPT-5.5 com raciocínio aprimorado, suas capacidades de voz ficaram para trás, criando uma disparidade na experiência multimodal geral. A introdução do GPT-Bidi-1 aborda essa lacuna, destacando a visão estratégica da OpenAI de posicionar a voz como uma interface primária para a IA de próxima geração. Este avanço também estabelece uma base técnica vital para dispositivos de hardware futuros focados em áudio e ferramentas de suporte a voz de nível empresarial.
A Anthropic confirma que a conta do Claude foi hackeada após os usuários perderem o acesso
Múltiplos usuários do Claude relataram recentemente nas redes sociais que as cotas de suas contas estavam sendo esgotadas rapidamente sem qualquer uso ativo. A investigação da Anthropic revelou que hackers obtiveram acesso não autorizado às contas de
A OpenAI Lança Grupo Consultivo de Matemática e IA; Modelo Misterioso Resolve 100 Problemas de Nível Mundial em 24 Dias
Em 22 de setembro, a OpenAI anunciou a formação de um “Grupo Consultivo sobre Matemática e Inteligência Artificial”. Com sede no Instituto de Estudos Avançados de Princeton, este órgão independente é composto por nove matemáticos que atuam separadame
Senspeech X2.5 Twin Stars: Primeiro contexto de um milhão de tokens na borda, totalmente treinado com poder computacional nacional
No dia 1º de setembro, a subsidiária integral da iFLYTEK, Ciyuan Xinghuo, lançou oficialmente e disponibilizou como código aberto dois grandes modelos gerais de borda: Xinghuo X2.5-4B e Xinghuo X2.5-1.7B. Estes modelos são os primeiros do seu gênero





Lar






