A OpenAI apresenta modelos de voz avançados para conversas em tempo real mais naturais

A OpenAI lançou novos modelos conversacionais, o GPT-Live-1 e o GPT-Live-1 mini, projetados para soarem mais naturais e gerenciarem a alternância de turnos de forma mais eficaz. Esses modelos full-duplex podem falar e ouvir simultaneamente, permitindo que os usuários interrompam naturalmente e possibilitando recursos como a tradução em tempo real.
A empresa também está implementando o GPT-Live-1 mini como substituto padrão do atual Modo de Voz Avançado no ChatGPT. Os usuários do plano pago terão acesso ao modelo GPT-Live-1, de maior capacidade. Anteriormente, o sistema contava com uma combinação de um modelo de conversão de fala em texto, um grande modelo de linguagem para gerar respostas e um modelo de conversão de texto em fala para produzir o resultado final.
Durante uma coletiva de imprensa, a OpenAI afirmou que os novos modelos resolvem problemas como interromper os usuários enquanto eles estão falando e a falta de inteligência suficiente para responder a perguntas. Os modelos atualizados encaminharão as consultas aos modelos de texto mais recentes, como o GPT-5.5, para tarefas de pesquisa, raciocínio ou agência, mantendo o fluxo da conversa.
A OpenAI também demonstrou que o modelo pode permanecer em silêncio por longos períodos, absorvendo o contexto da conversa até que seja solicitado a responder. Além disso, como o novo modo de voz se integra aos modelos GPT mais recentes, ele pode apresentar informações visualmente. Outras startups, como a Monogram — que levantou US$ 40 milhões em financiamento inicial da DST e da Lux Capital —, também estão se concentrando em respostas visuais para tornar os assistentes mais interativos.
A empresa observou que o novo modo de voz no ChatGPT foi desenvolvido para conversas mais longas. Na coletiva, o líder de produto do ChatGPT Voice, Atty Eleti, mencionou ter mantido conversas de 30 a 40 minutos com o recurso de voz durante caminhadas.
A OpenAI acredita que a voz pode se tornar a interface principal para tarefas computacionais complexas. Relatos sugerem que a empresa pode lançar fones de ouvido com inteligência artificial ainda este ano, embora não tenham sido fornecidos detalhes sobre os produtos de hardware.
“Com o tempo, acreditamos que isso também abrirá a possibilidade de usar a voz como uma espécie de interface principal para a computação e para gerenciar tarefas autônomas cada vez mais complexas e de longa duração. Considerando os casos de uso incríveis que vemos as pessoas realizando com o Codex e o ChatGPT, acreditamos que a voz pode ser a interface do futuro para todos os tipos de trabalho”, disse Eleti.
A OpenAI vem aprimorando os recursos baseados em voz nos últimos anos para tornar o modo de voz do ChatGPT mais natural. A empresa informa que mais de 150 milhões de pessoas usam os recursos de voz e ditado para interagir com o ChatGPT.
Os concorrentes também estão trabalhando para tornar seus assistentes mais expressivos.
Tanto a Apple quanto a Amazon atualizaram seus assistentes para torná-los mais coloquiais, com melhor tratamento do contexto. Startups como a Sesame, cofundada por Brendan Iribe, cofundador da Oculus, e Ankit Kumar, lançaram assistentes de IA que mantêm conversas mais naturais enquanto realizam tarefas em segundo plano.
A OpenAI está seguindo um caminho semelhante, com o objetivo de permitir que os usuários interajam com seu assistente sem usar as mãos por períodos mais longos. Apesar de afirmar que o novo modo de voz soa mais natural, a empresa enfatizou que ele não foi projetado para ser um companheiro de IA. Ela observou que os novos modelos incluem medidas de segurança para fornecer respostas adequadas à idade dos adolescentes e oferecer recursos caso as conversas abordem temas como automutilação.
O novo modo de voz ainda tem espaço para melhorias. Durante uma demonstração do recurso de tradução em tempo real para o hindi, o assistente falou com um sotaque americano acentuado e usou um hindi pouco natural e um pouco rebuscado. A empresa afirmou que o modo está otimizado para “a maioria das línguas faladas”, mas não especificou quais.
Artigo relacionado
A Warner Music adquire a startup de atribuição de IA Sureel AI
A Warner Music Group (WMG) confirmou na quarta-feira que está adquirindo a Sureel AI, uma startup de atribuição por inteligência artificial. A tecnologia proprietária da Sureel gera “DNA de IA” para faixas musicais, desconstruindo-as em elementos con
A Amazon apresenta a Alexa para Compras, enquanto coloca o Rufus em segundo plano
A Amazon lançou a Alexa para Compras, integrando seu chatbot de compras Rufus com o Alexa+ em todo o aplicativo, site e dispositivos Echo Show.O assistente responde a consultas sobre produtos, compara itens, rastreia preços e oferece suporte para le
A Microsoft, o Azure e a tecnologia de IA combatem os riscos de incêndios florestais na Califórnia
A Microsoft investe na detecção de incêndios florestais com tecnologia de IA, e Juan Lavista Ferres, vice-presidente corporativo e cientista-chefe de dados, discute estratégias para mitigar os danos a
Recomendações de tópicos especiais relacionados
Comentários (0)

A OpenAI lançou novos modelos conversacionais, o GPT-Live-1 e o GPT-Live-1 mini, projetados para soarem mais naturais e gerenciarem a alternância de turnos de forma mais eficaz. Esses modelos full-duplex podem falar e ouvir simultaneamente, permitindo que os usuários interrompam naturalmente e possibilitando recursos como a tradução em tempo real.
A empresa também está implementando o GPT-Live-1 mini como substituto padrão do atual Modo de Voz Avançado no ChatGPT. Os usuários do plano pago terão acesso ao modelo GPT-Live-1, de maior capacidade. Anteriormente, o sistema contava com uma combinação de um modelo de conversão de fala em texto, um grande modelo de linguagem para gerar respostas e um modelo de conversão de texto em fala para produzir o resultado final.
Durante uma coletiva de imprensa, a OpenAI afirmou que os novos modelos resolvem problemas como interromper os usuários enquanto eles estão falando e a falta de inteligência suficiente para responder a perguntas. Os modelos atualizados encaminharão as consultas aos modelos de texto mais recentes, como o GPT-5.5, para tarefas de pesquisa, raciocínio ou agência, mantendo o fluxo da conversa.
A OpenAI também demonstrou que o modelo pode permanecer em silêncio por longos períodos, absorvendo o contexto da conversa até que seja solicitado a responder. Além disso, como o novo modo de voz se integra aos modelos GPT mais recentes, ele pode apresentar informações visualmente. Outras startups, como a Monogram — que levantou US$ 40 milhões em financiamento inicial da DST e da Lux Capital —, também estão se concentrando em respostas visuais para tornar os assistentes mais interativos.
A empresa observou que o novo modo de voz no ChatGPT foi desenvolvido para conversas mais longas. Na coletiva, o líder de produto do ChatGPT Voice, Atty Eleti, mencionou ter mantido conversas de 30 a 40 minutos com o recurso de voz durante caminhadas.
A OpenAI acredita que a voz pode se tornar a interface principal para tarefas computacionais complexas. Relatos sugerem que a empresa pode lançar fones de ouvido com inteligência artificial ainda este ano, embora não tenham sido fornecidos detalhes sobre os produtos de hardware.
“Com o tempo, acreditamos que isso também abrirá a possibilidade de usar a voz como uma espécie de interface principal para a computação e para gerenciar tarefas autônomas cada vez mais complexas e de longa duração. Considerando os casos de uso incríveis que vemos as pessoas realizando com o Codex e o ChatGPT, acreditamos que a voz pode ser a interface do futuro para todos os tipos de trabalho”, disse Eleti.
A OpenAI vem aprimorando os recursos baseados em voz nos últimos anos para tornar o modo de voz do ChatGPT mais natural. A empresa informa que mais de 150 milhões de pessoas usam os recursos de voz e ditado para interagir com o ChatGPT.
Os concorrentes também estão trabalhando para tornar seus assistentes mais expressivos.
Tanto a Apple quanto a Amazon atualizaram seus assistentes para torná-los mais coloquiais, com melhor tratamento do contexto. Startups como a Sesame, cofundada por Brendan Iribe, cofundador da Oculus, e Ankit Kumar, lançaram assistentes de IA que mantêm conversas mais naturais enquanto realizam tarefas em segundo plano.
A OpenAI está seguindo um caminho semelhante, com o objetivo de permitir que os usuários interajam com seu assistente sem usar as mãos por períodos mais longos. Apesar de afirmar que o novo modo de voz soa mais natural, a empresa enfatizou que ele não foi projetado para ser um companheiro de IA. Ela observou que os novos modelos incluem medidas de segurança para fornecer respostas adequadas à idade dos adolescentes e oferecer recursos caso as conversas abordem temas como automutilação.
O novo modo de voz ainda tem espaço para melhorias. Durante uma demonstração do recurso de tradução em tempo real para o hindi, o assistente falou com um sotaque americano acentuado e usou um hindi pouco natural e um pouco rebuscado. A empresa afirmou que o modo está otimizado para “a maioria das línguas faladas”, mas não especificou quais.
A Warner Music adquire a startup de atribuição de IA Sureel AI
A Warner Music Group (WMG) confirmou na quarta-feira que está adquirindo a Sureel AI, uma startup de atribuição por inteligência artificial. A tecnologia proprietária da Sureel gera “DNA de IA” para faixas musicais, desconstruindo-as em elementos con
A Microsoft, o Azure e a tecnologia de IA combatem os riscos de incêndios florestais na Califórnia
A Microsoft investe na detecção de incêndios florestais com tecnologia de IA, e Juan Lavista Ferres, vice-presidente corporativo e cientista-chefe de dados, discute estratégias para mitigar os danos a





Lar






