Lar
A OpenAI apresenta três modelos de reconhecimento de fala em tempo real com capacidade de raciocínio comparável à do GPT-5

A OpenAI, gigante da IA, mais uma vez ampliou as fronteiras da tecnologia de voz com o lançamento oficial de três novos modelos de voz em tempo real: GPT-Realtime-2, GPT-Realtime-Translate e GPT-Realtime-Whisper. Esses modelos agora estão integrados à API Realtime para desenvolvedores, visando resolver desafios comuns na interação por voz, como alta latência, falta de tratamento natural de interrupções e problemas de suporte multilíngue.
O destaque deste lançamento é o GPT-Realtime-2, descrito como o modelo de voz de IA mais inteligente até o momento e a primeira ferramenta de voz com raciocínio no nível do GPT-5. Ao contrário dos assistentes de voz convencionais, ele permite conversas altamente naturais e fluidas, ao mesmo tempo em que realiza raciocínio lógico em tempo real, aciona ferramentas externas de maneira integrada e detecta e responde com precisão às interrupções ou correções do usuário. Esse avanço indica que os futuros assistentes de voz evoluirão além de simples executores de comandos, tornando-se parceiros colaborativos em tempo real, capazes de gerenciar tarefas complexas com várias etapas.
O preço do GPT-Realtime-2 está definido em US$ 32 por milhão de tokens para entrada de áudio (aproximadamente 218 RMB) e US$ 64 por milhão de tokens para saída (aproximadamente 436 RMB). Os custos de entrada em cache são significativamente mais baixos, custando apenas US$ 0,4 por milhão de tokens.
Além do modelo central de raciocínio, os outros dois modelos funcionais oferecem recursos distintos. O GPT-Realtime-Translate apresenta excelente desempenho em tradução, suportando conversão em tempo real entre 70 idiomas de entrada e 13 idiomas de saída. Sua velocidade de tradução quase acompanha o ritmo do locutor, tornando-o ideal para cenários de comunicação em tempo real de alta demanda, como reuniões internacionais. O GPT-Realtime-Whisper concentra-se na transcrição de streaming com latência ultrabaixa, proporcionando uma experiência em que “a voz acompanha a pessoa”, o que reduz significativamente os tempos de espera para anotações de reuniões e legendas ao vivo. Esses dois modelos utilizam um sistema de cobrança mais flexível, com tarifas por minuto de US$ 0,034 e US$ 0,017, respectivamente.
Analistas do setor veem as últimas iniciativas da OpenAI como uma mudança na interação de voz por IA, passando de “respostas simples” para “compreensão profunda em tempo real”, consolidando ainda mais a liderança tecnológica da empresa na era da inteligência.
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (0)

A OpenAI, gigante da IA, mais uma vez ampliou as fronteiras da tecnologia de voz com o lançamento oficial de três novos modelos de voz em tempo real: GPT-Realtime-2, GPT-Realtime-Translate e GPT-Realtime-Whisper. Esses modelos agora estão integrados à API Realtime para desenvolvedores, visando resolver desafios comuns na interação por voz, como alta latência, falta de tratamento natural de interrupções e problemas de suporte multilíngue.
O destaque deste lançamento é o GPT-Realtime-2, descrito como o modelo de voz de IA mais inteligente até o momento e a primeira ferramenta de voz com raciocínio no nível do GPT-5. Ao contrário dos assistentes de voz convencionais, ele permite conversas altamente naturais e fluidas, ao mesmo tempo em que realiza raciocínio lógico em tempo real, aciona ferramentas externas de maneira integrada e detecta e responde com precisão às interrupções ou correções do usuário. Esse avanço indica que os futuros assistentes de voz evoluirão além de simples executores de comandos, tornando-se parceiros colaborativos em tempo real, capazes de gerenciar tarefas complexas com várias etapas.
O preço do GPT-Realtime-2 está definido em US$ 32 por milhão de tokens para entrada de áudio (aproximadamente 218 RMB) e US$ 64 por milhão de tokens para saída (aproximadamente 436 RMB). Os custos de entrada em cache são significativamente mais baixos, custando apenas US$ 0,4 por milhão de tokens.
Além do modelo central de raciocínio, os outros dois modelos funcionais oferecem recursos distintos. O GPT-Realtime-Translate apresenta excelente desempenho em tradução, suportando conversão em tempo real entre 70 idiomas de entrada e 13 idiomas de saída. Sua velocidade de tradução quase acompanha o ritmo do locutor, tornando-o ideal para cenários de comunicação em tempo real de alta demanda, como reuniões internacionais. O GPT-Realtime-Whisper concentra-se na transcrição de streaming com latência ultrabaixa, proporcionando uma experiência em que “a voz acompanha a pessoa”, o que reduz significativamente os tempos de espera para anotações de reuniões e legendas ao vivo. Esses dois modelos utilizam um sistema de cobrança mais flexível, com tarifas por minuto de US$ 0,034 e US$ 0,017, respectivamente.
Analistas do setor veem as últimas iniciativas da OpenAI como uma mudança na interação de voz por IA, passando de “respostas simples” para “compreensão profunda em tempo real”, consolidando ainda mais a liderança tecnológica da empresa na era da inteligência.
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri











