OpenAI prepara un nuevo modelo de voz bidireccional GPT-Bidi-1
Al parecer, OpenAI se está preparando para lanzar GPT-Bidi-1, un modelo de audio bidireccional de próxima generación diseñado para revolucionar las capacidades de voz de ChatGPT. Al adoptar una arquitectura bidireccional, este avance elimina las limitaciones de la comunicación simplex tradicional, permitiendo que el sistema escuche y hable simultáneamente. Esto posibilita la captura en tiempo real de las interrupciones del usuario y ajustes semánticos dinámicos sin tartamudeos, mejorando significativamente el flujo natural de las interacciones de voz en vivo.

El progreso del desarrollo indica que OpenAI ya ha integrado el código base de este modelo en las plataformas web y móviles. La nueva función coexistirá con el modo de voz avanzado existente, brindando a los usuarios la flexibilidad de cambiar al nuevo modo «Bidi» según su conveniencia. Además, el modelo introduce tres niveles de rendimiento distintos: Alto, Medio e Instantáneo, lo que permite a los usuarios equilibrar la profundidad de la interacción frente a la velocidad de respuesta en función de sus necesidades específicas.

Este salto tecnológico va más allá de las mejoras meramente en la calidad del audio, ya que constituye un componente crítico de la estrategia multimodal más amplia de OpenAI.
Aunque los modelos basados en texto de OpenAI han avanzado hasta GPT-5.5 con capacidades de razonamiento mejoradas, sus capacidades de voz han quedado rezagadas, lo que ha creado una disparidad en la experiencia multimodal general. La introducción de GPT-Bidi-1 aborda esta brecha, subrayando la visión estratégica de OpenAI de posicionar la voz como una interfaz principal para la inteligencia artificial de próxima generación. Este avance también sienta una base técnica vital para futuros dispositivos de hardware centrados en el audio y herramientas empresariales de soporte de voz.
Artículo relacionado
Anthropic confirma que la cuenta de Claude fue hackeada después de que los usuarios perdieran el acceso
Múltiples usuarios de Claude han informado recientemente en redes sociales que sus cuotas de cuenta se estaban agotando rápidamente sin ningún uso activo. La investigación de Anthropic reveló que los hackers obtuvieron acceso no autorizado a las cuen
OpenAI lanza un grupo asesor de matemáticas e inteligencia artificial; un modelo misterioso resuelve 100 problemas de clase mundial en 24 días
El 22 de septiembre, OpenAI anunció la formación de un «Grupo Asesor sobre Matemáticas e Inteligencia Artificial». Con sede en el Instituto de Estudios Avanzados de Princeton, este órgano independiente está compuesto por nueve matemáticos que operan
Senspeech X2.5 Twin Stars: Primer contexto de un millón de tokens en el borde, completamente entrenado con potencia de computación nacional
El 1 de septiembre, la filial de propiedad total de iFLYTEK, Ciyuan Xinghuo, lanzó oficialmente y abrió al código fuente dos modelos grandes generales de borde: Xinghuo X2.5-4B y Xinghuo X2.5-1.7B. Estos modelos son los primeros en su tipo en admitir
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Al parecer, OpenAI se está preparando para lanzar GPT-Bidi-1, un modelo de audio bidireccional de próxima generación diseñado para revolucionar las capacidades de voz de ChatGPT. Al adoptar una arquitectura bidireccional, este avance elimina las limitaciones de la comunicación simplex tradicional, permitiendo que el sistema escuche y hable simultáneamente. Esto posibilita la captura en tiempo real de las interrupciones del usuario y ajustes semánticos dinámicos sin tartamudeos, mejorando significativamente el flujo natural de las interacciones de voz en vivo.

El progreso del desarrollo indica que OpenAI ya ha integrado el código base de este modelo en las plataformas web y móviles. La nueva función coexistirá con el modo de voz avanzado existente, brindando a los usuarios la flexibilidad de cambiar al nuevo modo «Bidi» según su conveniencia. Además, el modelo introduce tres niveles de rendimiento distintos: Alto, Medio e Instantáneo, lo que permite a los usuarios equilibrar la profundidad de la interacción frente a la velocidad de respuesta en función de sus necesidades específicas.

Este salto tecnológico va más allá de las mejoras meramente en la calidad del audio, ya que constituye un componente crítico de la estrategia multimodal más amplia de OpenAI.
Aunque los modelos basados en texto de OpenAI han avanzado hasta GPT-5.5 con capacidades de razonamiento mejoradas, sus capacidades de voz han quedado rezagadas, lo que ha creado una disparidad en la experiencia multimodal general. La introducción de GPT-Bidi-1 aborda esta brecha, subrayando la visión estratégica de OpenAI de posicionar la voz como una interfaz principal para la inteligencia artificial de próxima generación. Este avance también sienta una base técnica vital para futuros dispositivos de hardware centrados en el audio y herramientas empresariales de soporte de voz.
Anthropic confirma que la cuenta de Claude fue hackeada después de que los usuarios perdieran el acceso
Múltiples usuarios de Claude han informado recientemente en redes sociales que sus cuotas de cuenta se estaban agotando rápidamente sin ningún uso activo. La investigación de Anthropic reveló que los hackers obtuvieron acceso no autorizado a las cuen
OpenAI lanza un grupo asesor de matemáticas e inteligencia artificial; un modelo misterioso resuelve 100 problemas de clase mundial en 24 días
El 22 de septiembre, OpenAI anunció la formación de un «Grupo Asesor sobre Matemáticas e Inteligencia Artificial». Con sede en el Instituto de Estudios Avanzados de Princeton, este órgano independiente está compuesto por nueve matemáticos que operan
Senspeech X2.5 Twin Stars: Primer contexto de un millón de tokens en el borde, completamente entrenado con potencia de computación nacional
El 1 de septiembre, la filial de propiedad total de iFLYTEK, Ciyuan Xinghuo, lanzó oficialmente y abrió al código fuente dos modelos grandes generales de borde: Xinghuo X2.5-4B y Xinghuo X2.5-1.7B. Estos modelos son los primeros en su tipo en admitir





Hogar






