Hogar
OpenAI presenta modelos de voz avanzados para conversaciones en tiempo real más naturales

OpenAI ha lanzado nuevos modelos conversacionales, GPT-Live-1 y GPT-Live-1 mini, diseñados para sonar más naturales y gestionar el turno de palabra de forma más eficaz. Estos modelos full-duplex pueden hablar y escuchar al mismo tiempo, lo que permite a los usuarios interrumpir de forma natural y habilita funciones como la traducción en tiempo real.
La empresa también está implantando GPT-Live-1 mini como sustituto por defecto del actual «Modo de voz avanzado» de ChatGPT. Los usuarios del plan de pago tendrán acceso al modelo GPT-Live-1, de mayor capacidad. Anteriormente, el sistema se basaba en una combinación de un modelo de conversión de voz a texto, un modelo de lenguaje a gran escala para generar respuestas y un modelo de conversión de texto a voz para producir el resultado final.
Durante una rueda de prensa, OpenAI afirmó que los nuevos modelos abordan problemas como interrumpir a los usuarios mientras hablan y carecer de la inteligencia suficiente para responder a las preguntas. Los modelos actualizados derivarán las consultas a los modelos de texto más recientes, como el GPT-5.5, para tareas de búsqueda, razonamiento o de agente, al tiempo que mantienen el flujo de la conversación.
OpenAI también ha demostrado que el modelo puede permanecer en silencio durante largos periodos de tiempo, asimilando el contexto de la conversación hasta que se le dirija la palabra. Además, dado que el nuevo modo de voz se integra con los modelos GPT más recientes, puede presentar la información de forma visual. Otras startups, como Monogram —que recaudó 40 millones de dólares en financiación inicial de DST y Lux Capital— también se están centrando en las respuestas visuales para hacer que los asistentes sean más interactivos.
La empresa señaló que el nuevo modo de voz de ChatGPT está diseñado para conversaciones más largas. En la sesión informativa, el responsable de producto de ChatGPT Voice, Atty Eleti, mencionó que mantenía conversaciones de entre 30 y 40 minutos con la función de voz mientras daba un paseo.
OpenAI cree que la voz podría convertirse en la interfaz principal para tareas informáticas complejas. Los informes sugieren que la empresa podría lanzar este año unos auriculares con capacidad de IA, aunque no se han facilitado detalles sobre los productos de hardware.
«Con el tiempo, creemos que esto también abrirá la posibilidad de utilizar la voz como una especie de interfaz principal para la informática y para gestionar tareas automatizadas cada vez más complejas y de larga duración. Teniendo en cuenta los increíbles casos de uso que vemos cuando la gente utiliza Codex y ChatGPT, creemos que la voz puede ser la interfaz del futuro para todo tipo de trabajo», afirmó Eleti.
OpenAI lleva varios años mejorando las funciones basadas en la voz para que el modo de voz de ChatGPT suene más natural. La empresa informa de que más de 150 millones de personas utilizan las funciones de voz y dictado para hablar con ChatGPT.
Los competidores también están trabajando para que sus asistentes sean más expresivos.
Tanto Apple como Amazon han actualizado sus asistentes para que sean más coloquiales, con una mejor gestión del contexto. Startups como Sesame, cofundada por el cofundador de Oculus, Brendan Iribe, y Ankit Kumar, han lanzado asistentes de IA que mantienen conversaciones más naturales mientras realizan tareas en segundo plano.
OpenAI sigue un camino similar, con el objetivo de permitir a los usuarios interactuar con su asistente sin necesidad de usar las manos durante períodos más prolongados. A pesar de afirmar que el nuevo modo de voz suena más natural, la empresa ha hecho hincapié en que no está diseñado como un compañero de IA. Ha señalado que los nuevos modelos incluyen medidas de seguridad para ofrecer respuestas adecuadas a la edad de los adolescentes y proporcionar recursos si las conversaciones abordan temas como las autolesiones.
El nuevo modo de voz aún tiene margen de mejora. Durante una demostración de la función de traducción en directo al hindi, el asistente habló con un marcado acento estadounidense y utilizó un hindi poco natural y ligeramente rebuscado. La empresa afirmó que el modo está optimizado para «la mayoría de los idiomas hablados», pero no especificó cuáles.
Artículo relacionado
Warner Music adquiere la startup de atribución de IA Sureel AI
Warner Music Group (WMG) confirmó el miércoles que está adquiriendo Sureel AI, una startup de atribución de inteligencia artificial. La tecnología propietaria de Sureel genera un «ADN de IA» para las pistas musicales, descomponiéndolas en sus element
Amazon presenta Alexa para Compras mientras relega a Rufus a un segundo plano
Amazon ha lanzado Alexa para Compras, fusionando su chatbot de compras Rufus con Alexa+ en la aplicación, el sitio web y los dispositivos Echo Show.El asistente responde consultas sobre productos, compara artículos, rastrea precios y admite recordat
Microsoft, Azure y la tecnología de IA combaten los riesgos de incendios forestales en California
Microsoft invierte en la detección de incendios forestales basada en la inteligencia artificial; Juan Lavista Ferres, vicepresidente corporativo y científico jefe de datos, analiza estrategias para mi
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

OpenAI ha lanzado nuevos modelos conversacionales, GPT-Live-1 y GPT-Live-1 mini, diseñados para sonar más naturales y gestionar el turno de palabra de forma más eficaz. Estos modelos full-duplex pueden hablar y escuchar al mismo tiempo, lo que permite a los usuarios interrumpir de forma natural y habilita funciones como la traducción en tiempo real.
La empresa también está implantando GPT-Live-1 mini como sustituto por defecto del actual «Modo de voz avanzado» de ChatGPT. Los usuarios del plan de pago tendrán acceso al modelo GPT-Live-1, de mayor capacidad. Anteriormente, el sistema se basaba en una combinación de un modelo de conversión de voz a texto, un modelo de lenguaje a gran escala para generar respuestas y un modelo de conversión de texto a voz para producir el resultado final.
Durante una rueda de prensa, OpenAI afirmó que los nuevos modelos abordan problemas como interrumpir a los usuarios mientras hablan y carecer de la inteligencia suficiente para responder a las preguntas. Los modelos actualizados derivarán las consultas a los modelos de texto más recientes, como el GPT-5.5, para tareas de búsqueda, razonamiento o de agente, al tiempo que mantienen el flujo de la conversación.
OpenAI también ha demostrado que el modelo puede permanecer en silencio durante largos periodos de tiempo, asimilando el contexto de la conversación hasta que se le dirija la palabra. Además, dado que el nuevo modo de voz se integra con los modelos GPT más recientes, puede presentar la información de forma visual. Otras startups, como Monogram —que recaudó 40 millones de dólares en financiación inicial de DST y Lux Capital— también se están centrando en las respuestas visuales para hacer que los asistentes sean más interactivos.
La empresa señaló que el nuevo modo de voz de ChatGPT está diseñado para conversaciones más largas. En la sesión informativa, el responsable de producto de ChatGPT Voice, Atty Eleti, mencionó que mantenía conversaciones de entre 30 y 40 minutos con la función de voz mientras daba un paseo.
OpenAI cree que la voz podría convertirse en la interfaz principal para tareas informáticas complejas. Los informes sugieren que la empresa podría lanzar este año unos auriculares con capacidad de IA, aunque no se han facilitado detalles sobre los productos de hardware.
«Con el tiempo, creemos que esto también abrirá la posibilidad de utilizar la voz como una especie de interfaz principal para la informática y para gestionar tareas automatizadas cada vez más complejas y de larga duración. Teniendo en cuenta los increíbles casos de uso que vemos cuando la gente utiliza Codex y ChatGPT, creemos que la voz puede ser la interfaz del futuro para todo tipo de trabajo», afirmó Eleti.
OpenAI lleva varios años mejorando las funciones basadas en la voz para que el modo de voz de ChatGPT suene más natural. La empresa informa de que más de 150 millones de personas utilizan las funciones de voz y dictado para hablar con ChatGPT.
Los competidores también están trabajando para que sus asistentes sean más expresivos.
Tanto Apple como Amazon han actualizado sus asistentes para que sean más coloquiales, con una mejor gestión del contexto. Startups como Sesame, cofundada por el cofundador de Oculus, Brendan Iribe, y Ankit Kumar, han lanzado asistentes de IA que mantienen conversaciones más naturales mientras realizan tareas en segundo plano.
OpenAI sigue un camino similar, con el objetivo de permitir a los usuarios interactuar con su asistente sin necesidad de usar las manos durante períodos más prolongados. A pesar de afirmar que el nuevo modo de voz suena más natural, la empresa ha hecho hincapié en que no está diseñado como un compañero de IA. Ha señalado que los nuevos modelos incluyen medidas de seguridad para ofrecer respuestas adecuadas a la edad de los adolescentes y proporcionar recursos si las conversaciones abordan temas como las autolesiones.
El nuevo modo de voz aún tiene margen de mejora. Durante una demostración de la función de traducción en directo al hindi, el asistente habló con un marcado acento estadounidense y utilizó un hindi poco natural y ligeramente rebuscado. La empresa afirmó que el modo está optimizado para «la mayoría de los idiomas hablados», pero no especificó cuáles.
Warner Music adquiere la startup de atribución de IA Sureel AI
Warner Music Group (WMG) confirmó el miércoles que está adquiriendo Sureel AI, una startup de atribución de inteligencia artificial. La tecnología propietaria de Sureel genera un «ADN de IA» para las pistas musicales, descomponiéndolas en sus element
Microsoft, Azure y la tecnología de IA combaten los riesgos de incendios forestales en California
Microsoft invierte en la detección de incendios forestales basada en la inteligencia artificial; Juan Lavista Ferres, vicepresidente corporativo y científico jefe de datos, analiza estrategias para mi











