OpenAI presenta sus capacidades de inteligencia vocal a través de su API

OpenAI anunció el jueves que su API ahora incluye varias nuevas funciones de inteligencia vocal, diseñadas para ayudar a los desarrolladores a crear aplicaciones capaces de hablar, transcribir y traducir conversaciones.
El nuevo modelo de voz de la empresa, GPT-Realtime-2, es otro ejemplo de esta tecnología; está diseñado para generar una simulación vocal realista que pueda interactuar con los usuarios en conversaciones. Sin embargo, a diferencia de su predecesor (GPT-Realtime-1.5), esta versión incorpora el razonamiento del nivel GPT-5, algo que OpenAI afirma fue desarrollado para manejar solicitudes de usuario más complejas.
La empresa también está lanzando GPT-Realtime-Translate, que, como su nombre indica, ofrece servicios de traducción en tiempo real que se mantienen al ritmo de la conversación. Esta función soporta más de 70 idiomas de entrada y 13 idiomas de salida.
Finalmente, OpenAI ha introducido una nueva capacidad de transcripción llamada GPT-Realtime-Whisper, que proporciona funcionalidad de conversión de voz a texto en tiempo real, capturando las palabras a medida que ocurren las interacciones.
“Juntos, los modelos que estamos lanzando llevan el audio en tiempo real desde interfaces simples de pregunta y respuesta hacia interfaces vocales que realmente pueden realizar tareas: escuchar, razonar, traducir, transcribir y tomar acciones a medida que avanza la conversación”, dijo la empresa.
¿Quién se beneficiará de estas actualizaciones? Las empresas que busquen expandir sus capacidades de servicio al cliente son un público obvio. No obstante, OpenAI también señala que las nuevas funciones serán útiles en una amplia gama de áreas, incluyendo la educación, los medios, los eventos y las plataformas para creadores.
Aunque estas herramientas sean muy útiles desde el punto de vista empresarial, también existe el potencial de su uso indebido. La empresa afirma haber establecido medidas de protección para evitar que sus nuevas funciones se utilicen con fines de spam, fraude u otros tipos de abuso en línea. Se han incorporado mecanismos específicos en el sistema para que “las conversaciones puedan ser interrumpidas si se detecta que violan nuestras directrices contra contenido dañino”, según OpenAI.
Todos los nuevos modelos de voz están incluidos en la API en tiempo real de OpenAI. Translate y Whisper se facturan por minuto, mientras que GPT-Realtime-2 se factura según el consumo de tokens.
Artículo relacionado
OpenAI lanza una versión más segura de ChatGPT para adolescentes, años después de que estos empezaran a utilizarla
Tras una serie de demandas relacionadas con la ausencia de protocolos de seguridad en los chatbots de IA —que contribuyeron a suicidios de adolescentes y otras crisis de salud mental—, OpenAI presentó
Frontier AI Labs se niega a revelar las estrategias de contención para los modelos rebeldes
Investigaciones recientes indican que muy pocos laboratorios líderes en IA han publicado o demostrado planes de respuesta de contención. Un plan de contención define los procedimientos a seguir cuando
El Tiffany de NEA: Las empresas aún luchan con el ROI de la IA
Cargando el reproductor…A principios de este año, el «tokenmaxxing» dominó Silicon Valley, con directores generales instando al personal a maximizar el uso de la inteligencia artificial. Ese entusiasmo se topó rápidamente con la realidad. Según info
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

OpenAI anunció el jueves que su API ahora incluye varias nuevas funciones de inteligencia vocal, diseñadas para ayudar a los desarrolladores a crear aplicaciones capaces de hablar, transcribir y traducir conversaciones.
El nuevo modelo de voz de la empresa, GPT-Realtime-2, es otro ejemplo de esta tecnología; está diseñado para generar una simulación vocal realista que pueda interactuar con los usuarios en conversaciones. Sin embargo, a diferencia de su predecesor (GPT-Realtime-1.5), esta versión incorpora el razonamiento del nivel GPT-5, algo que OpenAI afirma fue desarrollado para manejar solicitudes de usuario más complejas.
La empresa también está lanzando GPT-Realtime-Translate, que, como su nombre indica, ofrece servicios de traducción en tiempo real que se mantienen al ritmo de la conversación. Esta función soporta más de 70 idiomas de entrada y 13 idiomas de salida.
Finalmente, OpenAI ha introducido una nueva capacidad de transcripción llamada GPT-Realtime-Whisper, que proporciona funcionalidad de conversión de voz a texto en tiempo real, capturando las palabras a medida que ocurren las interacciones.
“Juntos, los modelos que estamos lanzando llevan el audio en tiempo real desde interfaces simples de pregunta y respuesta hacia interfaces vocales que realmente pueden realizar tareas: escuchar, razonar, traducir, transcribir y tomar acciones a medida que avanza la conversación”, dijo la empresa.
¿Quién se beneficiará de estas actualizaciones? Las empresas que busquen expandir sus capacidades de servicio al cliente son un público obvio. No obstante, OpenAI también señala que las nuevas funciones serán útiles en una amplia gama de áreas, incluyendo la educación, los medios, los eventos y las plataformas para creadores.
Aunque estas herramientas sean muy útiles desde el punto de vista empresarial, también existe el potencial de su uso indebido. La empresa afirma haber establecido medidas de protección para evitar que sus nuevas funciones se utilicen con fines de spam, fraude u otros tipos de abuso en línea. Se han incorporado mecanismos específicos en el sistema para que “las conversaciones puedan ser interrumpidas si se detecta que violan nuestras directrices contra contenido dañino”, según OpenAI.
Todos los nuevos modelos de voz están incluidos en la API en tiempo real de OpenAI. Translate y Whisper se facturan por minuto, mientras que GPT-Realtime-2 se factura según el consumo de tokens.
OpenAI lanza una versión más segura de ChatGPT para adolescentes, años después de que estos empezaran a utilizarla
Tras una serie de demandas relacionadas con la ausencia de protocolos de seguridad en los chatbots de IA —que contribuyeron a suicidios de adolescentes y otras crisis de salud mental—, OpenAI presentó
Frontier AI Labs se niega a revelar las estrategias de contención para los modelos rebeldes
Investigaciones recientes indican que muy pocos laboratorios líderes en IA han publicado o demostrado planes de respuesta de contención. Un plan de contención define los procedimientos a seguir cuando
El Tiffany de NEA: Las empresas aún luchan con el ROI de la IA
Cargando el reproductor…A principios de este año, el «tokenmaxxing» dominó Silicon Valley, con directores generales instando al personal a maximizar el uso de la inteligencia artificial. Ese entusiasmo se topó rápidamente con la realidad. Según info





Hogar






