Hogar
Actualización de la API de voz de OpenAI: mayor precisión en la transcripción y un 40 % más de velocidad en los agentes
OpenAI ha presentado recientemente dos actualizaciones clave de la API para desarrolladores de todo el mundo, diseñadas para mejorar significativamente el rendimiento de los agentes de IA en las interacciones de voz y en los flujos de trabajo de tareas complejas.
En cuanto a los modelos, se han lanzado oficialmente el nuevo modelo en tiempo real gpt-realtime-1.5 y su modelo de audio asociado. Su objetivo principal es mejorar la fiabilidad de los comandos de voz. Según los datos de pruebas internas de OpenAI, el nuevo modelo mejora la precisión de la transcripción de números y letras en aproximadamente un 10 %, aumenta la precisión en tareas lógicas de audio en un 5 % y incrementa la precisión en la ejecución de instrucciones en un 7 %, lo que resuelve de forma eficaz los problemas en los que la IA malinterpreta frases clave o tiene dificultades con comandos de voz complejos.

Desde el punto de vista arquitectónico, la API de respuestas ahora es compatible con el protocolo WebSocket, lo que supone un cambio significativo en la comunicación de la IA. A diferencia de los métodos anteriores, que requerían retransmitir el contexto completo con cada solicitud, WebSocket permite a los desarrolladores establecer una conexión persistente, de modo que el sistema solo envía datos incrementales cuando se genera nueva información.
OpenAI ha señalado que esta mejora es especialmente importante para los agentes de IA complejos que recurren con frecuencia a numerosas herramientas, ya que puede aumentar directamente su velocidad de funcionamiento entre un 20 % y un 40 %.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
OpenAI ha presentado recientemente dos actualizaciones clave de la API para desarrolladores de todo el mundo, diseñadas para mejorar significativamente el rendimiento de los agentes de IA en las interacciones de voz y en los flujos de trabajo de tareas complejas.
En cuanto a los modelos, se han lanzado oficialmente el nuevo modelo en tiempo real gpt-realtime-1.5 y su modelo de audio asociado. Su objetivo principal es mejorar la fiabilidad de los comandos de voz. Según los datos de pruebas internas de OpenAI, el nuevo modelo mejora la precisión de la transcripción de números y letras en aproximadamente un 10 %, aumenta la precisión en tareas lógicas de audio en un 5 % y incrementa la precisión en la ejecución de instrucciones en un 7 %, lo que resuelve de forma eficaz los problemas en los que la IA malinterpreta frases clave o tiene dificultades con comandos de voz complejos.

Desde el punto de vista arquitectónico, la API de respuestas ahora es compatible con el protocolo WebSocket, lo que supone un cambio significativo en la comunicación de la IA. A diferencia de los métodos anteriores, que requerían retransmitir el contexto completo con cada solicitud, WebSocket permite a los desarrolladores establecer una conexión persistente, de modo que el sistema solo envía datos incrementales cuando se genera nueva información.
OpenAI ha señalado que esta mejora es especialmente importante para los agentes de IA complejos que recurren con frecuencia a numerosas herramientas, ya que puede aumentar directamente su velocidad de funcionamiento entre un 20 % y un 40 %.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











