Hogar
OpenAI presenta tres modelos de voz en tiempo real con capacidad de razonamiento al nivel de GPT-5

OpenAI, el gigante de la inteligencia artificial, ha vuelto a ampliar las fronteras de la tecnología de voz con el lanzamiento oficial de tres nuevos modelos de voz en tiempo real: GPT-Realtime-2, GPT-Realtime-Translate y GPT-Realtime-Whisper. Estos modelos ya están integrados en la API Realtime para desarrolladores y abordan retos habituales de la interacción por voz, como la alta latencia, la falta de gestión natural de las interrupciones y los problemas de compatibilidad multilingüe.
La característica más destacada de este lanzamiento es GPT-Realtime-2, descrito como el modelo de voz de IA más inteligente hasta la fecha y la primera herramienta de voz con un nivel de razonamiento equivalente al de GPT-5. A diferencia de los asistentes de voz convencionales, permite mantener conversaciones muy naturales y fluidas, al tiempo que realiza razonamientos lógicos en tiempo real, invoca herramientas externas sin interrupciones y detecta y responde con precisión a las interrupciones o correcciones del usuario. Este avance indica que los futuros asistentes de voz evolucionarán más allá de la simple ejecución de comandos para convertirse en socios colaborativos en tiempo real capaces de gestionar tareas complejas de varios pasos.
El precio de GPT-Realtime-2 se ha fijado en 32 dólares por millón de tokens para la entrada de audio (aproximadamente 218 RMB) y en 64 dólares por millón de tokens para la salida (aproximadamente 436 RMB). Los costes de las entradas almacenadas en caché son significativamente más bajos, de tan solo 0,4 dólares por millón de tokens.
Más allá del modelo de razonamiento principal, los otros dos modelos funcionales ofrecen capacidades diferenciadas. GPT-Realtime-Translate ofrece un excelente rendimiento en traducción, admitiendo la conversión en tiempo real entre 70 idiomas de entrada y 13 idiomas de salida. Su velocidad de traducción casi iguala el ritmo del hablante, lo que lo hace ideal para situaciones de comunicación en tiempo real de alta exigencia, como las reuniones internacionales. GPT-Realtime-Whisper se centra en la transcripción en streaming con latencia ultrabaja, ofreciendo una experiencia en la que «la voz sigue a la persona», lo que reduce significativamente los tiempos de espera para las notas de reuniones y los subtítulos en directo. Estos dos modelos utilizan una facturación más flexible, con un coste por minuto de 0,034 y 0,017 dólares, respectivamente.
Los analistas del sector consideran que las últimas iniciativas de OpenAI suponen un cambio en la interacción de voz mediante IA, pasando de la «respuesta simple» a la «comprensión profunda en tiempo real», lo que consolida aún más el liderazgo tecnológico de la empresa en la era de la inteligencia.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

OpenAI, el gigante de la inteligencia artificial, ha vuelto a ampliar las fronteras de la tecnología de voz con el lanzamiento oficial de tres nuevos modelos de voz en tiempo real: GPT-Realtime-2, GPT-Realtime-Translate y GPT-Realtime-Whisper. Estos modelos ya están integrados en la API Realtime para desarrolladores y abordan retos habituales de la interacción por voz, como la alta latencia, la falta de gestión natural de las interrupciones y los problemas de compatibilidad multilingüe.
La característica más destacada de este lanzamiento es GPT-Realtime-2, descrito como el modelo de voz de IA más inteligente hasta la fecha y la primera herramienta de voz con un nivel de razonamiento equivalente al de GPT-5. A diferencia de los asistentes de voz convencionales, permite mantener conversaciones muy naturales y fluidas, al tiempo que realiza razonamientos lógicos en tiempo real, invoca herramientas externas sin interrupciones y detecta y responde con precisión a las interrupciones o correcciones del usuario. Este avance indica que los futuros asistentes de voz evolucionarán más allá de la simple ejecución de comandos para convertirse en socios colaborativos en tiempo real capaces de gestionar tareas complejas de varios pasos.
El precio de GPT-Realtime-2 se ha fijado en 32 dólares por millón de tokens para la entrada de audio (aproximadamente 218 RMB) y en 64 dólares por millón de tokens para la salida (aproximadamente 436 RMB). Los costes de las entradas almacenadas en caché son significativamente más bajos, de tan solo 0,4 dólares por millón de tokens.
Más allá del modelo de razonamiento principal, los otros dos modelos funcionales ofrecen capacidades diferenciadas. GPT-Realtime-Translate ofrece un excelente rendimiento en traducción, admitiendo la conversión en tiempo real entre 70 idiomas de entrada y 13 idiomas de salida. Su velocidad de traducción casi iguala el ritmo del hablante, lo que lo hace ideal para situaciones de comunicación en tiempo real de alta exigencia, como las reuniones internacionales. GPT-Realtime-Whisper se centra en la transcripción en streaming con latencia ultrabaja, ofreciendo una experiencia en la que «la voz sigue a la persona», lo que reduce significativamente los tiempos de espera para las notas de reuniones y los subtítulos en directo. Estos dos modelos utilizan una facturación más flexible, con un coste por minuto de 0,034 y 0,017 dólares, respectivamente.
Los analistas del sector consideran que las últimas iniciativas de OpenAI suponen un cambio en la interacción de voz mediante IA, pasando de la «respuesta simple» a la «comprensión profunda en tiempo real», lo que consolida aún más el liderazgo tecnológico de la empresa en la era de la inteligencia.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











