Maison
OpenAI dévoile trois modèles de synthèse vocale en temps réel dotés d'une capacité de raisonnement équivalente à celle de GPT-5

OpenAI, le géant de l'IA, a une nouvelle fois repoussé les limites de la technologie vocale avec le lancement officiel de trois nouveaux modèles vocaux en temps réel : GPT-Realtime-2, GPT-Realtime-Translate et GPT-Realtime-Whisper. Ces modèles sont désormais intégrés à l’API Realtime destinée aux développeurs, et visent à résoudre les défis courants liés aux interactions vocales, tels que la latence élevée, la gestion insuffisante des interruptions naturelles et les problèmes de prise en charge multilingue.
La fonctionnalité phare de cette version est GPT-Realtime-2, décrit comme le modèle vocal d’IA le plus intelligent à ce jour et le premier outil vocal doté d’un raisonnement de niveau GPT-5. Contrairement aux assistants vocaux classiques, il permet des conversations très naturelles et fluides tout en effectuant simultanément un raisonnement logique en temps réel, en appelant de manière transparente des outils externes et en détectant et en répondant avec précision aux interruptions ou corrections de l’utilisateur. Cette avancée majeure indique que les futurs assistants vocaux évolueront au-delà du simple rôle d’exécuteurs de commandes pour devenir des partenaires collaboratifs en temps réel, capables de gérer des tâches complexes en plusieurs étapes.
Le tarif de GPT-Realtime-2 est fixé à 32 dollars par million de jetons pour les entrées audio (environ 218 RMB) et à 64 dollars par million de jetons pour les sorties (environ 436 RMB). Les coûts liés aux entrées mises en cache sont nettement inférieurs, à seulement 0,4 dollar par million de jetons.
Au-delà du modèle de raisonnement principal, les deux autres modèles fonctionnels offrent des capacités distinctes. GPT-Realtime-Translate offre de solides performances de traduction, prenant en charge la conversion en temps réel entre 70 langues d’entrée et 13 langues de sortie. Sa vitesse de traduction suit presque le rythme de l’orateur, ce qui le rend idéal pour les scénarios de communication en temps réel très exigeants, tels que les réunions internationales. GPT-Realtime-Whisper se concentre sur la transcription en streaming à très faible latence, offrant une expérience où « la voix suit la personne », ce qui réduit considérablement les temps d’attente pour les comptes-rendus de réunion et les sous-titres en direct. Ces deux modèles utilisent une facturation plus flexible, à raison de 0,034 $ et 0,017 $ par minute respectivement.
Les analystes du secteur considèrent les dernières initiatives d’OpenAI comme une évolution de l’interaction vocale par IA, passant d’une « simple réponse » à une « compréhension approfondie en temps réel », ce qui renforce encore le leadership technologique de l’entreprise à l’ère de l’intelligence artificielle.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)

OpenAI, le géant de l'IA, a une nouvelle fois repoussé les limites de la technologie vocale avec le lancement officiel de trois nouveaux modèles vocaux en temps réel : GPT-Realtime-2, GPT-Realtime-Translate et GPT-Realtime-Whisper. Ces modèles sont désormais intégrés à l’API Realtime destinée aux développeurs, et visent à résoudre les défis courants liés aux interactions vocales, tels que la latence élevée, la gestion insuffisante des interruptions naturelles et les problèmes de prise en charge multilingue.
La fonctionnalité phare de cette version est GPT-Realtime-2, décrit comme le modèle vocal d’IA le plus intelligent à ce jour et le premier outil vocal doté d’un raisonnement de niveau GPT-5. Contrairement aux assistants vocaux classiques, il permet des conversations très naturelles et fluides tout en effectuant simultanément un raisonnement logique en temps réel, en appelant de manière transparente des outils externes et en détectant et en répondant avec précision aux interruptions ou corrections de l’utilisateur. Cette avancée majeure indique que les futurs assistants vocaux évolueront au-delà du simple rôle d’exécuteurs de commandes pour devenir des partenaires collaboratifs en temps réel, capables de gérer des tâches complexes en plusieurs étapes.
Le tarif de GPT-Realtime-2 est fixé à 32 dollars par million de jetons pour les entrées audio (environ 218 RMB) et à 64 dollars par million de jetons pour les sorties (environ 436 RMB). Les coûts liés aux entrées mises en cache sont nettement inférieurs, à seulement 0,4 dollar par million de jetons.
Au-delà du modèle de raisonnement principal, les deux autres modèles fonctionnels offrent des capacités distinctes. GPT-Realtime-Translate offre de solides performances de traduction, prenant en charge la conversion en temps réel entre 70 langues d’entrée et 13 langues de sortie. Sa vitesse de traduction suit presque le rythme de l’orateur, ce qui le rend idéal pour les scénarios de communication en temps réel très exigeants, tels que les réunions internationales. GPT-Realtime-Whisper se concentre sur la transcription en streaming à très faible latence, offrant une expérience où « la voix suit la personne », ce qui réduit considérablement les temps d’attente pour les comptes-rendus de réunion et les sous-titres en direct. Ces deux modèles utilisent une facturation plus flexible, à raison de 0,034 $ et 0,017 $ par minute respectivement.
Les analystes du secteur considèrent les dernières initiatives d’OpenAI comme une évolution de l’interaction vocale par IA, passant d’une « simple réponse » à une « compréhension approfondie en temps réel », ce qui renforce encore le leadership technologique de l’entreprise à l’ère de l’intelligence artificielle.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











