Maison
Mise à jour de l'API OpenAI Voice : précision de transcription améliorée, vitesse de traitement des agents accrue de 40 %
OpenAI a récemment présenté deux mises à jour majeures de son API destinées aux développeurs du monde entier, conçues pour améliorer considérablement les performances des agents IA dans les interactions vocales et les flux de travail impliquant des tâches complexes.
Côté modèles, le nouveau modèle en temps réel gpt-realtime-1.5 et son modèle audio associé ont été officiellement lancés. Leur objectif principal est d’améliorer la fiabilité des commandes vocales. Selon les données de tests internes d’OpenAI, ce nouveau modèle améliore la précision de la transcription des chiffres et des lettres d’environ 10 %, augmente la précision dans les tâches audio logiques de 5 % et renforce la précision d’exécution des instructions de 7 %, ce qui permet de résoudre efficacement les problèmes liés à une mauvaise interprétation des phrases clés ou à des difficultés face à des commandes vocales complexes par l’IA.

Sur le plan architectural, l’API Responses prend désormais en charge le protocole WebSocket, ce qui marque un tournant significatif dans la communication de l’IA. Contrairement aux méthodes antérieures qui nécessitaient de retransmettre l’intégralité du contexte à chaque requête, WebSocket permet aux développeurs d’établir une connexion persistante, le système n’envoyant que des données incrémentielles lorsque de nouvelles informations sont générées.
OpenAI a souligné que cette amélioration est particulièrement importante pour les agents IA complexes qui font fréquemment appel à de nombreux outils, car elle peut augmenter directement leur vitesse de fonctionnement de 20 % à 40 %.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)
OpenAI a récemment présenté deux mises à jour majeures de son API destinées aux développeurs du monde entier, conçues pour améliorer considérablement les performances des agents IA dans les interactions vocales et les flux de travail impliquant des tâches complexes.
Côté modèles, le nouveau modèle en temps réel gpt-realtime-1.5 et son modèle audio associé ont été officiellement lancés. Leur objectif principal est d’améliorer la fiabilité des commandes vocales. Selon les données de tests internes d’OpenAI, ce nouveau modèle améliore la précision de la transcription des chiffres et des lettres d’environ 10 %, augmente la précision dans les tâches audio logiques de 5 % et renforce la précision d’exécution des instructions de 7 %, ce qui permet de résoudre efficacement les problèmes liés à une mauvaise interprétation des phrases clés ou à des difficultés face à des commandes vocales complexes par l’IA.

Sur le plan architectural, l’API Responses prend désormais en charge le protocole WebSocket, ce qui marque un tournant significatif dans la communication de l’IA. Contrairement aux méthodes antérieures qui nécessitaient de retransmettre l’intégralité du contexte à chaque requête, WebSocket permet aux développeurs d’établir une connexion persistante, le système n’envoyant que des données incrémentielles lorsque de nouvelles informations sont générées.
OpenAI a souligné que cette amélioration est particulièrement importante pour les agents IA complexes qui font fréquemment appel à de nombreux outils, car elle peut augmenter directement leur vitesse de fonctionnement de 20 % à 40 %.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











