Maison
OpenAI dévoile des modèles vocaux avancés pour des conversations en temps réel plus naturelles

OpenAI a lancé de nouveaux modèles conversationnels, GPT-Live-1 et GPT-Live-1 mini, conçus pour offrir un son plus naturel et gérer plus efficacement les échanges. Ces modèles en duplex intégral peuvent parler et écouter simultanément, ce qui permet aux utilisateurs d'interrompre naturellement la conversation et offre des fonctionnalités telles que la traduction en temps réel.
L'entreprise déploie également GPT-Live-1 mini en remplacement par défaut de l'actuel mode vocal avancé (Advanced Voice Mode) de ChatGPT. Les utilisateurs de l'offre payante auront accès au modèle GPT-Live-1, plus puissant. Auparavant, le système s’appuyait sur une combinaison d’un modèle de reconnaissance vocale, d’un grand modèle linguistique pour générer des réponses et d’un modèle de synthèse vocale pour produire le résultat final.
Lors d’une conférence de presse, OpenAI a déclaré que les nouveaux modèles remédient à des problèmes tels que l’interruption des utilisateurs pendant qu’ils parlent et le manque d’intelligence suffisante pour répondre aux questions. Les modèles mis à jour achemineront les requêtes vers les modèles textuels les plus récents, tels que GPT-5.5, pour la recherche, le raisonnement ou les tâches d’agent, tout en préservant le flux de la conversation.
OpenAI a également démontré que le modèle peut rester silencieux pendant de longues périodes, en assimilant le contexte conversationnel jusqu’à ce qu’on s’adresse à lui. De plus, comme le nouveau mode vocal s’intègre aux modèles GPT les plus récents, il peut présenter les informations sous forme visuelle. D’autres start-ups, telles que Monogram — qui a levé 40 millions de dollars en financement d’amorçage auprès de DST et Lux Capital — se concentrent également sur les réponses visuelles afin de rendre les assistants plus interactifs.
L’entreprise a souligné que le nouveau mode vocal de ChatGPT est conçu pour des conversations plus longues. Lors de la présentation, Atty Eleti, responsable produit de ChatGPT Voice, a indiqué avoir eu des conversations de 30 à 40 minutes avec la fonctionnalité vocale pendant ses promenades.
OpenAI estime que la voix pourrait devenir l’interface principale pour les tâches informatiques complexes. Selon certaines informations, l’entreprise pourrait lancer cette année des écouteurs dotés d’une intelligence artificielle, bien qu’aucun détail sur ces produits matériels n’ait été fourni.
« À terme, nous pensons que cela permettra également d’utiliser la voix comme une sorte d’interface principale pour l’informatique, et de gérer des tâches automatisées de plus en plus complexes et de longue durée. Au vu des cas d’utilisation incroyables que nous observons lorsque les utilisateurs se servent de Codex et de ChatGPT, nous pensons que la voix peut devenir l’interface du futur pour toutes sortes de tâches », a déclaré Atty Eleti.
OpenAI n’a cessé d’améliorer ses fonctionnalités vocales ces dernières années afin de rendre le mode vocal de ChatGPT plus naturel. L’entreprise indique que plus de 150 millions de personnes utilisent les fonctionnalités « Voix » et « Dictée » pour dialoguer avec ChatGPT.
Les concurrents s’efforcent également de rendre leurs assistants plus expressifs.
Apple et Amazon ont tous deux mis à jour leurs assistants pour les rendre plus conversationnels, avec une meilleure gestion du contexte. Des start-ups comme Sesame, cofondée par Brendan Iribe, cofondateur d’Oculus, et Ankit Kumar, ont lancé des assistants IA capables de mener des conversations plus naturelles tout en effectuant des tâches en arrière-plan.
OpenAI suit une voie similaire, avec pour objectif de permettre aux utilisateurs d’interagir avec son assistant en mode mains libres pendant des périodes plus longues. Bien qu’elle affirme que le nouveau mode vocal sonne plus naturellement, l’entreprise a souligné qu’il n’était pas conçu comme un compagnon IA. Elle a précisé que les nouveaux modèles intègrent des mesures de sécurité pour fournir des réponses adaptées à l’âge des adolescents et proposer des ressources si les conversations abordent des sujets tels que l’automutilation.
Le nouveau mode vocal peut encore être amélioré. Lors d’une démonstration de la fonctionnalité de traduction en direct en hindi, l’assistant s’est exprimé avec un fort accent américain et a utilisé un hindi peu naturel, légèrement livresque. L’entreprise a déclaré que ce mode était optimisé pour « la plupart des langues parlées », sans toutefois préciser lesquelles.
Article connexe
Warner Music acquiert l'entreprise de démarrage Sureel AI spécialisée dans l'attribution par intelligence artificielle
Warner Music Group (WMG) a confirmé mercredi qu’elle acquiert Sureel AI, une startup spécialisée dans l’attribution par intelligence artificielle. La technologie propriétaire de Sureel génère une « ADN IA » pour les titres musicaux, en décomposant ce
Amazon présente Alexa pour les achats tout en reléguant Rufus au second plan
Amazon a lancé Alexa for Shopping, fusionnant son chatbot de shopping Rufus avec Alexa+ sur l’application, le site web et les appareils Echo Show.L’assistant répond aux requêtes sur les produits, compare les articles, suit les prix et prend en charg
Microsoft, Azure et les technologies d'IA luttent contre les risques d'incendies de forêt en Californie
Microsoft investit dans la détection des feux de forêt grâce à l'IA ; Juan Lavista Ferres, vice-président corporatif et responsable scientifique des données, évoque les stratégies visant à atténuer le
Recommandations de sujets spéciaux liés
commentaires (0)

OpenAI a lancé de nouveaux modèles conversationnels, GPT-Live-1 et GPT-Live-1 mini, conçus pour offrir un son plus naturel et gérer plus efficacement les échanges. Ces modèles en duplex intégral peuvent parler et écouter simultanément, ce qui permet aux utilisateurs d'interrompre naturellement la conversation et offre des fonctionnalités telles que la traduction en temps réel.
L'entreprise déploie également GPT-Live-1 mini en remplacement par défaut de l'actuel mode vocal avancé (Advanced Voice Mode) de ChatGPT. Les utilisateurs de l'offre payante auront accès au modèle GPT-Live-1, plus puissant. Auparavant, le système s’appuyait sur une combinaison d’un modèle de reconnaissance vocale, d’un grand modèle linguistique pour générer des réponses et d’un modèle de synthèse vocale pour produire le résultat final.
Lors d’une conférence de presse, OpenAI a déclaré que les nouveaux modèles remédient à des problèmes tels que l’interruption des utilisateurs pendant qu’ils parlent et le manque d’intelligence suffisante pour répondre aux questions. Les modèles mis à jour achemineront les requêtes vers les modèles textuels les plus récents, tels que GPT-5.5, pour la recherche, le raisonnement ou les tâches d’agent, tout en préservant le flux de la conversation.
OpenAI a également démontré que le modèle peut rester silencieux pendant de longues périodes, en assimilant le contexte conversationnel jusqu’à ce qu’on s’adresse à lui. De plus, comme le nouveau mode vocal s’intègre aux modèles GPT les plus récents, il peut présenter les informations sous forme visuelle. D’autres start-ups, telles que Monogram — qui a levé 40 millions de dollars en financement d’amorçage auprès de DST et Lux Capital — se concentrent également sur les réponses visuelles afin de rendre les assistants plus interactifs.
L’entreprise a souligné que le nouveau mode vocal de ChatGPT est conçu pour des conversations plus longues. Lors de la présentation, Atty Eleti, responsable produit de ChatGPT Voice, a indiqué avoir eu des conversations de 30 à 40 minutes avec la fonctionnalité vocale pendant ses promenades.
OpenAI estime que la voix pourrait devenir l’interface principale pour les tâches informatiques complexes. Selon certaines informations, l’entreprise pourrait lancer cette année des écouteurs dotés d’une intelligence artificielle, bien qu’aucun détail sur ces produits matériels n’ait été fourni.
« À terme, nous pensons que cela permettra également d’utiliser la voix comme une sorte d’interface principale pour l’informatique, et de gérer des tâches automatisées de plus en plus complexes et de longue durée. Au vu des cas d’utilisation incroyables que nous observons lorsque les utilisateurs se servent de Codex et de ChatGPT, nous pensons que la voix peut devenir l’interface du futur pour toutes sortes de tâches », a déclaré Atty Eleti.
OpenAI n’a cessé d’améliorer ses fonctionnalités vocales ces dernières années afin de rendre le mode vocal de ChatGPT plus naturel. L’entreprise indique que plus de 150 millions de personnes utilisent les fonctionnalités « Voix » et « Dictée » pour dialoguer avec ChatGPT.
Les concurrents s’efforcent également de rendre leurs assistants plus expressifs.
Apple et Amazon ont tous deux mis à jour leurs assistants pour les rendre plus conversationnels, avec une meilleure gestion du contexte. Des start-ups comme Sesame, cofondée par Brendan Iribe, cofondateur d’Oculus, et Ankit Kumar, ont lancé des assistants IA capables de mener des conversations plus naturelles tout en effectuant des tâches en arrière-plan.
OpenAI suit une voie similaire, avec pour objectif de permettre aux utilisateurs d’interagir avec son assistant en mode mains libres pendant des périodes plus longues. Bien qu’elle affirme que le nouveau mode vocal sonne plus naturellement, l’entreprise a souligné qu’il n’était pas conçu comme un compagnon IA. Elle a précisé que les nouveaux modèles intègrent des mesures de sécurité pour fournir des réponses adaptées à l’âge des adolescents et proposer des ressources si les conversations abordent des sujets tels que l’automutilation.
Le nouveau mode vocal peut encore être amélioré. Lors d’une démonstration de la fonctionnalité de traduction en direct en hindi, l’assistant s’est exprimé avec un fort accent américain et a utilisé un hindi peu naturel, légèrement livresque. L’entreprise a déclaré que ce mode était optimisé pour « la plupart des langues parlées », sans toutefois préciser lesquelles.
Warner Music acquiert l'entreprise de démarrage Sureel AI spécialisée dans l'attribution par intelligence artificielle
Warner Music Group (WMG) a confirmé mercredi qu’elle acquiert Sureel AI, une startup spécialisée dans l’attribution par intelligence artificielle. La technologie propriétaire de Sureel génère une « ADN IA » pour les titres musicaux, en décomposant ce
Microsoft, Azure et les technologies d'IA luttent contre les risques d'incendies de forêt en Californie
Microsoft investit dans la détection des feux de forêt grâce à l'IA ; Juan Lavista Ferres, vice-président corporatif et responsable scientifique des données, évoque les stratégies visant à atténuer le











