Maison
Une étude de l'Université de l'État de Washington révèle les contradictions majeures de ChatGPT dans ses jugements scientifiques complexes

Une étude récente de l'université de l'État de Washington (WSU) révèle que, bien que ChatGPT réponde avec assurance, son traitement des énoncés scientifiques complexes s'apparente à des suppositions aléatoires. Cette étude met en évidence non seulement une précision limitée, mais aussi des réponses souvent contradictoires à une même question.
Le professeur Mesut Cicek et son équipe ont extrait 719 hypothèses de recherche de revues spécialisées en gestion publiées depuis 2021 et les ont soumises à plusieurs reprises au modèle afin d’en vérifier la véracité.
Bien que la précision apparente de ChatGPT semble avoisiner les 80 %, une fois les devinettes aléatoires prises en compte, ses performances réelles ne sont que d’environ 60 % supérieures à celles d’un tirage au sort à 50 %. Les chercheurs ont attribué à ce résultat la note « D », correspondant à un niveau faible. Le modèle s’est montré particulièrement peu performant pour identifier les fausses affirmations, ne jugeant correctement que 16,4 % des propositions fausses.
Les chercheurs ont soumis chaque hypothèse au modèle à dix reprises et ont constaté qu’il avait du mal à maintenir des positions cohérentes :
Fluctuation des réponses: dans environ 73 % des cas, le modèle a maintenu des conclusions cohérentes sur les dix répétitions.
Contradictions extrêmes: dans certains cas, le modèle alternait entre des réponses « vraies » et « fausses », avec des cas extrêmes où la moitié des réponses était vraie et l’autre moitié fausse, alors que la consigne était exactement la même.
L’étude souligne que les utilisateurs se laissent facilement induire en erreur par le langage fluide et persuasif de l’IA, mais que cela ne témoigne pas d’une véritable capacité de raisonnement.
Absence de véritable compréhension: le modèle s’appuie sur la mémoire et la reconnaissance de schémas, contrairement aux humains qui comprennent véritablement le monde et ce qu’ils disent.
Progrès limités de la version: les tests ont montré que la version mise à jour de ChatGPT-5 mini (testée en 2025) présentait des performances similaires à celles des versions antérieures sur cette tâche spécifique, sans amélioration significative.
Sur la base de ces résultats, Cicek conseille aux dirigeants d’entreprise de faire preuve d’un scepticisme marqué lorsqu’ils prennent des décisions complexes. Ils ne doivent pas considérer l’IA générative comme une « autorité » capable de se substituer au jugement professionnel et doivent vérifier manuellement tous les résultats. Les organisations devraient renforcer la formation afin d’aider les employés à comprendre à la fois les atouts et les limites des outils d’IA, évitant ainsi les biais décisionnels liés à une confiance aveugle.
Cette étude rappelle une fois de plus que, malgré le développement rapide de l’IA, les capacités de cette technologie en matière de raisonnement logique approfondi et d’évaluation des preuves doivent encore être améliorées.
Article connexe
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Top AI Tools for Converting Video and Audio to TextTable of Contents:IntroductionWeet.io - Convert Video to TextYouTube Subtitles and TranscriptionsFigo.com - Fastest Video to Text ConversionBlack Box - Screenshots of Video to Text ConversionYouTube
L'usine de robots humanoïdes Xpeng à Guangzhou entame la production pilote, avec une sortie en masse prévue pour 2026
Le robot humanoïde de Xiaopeng est entré en phase de production pilote à petite échelle dans son usine de Guangzhou. La ligne de production en série est actuellement en cours d’intégration finale, ce qui marque le début du compte à rebours vers une f
Musk appelle les géants de l’IA à tester mutuellement leurs modèles et à inviter la critique de leurs rivaux
Lors du sommet All-In du 15 septembre, Elon Musk, la personne la plus riche au monde, a participé à distance par vidéo. S’exprimant sur l’intelligence artificielle, il a exhorté les principales entreprises d’IA à tester mutuellement leurs modèles ava
Recommandations de sujets spéciaux liés
commentaires (1)

Une étude récente de l'université de l'État de Washington (WSU) révèle que, bien que ChatGPT réponde avec assurance, son traitement des énoncés scientifiques complexes s'apparente à des suppositions aléatoires. Cette étude met en évidence non seulement une précision limitée, mais aussi des réponses souvent contradictoires à une même question.
Le professeur Mesut Cicek et son équipe ont extrait 719 hypothèses de recherche de revues spécialisées en gestion publiées depuis 2021 et les ont soumises à plusieurs reprises au modèle afin d’en vérifier la véracité.
Bien que la précision apparente de ChatGPT semble avoisiner les 80 %, une fois les devinettes aléatoires prises en compte, ses performances réelles ne sont que d’environ 60 % supérieures à celles d’un tirage au sort à 50 %. Les chercheurs ont attribué à ce résultat la note « D », correspondant à un niveau faible. Le modèle s’est montré particulièrement peu performant pour identifier les fausses affirmations, ne jugeant correctement que 16,4 % des propositions fausses.
Les chercheurs ont soumis chaque hypothèse au modèle à dix reprises et ont constaté qu’il avait du mal à maintenir des positions cohérentes :
Fluctuation des réponses: dans environ 73 % des cas, le modèle a maintenu des conclusions cohérentes sur les dix répétitions.
Contradictions extrêmes: dans certains cas, le modèle alternait entre des réponses « vraies » et « fausses », avec des cas extrêmes où la moitié des réponses était vraie et l’autre moitié fausse, alors que la consigne était exactement la même.
L’étude souligne que les utilisateurs se laissent facilement induire en erreur par le langage fluide et persuasif de l’IA, mais que cela ne témoigne pas d’une véritable capacité de raisonnement.
Absence de véritable compréhension: le modèle s’appuie sur la mémoire et la reconnaissance de schémas, contrairement aux humains qui comprennent véritablement le monde et ce qu’ils disent.
Progrès limités de la version: les tests ont montré que la version mise à jour de ChatGPT-5 mini (testée en 2025) présentait des performances similaires à celles des versions antérieures sur cette tâche spécifique, sans amélioration significative.
Sur la base de ces résultats, Cicek conseille aux dirigeants d’entreprise de faire preuve d’un scepticisme marqué lorsqu’ils prennent des décisions complexes. Ils ne doivent pas considérer l’IA générative comme une « autorité » capable de se substituer au jugement professionnel et doivent vérifier manuellement tous les résultats. Les organisations devraient renforcer la formation afin d’aider les employés à comprendre à la fois les atouts et les limites des outils d’IA, évitant ainsi les biais décisionnels liés à une confiance aveugle.
Cette étude rappelle une fois de plus que, malgré le développement rapide de l’IA, les capacités de cette technologie en matière de raisonnement logique approfondi et d’évaluation des preuves doivent encore être améliorées.
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Top AI Tools for Converting Video and Audio to TextTable of Contents:IntroductionWeet.io - Convert Video to TextYouTube Subtitles and TranscriptionsFigo.com - Fastest Video to Text ConversionBlack Box - Screenshots of Video to Text ConversionYouTube
L'usine de robots humanoïdes Xpeng à Guangzhou entame la production pilote, avec une sortie en masse prévue pour 2026
Le robot humanoïde de Xiaopeng est entré en phase de production pilote à petite échelle dans son usine de Guangzhou. La ligne de production en série est actuellement en cours d’intégration finale, ce qui marque le début du compte à rebours vers une f
Musk appelle les géants de l’IA à tester mutuellement leurs modèles et à inviter la critique de leurs rivaux
Lors du sommet All-In du 15 septembre, Elon Musk, la personne la plus riche au monde, a participé à distance par vidéo. S’exprimant sur l’intelligence artificielle, il a exhorté les principales entreprises d’IA à tester mutuellement leurs modèles ava











