Hogar
Un estudio de la Universidad Estatal de Washington revela las principales contradicciones de ChatGPT en valoraciones científicas complejas

Un estudio reciente de la Universidad Estatal de Washington (WSU) revela que, aunque ChatGPT responde con seguridad, su tratamiento de afirmaciones científicas complejas se asemeja a una conjetura aleatoria. La investigación pone de relieve no solo una precisión limitada, sino también respuestas contradictorias frecuentes a la misma pregunta.
El profesor Mesut Cicek y su equipo extrajeron 719 hipótesis de investigación de revistas especializadas en negocios publicadas desde 2021 y las sometieron repetidamente al modelo para verificar su veracidad.
Aunque la precisión aparente de ChatGPT ronda el 80 %, una vez tenidas en cuenta las conjeturas aleatorias, su rendimiento real solo es un 60 % superior al de lanzar una moneda al aire (50 %). Los investigadores calificaron este resultado como una «nota baja de grado D». El modelo obtuvo resultados especialmente deficientes a la hora de identificar afirmaciones falsas, ya que solo juzgó correctamente el 16,4 % de las proposiciones falsas.
Los investigadores sometieron cada hipótesis al modelo diez veces y observaron que este tenía dificultades para mantener posiciones coherentes:
Fluctuación en las respuestas: en aproximadamente el 73 % de los casos, el modelo mantuvo conclusiones coherentes a lo largo de las diez repeticiones.
Contradicciones extremas: en algunos casos, el modelo alternaba entre respuestas «verdaderas» y «falsas», con casos extremos en los que la mitad eran verdaderas y la otra mitad falsas, a pesar de utilizar exactamente la misma pregunta.
El estudio señala que los usuarios se dejan engañar fácilmente por el lenguaje fluido y persuasivo de la IA, pero esto no indica una capacidad de razonamiento genuina.
Falta de comprensión real: el modelo se basa en la memoria y la identificación de patrones, a diferencia de los seres humanos, que comprenden realmente el mundo y lo que dicen.
Progreso limitado de la versión: Las pruebas demostraron que la versión actualizada de ChatGPT-5 mini (probada en 2025) obtuvo resultados similares a los de versiones anteriores en esta tarea específica, sin mejoras significativas.
A la luz de estos hallazgos, Cicek aconseja a los directivos empresariales que mantengan un alto grado de escepticismo a la hora de tomar decisiones complejas. No deben considerar la IA generativa como una «autoridad» capaz de sustituir el criterio profesional y deben verificar manualmente todos los resultados. Las organizaciones deben mejorar la formación para ayudar a los empleados a comprender tanto los puntos fuertes como las limitaciones de las herramientas de IA, evitando así sesgos en la toma de decisiones derivados de una confianza ciega.
Este estudio sirve como un nuevo recordatorio de que, a pesar del rápido desarrollo de la IA, las capacidades de razonamiento lógico profundo y de evaluación de pruebas de esta tecnología aún deben mejorarse.
Artículo relacionado
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Principales herramientas de IA para convertir video y audio a textoTabla de contenidos:IntroducciónWeet.io - Convertir video a textoSubtítulos y transcripciones de YouTubeFigo.com - Conversión de video a texto más rápidaBlack Box - Capturas de pantal
La fábrica de robots humanoides de Xiaopeng en Guangzhou inicia la producción de prueba, con miras a la producción en masa para 2026
El robot humanoide de Xiaopeng ha entrado en producción piloto a pequeña escala en sus instalaciones de Guangzhou. La línea de producción en masa se encuentra actualmente en la fase final de integración, lo que marca el inicio de la cuenta regresiva
Musk pide a los gigantes de la IA que prueben mutuamente sus modelos e invite a la crítica de sus rivales
Durante la cumbre All-In del 15 de septiembre, Elon Musk, la persona más rica del mundo, se unió de forma remota a través de video. Al abordar la inteligencia artificial, instó a las principales empresas de IA a realizar pruebas cruzadas entre sí de
Recomendaciones de temas especiales relacionados
comentario (1)
0/500

Un estudio reciente de la Universidad Estatal de Washington (WSU) revela que, aunque ChatGPT responde con seguridad, su tratamiento de afirmaciones científicas complejas se asemeja a una conjetura aleatoria. La investigación pone de relieve no solo una precisión limitada, sino también respuestas contradictorias frecuentes a la misma pregunta.
El profesor Mesut Cicek y su equipo extrajeron 719 hipótesis de investigación de revistas especializadas en negocios publicadas desde 2021 y las sometieron repetidamente al modelo para verificar su veracidad.
Aunque la precisión aparente de ChatGPT ronda el 80 %, una vez tenidas en cuenta las conjeturas aleatorias, su rendimiento real solo es un 60 % superior al de lanzar una moneda al aire (50 %). Los investigadores calificaron este resultado como una «nota baja de grado D». El modelo obtuvo resultados especialmente deficientes a la hora de identificar afirmaciones falsas, ya que solo juzgó correctamente el 16,4 % de las proposiciones falsas.
Los investigadores sometieron cada hipótesis al modelo diez veces y observaron que este tenía dificultades para mantener posiciones coherentes:
Fluctuación en las respuestas: en aproximadamente el 73 % de los casos, el modelo mantuvo conclusiones coherentes a lo largo de las diez repeticiones.
Contradicciones extremas: en algunos casos, el modelo alternaba entre respuestas «verdaderas» y «falsas», con casos extremos en los que la mitad eran verdaderas y la otra mitad falsas, a pesar de utilizar exactamente la misma pregunta.
El estudio señala que los usuarios se dejan engañar fácilmente por el lenguaje fluido y persuasivo de la IA, pero esto no indica una capacidad de razonamiento genuina.
Falta de comprensión real: el modelo se basa en la memoria y la identificación de patrones, a diferencia de los seres humanos, que comprenden realmente el mundo y lo que dicen.
Progreso limitado de la versión: Las pruebas demostraron que la versión actualizada de ChatGPT-5 mini (probada en 2025) obtuvo resultados similares a los de versiones anteriores en esta tarea específica, sin mejoras significativas.
A la luz de estos hallazgos, Cicek aconseja a los directivos empresariales que mantengan un alto grado de escepticismo a la hora de tomar decisiones complejas. No deben considerar la IA generativa como una «autoridad» capaz de sustituir el criterio profesional y deben verificar manualmente todos los resultados. Las organizaciones deben mejorar la formación para ayudar a los empleados a comprender tanto los puntos fuertes como las limitaciones de las herramientas de IA, evitando así sesgos en la toma de decisiones derivados de una confianza ciega.
Este estudio sirve como un nuevo recordatorio de que, a pesar del rápido desarrollo de la IA, las capacidades de razonamiento lógico profundo y de evaluación de pruebas de esta tecnología aún deben mejorarse.
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Principales herramientas de IA para convertir video y audio a textoTabla de contenidos:IntroducciónWeet.io - Convertir video a textoSubtítulos y transcripciones de YouTubeFigo.com - Conversión de video a texto más rápidaBlack Box - Capturas de pantal
La fábrica de robots humanoides de Xiaopeng en Guangzhou inicia la producción de prueba, con miras a la producción en masa para 2026
El robot humanoide de Xiaopeng ha entrado en producción piloto a pequeña escala en sus instalaciones de Guangzhou. La línea de producción en masa se encuentra actualmente en la fase final de integración, lo que marca el inicio de la cuenta regresiva
Musk pide a los gigantes de la IA que prueben mutuamente sus modelos e invite a la crítica de sus rivales
Durante la cumbre All-In del 15 de septiembre, Elon Musk, la persona más rica del mundo, se unió de forma remota a través de video. Al abordar la inteligencia artificial, instó a las principales empresas de IA a realizar pruebas cruzadas entre sí de











