Home Smartwatch Los estudios muestran que ChatGPT se equivoca con la ciencia con más...

Los estudios muestran que ChatGPT se equivoca con la ciencia con más frecuencia de lo que cree

248

El profesor de la Universidad Estatal de Washington, Mesut Cisek, y su equipo de investigación han probado repetidamente ChatGPT con hipótesis extraídas de artículos científicos. El objetivo era que la IA pudiera determinar con precisión si cada afirmación estaba respaldada por una investigación; en otras palabras, si era verdadera o falsa.

En general, el equipo evaluó más de 700 hipótesis y formuló la misma pregunta 10 veces en cada una para medir la coherencia.

Resultados de precisión y límites de rendimiento de la IA

Cuando la prueba se realizó por primera vez en 2024, ChatGPT respondió correctamente el 76,5% de las veces. En una prueba de seguimiento realizada en 2025, la precisión aumentó ligeramente hasta el 80%. Sin embargo, una vez que los investigadores ajustaron la hipótesis aleatoria, los resultados parecieron mucho menos impresionantes. La IA funcionó aproximadamente un 60% mejor que el azar, un nivel más cercano a D que una confiabilidad fuerte.

El sistema tuvo más problemas para detectar declaraciones falsas, etiquetándolas correctamente sólo el 16,4% de las veces. También muestra importantes inconsistencias. Incluso si se le dio exactamente el mismo mensaje 10 veces, ChatGPT produjo respuestas consistentes aproximadamente el 73% de las veces.

Las respuestas inconsistentes aumentan la ansiedad

“No estamos hablando sólo de precisión, estamos hablando de inconsistencia, porque si haces la misma pregunta una y otra vez, obtendrás respuestas diferentes”, dijo Cisek, profesor asociado en el Departamento de Marketing y Negocios Internacionales de la Facultad de Negocios Carson de WSU y autor principal de la nueva publicación.

“Usamos 10 mensajes con exactamente la misma pregunta. Todo era igual. Respondía verdadero. Después de eso, decía que era falso. Era verdadero, era falso, falso, verdadero. Hubo varios casos en los que cinco eran verdaderos y cinco eran falsos”.

Fluidez de la IA frente a comprensión real

Resultados, publicados Revisión empresarial de RutgersResalte la importancia de tener precaución al confiar en la IA para tomar decisiones importantes, especialmente aquellas que requieren un razonamiento sutil o complejo. Si bien la IA generativa puede producir un lenguaje fluido y creíble, todavía no demuestra el mismo nivel de comprensión conceptual.

Según Cisek, estos hallazgos sugieren que la inteligencia artificial general capaz de “pensar” verdaderamente puede estar más lejos de lo que muchos esperan.

“Las herramientas de inteligencia artificial actuales no entienden el mundo como lo hacemos nosotros; no tienen un ‘cerebro'”, afirmó Cisek. “Simplemente memorizan y pueden darte alguna idea, pero no entienden de qué están hablando”.

Diseño y métodos del estudio.

Cisek trabajó con los coautores Sevingul Ulu de la Universidad del Sur de Illinois, Ken Woosley de la Universidad de Rutgers y Kate Karniuchina de la Universidad Northeastern.

El equipo utilizó 719 hipótesis de estudios científicos publicados en revistas de negocios desde 2021. Estas preguntas a menudo implican matices que afectan el respaldo de una hipótesis. Un simple juicio de verdad o falsedad requiere un razonamiento cuidadoso para reducir dicha complejidad.

Los investigadores probaron la versión gratuita de ChatGPT-3.5 en 2024 y el ChatGPT-5 mini actualizado en 2025. En general, el rendimiento fue similar en ambas versiones. Después de ajustar por probabilidad aleatoria, que da un 50% de probabilidad de una respuesta correcta, el rendimiento de la IA fue aproximadamente un 60% mayor que la probabilidad en ambos años.

Debilidades clave en el razonamiento de la IA

Los resultados indican una limitación fundamental de los sistemas de IA con modelos de lenguaje grandes. Aunque pueden producir respuestas fluidas y persuasivas, a menudo tienen dificultades para razonar preguntas complejas. Esto puede conducir a respuestas que parecen plausibles pero que en realidad son incorrectas, afirma Cisek.

Por qué los expertos son cautelosos con la IA

Con base en estos hallazgos, los investigadores recomiendan que los líderes empresariales analicen la información generada por la IA y la aborden con escepticismo. Enfatizan la necesidad de capacitación para comprender mejor lo que los sistemas de IA pueden y no pueden hacer de manera efectiva.

Aunque este estudio se centró específicamente en ChatGPT, Cicek señaló que pruebas similares con otras herramientas de inteligencia artificial han producido resultados comparables. El trabajo también se basa en investigaciones anteriores que apuntan a ser cautelosos con respecto a la exageración de la IA. Una encuesta nacional de 2024 encontró que era menos probable que los consumidores compraran productos cuando se comercializaban centrándose en la IA.

“Sé siempre escéptico”, dijo. “No estoy en contra de la IA. La estoy usando. Pero hay que tener mucho cuidado”.

Enlace fuente