Por Canuto  

Los modelos de IA que supuestamente razonan paso a paso están dominando problemas complejos, pero un nuevo análisis de Quanta Magazine revela que sus cadenas de pensamiento podrían ser simples ilusiones estadísticas, no procesos lógicos reales. Expertos debaten si estamos ante un verdadero razonamiento o ante atajos bien disfrazados.
***

  • Investigadores cuestionan la fidelidad de las cadenas de pensamiento de los modelos de razonamiento de IA.
  • Estudios muestran que eliminar pasos intermedios no afecta el rendimiento en algunos casos.
  • La hipótesis de la ‘recuperación aproximada’ sugiere que los LRM no razonan, sino que imitan patrones de entrenamiento.


La inteligencia artificial que resuelve problemas matemáticos complejos y razona paso a paso parece un logro impresionante. Pero un nuevo análisis publicado por Quanta Magazine revela que lo que llamamos razonamiento podría ser una ilusión estadística, no un proceso lógico real.

El artículo, firmado por John Pavlus, recorre el debate científico que divide a expertos sobre las capacidades de los grandes modelos de razonamiento (LRM). La pregunta central: ¿están en lo correcto por las razones equivocadas?

La ilusión de las cadenas de pensamiento

Los LRM, como los que impulsan a ChatGPT y otros asistentes, generan cadenas de pensamiento antes de dar una respuesta. Estos textos intermedios pretenden mostrar un proceso de razonamiento similar al humano.

Sin embargo, investigaciones recientes han sembrado dudas sobre si esos pasos son fieles a lo que ocurre dentro del modelo. Un estudio de Apple los denominó “Ilusión de Pensamiento” y mostró fallas en condiciones simples.

Otro trabajo del Instituto de Santa Fe, dirigido por Melanie Mitchell, reveló que los LRM usan “atajos de nivel superficial” para resolver problemas, sin aplicar un razonamiento generalizable. Estos atajos son patrones que el modelo ha memorizado durante su entrenamiento.

La propia Mitchell, científica de renombre, resumió la situación en tres puntos. Primero, el razonamiento funciona y mejora los resultados. Segundo, el texto generado no es necesariamente fiel al proceso interno. Y tercero, mucho de ese texto ni siquiera es útil.

Un artículo de la Universidad de Nueva York demostró que tokens de relleno, como cadenas de puntos, funcionan igual que una cadena de pensamiento legible. El investigador William Merrill lo expresó sin rodeos: “No hay garantía de que la cadena de pensamiento tenga que ser significativa en ningún sentido”.

Éxitos que contradicen las críticas

A pesar de estas críticas, los LRM han logrado hazañas sorprendentes. En mayo de 2026, un modelo de OpenAI resolvió un famoso problema abierto de matemáticas, la conjetura de la distancia unitaria. El logro fue celebrado como prueba de razonamiento real.

Además, Google DeepMind y el matemático Terence Tao usaron IA para redescubrir soluciones a 67 problemas en diversas áreas. Estos éxitos han llevado a muchos a defender que el razonamiento artificial es genuino.

Sébastien Bubeck, miembro técnico de OpenAI y evangelista de los modelos de razonamiento, descartó las críticas de Apple como “erróneas”. Afirmó que los modelos modernos, desde GPT-5.5, no presentan esos problemas y que “razonan como lo haría un humano”.

Sin embargo, los investigadores más escépticos señalan que los modelos modernos están rodeados de software de verificación. Según Kambhampati, sistemas como AlphaProof Nexus de Google dependen de herramientas como Lean para validar resultados, no de la pura cadena de pensamiento.

La controversia se intensifica al saber que OpenAI no libera las cadenas de pensamiento crudas de sus modelos, sino resúmenes reescritos por humanos. Esto impide una verificación independiente de los procesos internos.

La hipótesis de la recuperación aproximada

Subbarao Kambhampati, profesor de la Universidad Estatal de Arizona, propone una explicación alternativa. Él sostiene que los LRM no son más que LLM entrenados para imitar patrones de razonamiento, no para razonar de verdad.

Su hipótesis se llama “recuperación aproximada”: el modelo busca en su memoria de entrenamiento cadenas de texto que se parezcan al problema actual, sin seguir una lógica interna. Los tokens de pensamiento, según él, solo cargan la memoria de trabajo, pero no narran un proceso fiel.

Para apoyar esta idea, Kambhampati cita experimentos donde reemplazar las trazas correctas por incorrectas no degrada el rendimiento. También señala que eliminar hasta el 60% de los pasos no afecta los resultados, como mostró un estudio de Northeastern y Berkeley.

Su crítica es contundente: “Estamos en tiempos maravillosos, pero muchas ideas sobre las fuentes de fortaleza de estos modelos han sido malentendidas”. Compara a los investigadores con inversores que reclaman habilidades antes de que existan, algo que no es ciencia.

Esta visión resuena con el concepto de “mnemónicos ilusorios”, acuñado por Drew McDermott en 1976. Kambhampati cree que términos como “razonamiento” o “cadena de pensamiento” son etiquetas que antropomorfizan lo que en el fondo es una predicción estadística.

El problema de la fidelidad

Otros estudios refuerzan que las cadenas de pensamiento no son causales. Un artículo de 2024 mostró que los tokens intermedios no solo pueden ser irrelevantes, sino que también se pueden entrenar con datos incorrectos y aún así generar soluciones correctas.

El investigador Pavel Izmailov, de NYU y Anthropic, duda que el aprendizaje por refuerzo incentive a los modelos a producir cadenas fieles. “Las probabilidades no son muy altas”, dijo, aunque reconoció que podría ocurrir en el futuro.

Melanie Mitchell considera que esta falta de fidelidad es un problema práctico. “Si no sabemos por qué el modelo da una respuesta, no podemos confiar en él en dominios no verificables”, explicó. En su opinión, necesitamos entender los mecanismos internos para aplicar la IA de forma segura.

Sin embargo, el propio Kambhampati matiza que la falta de fidelidad no invalida los resultados. Los LRM pueden ser útiles incluso si no razonan como humanos, siempre que se verifiquen sus salidas con herramientas externas.

El debate toca un punto filosófico: ¿qué constituye un razonamiento real? Si una máquina produce la respuesta correcta a través de atajos estadísticos, ¿contamos eso como inteligencia? La ciencia aún no tiene una respuesta definitiva.

La defensa de OpenAI

Bubeck defiende que los modelos de razonamiento son cajas negras, pero exitosas. “Estamos tratando de ser útiles, de acelerar la investigación científica”, dijo. Para él, es más productivo centrarse en lo que pueden hacer que en por qué lo hacen.

Esta postura choca con la de Kambhampati, quien insiste en que “una teoría falsa es peor que admitir que no tenemos una teoría”. La ciencia necesita modelos internos correctos para avanzar, no solo resultados empíricos.

Ambos coinciden en que la IA puede ser útil para tareas verificables, como el código informático o las demostraciones matemáticas. En esos campos, el modelo genera propuestas que luego se validan con herramientas, sin necesidad de que su proceso interno sea fiel.

Pero en áreas como el diagnóstico médico o la toma de decisiones legales, la falta de transparencia puede ser peligrosa. Mitchell insistió: “Quieres la respuesta correcta por la razón correcta, para poder confiar en estas cosas”.

El artículo de Quanta Magazine concluye que estamos ante una dicotomía: los LRM funcionan, pero no sabemos exactamente cómo. El escepticismo y el entusiasmo conviven en un campo que avanza rápido, pero sin una teoría unificada.

Tal vez la solución sea adoptar una perspectiva pragmática: usar la IA como herramienta, sin caer en la antropomorfización de sus procesos. Los mnemónicos ilusorios son útiles mientras no nos engañen.

Mientras tanto, los motores de la IA siguen rugiendo, impulsando avances y generando nuevas preguntas científicas. El veredicto final sobre si razonan o no sigue en el aire.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín