Por Canuto  

Claude Opus 5 obtuvo 30,2% en ARC-AGI-3, casi cuatro veces el récord anterior, aunque pruebas independientes plantean dudas sobre el alcance real de su ventaja.
***

  • Claude Opus 5 alcanzó 30,2% en ARC-AGI-3, frente al récord previo de 7,8% de GPT-5.6 Sol (Max).
  • El modelo resolvió cinco entornos inéditos y mostró capacidades nuevas, como traducir tareas a notación algebraica.
  • El resultado en Witness, de 43,4%, sugiere una mejora más moderada y mantiene abierto el debate sobre el entrenamiento específico.

 

Claude Opus 5, el modelo de inteligencia artificial desarrollado por Anthropic, alcanzó 30,2% en ARC-AGI-3. El resultado lo convirtió en el nuevo líder del benchmark diseñado para evaluar la capacidad de resolver problemas inéditos.

La puntuación supera casi cuatro veces el récord anterior, situado en 7,8%. Ese registro pertenecía a GPT-5.6 Sol (Max), de OpenAI, según los datos divulgados por ARC Prize y reseñados por The Decoder.

El desempeño también dejó atrás a los modelos de clase Fable de Anthropic. Estas versiones habían alcanzado aproximadamente 20% en la misma evaluación, de acuerdo con el equipo responsable del benchmark.

Opus 5 resolvió cinco entornos que ningún modelo había logrado completar antes. Cuatro de esos entornos fueron superados a nivel humano o superior, un resultado que amplió la distancia frente a sus competidores.

Durante las pruebas, el modelo mostró comportamientos que los investigadores no habían observado previamente en un sistema de inteligencia artificial. Entre ellos apareció la traducción de tareas a notación algebraica.

El sistema también formuló de manera independiente ecuaciones de reflexión. Esta conducta llamó la atención porque sugiere una estrategia explícita para representar y manipular reglas dentro de escenarios desconocidos.

Qué mide ARC-AGI-3

ARC-AGI-3 busca medir qué tan bien un modelo puede resolver tareas nuevas que no encontró durante su entrenamiento. El benchmark se enfoca especialmente en problemas que los humanos suelen manejar con relativa facilidad.

La versión actual funciona como un juego interactivo. El modelo debe inferir las reglas de un entorno, planificar una secuencia de acciones y ejecutarla paso a paso para alcanzar un objetivo.

Este diseño intenta evaluar el razonamiento general en lugar de premiar únicamente el conocimiento almacenado. Por eso, una puntuación elevada exige descubrir relaciones, probar hipótesis y corregir errores dentro del propio entorno.

El análisis de ARC Prize atribuyó la ventaja de Opus 5 a un razonamiento lógico más sólido. Según el equipo, esa capacidad permite explorar, planificar y ejecutar acciones con mayor autonomía en entornos desconocidos.

Seis de los 25 entornos de demostración pública ya fueron resueltos. Los resultados, las reproducciones y el código utilizado para el benchmark están disponibles públicamente.

El equipo también distingue entre el modelo y las herramientas externas que pueden acompañarlo. Algunos sistemas podrían haber superado la prueba usando software adicional, conocido como un arnés, pero las puntuaciones oficiales consideran solo el desempeño del modelo de lenguaje.

Resultados anteriores y posibles límites

En ARC-AGI-2, Claude Opus 5 obtuvo 90,4%. En ARC-AGI-1 alcanzó 97,5%, cifras que igualan los máximos registrados anteriormente, aunque con un costo ligeramente mayor, según The Decoder.

ARC Prize sostiene que los futuros sistemas de inteligencia artificial general no deberían depender de ayuda externa para resolver tareas nuevas. Bajo esa lógica, el resultado oficial debe reflejar las capacidades propias del modelo.

El análisis también plantea que Opus 5 podría haber conseguido una puntuación superior dentro de Claude Code. Sin embargo, esa posibilidad no forma parte del resultado oficial presentado para la comparación.

Anthropic no explicó cuál fue la causa exacta de la mejora. El etiquetado dirigido de datos y el aprendizaje por refuerzo aparecen como factores plausibles, aunque la información disponible no confirma una explicación definitiva.

Opus 5 se desarrolló después de que ARC-AGI-3 se hiciera público. Ese calendario pudo permitir que Anthropic orientara ciertas habilidades y formatos de rompecabezas, sin demostrar que el modelo haya sido entrenado con las tareas exactas.

Los anotadores pudieron etiquetar rastros de razonamiento, acciones útiles, intentos fallidos y pasos de recuperación en rompecabezas similares. Luego, el aprendizaje por refuerzo pudo premiar la exploración, el descubrimiento de reglas, la planificación y la autocorrección.

Las pruebas de Witness moderan el entusiasmo

Las pruebas independientes realizadas en Witness ofrecen una imagen menos contundente. Se trata de un benchmark privado creado por Guanghan Ning para evaluar el desempeño en juegos de rompecabezas interactivos.

En Witness, Opus 5 obtuvo 43,4%. El resultado empató estadísticamente con Kimi K3 y Fable 5, mientras que la mejora frente a Opus 4.8 fue mucho menor que la observada en ARC-AGI-3.

En un rompecabezas basado en mecánicas comunes, Opus 5 identificó las reglas ocultas antes de realizar su primer movimiento. Esa conducta reflejó una preparación estratégica más visible que en modelos anteriores.

Sin embargo, su desempeño cayó cuando el juego combinó reglas de una forma menos familiar. En ese caso, Opus 5 obtuvo una puntuación inferior a la de Opus 4.8.

Ning consideró que ese patrón puede ser compatible con un entrenamiento realizado sobre datos específicos del género. Witness no permite determinar qué datos empleó Anthropic, por lo que la prueba no identifica el origen de la ventaja.

Greg Kamradt, uno de los investigadores de ARC-AGI-3, afirmó que los resultados no descartan mejoras más amplias en el razonamiento. También señaló que un rompecabezas convencional quizá no mida bien la novedad si utiliza mecánicas familiares.

Un debate similar al de los benchmarks de codificación

Kamradt añadió que el desempeño más débil en un juego inusual podría representar una regresión aislada. Opus 4.8, por ejemplo, superó a Opus 5 en algunos juegos de ARC-AGI-3, aunque quedó por detrás en el resultado general.

Ning aclaró posteriormente que Opus 5 sí mostró mejoras más amplias en Witness. No obstante, indicó que esas ganancias fueron mucho menores que las registradas en ARC-AGI-3.

Para medir el alcance real de la mejora, sería necesario observar resultados detallados en tareas más desconocidas. Las cifras agregadas pueden ocultar diferencias importantes entre mecánicas familiares, combinaciones poco habituales y entornos completamente nuevos.

Ning comparó esta evolución con la historia de los benchmarks de codificación. Según su planteamiento, las pruebas iniciales pueden saturarse cuando los modelos aprenden los patrones más frecuentes de un conjunto limitado.

La codificación siguió un recorrido desde benchmarks saturados como HumanEval hasta competencias que se actualizan con frecuencia. En paralelo, aparecieron agentes de programación capaces de operar en escenarios más complejos.

ARC-AGI-3 podría seguir una trayectoria parecida. Como objetivo importante para el razonamiento interactivo, probablemente reciba primero el mayor esfuerzo de entrenamiento, mientras los investigadores incorporan nuevos casos límite.

La incorporación de esos casos podría obligar a los modelos a manejar una gama más amplia de tareas de razonamiento abstracto. Por ahora, el récord de Claude Opus 5 constituye un avance notable, pero no resuelve por sí solo la discusión sobre la inteligencia general.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín