Por Canuto  

La evidencia pública disponible sitúa a Claude Opus 5 en 30,2% en ARC-AGI-3, la puntuación más alta registrada en ese evaluador hasta el 24 de julio de 2026. Aunque el borrador atribuía a Nvidia una prueba con un arnés capaz de elevar el resultado a 100%, ese dato no está respaldado por la evidencia disponible; por ello, el artículo se centra en cómo la memoria, el contexto y la supervisión pueden influir en el rendimiento de los agentes.
***

  • La página oficial de resultados de ARC Prize registra a Claude Opus 5 con 30,2% en ARC-AGI-3 al 24 de julio de 2026.
  • No hay evidencia verificable en los resultados disponibles para confirmar una puntuación de 100% obtenida con un arnés de Nvidia ni para identificarlo como AVO.
  • ARC-AGI-3 evalúa el razonamiento interactivo en entornos novedosos; OpenAI informó que ciertos ajustes de configuración elevaron su resultado de 13,3% a 38,3% en el conjunto público.


La elección del modelo de inteligencia artificial dejó de ser el único factor decisivo para construir agentes capaces de completar tareas complejas. Sin embargo, la afirmación de que Claude Opus 5 obtuvo 100% en ARC-AGI-3 dentro de un arnés personalizado de Nvidia no está respaldada por la evidencia disponible. La página oficial de resultados de ARC Prize registra a Claude Opus 5 (High) con una puntuación de 30,2% al 24 de julio de 2026, la más alta de ese evaluador hasta esa fecha.

El dato sí refuerza una discusión relevante para el desarrollo de agentes: el rendimiento final puede depender tanto del modelo como de la arquitectura que lo rodea. La memoria, la gestión del contexto, las herramientas y los mecanismos de supervisión pueden cambiar la forma en que un sistema afronta tareas prolongadas, aunque no permiten convertir automáticamente un resultado de referencia en una capacidad general.

El arnés convierte al modelo en un agente

Un arnés, o harness, es la capa de software que rodea al modelo y coordina elementos como la memoria, el contexto, las herramientas, el estado de la tarea y los mecanismos de seguridad. En un agente, esa estructura ayuda a organizar los ciclos de observación, planificación y acción, en lugar de dejar que el modelo gestione por sí solo cada aspecto del proceso.

Los resultados disponibles mencionan herramientas de Nvidia para construir sistemas agénticos y señalan que NVIDIA Labs ha presentado una vista previa de investigación denominada NVIDIA Labs Object-Oriented Agents. No obstante, no aportan evidencia suficiente para confirmar que el arnés utilizado en una prueba de Claude Opus 5 se llamara Agentic Harness, que estuviera identificado como AVO o que hubiera sido construido específicamente con componentes de NeMo.

La comparación entre ejecuciones con distintas configuraciones debe interpretarse con cautela. Dos sistemas que emplean el mismo modelo pueden ofrecer resultados diferentes si cambian las instrucciones, la memoria, el número de intentos, las herramientas disponibles o el método de evaluación. Eso no demuestra por sí solo que una configuración sea superior en todos los escenarios.

ARC-AGI-3 pone a prueba el razonamiento interactivo

ARC-AGI-3 es un punto de referencia diseñado para evaluar el razonamiento interactivo. Según la descripción de ARC Prize, los agentes deben explorar entornos novedosos, adquirir objetivos sobre la marcha y construir modelos del mundo adaptables. Los resultados de búsqueda también describen entornos o juegos bidimensionales en los que no se entregan instrucciones explícitas.

La puntuación de 30,2% de Claude Opus 5 no significa que el modelo resuelva cualquier tarea prolongada en condiciones reales. Indica su desempeño en una evaluación concreta y bajo la configuración registrada por ARC Prize. Tampoco permite concluir que haya alcanzado un nivel humano general, ni respalda una supuesta puntuación perfecta obtenida mediante un arnés de Nvidia.

Otros resultados muestran hasta qué punto la configuración puede influir en las mediciones. OpenAI informó que, con el arnés oficial, GPT-5.6 Sol obtuvo 13,3% en el conjunto público de ARC-AGI-3, mientras que una configuración con razonamiento retenido y compactación llegó a 38,3%. En ese caso, la mejora fue atribuida a cambios de configuración, pero no constituye una prueba de que el arnés sea el único factor que explique las diferencias entre modelos.

La conclusión prudente es que comparar modelos únicamente mediante una cifra aislada puede ocultar el efecto del sistema que los acompaña. El rendimiento observado depende de la combinación entre modelo, instrucciones, memoria, herramientas, ciclos de evaluación y mecanismos para detener o redirigir una estrategia fallida.

Un supervisor para evitar caminos sin salida

Una arquitectura agéntica puede incorporar un componente supervisor separado del agente principal que ejecuta el trabajo. Ese supervisor puede revisar el rumbo general, detectar señales de deterioro y recomendar un cambio de estrategia cuando el sistema se aproxima a un callejón sin salida.

La supervisión añade una segunda capa de control sobre el proceso. Mientras el agente principal intenta resolver el problema, otro componente puede evaluar los resultados intermedios y comprobar si las acciones siguen alineadas con el objetivo. Este diseño no elimina los errores, pero puede limitar la perseverancia ciega y mejorar la recuperación ante fallos.

El concepto no es completamente nuevo y su utilidad depende de cómo se implemente. Un supervisor mal configurado puede añadir latencia, consumo de recursos o decisiones contradictorias. Por ello, cualquier afirmación sobre mejoras concretas debe apoyarse en resultados reproducibles que describan el modelo, el arnés y el protocolo de evaluación.

Causas de movimientos recientes

En este caso no corresponde atribuir un movimiento o una mejora de mercado a un catalizador confirmado: la evidencia disponible trata sobre resultados de referencia de inteligencia artificial y no aporta datos de cotizaciones ni una relación causal con los mercados. La explicación más plausible es que las diferencias observadas respondan a la configuración experimental —incluidos el arnés, la memoria y la compactación—, pero el motivo exacto no está identificado.

Errores, seguridad y costo de operación

La necesidad de mejorar los arneses surge también de las fallas observadas en tareas prolongadas. El borrador original mencionaba un estudio de Microsoft sobre 19 modelos y trabajos de edición documental, además de una investigación de Databricks sobre costos; sin embargo, los resultados disponibles solo muestran páginas de notas de Azure Databricks, precios de AI Search y comunicados corporativos, no los hallazgos concretos descritos. Por eso, esas afirmaciones no pueden presentarse aquí como conclusiones verificadas.

En términos generales, los sistemas que encadenan decisiones autónomas pueden introducir riesgos cuando reciben acceso amplio a archivos, bases de datos o herramientas externas. La memoria y la supervisión deben acompañarse de límites de permisos, registros de actividad y mecanismos para detener acciones peligrosas. El arnés es, por tanto, una cuestión de seguridad y control, además de eficiencia.

El arnés también puede alterar el costo de utilizar un modelo, porque las decisiones sobre memoria, llamadas a herramientas y ciclos de razonamiento determinan cuántos recursos consume cada tarea. Una comparación económica rigurosa debe considerar la pila completa y no únicamente el precio por token o la tarifa asociada al modelo.

El avance hacia arquitecturas abiertas

El interés por los arneses abiertos refleja la búsqueda de mayor control sobre la memoria, la infraestructura y el entorno de ejecución. Si los desarrolladores pueden modificar esos componentes, también pueden adaptar el agente a necesidades específicas de precisión, seguridad y supervisión, sin depender por completo de una configuración cerrada.

El cambio de foco no implica que el modelo haya dejado de importar. Sus capacidades de comprensión, planificación y generación siguen delimitando lo que el agente puede hacer. La evidencia sobre Claude Opus 5 y ARC-AGI-3 muestra un avance destacado —30,2% en el registro oficial consultado—, mientras que los experimentos de configuración de OpenAI ilustran que el modo de ejecución también puede influir en el resultado.

Para los desarrolladores, la lección es que construir agentes no consiste simplemente en conectar un modelo potente a una interfaz. La competencia también se trasladará al diseño de memoria, herramientas, supervisores y mecanismos de recuperación, componentes capaces de decidir si una inteligencia artificial avanza con criterio o se pierde después de muchas decisiones.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín