El agente Lean de código abierto de NEAR AI completó los 672 problemas de PutnamBench por USD $111, una cifra muy inferior a la de otros envíos conocidos. El resultado, atribuido a una publicación de Alex Skidanov, coloca la eficiencia computacional y la verificabilidad matemática en el centro de la conversación sobre el futuro de la inteligencia artificial.
***
- El agente Lean de NEAR AI resolvió los 672 problemas codificados en Lean 4 que integran PutnamBench.
- La ejecución completa costó USD $111, frente a un envío conocido que habría sido 250 veces más caro.
- NEAR Protocol vinculó el avance con su visión de IA confidencial y verificable, además de presentar el agente como código abierto.
🤖📐 NEAR AI resuelve 672 problemas por USD 111
Su agente Lean, de código abierto, completó PutnamBench en Lean 4.
Según el equipo, el costo fue 250 veces menor que el envío conocido más barato.
Cada solución fue verificada formalmente por Lean. pic.twitter.com/6gxfsyjUtP
— Diario฿itcoin (@DiarioBitcoin) September 6, 2026
El agente Lean de código abierto desarrollado por NEAR AI resolvió, según el anuncio difundido por el equipo, los 672 problemas del benchmark PutnamBench por un costo total de USD $111. Alex Skidanov compartió el resultado en una publicación asociada con NEAR, destacando una diferencia de eficiencia que podría ampliar el acceso a la investigación en demostración automatizada de teoremas. El envío conocido más barato anterior habría costado 250 veces más, de acuerdo con la información difundida por KuCoin y otros medios.
La importancia del resultado no se limita a completar una lista de ejercicios matemáticos. PutnamBench exige que cada solución se formalice en Lean 4, un asistente de pruebas que somete los argumentos a una verificación rigurosa y rechaza cualquier paso que no pueda comprobarse lógicamente. Para la inteligencia artificial, esa exigencia representa una prueba especialmente dura: no basta con producir una respuesta plausible, porque el sistema debe construir una demostración que una máquina pueda auditar de principio a fin.
Un benchmark diseñado para medir razonamiento formal
PutnamBench fue introducido en 2024 como una suite de evaluación para demostradores de teoremas basados en inteligencia artificial. Sus problemas proceden de la Competición Matemática William Lowell Putnam, considerada una de las principales competencias universitarias de matemáticas de América del Norte. La dificultad de ese examen es elevada incluso para estudiantes con un desempeño académico sobresaliente.
El benchmark transforma esa dificultad tradicional en un entorno donde la precisión formal tiene prioridad absoluta. Los problemas no se resuelven mediante una explicación informal o una intuición correcta, sino mediante instrucciones escritas en Lean 4 que deben satisfacer las reglas del verificador. Por eso, un argumento descuidado no recibe crédito parcial: el motor lo rechaza cuando encuentra una inconsistencia, un salto lógico o una afirmación que no puede demostrar.
La comparación divulgada por NEAR AI sitúa el costo de su ejecución completa en USD $111 y afirma que el envío conocido más barato anterior costaba 250 veces más. La magnitud exacta de los costos de otros sistemas no queda establecida por los datos disponibles, pero la diferencia anunciada apunta a una reducción sustancial del gasto necesario para experimentar con este tipo de herramientas.
La diferencia económica también afecta quién puede participar en el desarrollo de agentes matemáticos. Cuando una ejecución completa exige una inversión elevada, solo un grupo reducido de organizaciones puede repetir las pruebas, comparar estrategias y ajustar sus sistemas con frecuencia. Un costo de USD $111 abre la posibilidad de que más investigadores exploren flujos de trabajo agénticos que combinen modelos de lenguaje con un verificador formal, aunque el resultado por sí solo no demuestra que todos los problemas puedan resolverse con igual eficiencia en otros entornos.
La apuesta de NEAR por una inteligencia artificial verificable
El avance llega en un momento en que los resultados de PutnamBench han mejorado con rapidez gracias a sistemas que integran modelos de lenguaje y motores de verificación. El agente Lean de NEAR AI extiende esa tendencia con una capa de eficiencia que, según la información difundida, no había sido observada previamente por la comunidad del benchmark. La cifra de USD $111 convierte el costo de inferencia en una parte central de la noticia, porque permite medir el desempeño no solo por problemas resueltos, sino también por recursos utilizados.
NEAR AI presentó este logro dentro de una visión más amplia relacionada con IronClaw, un marco orientado a la inteligencia artificial confidencial y verificable. La conexión con las pruebas formales es directa: cuando un sistema produce un argumento matemático que Lean puede comprobar, el resultado puede someterse a una auditoría independiente en lugar de aceptarse únicamente por la confianza depositada en el modelo. Esa lógica apunta a una clase de aplicaciones donde la trazabilidad y la comprobación importan tanto como la capacidad de generar respuestas.
La verificación formal no elimina todos los desafíos de la inteligencia artificial, pero sí establece una frontera clara entre una salida convincente y una salida demostrada. En el caso de PutnamBench, cada solución debe superar el control del sistema Lean, lo que reduce el riesgo de que una respuesta aparentemente correcta contenga errores ocultos. Para investigadores y desarrolladores, esa propiedad ofrece una base más sólida para evaluar agentes que pretenden razonar sobre matemáticas, software u otros dominios con reglas explícitas.
El componente de código abierto añade otra dimensión al anuncio de NEAR Protocol. La liberación del agente permitiría inspeccionar, extender y utilizar su metodología, aunque el impacto final dependerá de la capacidad de la comunidad para reproducir el resultado y adaptarlo a nuevos problemas. El hito plantea una pregunta relevante para el sector: cuánto más accesible puede volverse la investigación avanzada cuando la eficiencia deja de estar reservada a los laboratorios con mayores presupuestos.
El caso de PutnamBench también muestra por qué el costo de operación se ha convertido en una métrica estratégica para los agentes de IA. Resolver un benchmark una sola vez demuestra capacidad, pero hacerlo con una factura reducida facilita iteraciones, correcciones y comparaciones que pueden acelerar el progreso técnico. NEAR AI aún deberá demostrar cómo se comporta su agente fuera de este conjunto específico, mientras que la comunidad tendrá que evaluar la reproducibilidad del anuncio. Por ahora, el resultado ofrece una referencia concreta para medir la relación entre razonamiento formal, código abierto y gasto computacional.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Estados Unidos
OpenAI afirma que sus agentes de IA ya realizan tres veces más investigación que su personal humano
AltCoins
FET rebota con fuerza del 5% y despierta el apetito alcista de los traders
Bitcoin
Berlín rechazó el rescate de Rhysida y ahora coordina cuatro fuerzas de tarea
Hardware