Por Canuto  

Una extensión creada por investigadores de NVIDIA, NTU y MIT promete reducir entre 44,7% y 49% el tráfico de tokens de agentes de código, con una disminución cercana al 33% en el costo de API y un rendimiento todavía próximo al de Pi.
***

  • SoL-Pi reduce entre 44,7% y 49% el tráfico de tokens frente a Pi en una evaluación de 51 tareas.
  • La extensión combina Action Fusion, Online Context Compact, ObservationPack y Evidence-Preserving Reducer.
  • El sistema mantuvo cerca del 94% del puntaje de Pi y redujo el costo de API aproximadamente 33%.


Los agentes de código pueden pasar horas editando archivos, ejecutando pruebas y revisando registros, pero cada una de esas acciones también incrementa el contexto que debe procesar el modelo. En ese escenario, investigadores de NVIDIA, NTU y MIT presentaron SoL-Pi, una extensión de código abierto diseñada para reducir el tráfico de tokens sin modificar la versión base de Pi. Según los resultados difundidos, el sistema recortó entre 44,7% y 49% los tokens registrados en EdgeBench y disminuyó el costo de API cerca de 33%.

La propuesta no busca principalmente acelerar los chips, comprimir los modelos o sustituirlos por alternativas más baratas, sino intervenir en el arnés que coordina al agente. Esa capa administra las llamadas a herramientas, el contexto, las observaciones y la delegación de tareas, por lo que puede determinar cuánta información vuelve al modelo después de cada paso. En las pruebas reportadas, SoL-Pi conservó un rendimiento cercano al de Pi con GPT-5.6 Sol y Opus 5, aunque los investigadores advirtieron que su transferencia entre modelos todavía es preliminar.

Una búsqueda automatizada sobre el arnés

La investigación parte de un problema habitual en los agentes autónomos: una sesión prolongada puede acumular ediciones, resultados de comandos, registros de compilación y evidencias repetidas. Cada observación regresa al contexto y eleva el consumo de tokens, incluso cuando buena parte de ese material ya no resulta necesaria para la siguiente decisión. SoL-Pi intenta reducir ese desperdicio sin eliminar los datos que podrían ser relevantes para verificar si una tarea terminó correctamente.

Para encontrar sus mecanismos, una inteligencia artificial observó las trayectorias de ejecución de un agente separado que utilizaba Pi base, propuso cambios en el arnés y los sometió a pruebas. La búsqueda exploró 152 direcciones agrupadas en seis familias: contexto, progreso, herramientas, delegación, instrucciones y política. El proceso acumuló más de 3.000 ejecuciones y más de 60.000 interacciones entre agente y entorno.

El equipo también utilizó 535 entornos ejecutables, incluidos 495 construidos a partir de pares de problemas y solicitudes de incorporación de cambios de GitHub, junto con 40 tareas sintéticas dotadas de verificadores ejecutables. Cada búsqueda funcionó como un ciclo aislado y desechable, con un paso de implementación inspirado en Ralph Loop y la revisión de un evaluador independiente. Las reglas de aceptación quedaron fijadas antes de la búsqueda, de modo que el optimizador no pudiera cambiarlas para favorecer sus propios resultados.

La evaluación reservada tuvo un papel central para contener el sobreajuste. De las 51 tareas públicas de EdgeBench, 11 se utilizaron para la aceptación unidireccional de candidatos congelados y 40 quedaron destinadas a la evaluación final, sin devolver sus resultados al proceso de búsqueda. Además, cada métrica de capacidad debía mantenerse dentro de una tolerancia declarada y el candidato tenía que mejorar al menos una métrica de eficiencia.

Cuatro mecanismos para reducir el consumo

El primer mecanismo, Action Fusion, combina en una sola solicitud de herramienta acciones que Pi normalmente ejecuta por separado. Por ejemplo, si el agente edita un archivo y luego emite un comando para probarlo, compilarlo o ejecutarlo, el sistema puede fusionar ambos pasos y devolver sus resultados dentro de una única observación. Con ello elimina un ciclo de ida y vuelta del modelo, aunque su beneficio depende del tipo de tarea y de la compatibilidad entre las acciones solicitadas.

El segundo componente, Online Context Compact, sigue los pasos del plan mediante la función update_plan y estima cuántas solicitudes quedan por ejecutar. Después compara el ahorro proyectado de entrada con el costo adicional de reescribir la caché de instrucciones, y activa la compactación nativa de Pi cuando la operación resulta conveniente o cuando el contexto se acerca al límite de la ventana. La lógica busca evitar tanto la acumulación excesiva como una compactación prematura que encarezca el proceso.

ObservationPack adopta otra estrategia para las salidas extensas. Cuando una herramienta produce más de 10 KiB, el contenido se archiva localmente y se envía completo al proveedor durante las dos solicitudes siguientes; desde la tercera, el modelo recibe un identificador estable, el tamaño original y un extracto breve de las líneas iniciales y finales. Las páginas exactas permanecen recuperables mediante ese identificador, lo que permite conservar acceso a la evidencia sin repetir continuamente todo el registro.

El cuarto mecanismo, Evidence-Preserving Reducer, procesa los registros de compilación y pruebas de al menos 4 KiB con un modelo más barato, GPT-5.6 Luna configurado en high. Ese modelo redacta un recibo compacto que un verificador determinista revisa mediante el esquema, el hash de la fuente, el estado de salida, las citas exactas y el tamaño final. El arnés vuelve al registro original si la verificación falla, si sospecha la presencia de credenciales o si el recibo no resulta más pequeño que el material de partida.

Resultados frente a Pi y otros arneses

En EdgeBench, la configuración orientada a la eficiencia de SoL-Pi registró 1,10 billones de tokens con GPT-5.6 Sol, frente a 2,15 billones de Pi y 3,05 billones de Codex. El costo de API descendió a USD $894, desde USD $1.339 de Pi y USD $1.787 de Codex, mientras el puntaje promedio llegó a 42,0, por debajo de los 44,8 puntos de Pi, pero todavía cerca de su nivel de capacidad.

Con Opus 5, SoL-Pi en su configuración de eficiencia utilizó 1,31 billones de tokens y tuvo un costo de USD $1.158, frente a 2,37 billones y USD $1.741 de Pi. Su puntaje promedio fue de 42,2, mientras Pi alcanzó 44,8 y Claude Code llegó a 43,7 con un gasto de USD $2.535. En términos relativos, la pila completa conservó 94,3% del puntaje de Pi en Opus 5 y redujo 44,7% el tráfico de tokens.

La configuración denominada Rendimiento seleccionó el mejor mecanismo individual para cada modelo y produjo un resultado diferente. En GPT-5.6 Sol, ObservationPack elevó el puntaje a 47,2, un 5,3% por encima de Pi, con 2,02 billones de tokens y un costo de USD $1.271; en Opus 5, Action Fusion llevó el puntaje a 50,5, un 12,8% superior al de Pi, con 2,10 billones de tokens y USD $1.605 de costo.

El sistema completo mantuvo en GPT-5.6 Sol un puntaje equivalente al 93,7% del obtenido por Pi, pero redujo 49,0% los tokens y 33,2% el costo de API. La optimización, sin embargo, elevó el tráfico de escritura en caché de 0,0141 billones a 0,0316 billones de tokens, aunque el costo total bajó de USD $1.339 a USD $894. El artículo estima ahorros por hora de USD $8,75 a USD $13,50 frente a Codex y Claude Code, y de USD $4,36 a USD $5,71 frente a Pi.

Pruebas adicionales y límites de la propuesta

Fuera de EdgeBench, SoL-Pi resolvió 15 de las 63 tareas de Terminal-Bench 4 ejecutadas solamente con CPU, mientras Codex y Pi resolvieron 18 cada uno. Aun con la misma cantidad inferior de tareas superadas, el sistema redujo el costo total 26,3% frente a Pi, al pasar de USD $286,45 a USD $211,12. El resultado sugiere que la eficiencia económica puede mantenerse en escenarios distintos, aunque no implica una ventaja general en capacidad de resolución.

En los problemas de la Olimpiada Internacional de Matemáticas de 2026 verificados con Lean 4, SoL-Pi aprobó tres de seis ejercicios, igualando a Pi y registrando el menor costo por problema aprobado, de USD $20,90. Codex superó cinco problemas en esa comparación, por lo que el ahorro de recursos no eliminó la diferencia de rendimiento en esa prueba. La cifra debe leerse como un resultado específico de ese conjunto y no como una medición universal de razonamiento matemático.

La evaluación también contempló un enjambre de agentes coordinado por Codex con 20 trabajadores SoL-Pi. Esa combinación alcanzó 1.127 ciclos por USD $60,11, mientras 20 trabajadores Pi llegaron a 1.366 ciclos por USD $82,12; un único agente Codex siguió siendo la alternativa más barata, con USD $39,20 y 1.333 ciclos. El contraste muestra que el arnés puede mejorar el costo de una flota, aunque la cantidad de ciclos y el precio no siempre favorecen la misma configuración.

Los investigadores calificaron como preliminar la transferencia entre modelos, porque los mecanismos se activaron con menor frecuencia en Opus 5 que en GPT-5.6 Sol. La búsqueda completa se construyó sobre GPT-5.6 Sol y luego se trasladó a Opus 5 sin realizar una nueva exploración, una decisión que puede explicar parte de la diferencia. Por ahora, SoL-Pi se presenta como una extensión opcional, no como un reemplazo definitivo de todos los arneses de agentes.

Una extensión disponible para Pi

SoL-Pi se distribuye en GitHub bajo la organización NVlabs como una extensión con licencia MIT y funciona sobre una versión de Pi sin modificar. El proyecto fue probado con Pi 0.85.1 y Node.js 22.19 o versiones posteriores, una condición relevante para quienes quieran reproducir las pruebas o integrarlo en flujos de trabajo existentes. Su diseño modular permite activar los mecanismos sin abandonar necesariamente el arnés original.

La decisión de trabajar sobre el arnés tiene implicaciones más amplias para el desarrollo de agentes de código. Las mejoras tradicionales suelen concentrarse en kernels más rápidos, cuantización o modelos con menor precio por token, pero SoL-Pi intenta reducir la cantidad de información que el sistema necesita intercambiar. Esa diferencia puede ser importante en tareas prolongadas, donde los costos acumulados de contexto, caché y observaciones terminan superando el precio de una llamada individual.

Al mismo tiempo, la reducción de información introduce riesgos que el diseño intenta controlar mediante recuperación de registros y verificaciones deterministas. Archivar salidas, resumir pruebas o fusionar acciones puede ahorrar tokens, pero también puede ocultar una señal necesaria para corregir un error si el agente pierde acceso a la evidencia. Por eso, el regreso automático al material original ante fallas o sospechas de credenciales constituye una pieza de seguridad, no solamente una optimización de costos.

La disponibilidad bajo una licencia abierta permitirá que otros equipos prueben los cuatro mecanismos en diferentes modelos, tareas y proveedores de API. Sin embargo, los resultados publicados no garantizan que cada integración alcance los mismos porcentajes, especialmente porque la activación de los mecanismos depende de las trayectorias del agente y de la estructura de cada entorno. La siguiente etapa será comprobar si la eficiencia observada se mantiene en tareas no vistas y en despliegues de mayor escala.

En conjunto, SoL-Pi plantea que una parte significativa del costo de los agentes autónomos puede estar en la coordinación y no únicamente en el modelo que genera el código. La reducción de hasta 49% en tokens y de aproximadamente 33% en API resulta atractiva para operaciones prolongadas, mientras los puntajes cercanos a Pi sugieren un compromiso controlado. El reto será demostrar que ese equilibrio resiste más modelos, más dominios y condiciones de producción menos previsibles.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín