Por Canuto  

Kimi AI y kvcache-ai publicaron AgentENV bajo licencia MIT, una plataforma distribuida que utiliza microVMs Firecracker, instantáneas y bifurcaciones rápidas para entrenar agentes de IA mediante aprendizaje por refuerzo.
***

  • AgentENV ejecuta cada entorno en una microVM Firecracker con su propio núcleo Linux, sistema de archivos y espacio de nombres de red.
  • Las instantáneas permiten reanudar entornos en menos de 50 milisegundos y bifurcar un sandbox en hasta 16 hijos independientes.
  • Su API HTTP es compatible con E2B y admite despliegues mediante instalación directa, Docker, Docker Compose, Kubernetes o compilación desde Rust.


El equipo Kimi de Moonshot AI y la empresa kvcache-ai publicaron AgentENV, también identificado como AENV, una plataforma distribuida para ejecutar entornos de agentes a gran escala. El proyecto busca resolver uno de los principales obstáculos del aprendizaje por refuerzo agentic: ofrecer computadoras aisladas, rápidas y replicables para que los modelos puedan actuar sobre sistemas reales.

La plataforma impulsa el entrenamiento de aprendizaje por refuerzo agentic para Kimi K3, el modelo Mixture-of-Experts de Moonshot AI que cuenta con 2,8 billones de parámetros. AgentENV se distribuye bajo una licencia MIT, por lo que los desarrolladores pueden estudiar, modificar y reutilizar su código.

Según MarkTechPost, el sistema combina microVMs Firecracker, almacenamiento por capas, instantáneas incrementales y una arquitectura distribuida. La propuesta apunta a que los equipos ejecuten miles de entornos sin asumir el costo operativo de iniciar y mantener máquinas virtuales completas de manera tradicional.

El desafío de entrenar agentes en computadoras reales

El aprendizaje por refuerzo agentic exige más que generar texto. El modelo debe interactuar con una computadora que tenga un sistema operativo, archivos, procesos activos y acceso a una pila de red.

Cada ejecución necesita un entorno Linux aislado para que el agente pueda instalar dependencias, modificar archivos, ejecutar comandos y completar tareas. Esa exigencia aumenta la complejidad frente a los sistemas que solo producen respuestas dentro de una ventana de texto.

Los contenedores ofrecen tiempos de inicio reducidos y un uso eficiente de los recursos. Sin embargo, comparten el núcleo del sistema anfitrión, una característica que puede debilitar el aislamiento cuando el código generado por un modelo actúa de manera impredecible.

Las máquinas virtuales completas ofrecen una separación más sólida, porque cada instancia puede utilizar su propio núcleo y sus propios componentes del sistema. El problema aparece en los tiempos de arranque y en la memoria que permanecen ocupando mientras las máquinas están inactivas.

AgentENV intenta ubicarse entre ambos extremos. Su diseño utiliza microVMs Firecracker para mantener un aislamiento basado en el núcleo, mientras incorpora mecanismos de pausa, reanudación e instantáneas que reducen el costo de operar muchos entornos.

Una arquitectura basada en microVMs Firecracker

Cada sandbox de AgentENV funciona dentro de una microVM Firecracker. La instancia cuenta con su propio núcleo Linux, sistema de archivos y espacio de nombres de red, lo que separa sus operaciones del entorno anfitrión.

Las solicitudes llegan mediante una API HTTP construida con Axum. Después, un orquestador se encarga de administrar el ciclo de vida del sandbox, desde su creación hasta las acciones de pausa, reanudación, bifurcación y eliminación.

El almacenamiento utiliza un dispositivo de bloque de espacio de usuario denominado ublk. Este componente se apoya en imágenes con capas overlaybd, una estructura que permite compartir capas base de solo lectura entre diferentes sandboxes.

Cada entorno escribe sobre su propia capa superior. Así, una imagen base puede servir para múltiples ejecuciones sin obligar al sistema a duplicar todos sus datos en cada instancia.

Dentro de cada invitado funciona un daemon llamado envd. El servicio atiende en el puerto 49983 y administra la ejecución de comandos, las operaciones con archivos y los reportes de salud del entorno.

AgentENV también incluye un proxy inverso para dirigir tráfico HTTP y WebSocket desde los clientes hacia los servicios que se ejecutan dentro de la microVM. Esta capa facilita que los agentes interactúen con aplicaciones y herramientas disponibles en el sandbox.

Instantáneas rápidas y bifurcaciones paralelas

Las instantáneas representan uno de los elementos centrales del proyecto. AgentENV guarda de forma incremental los cambios de memoria y del sistema de archivos, en lugar de escribir una imagen completa cada vez que captura el estado de un entorno.

El proyecto reporta que los entornos respaldados por instantáneas pueden iniciar o reanudar en menos de 50 milisegundos. También señala que las pausas tardan menos de 100 milisegundos.

La captura de una instantánea incremental puede completarse en menos de 100 milisegundos, incluso cuando el disco registra una intensa actividad de modificación. Estas cifras buscan reducir el tiempo muerto durante las sesiones de entrenamiento.

La bifurcación permite que un sandbox en ejecución genere hasta 16 sandboxes hijos independientes en el mismo nodo. Para crear la copia, el sistema pausa brevemente el entorno original, captura su estado y luego lo reanuda.

Cada hijo hereda el sistema de archivos, la memoria y la configuración de recursos de la instancia fuente. Esto permite configurar una tarea una sola vez y ejecutar varias trayectorias de entrenamiento a partir del mismo punto de partida.

Un equipo puede instalar dependencias, clonar un repositorio y preparar un estado de trabajo específico. Después, AgentENV puede replicar ese estado para que los agentes exploren diferentes acciones en paralelo, sin repetir toda la fase de preparación.

Almacenamiento bajo demanda y densidad del clúster

Las imágenes se cargan bajo demanda mediante overlaybd. El disco local actúa como una caché limitada que conserva los datos utilizados con mayor frecuencia y expulsa los elementos que permanecen fríos.

Este esquema evita que los nodos tengan que precalentar cada imagen antes de iniciar una tarea. También reduce la necesidad de conservar una copia completa de todas las instantáneas en cada servidor.

Como consecuencia, el conjunto de imágenes direccionables puede superar la capacidad del disco local. El sistema mantiene el acceso rápido a los datos más utilizados sin exigir que toda la biblioteca de entornos esté almacenada permanentemente en cada nodo.

El repositorio de instantáneas se divide en tres capas. Un espacio de trabajo de construcción conserva los artefactos durante una compilación, un repositorio comprometido funciona como fuente duradera de verdad y una caché local mantiene las configuraciones derivadas del lanzamiento.

AgentENV admite los backends posix_fs, que funciona de manera predeterminada, y oss. La segunda opción utiliza un cliente compartido compatible con S3 y requiere especificar de forma explícita una región.

El proyecto también ofrece un transporte opcional entre pares basado en iroh. Esta función puede anunciar artefactos comprometidos a otros nodos, aunque permanece deshabilitada por defecto y no modifica el modelo de instantáneas comprometidas.

Para los despliegues con almacenamiento compartido, la documentación solicita una conexión de al menos 1 Gbps. Además, recomienda utilizar una red de 10 Gbps o más rápida.

Compatibilidad con E2B y opciones de implementación

AgentENV expone una API HTTP compatible con E2B. Los equipos pueden apuntar la variable E2B_API_URL al servidor de AgentENV y utilizar los SDK oficiales de E2B para Python o TypeScript sin cambiar el código de sus agentes.

Esta compatibilidad funciona como una estrategia de adopción. Los desarrolladores que ya ejecutan agentes sobre E2B pueden autoalojar el entorno de ejecución sin reescribir sus aplicaciones ni modificar la lógica principal de sus flujos.

El proyecto también incluye una CLI nativa llamada aenv. La documentación recomienda esta herramienta para los procesos que requieren funciones específicas de AgentENV.

El servidor necesita Linux 6.8 o una versión posterior, además de acceso a /dev/kvm. El script de instalación agrega un requisito de Ubuntu 24.04.

La CLI aenv funciona en Linux y macOS, tanto en arquitecturas x86_64 como arm64. El servidor, en cambio, solo opera en Linux porque depende de KVM.

Los desarrolladores pueden elegir entre cinco rutas de implementación. El proyecto ofrece un script que instala el servidor como servicio systemd, una imagen Docker publicada en ghcr.io/kvcache-ai/aenv-server, una pila Docker Compose, manifiestos de Kubernetes y una compilación desde el código fuente mediante la cadena de herramientas de Rust.

Docker Compose incluye una configuración que simula un clúster multinodo. Kubernetes incorpora un gateway, un programador y un DaemonSet para los nodos, mientras que las implementaciones multinodo agregan un gateway en el puerto 8080 y un programador en el puerto 9090.

Implicaciones para el entrenamiento agentic

La infraestructura de AgentENV está diseñada para que los agentes prueben acciones dentro de entornos reproducibles. La posibilidad de congelar un estado y retomarlo reduce la necesidad de reiniciar desde cero después de cada intento.

La bifurcación también puede ayudar a separar trayectorias de exploración. Un mismo estado inicial puede originar hasta 16 ejecuciones independientes en el mismo nodo, lo que facilita comparar resultados sin reconstruir cada entorno.

El uso de microVMs diferencia a AgentENV de una plataforma basada únicamente en contenedores. La separación del núcleo busca limitar los riesgos asociados con código generado por modelos que interactúan con el sistema operativo.

La densidad dependerá de la capacidad del hardware, la memoria disponible y el comportamiento de las cargas. AgentENV incorpora caché de páginas y ampliación de memoria para devolver al anfitrión la memoria recuperable del invitado y sostener el sobrecompromiso.

La plataforma también contempla un detalle operativo importante. Cada sandbox tiene un tiempo de vida definido, y cuando llega a su vencimiento el comportamiento predeterminado consiste en pausarlo, no en eliminarlo.

Para ordenar la eliminación automática, el usuario debe establecer autoPause: false al crear el sandbox. Esta diferencia puede afectar la administración de recursos en flotas con muchas ejecuciones temporales.

El código abierto bajo licencia MIT permite que otros equipos revisen la arquitectura y adapten el sistema a sus necesidades. Aun así, la documentación describe el plano de control multinodo como un prototipo, por lo que su madurez debe evaluarse antes de utilizarlo en operaciones críticas.

Con AgentENV, Kimi AI y kvcache-ai presentan una pieza de infraestructura enfocada en el crecimiento del aprendizaje por refuerzo agentic. La propuesta combina aislamiento de microVM, almacenamiento por capas, instantáneas rápidas y compatibilidad con E2B para reducir las barreras técnicas de entrenar agentes a gran escala.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín