Claude Code, la herramienta de inteligencia artificial de Anthropic, ha asumido el mantenimiento diario de las aplicaciones internas de la empresa. En pocas semanas generó 388 pull requests y fusionó 180, lo que representa una tasa de éxito del 46%. El ingeniero Boris Cherny califica los resultados como ‘sorprendentemente positivos’.
***
- Claude Code ejecuta doce rutinas de mantenimiento diario en las aplicaciones de Anthropic, incluyendo fuzzing de errores, eliminación de código muerto y simplificación de lógica.
- En las primeras semanas, la IA creó 388 pull requests en los repositorios de la empresa, de las cuales 180 fueron fusionadas tras la revisión humana, un 46% de aceptación.
- El ingeniero Boris Cherny, creador de Claude Code, considera el experimento como un ‘signo temprano de vida’ para el mantenimiento autónomo de aplicaciones con IA.
Anthropic está probando si su propia herramienta de inteligencia artificial, Claude Code, puede encargarse del mantenimiento diario del software interno de la compañía. Según informó The Decoder, el ingeniero Boris Cherny, creador de Claude Code, reveló que la IA ha estado ejecutando rutinas de mantenimiento durante las últimas semanas en todas las plataformas de Anthropic: iOS, Android, escritorio, web, CLI y el Agent SDK.
La idea no es atar a los desarrolladores con tareas repetitivas, sino delegarlas a Claude, que opera de manera autónoma a través de un canal de Slack dedicado llamado “proj-claude-maintains-apps”. Cherny califica los resultados como “sorprendentemente positivos” y describe un escenario donde la IA maneja rutinas diarias sin intervención humana constante, aunque con revisión posterior de las modificaciones propuestas.
El experimento: Claude toma el control del mantenimiento
El experimento, que lleva “las últimas semanas” en curso, forma parte de un esfuerzo más amplio de Anthropic para evaluar los límites de sus propios sistemas de IA en tareas de ingeniería de software. Cherny, quien diseñó Claude Code, explica que la configuración actual permite que Claude, a través de una integración con Slack, inicie una batería de rutinas diarias que cubren todo el espectro del mantenimiento de código.
Entre las tareas delegadas se incluye un “Crash Fuzzer” que abre aplicaciones en un simulador, genera toques aleatorios para provocar fallos, analiza la causa raíz y crea una corrección automáticamente. También hay un “Dup Unifier” que escanea el código en busca de abstracciones similares pero ligeramente diferentes y propone fusionarlas, mientras que el “Dead-Code Remover” elimina código estáticamente inalcanzable y, para código sospechoso, añade registro para verificar al día siguiente si realmente se usa.
Cherny compartió algunos de los prompts utilizados en Slack, y no hay ingeniería de prompts elaborada: se le dice a Claude en lenguaje natural que inicie rutinas diarias para fuzzing de fallos en iOS, Android y escritorio, que use aplicaciones reales sin mocks, que provoque fallos y que cree pull requests con correcciones. Este enfoque sencillo ha demostrado ser efectivo, según el ingeniero, y ha llevado a que la IA genere propuestas de cambios que luego son revisadas tanto por herramientas automatizadas como por humanos.
El proceso de revisión combina la revisión automatizada de Claude Code con la supervisión humana, y la tasa de fusión ha alcanzado el 46% en las primeras semanas. Cuando una pull request no es aceptada, el equipo ajusta la rutina para que la IA mejore al día siguiente, y ese ajuste a veces toma varios días, pero ha demostrado ser un ciclo de aprendizaje efectivo.
Las doce rutinas que cubren todo el espectro
El sistema de mantenimiento de Claude Code se compone de doce rutinas especializadas que abarcan desde la búsqueda de errores hasta la mejora de la arquitectura. Además del Crash Fuzzer, el Dup Unifier y el Dead-Code Remover, existen otras nueve: el “Ant-only Shipper” entrega o elimina características internas olvidadas; el “Logic Simplifier” simplifica la lógica de negocio anidada; el “Logic Bug Fixer” modela lógica compleja para encontrar y corregir errores; el “Useless Test Pruner” elimina pruebas que nunca pueden fallar; el “Shipped-Feature Inliner” quita las banderas de características para características que ya se han lanzado por completo; el “Flaky-Test Fixer” analiza y corrige pruebas de CI inestables; el “Abstraction Improver” simplifica abstracciones sobre-diseñadas; y el “Abstraction Police” corrige violaciones de capas en la arquitectura.
Cada rutina se ejecuta de manera autónoma, pero los resultados se presentan como pull requests que luego se someten a revisión. Cherny señala que Claude generalmente acierta a la primera con las pull requests, aunque cuando no lo hace, el ajuste de la rutina para el día siguiente es parte del proceso de mejora continua. Este enfoque modular permite que cada rutina se pueda depurar independientemente, garantizando que el sistema evolucione con el tiempo.
La implementación de estas rutinas no requiere de una ingeniería de prompts compleja; en cambio, se basan en instrucciones claras y verificables. Por ejemplo, para el Crash Fuzzer, el prompt indica que se usen aplicaciones reales y se generen fallos, mientras que para el Dup Unifier se pide escanear el código y proponer fusiones. Esta simplicidad es una de las claves del éxito, según Cherny, porque permite que la IA ejecute tareas de manera predecible y con resultados medibles.
El hecho de que estas rutinas cubran todo el espectro del mantenimiento sugiere que Claude Code no se limita a tareas triviales, sino que también aborda problemas de arquitectura y lógica de negocio. Sin embargo, el experimento está aún en sus primeras fases, y los resultados iniciales son alentadores pero no concluyentes sobre la autonomía total de la IA en este tipo de operaciones.
Resultados: 388 pull requests, 46% de tasa de fusión
En las primeras semanas del experimento, Claude Code creó 388 pull requests en los repositorios de Anthropic. Después de una combinación de revisión automatizada y revisión humana, 180 de esas solicitudes fueron fusionadas, lo que representa una tasa de aproximadamente el 46 por ciento. Cherny destacó que Claude generalmente acierta a la primera con las pull requests, y cuando no lo hace, el equipo ajusta la rutina para que la IA mejore al día siguiente.
Ese ajuste a veces lleva unos días, pero es parte de un ciclo de aprendizaje iterativo que busca acelerar el proceso de fusión para este tipo de cambios mecánicos. Más de la mitad de las pull requests generadas automáticamente no llegaron a través, lo que dice algo sobre los límites y el potencial del enfoque. Aun así, Cherny describe el experimento como “signos tempranos de vida” de que el mantenimiento autónomo de aplicaciones impulsado por IA podría funcionar.
La tasa de fusión del 46% es notable si se considera que muchas de estas solicitudes son correcciones automáticas generadas por una IA que no había sido específicamente entrenada para estas tareas. El proceso de revisión humana actúa como un filtro de calidad, pero también como un mecanismo de control sobre los cambios propuestos, lo que garantiza que no se introduzcan errores graves en el código.
Aunque la cifra de 388 pull requests puede parecer alta en tan poco tiempo, la mayoría son cambios menores y mecánicos, como la eliminación de código muerto o la fusión de duplicados. Sin embargo, la presencia de rutinas como el Crash Fuzzer sugiere que la IA también es capaz de identificar y corregir errores reales de ejecución, lo que añade un valor significativo al proceso de desarrollo de Anthropic.
Implicaciones y próximos pasos
El experimento de Anthropic con Claude Code abre la puerta a una nueva era en el desarrollo de software, donde las tareas repetitivas de mantenimiento pueden ser delegadas a la IA. Si bien la tasa de éxito no es perfecta, el hecho de que una IA pueda manejar de manera autónoma una parte considerable del mantenimiento diario de una empresa tecnológica es un hito importante. Cherny mencionó que Anthropic está buscando formas de acelerar el proceso de fusión para estos cambios mecánicos, lo que podría aumentar aún más la eficiencia del sistema.
Para el equipo de Anthropic, el siguiente paso es perfeccionar las rutinas para que la IA aprenda de los errores y reduzca la cantidad de pull requests rechazadas. Esto implica un equilibrio entre confiar en la IA y mantener la supervisión humana, un desafío que muchas empresas tendrán que enfrentar a medida que adopten herramientas de desarrollo asistidas por IA. El experimento también plantea preguntas sobre el papel de los desarrolladores en un entorno donde la IA se encarga de las tareas mundanas, potencialmente liberando tiempo para trabajos más creativos y complejos.
La comunidad tecnológica ha recibido la noticia con interés, ya que demuestra que los modelos de lenguaje grandes no solo pueden generar código, sino también mantenerlo y mejorarlo de manera autónoma. Sin embargo, los expertos advierten que aún es temprano para extraer conclusiones definitivas sobre la autonomía total, dado que el experimento es pequeño y se limita al código interno de Anthropic.
En cualquier caso, el enfoque de Anthropic representa un paso concreto hacia la automatización del desarrollo de software, y es probable que otras empresas sigan su ejemplo en el futuro. La pregunta ya no es si la IA puede hacer mantenimiento de código, sino cómo se pueden integrar estas herramientas de manera segura y efectiva en los flujos de trabajo reales, garantizando la calidad y la supervisión humana adecuada.
Mientras tanto, Claude Code continúa con sus rutinas diarias, y los datos recopilados serán valiosos para mejorar tanto la herramienta como los procesos de integración. Cherny y su equipo planean seguir refinando las rutinas y explorar nuevas aplicaciones de Claude Code en el desarrollo de software, mientras observan de cerca los resultados para asegurar que la IA se convierte en un asistente confiable y no en un reemplazo problemático.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
Estudio tumba las promesas de Anthropic y OpenAI sobre investigación autónoma de IA
China
China utilizó inversión espacial en Nueva Zelanda para espiar, según inteligencia local
billonarios
La magnate minera Gina Rinehart revela participación de USD $1.400 millones en SpaceX
Capital de Riesgo