Por Canuto  

Investigadores de Stanford desarrollaron Paper2Agent, un sistema que convierte artículos científicos y sus repositorios de código en agentes de IA capaces de ejecutar métodos, reproducir resultados y trabajar con datos nuevos mediante lenguaje natural.
***

  • Paper2Agent convierte artículos y repositorios en servidores MCP con herramientas, recursos y flujos de trabajo verificables.
  • El agente de AlphaGenome creó 22 herramientas en unos 45 minutos y obtuvo 100% en consultas novedosas.
  • El sistema agentificó 74 de 100 artículos de bioRxiv y respaldó una hipótesis sobre GPR137 en psoriasis.


Los artículos científicos computacionales suelen prometer métodos reproducibles, pero para comprobarlos el lector todavía debe clonar repositorios, instalar dependencias, configurar entornos y resolver errores de código. Ese costo técnico mantiene buena parte del conocimiento útil encerrado en archivos PDF, incluso cuando los datos y programas están disponibles públicamente. Un equipo de Stanford propone reducir esa barrera con Paper2Agent, una arquitectura que transforma una investigación y su base de código en un agente capaz de ejecutar sus métodos mediante instrucciones en lenguaje natural.

El sistema fue descrito por Nature en un artículo publicado el 16 de septiembre de 2026, y utiliza el Model Context Protocol, conocido como MCP, para empaquetar la lógica de cada artículo en un servidor interoperable. La idea no consiste solamente en resumir una publicación, sino en convertir sus procedimientos en herramientas que otro agente pueda invocar, verificar y combinar con información nueva. Sus autores, Jiacheng Miao y James Zou, describen el resultado como una especie de autor de correspondencia virtual para la investigación computacional.

Del PDF a un servidor MCP

Paper2Agent funciona sobre el SDK de agentes de Claude Code y distribuye el trabajo entre un orquestador central y varios subagentes especializados. El proceso comienza con la localización y descarga del repositorio asociado al artículo, seguida por la construcción de un entorno virtual aislado que busca mantener separadas las dependencias del proyecto. Después, un escáner identifica los tutoriales disponibles y selecciona aquellos que muestran cómo utilizar realmente los métodos descritos.

Un ejecutor recorre cada tutorial de principio a fin y registra sus resultados de referencia, mientras otra etapa convierte esos recorridos en herramientas MCP parametrizadas. El sistema no da por válida una herramienta solo porque el código termine sin errores: también comprueba que aparezcan los archivos esperados y que los números obtenidos coincidan con las referencias dentro de un margen del 3%. Esa exigencia intenta evitar que un agente entregue respuestas plausibles, pero científicamente incorrectas.

La validación incluye las figuras mediante comparación perceptual de imágenes, con una distancia de Hamming inferior a 20 frente a las referencias originales. Cada función puede recibir hasta seis intentos de reparación y las que continúan fallando quedan excluidas del servidor final, en lugar de presentarse como capacidades confiables. El resultado es una selección más pequeña, pero con una trazabilidad de ejecución superior a la que ofrecería un modelo que simplemente leyera el repositorio y respondiera con texto.

Cada servidor expone tres tipos de componentes: herramientas para ejecutar los métodos, recursos con el manuscrito, los enlaces al código, los conjuntos de datos y las figuras, y prompts que describen flujos de trabajo de varios pasos. Esa última capa puede codificar, por ejemplo, el orden correcto del preprocesamiento en Scanpy, algo que un usuario podría omitir si recibiera únicamente una explicación general. El equipo utilizó Claude Sonnet 4 para las aplicaciones descritas en el estudio, aunque la arquitectura está planteada para agentes compatibles con MCP.

Pruebas con AlphaGenome, Scanpy y TISSUE

La prueba más detallada se realizó con AlphaGenome, para el que Paper2Agent construyó 22 herramientas en aproximadamente 45 minutos, con un costo de USD $14. Las 22 superaron la validación sin intervención humana, y el agente alcanzó una precisión de 98,7% en 15 consultas derivadas de tutoriales. En 15 consultas novedosas obtuvo 100%, mientras que en 30 preguntas abiertas llegó a 82,7%, resultados comparados con Claude Code conectado al repositorio y con Biomni.

En las consultas basadas en tutoriales, Paper2Agent superó a Claude más repositorio, que registró 82,7% en la primera prueba y 78,7% en las novedosas, mientras Biomni obtuvo 37,3% y 56%, respectivamente. En las preguntas abiertas, Claude más repositorio llegó a 56,7% y Biomni a 72,2%, por lo que el desempeño no fue uniforme en todos los escenarios. Las mediciones reunieron cinco ejecuciones y fueron calificadas por dos expertos humanos, con un acuerdo entre evaluadores de 96,7%.

El tiempo medio de ejecución en las consultas de tutoriales cayó 1,9 veces frente a Claude más repositorio y 3,1 veces frente a Biomni. Las mejoras se mantuvieron cuando la comparación se actualizó a Claude Opus 4.6, una señal de que el beneficio no dependía únicamente de emplear un modelo más potente. La estructura de herramientas verificadas parece aportar una ventaja adicional frente a entregar al modelo acceso abierto a un repositorio desordenado.

El agente también volvió a examinar la variante de colesterol LDL chr1:109274968:G>T y clasificó a SORT1 como el gen causal probable. El trabajo original de AlphaGenome había destacado a CELSR2 y PSRC1, mientras que GTEx muestra eQTL hepáticos significativos para los tres genes, una coincidencia que ilustra la dificultad de asignar causalidad en estos loci. El resultado no resuelve por sí mismo la cuestión biológica, pero muestra cómo un agente puede reanalizar una hipótesis con datos y métodos ya publicados.

En una prueba separada, el agente de Scanpy recibió siete herramientas validadas en unos 45 minutos, con un costo de USD $13. Al utilizar cuatro conjuntos de datos públicos, igualó a investigadores humanos en recuentos celulares, recuentos de genes y principales genes marcadores, mientras un agente basado en TISSUE reprodujo resultados humanos en datos de transcriptómica espacial. Estos experimentos sugieren que la utilidad del sistema no se limita a una sola disciplina o a un único formato de análisis.

Escala, costos y límites de la automatización

La evaluación a escala incluyó 100 artículos de biología computacional tomados de bioRxiv. Paper2Agent logró agentificar 74 de ellos y validó 593 de las 599 herramientas propuestas, una tasa que deja claro tanto el alcance del método como la existencia de repositorios que todavía no pueden convertirse automáticamente en servicios confiables. El sistema no ocultó los fallos: las funciones que no cumplieron los controles fueron retiradas del servidor final.

En un conjunto de 300 preguntas, Paper2Agent alcanzó 91,2%, frente a 80,3% para Sonnet 4 y 86,3% para Claude más repositorio utilizando Sonnet 4.6. Cada consulta costó en promedio USD $0,20 y tomó 1,6 minutos, mientras la alternativa de Claude más repositorio costó USD $0,38 y tardó 4,3 minutos. La diferencia puede ser relevante para laboratorios que necesitan ejecutar numerosas consultas, aunque el costo real también dependerá de los datos, las dependencias y la infraestructura utilizada.

El equipo extendió las pruebas a 10 artículos fuera de la biología, incluidos TabPFN, SAM 2 y SAELens, y obtuvo una precisión de 98,1% en 42 tareas de ejecución. Para 26 artículos centrados en datos, la capa de recursos logró 89% frente a 82% cuando los agentes usaron el navegador, además de ser 34 veces más barata y 15 veces más rápida. Paper2Agent también rechazó el 100% de las consultas fuera de alcance en un benchmark permutado, un resultado importante para limitar respuestas que excedan las capacidades documentadas.

Las pruebas de robustez incluyeron fallos inyectados en dependencias, rutas de archivos, errores tipográficos y APIs obsoletas, y el sistema logró recuperarse de esos problemas en los escenarios evaluados. Sin embargo, la validación automática no sustituye la revisión científica de los supuestos, la calidad de los datos o la interpretación causal de los resultados. Un agente puede reproducir un cálculo con precisión y aun así heredar limitaciones metodológicas del artículo original, por lo que la automatización debe complementar, no eliminar, el criterio de los investigadores.

El código de Paper2Agent está disponible bajo licencia MIT y puede instalarse como una skill para Claude Code o Codex. También existen servidores preconstruidos de AlphaGenome, Scanpy y TISSUE en Hugging Face Spaces, además de una versión alojada en paper2agent.ai, lo que reduce la distancia entre el prototipo académico y el uso práctico. La disponibilidad abierta podría facilitar que otros equipos adapten el sistema a áreas como aprendizaje automático, análisis de imágenes o ingeniería de software.

Agentes que colaboran para generar hipótesis

El estudio llevó la idea más allá de la ejecución aislada al conectar tres agentes de artículos: AlphaGenome, un análisis de scCRISPRi acoplado a MPRA y un conjunto de datos de Perturb-seq de células T CD4+. En conjunto, el sistema señaló a GPR137 como posible gen causal en el locus de psoriasis rs887314, con una puntuación de cuantil de RNA-seq de 0,997. La propuesta no surgió como una afirmación definitiva, sino como una hipótesis que debía contrastarse con una estrategia experimental.

El co-científico de IA planteó 10 estrategias de validación y un investigador seleccionó la comparación de firmas. Solo el knockdown de GPR137 coincidió con la firma de perturbación CRE, y la coincidencia apareció bajo estimulación, con una correlación de Spearman de 0,613 a las ocho horas y de 0,630 a las 48 horas. BAD y otros tres candidatos no mostraron una correlación significativa en esa evaluación, lo que reforzó la prioridad de GPR137 dentro del conjunto analizado.

La colaboración entre agentes cambia el papel del sistema: en lugar de ejecutar un único tutorial, puede reunir resultados de varias publicaciones y proponer conexiones entre experimentos, datos y candidatos biológicos. Aun así, el propio diseño conserva una intervención humana en el punto decisivo, porque el investigador escoge qué estrategia de validación seguir y debe evaluar si la señal merece un experimento. Esa combinación limita el riesgo de presentar una sugerencia estadística como una conclusión clínica o causal.

Un segundo estudio emparejó AlphaGenome con un análisis de asociación del TDAH y nominó la variante rs1626703 entre 209 candidatos. Esa hipótesis todavía necesita validación experimental, una advertencia que resulta central para interpretar los resultados de Paper2Agent sin exagerar sus capacidades. El sistema puede hacer más accesibles los métodos publicados, acelerar la exploración y ordenar la evidencia, pero no convierte automáticamente una predicción computacional en un descubrimiento confirmado.

El proyecto plantea una posible nueva capa para la comunicación científica: artículos que no solo expliquen un método, sino que también lo entreguen como un conjunto de funciones reutilizables y comprobadas. Si ese formato se generaliza, los investigadores podrían consultar trabajos previos sobre datos nuevos sin repetir manualmente cada paso de instalación y configuración. El desafío siguiente será mantener servidores actualizados cuando cambien las dependencias, documentar los límites de cada herramienta y preservar la reproducibilidad cuando los modelos de IA evolucionen.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín