Por Canuto  

Un nuevo marco de aprendizaje automático desarrollado en MIT intenta cambiar la forma en que se evalúa la IA para diseñar proteínas: en lugar de premiar que copie secuencias naturales, busca que encuentre combinaciones inéditas capaces de adoptar estructuras estables y útiles.
***

  • PottsMPNN modela con mayor precisión la relación entre secuencia, energía y estabilidad de las proteínas.
  • El marco incorpora ruido, interacciones entre pares de aminoácidos e información evolutiva para ampliar la diversidad de diseños.
  • Amy E. Keating y Foster Birnbaum sostienen que reproducir una secuencia natural no es la mejor métrica para evaluar el diseño de proteínas.


Un equipo del Instituto Tecnológico de Massachusetts (MIT) desarrolló un marco de aprendizaje automático que busca ampliar las posibilidades del diseño computacional de proteínas, una disciplina donde la inteligencia artificial intenta convertir estructuras deseadas en secuencias de aminoácidos viables. El sistema, denominado PottsMPNN, procura que los modelos dejen de concentrarse en reproducir las secuencias elegidas por la evolución y exploren alternativas que no se parezcan a proteínas nativas, pero que conserven la capacidad de plegarse y mantenerse estables.

La investigación parte de una premisa central de la biología: la función de una proteína depende de su estructura, mientras que esa estructura está condicionada por la secuencia de aminoácidos que la compone. Sin embargo, la relación no es única ni sencilla, porque numerosas secuencias pueden adoptar el mismo plegamiento y una misma secuencia también puede asumir estructuras diferentes dependiendo de su flexibilidad o de un desencadenante funcional.

Una métrica que podría estar equivocada

Muchos sistemas de diseño de proteínas trabajan en dos etapas. Primero proponen una estructura y después utilizan un modelo de aprendizaje automático para generar un repertorio de secuencias que potencialmente podrían adoptar esa forma, incluso en proyectos orientados a crear moléculas capaces de unirse a compuestos relacionados con enfermedades dentro de las células.

Durante años, los investigadores midieron el rendimiento de estos modelos preguntando si podían recuperar la secuencia proteica que la evolución había seleccionado en la naturaleza. Amy E. Keating afirmó que recuperar una secuencia natural no es necesariamente la mejor métrica para el diseño de proteínas, porque una secuencia natural representa apenas una posibilidad entre muchas compatibles con una estructura.

El problema se vuelve más evidente cuando el objetivo consiste en crear una proteína cuya estructura no existe en la naturaleza. En ese escenario no habría una secuencia nativa de referencia con la cual comparar el resultado, por lo que la similitud evolutiva podría castigar precisamente los diseños más originales, aunque sean capaces de plegarse correctamente y conservar la estabilidad necesaria.

Foster Birnbaum, autor principal del estudio, explicó que el interés real está en determinar si las secuencias generadas se plegarán en las estructuras buscadas. También destacó la importancia de saber cuánto entiende el modelo del paisaje secuencia-energía y qué tan bien puede anticipar el efecto de las mutaciones sobre la estabilidad de una proteína.

Cómo funciona PottsMPNN

PottsMPNN incorpora principios físicos que gobiernan la estructura y la estabilidad de las proteínas, con el propósito de mejorar tanto la generación de secuencias como la predicción de los efectos provocados por cambios en sus aminoácidos. En términos prácticos, el marco intenta representar con mayor fidelidad la relación entre la identidad de cada componente y la energía asociada con la estabilidad del plegamiento.

Una de sus herramientas consiste en añadir variaciones, conocidas en el campo como ruido, a las estructuras de proteínas durante el entrenamiento. Esa perturbación reduce la tendencia del modelo a imitar de manera excesiva las secuencias naturales y aumenta la diversidad de estructuras para las que puede generar secuencias potencialmente compatibles.

El marco también utiliza una distribución por pares para capturar las interacciones entre aminoácidos. Considerar las interacciones físicas entre las 20 opciones de secuencia disponibles en un par de posiciones permite modelar con mayor precisión el paisaje secuencia-energía frente a métodos que tratan esas relaciones de forma menos detallada.

El equipo incorporó además conjuntos de secuencias evolutivamente relacionadas durante el entrenamiento. La finalidad era enseñar al sistema que diferentes secuencias pueden producir el mismo plegamiento, una lección que aprovecha la información de la evolución sin convertir la recuperación exacta de una secuencia nativa en el objetivo principal del diseño.

Menos dependencia de secuencias nativas

Usar información evolutiva mantiene cierta dependencia de las secuencias naturales, incluso cuando el objetivo es alejarse de ellas. Esa tensión no elimina el valor del método, porque la información evolutiva puede revelar qué combinaciones de aminoácidos toleran una estructura compartida y ofrecer señales físicas que un modelo tendría dificultades para deducir únicamente desde ejemplos aislados.

Los resultados descritos por el equipo muestran una mejora cuando PottsMPNN reduce progresivamente su dependencia de las secuencias nativas. En particular, aumentan la compatibilidad estructural y la capacidad de predecir la energía, incluso en proteínas novedosas que no se parecen de manera estrecha a los ejemplos encontrados en la naturaleza.

Ese cambio propone una forma distinta de evaluar el aprendizaje automático aplicado a la biología. En vez de preguntar si la IA puede memorizar o reconstruir una solución evolutiva, los investigadores pueden examinar si comprende el conjunto de alternativas que hacen viable una estructura y si anticipa correctamente cómo una mutación alterará su estabilidad.

La distinción tiene consecuencias para los flujos de trabajo de diseño de proteínas. Si un investigador introduce PottsMPNN en una cadena de diseño, podría generar candidatos estructuralmente viables con secuencias alejadas de cualquier proteína nativa, lo que ampliaría el espacio de búsqueda y evitaría descartar soluciones útiles por su falta de parecido con la evolución conocida.

Un campo con aplicaciones y riesgos

El aprendizaje automático ha acelerado el ritmo y el alcance de la investigación biológica fundamental, aunque su impacto reciente también muestra los límites de las métricas heredadas. Birnbaum señaló que ProteinMPNN, un modelo ampliamente utilizado y publicado en 2022, estableció un punto de comparación importante para el diseño de secuencias de proteínas. El trabajo sobre PottsMPNN busca analizar qué hace eficaces a estos sistemas y cómo evaluar mejor sus resultados.

La relevancia de PottsMPNN no depende solamente de producir secuencias más diferentes, sino de conectar esa diversidad con propiedades físicas comprobables. La estabilidad, el plegamiento y la respuesta a mutaciones determinan si una propuesta computacional puede avanzar hacia pruebas posteriores, de modo que una secuencia novedosa sin respaldo energético suficiente seguiría siendo un resultado débil.

La posibilidad de diseñar proteínas nuevas también plantea preguntas de bioseguridad. El desarrollo de moléculas novedosas no demuestra por sí mismo una aplicación dañina, pero sí refuerza la necesidad de evaluación experimental, controles de acceso y revisión especializada antes de trasladar diseños computacionales a entornos biológicos.

El investigador espera que el marco pueda mejorarse y ajustarse a tareas concretas, una estrategia que en el pasado permitió obtener predicciones más precisas sobre el resultado de mutaciones particulares. Para Keating, estos métodos acercan al campo al diseño de proteínas nuevas y útiles para distintas aplicaciones, además de proporcionar una base más sólida para futuros avances en biología computacional.

El estudio no presenta el diseño automatizado de proteínas como una capacidad sin límites ni como una tecnología lista para resolver por sí sola todos los problemas de la biología. Su aporte consiste en redefinir qué significa que un modelo tenga éxito: no copiar una respuesta natural, sino comprender el paisaje de alternativas que puede conducir a una estructura estable y funcional.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín