Un equipo de investigación de la Universidad de Medicina Tradicional China de Shanghái, liderado por Hao Zhang, desarrolló un modelo de aprendizaje profundo denominado DeepETD. La herramienta fue diseñada para identificar y priorizar con precisión dianas proteicas vinculadas a enfermedades a partir de metabolitos endógenos presentes en el cuerpo humano.
Los metabolitos endógenos no solo actúan como intermediarios metabólicos, sino también como moléculas de señalización que inciden en la fisiología y en el desarrollo de diversas patologías. El trabajo, publicado en la revista Targetome, busca resolver la dificultad de relacionar la unión física entre metabolitos y proteínas con fenotipos específicos de enfermedades, integrando múltiples fuentes de evidencia biomédica.
Integración de datos y arquitectura del modelo
Para estructurar DeepETD, el equipo reunió un conjunto de 15.872 pares de metabolitos y proteínas procedentes de bases de datos de referencia como Human Metabolome Database, IUPHAR/BPS Guide to PHARMACOLOGY, ChEMBL y BindingDB. Se definieron como muestras positivas los pares con valores de concentración inhibitoria media máxima (IC50) iguales o inferiores a 100 nmol·L−1, lo que arrojó un total de 2.565 ejemplos positivos y 13.307 negativos.
El modelo incorpora información de resúmenes de PubMed junto con datos de Disease Ontology y Human Phenotype Ontology. De esta manera, genera huellas digitales que describen cada metabolito y proteína a través de enfermedades asociadas, fenotipos celulares y localizaciones subcelulares. Una capa de atención asigna diferentes ponderaciones a estas características antes de que una red neuronal profunda calcule las probabilidades de interacción.
Rendimiento y desarrollo de la base EMTDD
En las evaluaciones, DeepETD alcanzó un área bajo la curva (AUC-ROC) de 0,8470 y una precisión del 82,49 % en la etapa de validación, mientras que en el entrenamiento registró valores de 0,9771 y 92,74 %, respectivamente. La validación cruzada de diez pliegues mostró un AUC medio de 0,8484 y una precisión media de 0,8344. Las pruebas de ablación demostraron que prescindir de los datos relacionados con enfermedades generó la disminución más significativa en el rendimiento.
En las pruebas globales, el modelo ubicó en los primeros puestos dianas conocidas de la dopamina dentro del contexto de la enfermedad de Parkinson, así como del estradiol en el marco del cáncer de mama. A partir de estos desarrollos, los investigadores aplicaron DeepETD a 3.382 metabolitos en diez entornos patológicos diferentes, lo que dio origen a la Endogenous Metabolites Target Discovery Database (EMTDD), un repositorio con 33.820 registros. Las predicciones formuladas fueron evaluadas experimentalmente mediante la técnica de microescala de termoforesis.