Herramienta de IA mejora detección de mutaciones cancerosas con secuenciación de lectura larga
Actualizado el 03 Aug 2026
La identificación precisa de mutaciones somáticas sigue siendo difícil, en particular en regiones genómicas estructuralmente complejas. Los flujos de trabajo de secuenciación de lecturas cortas pueden pasar por alto variantes clínicamente relevantes, lo que limita la investigación y la oncología de precisión.
La secuenciación de lecturas largas amplía la cobertura genómica, pero requiere modelos que puedan entrenarse a pesar de la escasez de conjuntos de datos tumorales. Un nuevo estudio describe un enfoque de aprendizaje profundo para mejorar la detección de variantes pequeñas en múltiples tipos de tumores.
La Escuela de Computación y Ciencia de Datos de la Universidad de Hong Kong (HKU) ha desarrollado ClairS, un algoritmo de aprendizaje profundo para detectar mutaciones cancerosas mediante secuenciación de lecturas largas. El sistema se centra en variantes somáticas pequeñas presentes en tumores pero ausentes en el tejido normal emparejado. Fue creado para superar las limitaciones de los métodos de lecturas cortas, que tienen dificultades en regiones genómicas complejas.
ClairS introduce una estrategia de síntesis de datos de entrenamiento para abordar la escasez de conjuntos de datos oncológicos etiquetados de alta calidad. El equipo mezcla lecturas de secuenciación de muestras humanas normales para crear pares tumor–normal sintéticos realistas, generando ejemplos de entrenamiento prácticamente ilimitados que abarcan distintas purezas tumorales, profundidades de secuenciación y cargas de mutación. Esto da lugar a un modelo de inteligencia artificial (IA) flexible y robusto, adecuado para el análisis genómico del cáncer en el mundo real.
El algoritmo se probó en conjuntos de datos de líneas celulares de cáncer de mama, cáncer de pulmón y melanoma, demostrando una alta precisión en distintos tipos de cáncer y condiciones de secuenciación. Evaluaciones adicionales en múltiples líneas celulares de cáncer, incluidos modelos pancreáticos, reforzaron su rendimiento para detectar pequeñas mutaciones en datos de lecturas largas. Las evaluaciones destacan cómo la secuenciación de lecturas largas puede revelar mutaciones que de otro modo podrían pasarse por alto.
ClairS se ha integrado en el flujo de trabajo oficial de llamada de variantes somáticas de Oxford Nanopore Technologies, situándolo dentro de un flujo práctico de análisis comercial. La investigación fue pbulicado en Nature Methods. El software es de código abierto y está disponible en GitHub. El trabajo destaca una forma escalable de entrenar IA médica cuando los datos clínicos reales son escasos.
“La secuenciación de lecturas largas está transformando la manera en que estudiamos los genomas del cáncer, especialmente en regiones que antes eran difíciles de analizar. ClairS hace posible entrenar potentes modelos de IA incluso cuando los datos reales de entrenamiento sobre cáncer son limitados, lo que contribuye a un descubrimiento más fiable de mutaciones cancerosas a partir de datos de secuenciación de lecturas largas”, dijo Ruibang Luo, Director adjunto (Experiencia de aprendizaje y enriquecimiento estudiantil) y director asociado del Departamento de IA y Ciencia de Datos, Escuela de Computación y Ciencia de Datos, Universidad de Hong Kong.
Enlaces relacionados
Universidad de Hong Kong