ES2990200T3 - Análisis paralelo múltiplex de regiones genómicas blanco para análisis prenatales no invasivos - Google Patents

Análisis paralelo múltiplex de regiones genómicas blanco para análisis prenatales no invasivos Download PDF

Info

Publication number
ES2990200T3
ES2990200T3 ES19216148T ES19216148T ES2990200T3 ES 2990200 T3 ES2990200 T3 ES 2990200T3 ES 19216148 T ES19216148 T ES 19216148T ES 19216148 T ES19216148 T ES 19216148T ES 2990200 T3 ES2990200 T3 ES 2990200T3
Authority
ES
Spain
Prior art keywords
tacs
mixture
sample
interest
sequences
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
ES19216148T
Other languages
English (en)
Inventor
George Koumbaris
Philippos Patsalis
Elena KYPRI
Kyriakos Tsangaras
Achilleas Achilleos
Elisavet Papageorgiou
Petros MINA
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Medicover Public Co Ltd
Original Assignee
Medicover Public Co Ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Medicover Public Co Ltd filed Critical Medicover Public Co Ltd
Application granted granted Critical
Publication of ES2990200T3 publication Critical patent/ES2990200T3/es
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12QMEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
    • C12Q1/00Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions
    • C12Q1/68Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions involving nucleic acids
    • C12Q1/6876Nucleic acid products used in the analysis of nucleic acids, e.g. primers or probes
    • C12Q1/6883Nucleic acid products used in the analysis of nucleic acids, e.g. primers or probes for diseases caused by alterations of genetic material
    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12QMEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
    • C12Q1/00Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions
    • C12Q1/68Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions involving nucleic acids
    • C12Q1/6813Hybridisation assays
    • C12Q1/6827Hybridisation assays for detection of mutation or polymorphism
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B30/00ICT specially adapted for sequence analysis involving nucleotides or amino acids
    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12QMEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
    • C12Q2600/00Oligonucleotides characterized by their use
    • C12Q2600/156Polymorphic or mutational markers
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B30/00ICT specially adapted for sequence analysis involving nucleotides or amino acids
    • G16B30/10Sequence alignment; Homology search

Landscapes

  • Chemical & Material Sciences (AREA)
  • Life Sciences & Earth Sciences (AREA)
  • Organic Chemistry (AREA)
  • Health & Medical Sciences (AREA)
  • Proteomics, Peptides & Aminoacids (AREA)
  • Engineering & Computer Science (AREA)
  • Zoology (AREA)
  • Wood Science & Technology (AREA)
  • Analytical Chemistry (AREA)
  • Physics & Mathematics (AREA)
  • Genetics & Genomics (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Biotechnology (AREA)
  • General Health & Medical Sciences (AREA)
  • Biophysics (AREA)
  • Microbiology (AREA)
  • Biochemistry (AREA)
  • Immunology (AREA)
  • Molecular Biology (AREA)
  • General Engineering & Computer Science (AREA)
  • Pathology (AREA)
  • Evolutionary Biology (AREA)
  • Medical Informatics (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Theoretical Computer Science (AREA)
  • Measuring Or Testing Involving Enzymes Or Micro-Organisms (AREA)
  • Chemical Kinetics & Catalysis (AREA)
  • Gas Separation By Absorption (AREA)

Abstract

La invención proporciona métodos para pruebas prenatales no invasivas que permiten detectar el riesgo de anomalías cromosómicas y subcromosómicas, incluyendo, entre otras, aneuploidías, microdeleciones y microduplicaciones, inserciones, translocaciones, inversiones y mutaciones de pequeño tamaño, incluyendo mutaciones puntuales y firmas mutacionales. Los métodos de la invención utilizan un grupo de secuencias de captura de destino (TACS) para enriquecer las secuencias de interés en una muestra mixta que contiene ADN materno y fetal, seguido de una secuenciación paralela masiva y un análisis estadístico de la población enriquecida para detectar de ese modo el riesgo de una anomalía genética en el ADN fetal. También se proporcionan kits para llevar a cabo los métodos de la invención. (Traducción automática con Google Translate, sin valor legal)

Description

DESCRIPCIÓN
Análisis paralelo múltiplex de regiones genómicas blanco para análisis prenatales no invasivos
Sector de la técnica
La presente invención se inscribe en el campo de los análisis prenatales no invasivos, en particular, el campo de los análisis del riesgo de una anomalía cromosómica en ADN fetal. La presente invención refiere a un kit para realizar un método de analizar el riesgo de una anomalía cromosómica en ADN fetal.
Estado de la técnica
El descubrimiento de ADN fetal libre (ADNfl) en la circulación materna (Lo, Y.M.et al.(1997)Lancet350:485-487) marcó un hito en el camino hacia el desarrollo de análisis prenatales no invasivos para la detección de aneuploidías fetales y abrió nuevas posibilidades en el entorno clínico. El ADNfl se ha usado exitosamente para la determinación del sexo fetal y el factor Rh fetal a partir de plasma materno (véanse, por ejemplo, Bianchi, D.et al.(2005)Obstet. Gynecol.106:841-844; Lo, Y.M.et al.(1998)N. Engl. J. Med.339:1734-1738; patente estadounidense n.° 6,258,540; publicación del PCT WO 91/07660). Estos métodos se han convertido en análisis de rutina en múltiples laboratorios de diagnóstico en todo el mundo. Sin embargo, el análisis directo de la cantidad reducida de ADNfl en presencia de un exceso de ADN materno es un gran desafío para la evaluación de las aneuploidías fetales mediante análisis prenatales no invasivos (NIPT).
Originalmente, se estimó que el ADNfl en la circulación materna representaba entre el 3 y el 6 % del ADN total (Lo, Y.M.et al.(1998)Am. J. Hum. Genet.62:768-775). Sin embargo, estudios recientes sugieren que el ADN fetal puede alcanzar un porcentaje del 10 al 20 % del ADN total en la circulación materna (Lun, F.M.et al.(2008)Clin. Chem.
54:1664-1672). En las aneuploidías, uno de los cromosomas está presente en más o menos copias de lo normal. Por ejemplo, en los casos de trisomía 21, el cromosoma 21 está presente en tres copias en lugar de dos. Por ende, la capacidad de distinguir los casos normales de los casos de trisomía 21 depende de la capacidad de detectar la copia adicional del cromosoma 21. Sin embargo, los niveles elevados de a Dn materno en la circulación materna en comparación con la cantidad reducida de ADN fetal complican aún más la cuantificación.
A lo largo de la última década, se han aplicado una serie de métodos diferentes para discriminar el ADNfl del ADN materno circulante o para enriquecer el ADNfl (Chan, K.C.et al.(2004)Clin. Chem.50:88-92; Papageorgiou, E.A.et al.(2009)Am. J. Pathol.174:1609-1618). Estos incluyen enfoques basados en el ADN, como enfoques de secuenciación (Chiu, R. W.et al.(2008)Proc. Natl. Acad. Sci. USA105:20458-20463; Fan, H.C.et al.(2008)Proc. Natl. Acad. Sci. USA105:16266-16271) o enfoques epigenéticos que se centran en la investigación de la metilación del ADN fetal mediante un tratamiento del ADN con bisulfito de sodio (Chim, S.S.et al.(2005)Proc. Natl. Acad. Sci. USA102:14753-14758; publicación del PCT WO 2003/020974; publicación del PCT WO 2005/028674), enzimas de restricción sensibles a la metilación (Old, R.W.et al.(2007)Reprod. Biomed. Online15:227-235; publicación del PCT WO 2005/035725) o anticuerpos específicos para los residuos de 5-metilcitosina de los dinucleótidos CpG a lo largo del genoma (Papageorgiou, E.A.et al.(2009)Am. J. Pathol.174:1609-1618, Papageorgiou, E.A.et al.(2011)Nature Medicine17:510-513; Tsaliki, E.et al.(2012)Prenat. Diagn.32:996-1001; publicación del PCT WO 2011/092592). Otros enfoques se han dirigido al ARNm específico del feto (Ng, E.K.et al.(2003)Proc. Natl. Acad. Sci. USA100:4748-4753) o bien a la investigación de proteínas específicas del feto (Avent, N.D.et al.(2008)Semin. Fetal Neonatal Med.
13:91-98).
La implementación de tecnologías de secuenciación de última generación (NGS) en el desarrollo de NIPT para la detección de aneuploidías ha revolucionado el campo. En 2008, dos grupos independientes demostraron que podía realizarse un NIPT para detectar la trisomía 21 mediante el uso de secuenciación masiva paralelashotgun(MPSS) de última generación (Chiu, R. W.et al.(2008)Proc. Natl. Acad. Sci. USA105:20458-20463; Fan, H.C.et al.(2008)Proc. Natl. Acad. Sci. USA105:16266-162710). La nueva era de los NIPT para la detección de aneuploidías ha abierto nuevas posibilidades para la implementación de estas tecnologías en la práctica clínica. Las empresas de biotecnología dedicadas total o parcialmente al desarrollo de NIPT han iniciado ensayos clínicos a gran escala tendientes a su implementación (Palomaki, G.E.et al.(2011)Genet. Med.13:913-920; Ehrich, M.et al.(2011)Am. J. Obstet. Gynecol.204:205e1-11; Chen, E.Z.et al.(2011)PLoS One6:e21791; Sehnert, A.J.et al.(2011)Clin. Chem.
57:1042-1049; Palomaki, G.E.et al.(2012);Genet. Med.14:296-305; Bianchi, D.W.et al.(2012)Obstet. Gynecol.
119:890-901; Zimmerman, B.et al.(2012)Prenat. Diag.32:1233-1241; Nicolaides, K.H.et al.(2013)Prenat. Diagn.
33:575-579; Sparks, A.B.et al.(2012)Prenat. Diagn.32:3-9). Actualmente, cuatro empresas en los Estados Unidos (SEQUENOM Inc., Verinata Health, Inc., Natera y Ariosa) ofrecen NIPT basados en enfoques de secuenciación de última generación.
Los primeros enfoques hacia los NIPT empleaban metodologías de secuenciación masiva paralelashotgun(MPSS) basada en tecnologías de NGS (véanse, por ejemplo, la patente estadounidense n.° 7,888,017; la patente estadounidense n.° 8,008,018; la patente estadounidense n.° 8,195,415; la patente estadounidense n.° 8,296,076; la patente estadounidense n.° 8,682,594; la publicación de patente estadounidense n.° 20110201507; y la publicación de patente estadounidense n.° 20120270739). Estos enfoques son de genoma completo, donde toda la muestra materna —muestra que contiene tanto ADN materno como<a>D<n>fetal libre— se somete a amplificación, secuenciación y análisis.
Más recientemente, se han desarrollado enfoques de NIPT basados en NGS dirigida, en los que se secuencian únicamente secuencias específicas de interés. Por ejemplo, se ha descrito un enfoque de NGS basado en polimorfismos de nucleótidos individuales (SNP) que involucra la amplificación y el análisis dirigidos de SNP en los cromosomas 13, 18, 21 X e Y en una única reacción (Zimmerman, B.et al.(2012)Prenat. Diag.32:1233-1241; Nicolaides, K.H.et al.(2013)Prenat. Diagn.33:575-579; publicación del PCT WO 2011/041485; patente estadounidense n.° 8,825,412). También se ha desarrollado un enfoque basado en NGS en el que se secuencian únicamente regiones específicas de interés y se hibridan al molde complementario tres sondas por cadalocusblanco. Una vez que las tres sondas hibridan, se ligan entre sí para formar una única sonda de mayor tamaño que, luego, se amplifica y secuencia (Sparks, A.B.et al.(2012)Prenat. Diagn.32:3-9; publicación de patente estadounidense n.° 20120034603). Las muestras se analizan con una determinación paralela altamente multiplexada denominada análisis digital de regiones seleccionadas (DANSR). Tales enfoques dirigidos requieren un volumen de secuenciación considerablemente menor que los enfoques de MPSS, dado que únicamente se secuencianlociespecíficos del cromosoma de interés en lugar de regiones de todo el genoma.
Aún se requieren otras metodologías para enfoques de NIPT basados en NGS, particularmente enfoques que puedan dirigirse a secuencias específicas de interés y, así, permitan reducir considerablemente el volumen de secuenciación necesario en comparación con los enfoques de genoma completo.
Se publicaron mezclas de secuencias de doble hebra que tienen entre 100 y 260 pares de bases de longitud y un contenido de GC de entre el 19 y el 50 % en Parayreet al.(“Easy DNA extraction method and optimisation of PCR-Temporal Temperature Gel Electrophoresis to identify the predominant high and low GC-content bacteria from dairy products”, Journal of Microbiological Methods 69 (2007) 431-441) y Liet al.(“GC Content-Based Pan-Pox Universal PCR Assays for Poxvirus Detection”, Journal of Clinical Microbiology, 2010, 48(1):268-276, Epub 2009). En Parayreet al.,se divulga un método para identificar bacterias con bajo y alto contenido de GC en productos lácteos, que involucra el uso de una PCR para generar un amplicón de una secuencia de ADN de interés. En Liet al.,se divulgan determinaciones de PCR usadas para amplificar regiones de interés del genoma de poxvirus caracterizados por diferentes contenidos de GC de entre distintos miembros de la familia de los cordopoxvirus a fin de distinguir entre las distintas especies. En cambio, la presente invención refiere a un kit para realizar un método para evaluar el riesgo de una anomalía cromosómica en<a>D<n>fetal en una muestra combinada de ADN materno y fetal.
Objeto de la invención
La invención refiere a un kit para realizar un método para evaluar el riesgo de una anomalía cromosómica en ADN fetal en una muestra combinada de ADN materno y fetal, donde el kit comprende componentes para:
(a) preparar la biblioteca de secuenciación a partir de la muestra combinada;
(b) hibridar la biblioteca de secuenciación a una mezcla de secuencias de captura de blancos (TACS) de doble hebra, donde la mezcla de TACS comprende secuencias que se unen a uno o más cromosomas de interés que comprenden una anomalía cromosómica, y donde:
(i) cada secuencia de la mezcla tiene entre 100 y 260 pares de bases de longitud;
(ii) cada secuencia de la mezcla se une al/a los cromosoma(s) de interés a una distancia de al menos 150 pares de bases, tanto en el extremo 5' como en el extremo 3', de regiones que presentan variaciones en el número de copias (CNV), duplicaciones segmentales o elementos de ADN repetitivo; y
(iii) el contenido de GC de las TACS se encuentra entre el 19 % y el 50 %;
(c) aislar aquellos miembros de la biblioteca de secuenciación que se unen a las TACS para obtener una biblioteca enriquecida;
(d) amplificar y secuenciar la biblioteca enriquecida; y
(e) realizar análisis estadísticos sobre las secuencias de la biblioteca enriquecida para determinar así un riesgo asociado con la anomalía cromosómica en el ADN fetal,
donde el kit comprende un contenedor que comprende la mezcla de TACS, donde la mezcla de TACS comprende secuencias de doble hebra que se unen a uno o más cromosomas de interés seleccionados de entre el grupo de los cromosomas 13, 18, 21, X e Y, comprendiendo los cromosomas una anomalía cromosómica, y donde:
(1) cada secuencia de la mezcla tiene entre 100 y 260 pares de bases de longitud;
(2) cada secuencia de la mezcla se une al/a los cromosoma(s) de interés a una distancia de al menos 150 pares de bases, tanto en el extremo 5' como en el extremo 3', de regiones que presentan variaciones en el número de copias (CNV), duplicaciones segmentales o elementos de ADN repetitivo; y
(3) el contenido de GC de las TACS se encuentra entre el 19 % y el 50 %.
También se divulgan, sin ser parte de la invención, métodos para análisis prenatales no invasivos que permiten detectar el riesgo de anomalías cromosómicas y utilizan un enfoque dirigido para enriquecer las secuencias de interés como paso previo a la secuenciación paralela en masa, junto con un análisis estadístico que permite un conteo y una evaluación altamente precisos de los constituyentes cromosómicos del plasma materno en regiones de interés. Así, los métodos que se divulgan reducen el volumen de secuenciación necesario para la secuenciación paralela en masa y hacen posible una aplicación de alta capacidad a menor costo y con un nivel muy alto de exactitud. Los métodos que se divulgan utilizan una mezcla de secuencias de captura de blancos (TACS) para enriquecer secuencias de interés en una muestra combinada que contiene tanto ADN materno como ADN fetal. En particular, la mezcla de TACS está diseñada de tal manera que las secuencias dentro de la mezcla tengan características que optimizan la eficiencia, la especificidad y la exactitud de la evaluación de las anomalías cromosómicas. Más específicamente, se ha optimizado el tamaño de las TACS, la cantidad de TACS, su ubicación en el/los cromosoma(s) de interés y su contenido de GC. La hibridación de las TACS a una biblioteca de secuenciación preparada a partir de una muestra combinada de ADN materno y fetal (p. ej., una muestra de plasma materno que contiene ADNfl), seguida por el aislamiento de aquellas secuencias dentro de la biblioteca que se unen a las TACS, permite enriquecer únicamente las regiones cromosómicas de interés como paso previo a la secuenciación paralela en masa y el correspondiente análisis.
También se divulga, sin ser parte de la invención, un método para evaluar el riesgo de una anomalía cromosómica en un cromosoma de interés en ADN fetal en una muestra combinada de ADN materno y fetal, donde el método comprende:
(a) preparar la biblioteca de secuenciación a partir de la muestra combinada;
(b) hibridar la biblioteca de secuenciación a una mezcla de secuencias de captura de blancos (TACS), donde la mezcla de TACS comprende secuencias que se unen a uno o más cromosomas de interés y donde:
(i) cada secuencia de la mezcla tiene entre 100 y 260 pares de bases de longitud;
(ii) cada secuencia de la mezcla se une al/a los cromosoma(s) de interés a una distancia de al menos 150 pares de bases, tanto en el extremo 5' como en el extremo 3', de regiones que presentan variaciones en el número de copias, duplicaciones segmentales o elementos de ADN repetitivo; y (iii) el contenido de GC de las TACS se encuentra entre el 19 % y el 50 %;
(c) aislar aquellos miembros de la biblioteca de secuenciación que se unen a las TACS para obtener una biblioteca enriquecida;
(d) amplificar y secuenciar la biblioteca enriquecida; y
(e) realizar análisis estadísticos sobre el resultado de la secuenciación de las secuencias de la biblioteca enriquecida para determinar así un riesgo asociado con la anomalía cromosómica y/o anomalía genética de otro tipo en el ADN fetal.
En una realización, la anomalía cromosómica es una aneuploidía, como una trisomía. El cromosoma de interés puede ser cualquier cromosoma, aunque los cromosomas preferentes incluyen el 13, el 18, el 21, el X y el Y. Una aneuploidía preferente para la detección es la trisomía 21 (T21). Además de las anomalías numéricas como las aneuploidías, la invención permite detectar otros tipos de anomalías cromosómicas, como anomalías estructurales, incluidas, sin carácter taxativo, las variaciones en el número de copias, incluidas, sin carácter taxativo, las microdeleciones y las microduplicaciones, las inserciones, las traslocaciones, las inversiones y las mutaciones pequeñas, incluidas las mutaciones puntuales y los perfiles de mutaciones.
En una realización, la mezcla de TACS está fijada a un sustrato sólido. Por ejemplo, las TACS pueden estar biotiniladas y fijadas a microesferas magnéticas recubiertas con estreptavidina. En otra realización, la mezcla de TACS puede estar libre en solución.
En una realización, las TACS están diseñadas para unirse a un cromosoma de interés y a una o más secuencias de referencia para detectar el riesgo de una anomalía cromosómica en el cromosoma de interés. Como alternativa, la mezcla de TACS puede estar diseñada para unirse a múltiples cromosomas de interés de manera que pueda detectarse el riesgo de múltiples anomalías cromosómicas, así como, por ejemplo, el género fetal, todo ello en un único análisis de la muestra. Por ejemplo, en una realización, la mezcla de TACS comprende diferentes secuencias que se unen a los cromosomas 13, 18, 21 y X, o a los cromosomas 13, 18, 21, X e Y.
En varias realizaciones, el contenido de GC de las TACS se encuentra entre el 19 % y el 50 %, entre el 19 % y el 49 %, entre el 19 % y el 48 %, entre el 19 % y el 47 %, entre el 19 % y el 46 %, entre el 19 % y el 45 %, entre el 19 % y el 44 %, entre el 19 % y el 43 %, entre el 19 % y el 42 %, entre el 19 % y el 41 % o entre el 19 % y el 40 %.
En varias realizaciones, cada secuencia dentro de la mezcla de TACS tiene entre 100 y 260 pares de bases, entre 150 y 260 pares de bases, entre 100 y 200 pares de bases o entre 200 y 260 pares de bases de longitud. En una realización, cada secuencia de la mezcla de TACS tiene 250 pares de bases de longitud.
En varias realizaciones, la mezcla de TACS puede comprender 800 o más secuencias distintas, 1500 o más secuencias distintas, 2000 o más secuencias distintas, 2500 o más secuencias distintas o 3000 o más secuencias distintas. En una realización, la mezcla de TACS comprende 1600 secuencias distintas.
En una realización, la secuenciación de la biblioteca enriquecida provee una profundidad de lecturas correspondiente a loslociubicados en el cromosoma de interés y profundidades de lecturas correspondientes a loslocide referencia, y el análisis estadístico se realiza aplicando un algoritmo que contrasta secuencialmente la profundidad de lecturas de loslociubicados en el cromosoma de interés contra la profundidad de lecturas de loslocide referencia, donde las diferencias detectadas pueden indicar la presencia de variantes genéticas. Los pasos del algoritmo pueden incluir, sin carácter taxativo, los siguientes: (a) eliminar loslocisecuenciados de forma inadecuada; (b) mitigar el sesgo inducido por el contenido de GC; y (c) determinar la ploidía. En una realización, el sesgo inducido por el contenido de GC se mitiga agrupando loslocicon contenidos de Gc equiparables.
En otra realización, la secuenciación de la biblioteca enriquecida provee el tamaño de los fragmentos del material genético acelular capturado por las TACS, y el análisis estadístico comprende el uso de un algoritmo que compara y contrasta la distribución de tamaños de fragmentos entre loslocibajo prueba y loslocide referencia, donde las diferencias en la distribución indican la presencia de variantes genéticas. Los pasos del algoritmo pueden incluir, sin carácter taxativo, los siguientes: (a) eliminar los valores atípicos(outliers)de tamaños de fragmento; (b) crear una distribución binaria de tamaños de fragmentos; y (c) contrastar la distribución binaria de tamaños de fragmentos obtenida a partir de la región de interés con la distribución correspondiente a loslocide referencia para determinar la ploidía.
En general, la clasificación de la ploidía se logra mediante la aplicación de uno o más métodos estadísticos. Por ejemplo, el método estadístico puede seleccionarse de entre el grupo que consiste en una prueba t, una prueba de remuestreo(bootstrap)bivariada no paramétrica, una prueba de permutación estratificada, una prueba binomial de proporciones y/o combinaciones de las anteriores. En una realización, se aplican a la muestra los cuatro métodos estadísticos mencionados arriba. En general, el método estadístico resulta en una puntuación asociada a la muestra combinada y se detecta el riesgo de la anomalía cromosómica en cuestión en el ADN fetal cuando la puntuación de la muestra combinada se encuentra por encima de un valor umbral de referencia. El método que se divulga puede comprender, además, la estimación de la fracción de ADN fetal en la muestra combinada.
En otra realización, el método estadístico puede seleccionarse de entre el grupo que comprende una prueba t, una prueba de remuestreo bivariada no paramétrica y una prueba de permutación estratificada. En una realización, se aplican a la muestra todos los métodos estadísticos mencionados arriba. En general, el método estadístico resulta en una puntuación asociada a la muestra combinada y se detecta el riesgo de la anomalía cromosómica en cuestión en el a Dn fetal cuando la puntuación de la muestra combinada se encuentra por encima de un valor umbral de referencia. El método que se divulga puede comprender, además, la estimación de la fracción de ADN fetal en la muestra combinada.
La invención provee kits para realizar el método que se divulga. En una realización, el kit comprende un contenedor que comprende la mezcla de TACS e instrucciones para aplicar el método. En varias otras realizaciones, el kit comprende otros componentes para realizar los otros pasos del método.
Descripción de las figuras
La Figura 1 es un diagrama esquemático del análisis paralelo múltiplex de regiones genómicas blanco para análisis prenatales no invasivos mediante secuencias de captura de blancos (TACS).
La Figura 2 es una lista de regiones cromosómicas ejemplares para amplificar TACS que se unan a los cromosomas 13, 18, 21 o X.
La Figura 3 es un gráfico de la asignación de un valor de puntuación a 98 muestras de sangre materna sujetas a un análisis paralelo múltiplex de regiones genómicas blanco mediante TACS para la detección del riesgo de trisomía 21, donde se evaluó la significación estadística de las diferencias entre las medianas de las profundidades de lecturas de los grupos condicionalmente apareados mediante una fórmula de una pruebat(denominado, en la presente, método estadístico 1).
La Figura 4 es un gráfico de la asignación de un valor de puntuación a 98 muestras de sangre materna sujetas a un análisis paralelo múltiplex de regiones genómicas blanco mediante TACS para la detección del riesgo de trisomía 21, donde el análisis se realizó mediante un método de remuestreo bivariado no paramétrico (denominado, en la presente, método estadístico 2).
La Figura 5 es un gráfico de la asignación de un valor de puntuación a 98 muestras de sangre materna sujetas a un análisis paralelo múltiplex de regiones genómicas blanco mediante TACS para la detección del riesgo de trisomía 21, donde el análisis se realizó mediante una prueba de permutación estratificada (denominado, en la presente, método estadístico 3).
La Figura 6 es un gráfico de la asignación de un valor de puntuación a 98 muestras de sangre materna sujetas a un análisis paralelo múltiplex de regiones genómicas blanco para la detección del riesgo de trisomía 21, donde el análisis se realizó mediante una prueba binomial de las proporciones de tamaños de fragmentos (denominado, en la presente, método estadístico 4).
La Figura 7 es un gráfico de los valores de puntuación ponderados de las 98 muestras de sangre materna obtenidos de un análisis mediante los métodos estadísticos 1, 2, 3 y el método de puntuación ponderada 1 que se muestran en las Figuras 3 a 5.
La Figura 8 es un gráfico de los valores de puntuación ponderados de las 98 muestras de sangre materna obtenidos de un análisis mediante los métodos estadísticos 1, 2, 3, 4 y el método de puntuación ponderada 1 que se muestran en las Figuras 3 a 6.
La Figura 9 es un gráfico de un método ponderado alternativo, el método de puntuación ponderada 2, de los valores de puntuación de las 98 muestras de sangre materna obtenidos de un análisis mediante los métodos estadísticos 1,2 y 3 que se muestran en las Figuras 3 a 5.
La Figura 10 es un gráfico de la asignación de un valor de puntuación a 9 muestras sintéticas sujetas a un análisis paralelo múltiplex de regiones genómicas blanco mediante TACS dirigidas allocus7q11.23, donde el análisis se realizó mediante una realización del método estadístico 1 para la detección de microdeleciones.
La Figura 11 es un gráfico de la asignación de un valor de puntuación a 9 muestras sintéticas sujetas a un análisis paralelo múltiplex de regiones genómicas blanco mediante TACS dirigidas allocus7q11.23, donde el análisis se realizó mediante una realización del método estadístico 1 para la detección de microduplicaciones.
Descripción detallada de la invención
La invención refiere a un kit para realizar un método para evaluar el riesgo de una anomalía cromosómica en ADN fetal en una muestra combinada de ADN materno y fetal, donde el kit comprende componentes para:
(a) preparar una biblioteca de secuenciación a partir de la muestra combinada;
(b) hibridar la biblioteca de secuenciación a una mezcla de secuencias de captura de blancos (TACS) de doble hebra, donde la mezcla de TACS comprende secuencias que se unen a uno o más cromosomas de interés que comprenden una anomalía cromosómica, y donde:
(i) cada secuencia de la mezcla tiene entre 100 y 260 pares de bases de longitud;
(ii) cada secuencia de la mezcla se une al/a los cromosoma(s) de interés a una distancia de al menos 150 pares de bases, tanto en el extremo 5' como en el extremo 3', de regiones que presentan variaciones en el número de copias (CNV), duplicaciones segmentales o elementos de ADN repetitivo; y
(iii) el contenido de GC de las TACS se encuentra entre el 19 % y el 50 %;
(c) aislar aquellos miembros de la biblioteca de secuenciación que se unen a las TACS para obtener una biblioteca enriquecida;
(d) amplificar y secuenciar la biblioteca enriquecida; y
(e) realizar análisis estadísticos sobre las secuencias de la biblioteca enriquecida para determinar así un riesgo asociado con la anomalía cromosómica en el ADN fetal,
donde el kit comprende un contenedor que comprende la mezcla de TACS, donde la mezcla de TACS comprende secuencias de doble hebra que se unen a uno o más cromosomas de interés seleccionados de entre el grupo de los cromosomas 13, 18, 21, X e Y, comprendiendo los cromosomas una anomalía cromosómica, y donde:
(1) cada secuencia de la mezcla tiene entre 100 y 260 pares de bases de longitud;
(2) cada secuencia de la mezcla se une al/a los cromosoma(s) de interés a una distancia de al menos 150 pares de bases, tanto en el extremo 5' como en el extremo 3', de regiones que presentan variaciones en el número de copias (CNV), duplicaciones segmentales o elementos de ADN repetitivo; y
(3) el contenido de GC de las TACS se encuentra entre el 19 % y el 50 %.
La patente divulga un método de NIPT que involucra un enriquecimiento basado en hibridación de determinadas regiones blanco a lo largo del genoma humano en un panel de determinaciones, seguido por la cuantificación, combinada con un nuevopipelinebioinformático y matemático. El enriquecimiento por hibridación en solución se ha usado en el pasado para enriquecer regiones específicas de interés antes de la secuenciación (véanse, por ejemplo, Meyer, M y Kircher, M. (2010)Cold Spring Harb. Protoc.2010(6):pdbprot5448; Liao, G.J.et al.(2012)PLoS One7:e38154; Maricic, T.et al.(2010)PLoS One5:e14004; Tewhey, R.et al.(2009)Genome Biol.10:R116; Tsangaras, K.et al.(2014)PLoS One9:e109101). Sin embargo, en los métodos de NIPT que se divulgan, las secuencias blanco empleadas para enriquecer regiones específicas de interés, relevantes para la detección del riesgo de una anomalía cromosómica, se han optimizado para maximizar la eficiencia, la especificidad y la exactitud. El genoma humano está repleto de elementos que pueden confundir y desconcertar todo tipo de análisis genéticos, lo que pone en evidencia el beneficio de un enfoque hacia los NIPT que sea de naturaleza dirigida. En vista de ello, la complejidad del genoma humano y la presencia de estos elementos de confusión exigen un diseño cuidadoso de las secuencias de captura de blancos empleadas para el enriquecimiento. De acuerdo con lo que se describe en la presente, se han desarrollado secuencias de captura de blancos (TACS) óptimas que permiten NIPT más simples y robustos a la vez que minimizan el riesgo de resultados falsos positivos y falsos negativos que suelen ocurrir en los NIPT de genomas completos a causa de la inevitable secuenciación de elementos de confusión.
El método que se divulga para evaluar el riesgo de una anomalía cromosómica en un cromosoma de interés en ADN fetal en una muestra combinada de ADN materno y fetal comprende:
(a) preparar la biblioteca de secuenciación a partir de la muestra combinada;
(b) hibridar la biblioteca de secuenciación a una mezcla de secuencias de captura de blancos (TACS), donde la mezcla de TACS comprende secuencias que se unen a uno o más cromosomas de interés y donde:
(i) cada secuencia de la mezcla tiene entre 100 y 260 pares de bases (bp) de longitud, donde cada secuencia tiene un extremo 5' y un extremo 3';
(ii) cada secuencia de la mezcla se une al/a los cromosoma(s) de interés a una distancia de al menos 150 pares de bases, tanto en el extremo 5' como en el extremo 3', de regiones que presentan variaciones en el número de copias (CNV), duplicaciones segmentales o elementos de ADN repetitivo; y
(iii) el contenido de GC de las TACS se encuentra entre el 19 % y el 50 %;
(c) aislar aquellos miembros de la biblioteca de secuenciación que se unen a las TACS para obtener una biblioteca enriquecida;
(d) amplificar y secuenciar la biblioteca enriquecida; y
(e) realizar análisis estadísticos sobre el resultado de la secuenciación de las secuencias de la biblioteca enriquecida para determinar así un riesgo asociado con la anomalía cromosómica en el ADN fetal.
También se incluyen kits para aplicar el método que se divulga.
Diversos aspectos de esta divulgación se describen en mayor detalle en las subsecciones siguientes.
Diseño de las secuencias de captura de blancos
En la presente, los términos “secuencias de captura de blancos” o “TACS” hacen referencia a secuencias de ADN cortas que son complementarias a la(s) región/ones de interés de uno o más cromosomas de interés y que se usan como "señuelo" para capturar y enriquecer la región de interés a partir de una biblioteca amplia de secuencias, como una biblioteca de secuenciación de genoma completo preparada a partir de una muestra de plasma materno. Para el enriquecimiento, se usa una mezcla de TACS, donde las secuencias dentro de la mezcla se han optimizado en relación con: (i) la longitud de las secuencias; (ii) la distribución de las TACS a lo largo de la(s) región/ones de interés; y (iii) el contenido de GC de las TACS. Asimismo, se ha optimizado la cantidad de secuencias dentro de la mezcla de TACS (tamaño de la mezcla).
Se ha descubierto que las TACS con una longitud de 100 a 260 pares de bases son óptimas para maximizar la eficiencia de enriquecimiento. En varias otras realizaciones, cada secuencia dentro de la mezcla de TACS tiene entre 150 y 260 pares de bases, entre 100 y 200 pares de bases o entre 200 y 260 pares de bases de longitud. En realizaciones preferentes, la longitud de las TACS de la mezcla es de 250 o 260 pares de bases. La persona razonablemente versada en la técnica apreciará que, por lo general, puede usarse una pequeña variación en el tamaño de las TACS sin afectar los resultados (p. ej., el agregado o la eliminación de unos pocos pares de bases a cada extremo de las TACS). Así, la cantidad de pares de bases que se indican en la presente deben considerarse como “aproximadas” admitiendo una pequeña variación (p. ej., del 1 al 5 %) en la longitud. Así, por ejemplo, una longitud de “250 pares de bases” hace referencia a “aproximadamente 250 pares de bases”, de manera que también abarca, por ejemplo, 248 pares de bases o 252 pares de bases.
La distribución de las TACS a lo largo de cada región o cromosoma de interés se ha optimizado para evitar las repeticiones con alto número de copias, las repeticiones con bajo número de copias y las variantes en el número de copias, y, a la vez, poder direccionar la captura a polimorfismos de nucleótidos individuales (SNP) informativos para permitir la detección de las aneuploidías, la detección de variaciones estructurales en el número de copias y la estimación de la fracción fetal (ff). Así, cada secuencia dentro de la mezcla de TACS está diseñada de manera tal que el extremo 5' y el extremo 3' se encuentran, cada uno, a una distancia de al menos 150 pares de bases de regiones en el genoma de las que se sabe que contienen uno o más de los siguientes elementos: variaciones en el número de copias (CNV), duplicaciones segmentales y/o elementos de ADN repetitivo (como transposones o zonas de repeticiones en tándem). En varias otras realizaciones, cada secuencia dentro de la mezcla de TACS está diseñada de manera tal que el extremo 5' y el extremo 3' se encuentran, cada uno, a una distancia de al menos 200, 250, 300, 400 o 500 pares de bases de regiones en el genoma de las que se sabe que contienen uno o más de los elementos anteriores.
El término “variaciones en el número de copias” (CNV) es un término de la técnica que hace referencia a una forma de variante estructural del genoma humano en la cual existen alteraciones en el ADN del genoma de ciertos individuos que resultan en una cantidad menor o mayor a la normal de una o más secciones del genoma. Las CNV corresponden a regiones relativamente extensas del genoma que pueden haberse borrado (por ejemplo, una sección que normalmente es A-B-C-D puede ser A-B-D) o duplicado (por ejemplo, una sección que normalmente es A-B-C-D puede ser A-B-C-C-D). Las CNV representan aproximadamente el 13 % del genoma humano y el tamaño de cada variación varía entre aproximadamente 1 kilobase a varias megabases.
El término “duplicaciones segmentales” (o “repeticiones con bajo número de copias”) también es un término de la técnica que refiere a bloques de ADN cuya longitud varía entre 1 y 400 kilobases que ocurren en más de una posición del genoma y que, por lo general, tienen un alto grado de identidad a nivel de secuencia (mayor del 90 %). Las duplicaciones segmentales se abordan, por ejemplo, en Eichler. E.E. (2001)Trends Genet.17:661-669.
El término “elementos de ADN repetitivo” (o “ADN repetitivo/repetido”) también es un término de la técnica que refiere a patrones de ADN que ocurren en múltiples copias a lo largo del genoma. El término “elemento de ADN repetitivo” abarca las repeticiones terminales, las repeticiones en tándem y las repeticiones intercaladas, incluidos los transposones. Los elementos de ADN repetitivo en el marco de las tecnologías de NGS se analizan en más detalle, por ejemplo, en Todd, J.et al.(2012)Nature Reviews Genet.13:36-46.
Las TACS están diseñadas con características específicas de contenido de GC con el fin de minimizar el sesgo inducido por el contenido de GC en los datos y permitir el uso de unpipelinede análisis de datos personalizado e innovador. Se ha determinado que las TACS con un contenido de GC del 19 al 50 % logran un enriquecimiento óptimo y son las que muestran mayor rendimiento con el ADN fetal acelular. Dentro de una mezcla de TACS, diferentes secuencias pueden tener diferentes contenidos de GC porcentuales, pero, para ser incluida en la mezcla, el contenido de GC porcentual de cada secuencia debe encontrarse en el rango del 19 al 50 %. En algunas instancias, la mezcla de TACS puede seleccionarse de manera de definir otro rango de contenido de GC porcentual que se considere más adecuado para la evaluación de anomalías genéticas específicas. Algunos ejemplos de rangos de contenidos de GC porcentuales pueden ser, sin carácter taxativo, entre el 19 y el 50 %, entre el 19 % y el 49 %, entre el 19 % y el 48 %, entre el 19 % y el 47 %, entre el 19 % y el 46 %, entre el 19 % y el 45 %, entre el 19 % y el 44 %, entre el 19 % y el 43 %, entre el 19 % y el 42 %, entre el 19 % y el 41 % o entre el 19 % y el 40 %.
Según se describe en mayor detalle más abajo a propósito de una realización del análisis de datos, luego de la amplificación y secuenciación de las secuencias enriquecidas, loslocide prueba y loslocide referencia pueden “aparearse” o agruparse en función de su contenido de GC porcentual (p. ej., loslocide prueba con un contenido de GC porcentual del 40 % se aparean conlocide referencia con un contenido de GC porcentual del 40 %). Se apreciará que el procedimiento de apareamiento en función del contenido de GC porcentual podría permitir una variación leve en el rango de contenido de GC porcentual admitido para un apareamiento. Como ejemplo no taxativo y con referencia al ejemplo descrito anteriormente, unlocusde prueba con un contenido de GC porcentual del 40 % podría aparearse conlocide referencia con un rango de contenido de GC porcentual entre el 39 y el 41 %, abarcando el contenido de GC porcentual dellocusde prueba dentro de un rango adecuado.
Para preparar una mezcla de TACS con los criterios optimizados mencionados arriba en relación con el tamaño, la ubicación en el genoma humano y el contenido de GC porcentual, pueden aplicarse métodos manuales o computarizados conocidos en la técnica para el análisis del genoma humano de referencia. En una realización, se implementa un método semiautomático en el que primeramente se designan manualmente regiones basadas en la versión 19 del genoma humano de referencia (hg19), de manera de evitar las regiones repetitivas mencionadas, y, posteriormente, las regiones designadas se curan en relación con el contenido de GC con ayuda de software que calcula el contenido de GC de cada región en función de sus coordenadas en la versión 19 del genoma humano de referencia (hg19). En otra realización, se emplea software hecho a medida para analizar el genoma humano de referencia e identificar regiones adecuadas para TACS que cumplan ciertos criterios, incluidos, sin carácter taxativo, criterios referidos al contenido de GC porcentual, la proximidad a regiones repetitivas y/o la proximidad a otras TACS.
La cantidad de TACS en la mezcla se ha examinado y ajustado cuidadosamente para lograr el mejor equilibrio entre la robustez de los resultados y el costo/la capacidad de la determinación. La mezcla generalmente contiene 800 o más TACS, pero puede incluir más; por ejemplo, 1500 o más TACS, 2000 o más TACS, o 2500 o más TACS. Se ha detectado que un número óptimo de TACS en la mezcla es de 1600. La persona razonablemente versada en la técnica apreciará que, por lo general, puede usarse una pequeña variación en el tamaño de la mezcla sin afectar los resultados (p. ej., la eliminación o el agregado de una pequeña cantidad de TACS). Así, las cantidades de TACS de la mezcla que se indican en la presente deben considerarse como “aproximadas” admitiendo una pequeña variación (p. ej., del 1 al 5 %) en su tamaño. Así, por ejemplo, un tamaño de mezcla de “1600 secuencias” hace referencia a “aproximadamente 1600 secuencias” de manera que también abarca, por ejemplo, 1590 secuencias o 1610 secuencias.
En vista de lo anterior, en otro aspecto, la patente divulga un método para preparar una mezcla de TACS para usar en el método que se divulga para detectar el riesgo de una anomalía cromosómica y/u otra anomalía genética, donde el método para preparar la mezcla de TACS comprende: seleccionar regiones en uno o más cromosomas de interés que cumplan los criterios definidos arriba (p. ej., que se encuentren a una distancia de al menos 150 pares de bases a cada extremo de las secuencias repetitivas mencionadas y que tengan un contenido de GC entre el 19 % y el 50 %); preparar cebadores que amplifiquen las secuencias que hibridan con las regiones seleccionadas; y amplificar las secuencias, donde cada secuencia tiene entre 100 y 260 pares de bases de longitud.
Obtención y preparación de las muestras
Los métodos que se divulgan se realizan sobre una muestra combinada que contiene tanto ADN materno como ADN fetal. En general, la muestra es una muestra de plasma materno, aunque pueden usarse otras fuentes de tejido que contengan tanto ADN materno como ADN fetal. El plasma materno puede obtenerse de una muestra de sangre periférica entera de una mujer embarazada mediante métodos estándar. Apenas 2 a 4 ml de plasma son suficientes para obtener material de ADN suficiente para el análisis de acuerdo con el método que se divulga. Luego, puede extraerse el ADN acelular total de la muestra mediante técnicas estándar, que incluyen, sin carácter taxativo, el protocolo Qiasymphony (Qiagen) adecuado para aislar ADN fetal libre, así como cualquier otro método de extracción manual o automático adecuado para aislar ADN acelular.
Luego de aislarse, el ADN acelular de la muestra combinada se usa para construir una biblioteca de secuenciación cuyo fin es hacer la muestra compatible con una tecnología de secuenciación ulterior (por ejemplo, sin carácter taxativo, la secuenciación de última generación Illumina). En general, esto involucra la ligación de adaptadores a los extremos de los fragmentos de ADN acelular, seguida por una amplificación. Hay kits para la preparación de bibliotecas de secuenciación disponibles comercialmente. En el Ejemplo 1, se describe en detalle un protocolo ejemplar —sin carácter taxativo— para la preparación de una biblioteca de secuenciación.
Enriquecimiento mediante hibridación de TACS
Para enriquecer la(s) región/ones de interés del/de los cromosoma(s) de interés, se hace hibridar la mezcla de TACS con la biblioteca de secuenciación y, a continuación, se aíslan las secuencias de la biblioteca de secuenciación que hibridan con las TACS. Para facilitar el aislamiento de las secuencias deseadas enriquecidas, las TACS generalmente se modifican de tal manera que las secuencias que hibridan con las TACS se pueden separar de aquellas que no hibridan con las TACS. En general, esto se logra fijando las TACS a un sustrato sólido. Esto permite la separación física de las secuencias que hibridan con las TACS de aquellas que no hibridan con las TACS. Por ejemplo, cada secuencia dentro de la mezcla de TACS puede marcarse con biotina, y la mezcla puede fijarse a microesferas recubiertas con una sustancia que se una a la biotina, como estreptavidina o avidina. En una realización preferente, las TACS se marcan con biotina y se unen a microesferas magnéticas recubiertas con estreptavidina. Sin embargo, la persona razonablemente versada en la técnica apreciará que existen otros sistemas de unión por afinidad conocidos en la técnica y que pueden usarse en lugar del sistema de biotina-estreptavidina/avidina. Por ejemplo, puede usarse un sistema basado en anticuerpos en el que las TACS se marquen con un antígeno y, luego, se unan a microesferas recubiertas con el anticuerpo correspondiente. Además, las TACS pueden incorporar en un extremo una secuencia marca y pueden fijarse a un sustrato sólido mediante una secuencia complementaria en el sustrato sólido que hibride con la secuencia marca. Por otra parte, además de microesferas magnéticas, pueden usarse otros tipos de sustratos sólidos, como microesferas poliméricas y otros similares.
Luego del enriquecimiento de la(s) secuencia(s) de interés con las TACS y la formación de la biblioteca enriquecida, los miembros de la biblioteca enriquecida se eluyen del sustrato sólido y se amplifican y secuencian mediante métodos estándar conocidos en la técnica. En general, se emplea la tecnología estándar de secuenciación de última generación Illumina, aunque pueden emplearse también otras tecnologías de secuenciación que provean no solo información de secuencia sino también recuentos muy exactos. Detectar anomalías genéticas — incluidas, sin carácter taxativo, las aneuploidías o las variaciones estructurales en el número de copias— exige un recuento muy exacto, y la NGS es un tipo de tecnología que provee tal recuento muy exacto. Así, para la detección de anomalías genéticas, incluidas, sin carácter taxativo, las aneuploidías o las variaciones estructurales en el número de copias, pueden usarse otros métodos de recuento exactos, como la PCR digital y los microarreglos, en lugar de la NGS. En el Ejemplo 3, se describen en detalle protocolos ejemplares —sin carácter taxativo— para la amplificación y secuenciación de la biblioteca enriquecida.
Análisis de los datos
La información obtenida de la secuenciación de la biblioteca enriquecida se analiza mediante un innovadorpipelinede análisis biomatemático/bioestadístico. Estepipelinede análisis explota las características de las TACS, en tanto que la alta eficiencia de la captura de blancos permite una detección eficiente de aneuploidías o variaciones estructurales en el número de copias, así como otros tipos de anomalías genéticas. En el Ejemplo 4, se describe en detalle un análisis ejemplar. En el análisis, los fragmentos de ADN secuenciados de la muestra se alinean primeramente al genoma humano de referencia. Se emplean métricas de control de calidad para inspeccionar las propiedades de la muestra alineada y decidir si la muestra es apta para clasificación. Estas métricas de control de calidad pueden incluir, sin carácter taxativo, el análisis de patrones de enriquecimiento de loslocide interés, como, por ejemplo, la profundidad de secuenciación general de la muestra, el volumen de secuenciación de la muestra que sea específico (“en el blanco”), el rendimiento de las TACS, el nivel esperado de sesgo inducido por el contenido de GC y la cuantificación de la fracción fetal. Para determinar el riesgo de una anomalía cromosómica en el ADN fetal de la muestra, se emplea un algoritmo innovador. Los pasos del algoritmo incluyen, sin carácter taxativo, eliminar loslocisecuenciados de forma inadecuada; extraer información relativa a la profundidad de lecturas y el tamaño de fragmentos en coordenadas específicas de las TACS; mitigar el sesgo inducido por el contenido de GC; y determinar la ploidía.
La determinación de la ploidía se logra mediante uno o más métodos estadísticos, algunos de los cuales son, sin carácter taxativo, una prueba t, una prueba de remuestreo(bootstrap),una prueba de permutación, una prueba binomial de proporciones y/o combinaciones de las anteriores. La persona razonablemente versada en la técnica apreciará que la selección y aplicación de pruebas estadísticas para incluir en una determinación de la ploidía se basan en la cantidad de puntos de datos disponibles. Así, la idoneidad de cada prueba viene dada por distintos factores como —sin carácter taxativo— la cantidad de TACS utilizadas y la correspondiente aplicación para mitigar el sesgo inducido por el contenido de GC, si corresponde. Así, los métodos mencionados deben considerarse como ejemplos de los tipos de análisis estadísticos que pueden emplearse y no son los únicos métodos adecuados para la determinación de la ploidía. En general, el método estadístico resulta en una puntuación asociada a la muestra combinada y se detecta el riesgo de la anomalía cromosómica en cuestión en el<a>D<n>fetal cuando la puntuación de la muestra combinada se encuentra por encima de un valor umbral de referencia.
En particular, un aspecto de los análisis estadísticos involucra cuantificar y mitigar el sesgo inducido por el contenido de GC. Además del desafío de detectar pequeños cambios de señal en el ADN fetal en la muestra combinada (por ejemplo, sin carácter taxativo, la presencia de más o menos material genético de ciertas regiones cromosómicas fetales), el propio proceso de secuenciación introduce ciertos sesgos que pueden oscurecer la detección de la señal. Uno de tales sesgos es la secuenciación/amplificación preferente de las regiones genéticas en función de su contenido de GC. Por ello, ciertos métodos de detección — incluidos, sin carácter taxativo, los métodos basados en la profundidad de lecturas— deben tener en cuenta tal sesgo al momento de analizar los datos de secuenciación. Así, se debe cuantificar el sesgo en los datos y, posteriormente, se deben aplicar métodos adecuados que contemplen dicho sesgo de manera tal que las dependencias del contexto genético no puedan afectar los métodos estadísticos que pudieran usarse para cuantificar el riesgo de anomalías genéticas fetales.
Por ejemplo, un método para cuantificar el sesgo inducido por el contenido de GC es aplicar la técnica de suavizado local ponderado de diagramas de dispersión (LOESS) a los datos de secuenciación. Cadalocusblanco puede definirse por su profundidad de lecturas obtenidas en la secuenciación y su contenido de GC. Una recta de ajuste óptimo por estas dos variables sobre una gran cantidad delociprovee una estimación de la profundidad de lecturas de secuenciación esperada dado el contenido de GC. Una vez que se completa este paso de cuantificación del sesgo inducido por el contenido de GC, el siguiente paso es usar esta información para considerar posibles sesgos en los datos. Un método es normalizar la profundidad de lecturas de todos loslocirespecto de su profundidad de lecturas esperada (en función del contenido de GC de cadalocus).En principio, eso desvincula los datos de profundidad de lecturas de su contexto genético y torna todos los datos comparables entre sí. Así, los datos recuperados de regiones con distintos contenidos de GC, como, por ejemplo —sin carácter taxativo— , distintos cromosomas, se pueden usar en pruebas estadísticas ulteriores para la detección de anomalías. Así, mediante el procedimiento LOESS, el sesgo inducido por el contenido de GC se desvincula de los datos antes de la aplicación de las pruebas estadísticas. En una realización, el análisis estadístico de las secuencias de la biblioteca enriquecida comprende mitigar el sesgo de GC con un procedimiento LOESS.
En una realización preferente alternativa, el sesgo inducido por el contenido de GC se cuantifica y mitiga agrupando loslocicon contenidos de GC similares (equiparables). Así, conceptualmente, este método para mitigar el sesgo inducido por el contenido de GC comprende los tres pasos siguientes: 123
1) identificar y calcular el contenido de GC en las TACS;
2) mitigar/considerar el sesgo inducido por el contenido de GC mediante diversos procedimientos de apareamiento/agrupación de las TACS; y
3) calcular el riesgo de que distintas anomalías genéticas estén presentes en el feto aplicando métodos estadísticos y matemáticos a los conjuntos de datos resultantes del paso 2.
En el caso de la pruebat,el conjunto de datos se divide en dos grupos: loslocide prueba y loslocide referencia. Por cada grupo, se crean subconjuntos de grupos en los que loslocise categorizan de acuerdo con su contenido de GC, como se ilustra en el ejemplo no taxativo de la Tabla 1, a continuación:
Tabla 1
La persona razonablemente versada en la técnica apreciará que la creación de subgrupos puede abarcar un rango de contenidos de GC adecuados y/o un subconjunto delocidefinidos por un contenido de GC y/o un rango de contenido de GC dados. Así, el contenido de GC porcentual dado en el ejemplo no taxativo de la Tabla 1 debe considerarse “aproximado”, admitiendo una leve variación (p. ej., del 1 al 2 %). Así, por ejemplo, un contenido de GC porcentual del “40 %” pretende hacer referencia a “aproximadamente el 40 %”, de tal manera que, por ejemplo, también podrían estar comprendidos loslocicon contenidos de GC en el rango del 39 % al 41 % si se considera pertinente.
Así, cuando se hace referencia a un contenido de GC particular, se entiende que los subgrupos delocide prueba y de referencia pueden comprender cualquier cantidad delocirelacionados con un contenido de GC porcentual y/o rango particulares.
Posteriormente, por cada subgrupo de contenido de GC, se calcula una profundidad de lecturas representativa. Para ello, se pueden usar distintos métodos, incluidos, sin carácter taxativo, la media, la mediana o la moda de cada conjunto. Así, se crean dos vectores de profundidades de lecturas representativas, donde uno corresponde a loslocide referencia y el otro a loslocide prueba (p. ej., Xm e Ym). En una realización, ambos vectores pueden contrastarse entre sí para identificar diferencias significativas en la profundidad de lecturas. En otra realización, la diferencia entre ambos vectores puede usarse para evaluar si hay discrepancias considerables entre loslocide referencia y loslocide prueba. Se le atribuye a la muestra la puntuación que arroja la prueba.
En el caso de los análisis estadísticos con un enfoque de remuestreo, el conjunto de datos se divide primero en dos grupos: loslocide prueba y loslocide referencia. Entonces, se calcula el contenido de GC de cadalocus.Luego, se realiza el siguiente procedimiento:
Se selecciona unlocusal azar de entre loslocide referencia y se registran su profundidad de lecturas y su contenido de GC. Posteriormente, se selecciona unlocusal azar de entre loslocide prueba, con la única condición de que su contenido de GC sea similar al dellocusde referencia. Se registra su profundidad de lecturas. La persona razonablemente versada en la técnica apreciará que la similitud entre los contenidos de GC puede abarcar un rango de contenidos de GC adecuados. Así, la referencia a un contenido de GC porcentual específico puede considerarse “aproximada”, “próxima” o “dentro de un rango adecuado” (p. ej., del 1 al 2 %) que incluya el contenido de GC porcentual específico investigado. De este modo, se crea un par delocide referencia y de prueba con contenidos de GC similares. Se registra la diferencia del par delocide referencia y de prueba, notada E1. Luego, loslocise regresan a sus grupos respectivos. Este proceso se repite hasta crear una muestra de remuestreo del mismo tamaño que la cantidad de TACS de prueba presentes. Entonces, se estima y se registra una profundidad de lecturas representativa de la muestra de remuestreo, notada E_mu. Para ello, se pueden usar distintos métodos, incluidos, sin carácter taxativo, la media, la moda o la mediana del vector, y/o múltiplos de dichos valores.
El proceso descrito anteriormente se repite tantas veces como sea necesario y se crea una distribución de E_mu. Luego, se atribuye a la muestra una puntuación que corresponde a un percentil de esta distribución.
En el caso de los análisis estadísticos con una prueba de permutación, el conjunto de datos se ordena primero en dos grupos: loslocide prueba y loslocide referencia. Por cada grupo, se crean subconjuntos de grupos en los que loslocise categorizan de acuerdo con la similitud en sus contenidos de GC (véanse las columnas 2 y 3 del ejemplo no taxativo de la Tabla 2, a continuación). También se registra la cantidad delocipresentes en cada subgrupo de prueba. Loslocidel grupo de prueba se usan para estimar la profundidad de lecturas del grupo de prueba, notada Yobs. Para hacerlo, puede seleccionarse un número representativo de cada subgrupo de contenido de GC. Para obtener una estimación de la profundidad de lecturas se pueden usar distintos métodos, incluidos, sin carácter taxativo, la media, la mediana o la moda de loslociseleccionados.
Tabla 2
Luego, se crea una distribución de los valores Yobs de prueba usando indistintamentelocique provengan del grupo de prueba o del grupo de referencia, tal como se explica a continuación. Loslocide prueba y de referencia de cada subgrupo de contenido de GC (véase la última columna del ejemplo de la Tabla 2) se combinan para permitir calcular una nueva estimación de la profundidad de lecturas. De cada subgrupo combinado se escoge una cantidad delocial azar, cantidad acotada superiormente por la cantidad delocide prueba usados en el cálculo original de Yobs (p. ej., en el caso de un contenido de GC del 40 % y en el contexto del ejemplo no taxativo de la Tabla 2, esta cantidad delocipuede estar en el rango [1,ny40]). La nueva estimación de la profundidad de lecturas se calcula a partir de todos loslociseleccionados. El procedimiento se repite tantas veces como sea necesario para construir una distribución de las medias observadas. Luego, se le atribuye a una muestra una puntuación que corresponde a la posición de Yobs en esta distribución, usando una transformación adecuada que tiene en cuenta los momentos de la distribución construida. Al igual que con los métodos descritos anteriormente, se apreciará que se admite una ligera variación en el contenido de GC porcentual (p. ej., del 1 al 2 %) si se considera adecuado. Así, la referencia a un contenido de GC específico puede interpretarse como “aproximada” de manera que, por ejemplo, al hacer referencia a un contenido de GC del 40 %, el método puede utilizar loslocique tengan un contenido de Gc de “aproximadamente” el 40 % (p. ej., entre el 39 y el 41 %).
En el caso del análisis estadístico con una prueba binomial de proporciones, se emplean los tamaños de fragmentos alineados a coordenadas genómicas específicas de las TACS. Se ha demostrado que los fragmentos de material genético acelular provenientes de la placenta son de menor tamaño que los de otros tipos de material genético acelular (Chan, K.C. (2004)Clin. Chem.50:88-92). Así, el estadístico de interés es si la proporción de fragmentos pequeños alineados a una región de prueba específica de una TACS se aparta significativamente de lo que se espera en comparación con la proporción respectiva de otras regiones de referencia específicas de TACS, lo que indicaría una anomalía genética fetal.
De este modo, los tamaños de fragmentos se dividen en dos grupos. Los tamaños de fragmentos relacionados con loslocide prueba se asignan a un grupo y los tamaños de fragmentos relacionados con loslocide referencia se asignan al otro grupo. Posteriormente, en cada grupo, los tamaños de fragmentos se distribuyen en dos subgrupos, donde los fragmentos pequeños se asignan a un subgrupo y todos los fragmentos restantes se asignan al otro subgrupo. El último paso es calcular la proporción de fragmentos pequeños en cada grupo y usar estas cantidades en una prueba binomial de proporciones. La puntuación de la prueba se atribuye a la muestra investigada.
El resultado final de una muestra puede asignarse combinando una o más puntuaciones derivadas de los diferentes métodos estadísticos, ejemplos no taxativos de lo cual se muestran en el Ejemplo 4.
Kits de la invención
La invención provee kits para realizar los métodos que se divulgan. En una realización, el kit comprende un contenedor que consiste en la mezcla de TACS e instrucciones para aplicar el método. En una realización, las TACS se proveen en un formato que permite unirlas a un sustrato sólido, por ejemplo, pueden ser TACS biotiniladas. En otra realización, las TACS se proveen junto con un sustrato sólido, por ejemplo, TACS biotiniladas provistas junto con microesferas magnéticas recubiertas con estreptavidina. En varias otras realizaciones, el kit puede comprender otros componentes para realizar otros aspectos del método. Por ejemplo, además de la mezcla de TACS, el kit puede comprender uno o más de los siguientes: (i) uno o más componentes para aislar ADN acelular de una muestra de plasma materno (p. ej., los que se describen en el Ejemplo 1); (ii) uno o más componentes para preparar la biblioteca de secuenciación (p. ej., cebadores, adaptadores, ligadores, enzimas de restricción, enzimas de ligación, polimerasas y similares, como los que se describen en el Ejemplo 1); (iii) uno o más componentes para amplificar y/o secuenciar la biblioteca enriquecida (p. ej., los que se describen en el Ejemplo 3); y/o (iv) software para realizar análisis estadístico (p. ej., el que se describe en el Ejemplo 4).
IV. Ejemplos
La presente invención se ilustra en mayor detalle mediante los siguientes ejemplos, pero no se debe interpretar que estos ejemplos limiten el alcance de la invención.
Ejemplo 1: Obtención de las muestras y preparación de las bibliotecas
Obtención de las muestras
Se obtuvieron muestras de plasma anónimas de mujeres embarazadas luego de la 10.a semana de gestación. Los protocolos empleados para la obtención de muestras para nuestro estudio fueron aprobados por el Comité de Bioética Nacional de Chipre y se obtuvo el consentimiento informado de todas las participantes.
Extracción de las muestras
Se extrajo ADN acelular de 2 a 4 ml de plasma de cada individuo mediante un método de extracción manual o automático adecuado para aislar ADN acelular, como, por ejemplo —sin carácter taxativo—, el protocolo Qiasymphony adecuado para asilar ADN fetal libre (Qiagen).
Preparación de las bibliotecas
El ADN extraído de las muestras de plasma materno se usó para la construcción de bibliotecas de secuenciación. Se usaron métodos estándar de preparación de bibliotecas con las siguientes modificaciones (Meyer, M. y Kircher, M. (2010)Cold Spring Harb. Protoc.2010(6):pdb prot5448). Se preparó una biblioteca de extracción independiente como control negativo para evaluar toda contaminación introducida durante el experimento. Durante este paso, las salientes 5' y 3' se completaron agregando 12 unidades de polimerasa T4 (NEB) y se incorporaron fosfatos 5' usando 40 unidades de polinucleótido quinasa T4 (NEB) en una reacción de 100 pl con posterior incubación a 25 oC durante 15 minutos y, luego, 12 °C durante 15 minutos. Los productos de reacción se purificaron con el kit MinElute (Qiagen). Posteriormente, se ligaron los adaptadores P5 y P7 (ver la sección sobre la preparación de los adaptadores) diluidos 1:10 a ambos extremos del ADN con 5 unidades de ligasa de ADN T4 (T4 DNA ligase, NEB) en una reacción de 40 pl durante 20 minutos a temperatura ambiente, seguido por una purificación con el kit MinElute (Qiagen). Se eliminaron las hendiduras de hebra simple(nicks)en una reacción de relleno con 16 unidades de polimerasa Bst (NEB) en una reacción de 40 pl con posterior incubación a 65 oC durante 25 minutos y, luego, 12 oC durante 20 minutos. Los productos se purificaron con el kit MinElute (Qiagen). La amplificación de las bibliotecas se realizó con una polimerasa Fusion (Herculase II Fusion DNA polymerase de Agilent Technologies o Pfusion High Fidelity Polymerase de NEB) en reacciones de 50 pl con las siguientes condiciones de termociclado: 95 °C durante 3 min; seguido por 10 ciclos de 95 °C durante 30 s, 60 °C durante 30 s y 72 °C durante 30 s; y, por último, 72 °C durante 3 min. Los productos finales de las bibliotecas se purificaron con el kit de purificación MinElute (Qiagen) y se midieron por espectrofotometría.
Preparación de los adaptadores
Se prepararon mezclas de hibridación de los adaptadores P5 y P7 (26) por separado y se las incubó durante 10 s a 95 oC, seguido por una rampa de 95 oC a 12 oC a razón de 0,1°oC/s. Las reacciones de P5 y P7 se combinaron para obtener una mezcla de adaptadores lista para usar (100 pM de cada adaptador). Las mezclas de hibridación se prepararon de la siguiente manera. La mezcla de reacción P5 contenía el adaptador P5_F (500 pM) a una concentración final de 200 pM y el adaptador P5+P7_R (500 pM) a una concentración final de 200 pM, con una solución amortiguadora de hibridación de oligonucleótidos en concentración 1 X. Por su parte, la mezcla de reacción P7 contenía el adaptador P7_F (500 pM) a una concentración final de 200 pM y el adaptador P5+P7_R (500 pM) a una concentración final de 200 pM, con una solución amortiguadora de hibridación de oligonucleótidos en concentración 1 X (30). Las secuencias fueron las siguientes, donde * representa un enlace fosforotioato (PTO) (Integrated DNA Technologies) (Meyer, M. y Kircher, M. (2010)Cold Spring Harb. Protoc.2010(6):pdb prot5448):
adaptador P5_F:
A*c *a *C*TCTTTCCCTACACGACGCTCTTCCG*A*T*C*T (ID DE SEC. N.° 1)
adaptador P7_F:
G*t *g *A*CTGGAGTTCAGACGTGTGCTCTTCCG*A*T*C*T (ID DE SEC. N.° 2)
adaptador P5+P7_R:
A*G*A*T*CGGAA*G*A*G*C (ID DE SEC. N.° 3)
Ejemplo 2 : Diseño y preparación de secuencias de captura de blancos (TACS)
Se prepararon TACS personalizadas para la detección de anomalías cromosómicas totales o parciales en los cromosomas 13, 18, 21, X, Y o cualquier otro, así como otras anomalías genéticas, incluidas, sin carácter taxativo, síndromes asociados con microdeleciones o microduplicaciones, traslocaciones, inversiones, inserciones y otras mutaciones puntuales o pequeñas. Loslocigenómicos blanco usados para el diseño de las TACS se seleccionaron en función de su contenido de GC y su distancia a elementos repetitivos (distancia mínima de 150 bp). El tamaño de las TACS puede ser variable. En una realización del método, el tamaño de las TACS varía entre 100 y 260 bp y las TACS se generan mediante un método basado en la reacción en cadena de la polimerasa (PCR), que se describe a continuación. Las TACS se prepararon mediante una PCR símplex con polimerasa Taq estándar, cebadores diseñados para amplificar loslociblanco y ADN normal como molde. En la Figura 2, se muestran las regiones cromosómicas usadas para diseñar cebadores para amplificarlociadecuados en los cromosomas 13, 18, 21 y X, con el fin de preparar la mezcla de TACS para el análisis de los cromosomas 13, 18, 21 y X.
Todas las TACS personalizadas se generaron empleando las siguientes condiciones de termociclado: 95 °C durante 3 min; 40 ciclos de 95 °C durante 15 s, 60 °C durante 15 s, 72 °C durante 12 s; y 72 °C durante 12 s, seguido por la verificación mediante electroforesis en gel de agarosa y purificación mediante kits estándar de limpieza de productos de PCR como el kit Qiaquick PCR Purification Kit (Qiagen), el NucleoSpin 96 PCR Clean-up Kit (Macherey-Nagel) o el kit Agencourt AMPure XP for PCR Purification (Beckman Coulter). La concentración se midió con un instrumento NanoDrop (Thermo Scientific).
Ejemplo 3 : Hibridación de las TACS y amplificación
Biotinilación de las TACS
Las TACS se prepararon para su hibridación de acuerdo con un protocolo descrito anteriormente (Maricic, T.et al.(2010)PLoS One5:e14004) con pequeñas modificaciones. Se comenzó por obtener extremos romos con el kit Quick Blunting Kit (NEB) y una incubación a temperatura ambiente durante 30 minutos. Posteriormente, los productos de la reacción se purificaron con el kit MinElute (Qiagen) y se ligaron a un adaptador de biotina mediante el kit Quick Ligation Kit (NEB) en una reacción de 40 pl a temperatura ambiente durante 15 minutos. Los productos de la reacción se purificaron con el kit MinElute (Qiagen) y se desnaturalizaron para obtener ADN de hebra simple antes de su inmovilización en microesferas magnéticas recubiertas con estreptavidina (Invitrogen).
Hibridación de TACS
Las bibliotecas amplificadas se mezclaron con oligonucleótidos bloqueadores (Maricic, T.supra)(200 pM), 5 pg de ADN Cot-1 (Cot-1 DNA, Invitrogen), 50 pg de ADN de esperma de salmón (Salmon Sperm DnA, Invitrogen),bufferde hibridación Agilent en concentración 2 X y agente bloqueador Agilent en concentración 10 X, y se calentaron a 95 °C durante 3 min para desnaturalizar las hebras de ADN. Luego de la desnaturalización, se realizó una incubación durante 30 minutos a 37 °C para bloquear los elementos repetitivos y las secuencias de los adaptadores. La mezcla resultante se agregó a las TACS biotiniladas. Todas las muestras se incubaron en un incubador giratorio durante 12 a 48 h a 66 °C. Luego de la incubación, las microesferas se lavaron como se describió anteriormente y el ADN se eluyó por calentamiento (Maricic, T.supra).Los productos eluidos se amplificaron con cebadores de adaptadores dirigidos hacia fuera. Los productos amplificados enriquecidos se combinaron de forma equimolar y se secuenciaron en una plataforma Illumina o cualquier otra plataforma adecuada.
Ejemplo 4 : Análisis bioinformático de las muestras
Alineación con el genoma humano
Por cada muestra, se aplicó la rutina bioinformática(pipeline)que se describe a continuación para alinear los fragmentos de ADN secuenciados de cada muestra con el genoma humano de referencia. Los fragmentos de lecturas apareadas dirigidas obtenidos de los resultados de la NGS se procesaron para eliminar las secuencias de adaptadores y las lecturas de baja calidad (puntuación Q < 25) con el software cutadapt (Martin, M.et al.(2011)EMB.netJournal17.1). La calidad de las lecturas crudas y/o procesadas, junto con toda estadística descriptiva que ayudara a evaluar la calidad del resultado de la secuenciación de la muestra, se obtuvieron con el software FastQC (Babraham Institute (2015)FastQC)y/u otras herramientas de software propias. Las lecturas procesadas de al menos 25 bases de longitud se alinearon al genoma humano de referencia, versión hg 19 (UCSC Genome Bioinformatics), con un algoritmo de alineación basado en la transformación de Burrows-Wheeler (Li, H. y Durbin, R. (2009)Bioinformatics25:1754-1760). Si correspondía, las lecturas duplicadas se eliminaron luego de la alineación. En los casos en que correspondía, el resultado de la secuenciación obtenido de la misma muestra, pero procesado en distintas calles(lanes)de secuenciación, se combinó en un único archivo de salida. Los procedimientos de eliminación de lecturas duplicadas y combinación se realizaron con el paquete de herramientas de software Picard (Broad Institute (2015)Picard)y/o el paquete de herramientas de software Sambamba (referencia de Sambamba: Tarasov, Artem,et al."Sambamba: fast processing of NGS alignment formats."Bioinformatics31.12 (2015): 2032-2034.).
El análisis de software anterior resultó en una versión final alineada de una muestra secuenciada contra el genoma humano de referencia, y todos los pasos ulteriores se basaron en esta versión alineada. La información relativa a los polimorfismos de nucleótidos individuales (SNP) en loslocide interés se obtuvo con la herramienta bcftools del paquete de software SAMtools (Li, H.et al.(2009)Bioinformatics25:2078-2079). La profundidad de lecturas por base en loslocide interés —denominada, en lo sucesivo, archivo mpileup— se obtuvo con la opción mpileup del paquete de software SAMtools. La información relativa al tamaño de los fragmentos alineados —denominada, en lo sucesivo, archivo de tamaños de fragmentos— se obtuvo con la opción view del paquete de software SAMtools.
El archivo mpileup y el archivo de tamaños de fragmentos se procesaron con interfaces de programación de aplicación (API) personalizadas escritas en los lenguajes de programación Python y R (Python Software Foundation (2015)Python;The R Foundation (2015)The R Project for Statistical Computing).Las API se usaron para determinar la ploidía de los cromosomas de interés mediante una serie de pasos (denominados colectivamente, en lo sucesivo, “el algoritmo”) y también para recopilar otras estadísticas descriptivas previstas para usar como métricas de control de calidad, tales como —sin carácter taxativo— la cuantificación de la fracción fetal (denominadas colectivamente, en lo sucesivo, “métricas de control de calidad”). Las API también pueden usarse para la evaluación de anomalías genéticas a partir de datos generados al aplicar el método descrito en casos de embarazos múltiples, así como otras anomalías genéticas, como —sin carácter taxativo— las microdeleciones, las microduplicaciones, las variaciones en el número de copias, las translocaciones, las inversiones, las inserciones, las mutaciones puntuales y los perfiles de mutaciones.
Métricas de control de calidad
Se emplearon métricas de control de calidad para inspeccionar las propiedades de una muestra alineada y decidir si la muestra era apta para clasificación. Algunas de estas métricas fueron, sin carácter taxativo:
(a) El enriquecimiento de una muestra. Los patrones de enriquecimiento son indicativos de si una muestra tuvo un enriquecimiento adecuado entre loslocide interés en un experimento de secuenciación dado (denominado, en lo sucesivo, una “corrida”). Para evaluar esto, se consideran distintas métricas, que incluyen, sin carácter taxativo:
(i) la profundidad de lecturas de la muestra en su conjunto que sean específicas (“en el blanco”); (ii) el volumen de secuenciación de la muestra que sea específico (“en el blanco”) con relación a la cantidad total de lecturas mapeadas;
(iii) el rendimiento de TACS individuales en términos de la profundidad de lecturas alcanzada; (iv) la curtosis y la asimetría estadística del enriquecimiento de TACS individuales; y (v) los momentos de curtosis y asimetría estadística que surgen de todas las TACS.
Las comprobaciones anteriores también se tienen en consideración en relación con el enriquecimiento del sesgo inducido por el contenido de GC. Las muestras que no cumplen con uno o más de los criterios mencionados anteriormente se identifican para su inspección ulterior antes de la clasificación.
(b) La fracción fetal de una muestra. Las muestras con una fracción fetal estimada por debajo de un umbral específico no se clasifican.
El algoritmo
El algoritmo es una colección de rutinas de procesamiento de datos y modelos matemáticos y estadísticos organizados como una serie de pasos. Los pasos del algoritmo buscan determinar la ploidía individual de un cromosoma de interés en relación con todos los demás cromosomas de la muestra secuenciada y se usan para la detección de anomalías cromosómicas totales o parciales en los cromosomas 13, 18, 21, X, Y o cualquier otro, así como otras anomalías genéticas como, por ejemplo —sin carácter taxativo— , los síndromes de microdeleciones/microduplicaciones y otras mutaciones puntuales o pequeñas. Así, el algoritmo puede usarse, sin carácter taxativo, para la detección de anomalías cromosómicas totales o parciales en los cromosomas 13, 18, 21, X, Y o cualquier otro, así como otras anomalías genéticas, incluidas, sin carácter taxativo, microdeleciones, microduplicaciones, variaciones en el número de copias, translocaciones, inversiones, inserciones, mutaciones puntuales y otros perfiles de mutaciones. El algoritmo realiza, sin carácter taxativo, dos tipos de evaluaciones, una relativa a la información sobre la profundidad de lecturas en cada muestra y otra relativa a la distribución de tamaños de fragmentos en regiones específicas de las TACS. A cada tipo de evaluación pueden asociarse una o más pruebas estadísticas, ejemplos no taxativos de los cuales se proveen en los métodos estadísticos descritos en la presente.
En caso de pruebas asociadas con la profundidad de lecturas, el algoritmo compara secuencialmente la profundidad de lecturas de loslocide cada cromosoma de interés (denominado, en lo sucesivo, cromosoma de prueba) contra la profundidad de lecturas de todos los demásloci(denominados, en lo sucesivo,locide referencia) para determinar su ploidía. Por cada muestra, los pasos fueron, sin carácter taxativo, los siguientes:
(a) Eliminar loslocisecuenciados de forma inadecuada. Se obtuvo la profundidad de lecturas de cadalocus.Loslocique no alcanzaron una cantidad mínima de lecturas se consideraron insuficientemente enriquecidos y se eliminaron antes de los pasos ulteriores.
(b) Mitigar el sesgo inducido por el contenido de GC. El procedimiento de secuenciación introduce discrepancias en la profundidad de lecturas entre loslocide interés en función de su contenido de GC. Para considerar tal sesgo, se empleó un nuevo enfoque de apareamiento de secuencias que aumenta tanto la sensibilidad como la especificidad a la hora de detectar aneuploidías cromosómicas. Se identificó el contenido de GC de cadalocusdel cromosoma de prueba y se agruparon loslocigenéticos similares para formar grupos genéticamente apareados. El procedimiento se repitió con loslocide referencia. Luego, los grupos genéticamente apareados del cromosoma de prueba se aparearon condicionalmente con sus grupos genéticamente apareados contrapartes en el/los cromosoma(s) de referencia. Los grupos pueden tener cualquier cantidad de miembros. Luego, los grupos condicionalmente apareados se usaron para determinar la ploidía de los cromosomas de prueba.
(c) Determinar la ploidía. La determinación de la ploidía se realizó empleando un único método estadístico y/o una puntuación ponderada del resultado de los siguientes métodos estadísticos (sin carácter taxativo):
Método estadístico 1: Las diferencias en las profundidades de lecturas entre los grupos condicionalmente apareados se evaluaron para determinar su significación estadística con la fórmula de la prueba t:
donde t es el resultado de la prueba t,xes el promedio de las diferencias entre los grupos condicionalmente apareados, p es la profundidad de lecturas esperada y se fija en un valor que representa diferencias de profundidad de lecturas insignificantes entre ambos grupos, s es la desviación estándar de las diferencias entre los grupos condicionalmente apareados y n es la longitud del vector de las diferencias condicionalmente apareadas. La magnitud del estadísticotse usó para identificar la evidencia, si correspondía, contra la hipótesis nula de igualdad de ploidía entre los cromosomas de referencia y de prueba. Específicamente,t>= c1 (donde c1 es un umbral predefinido que pertenece al conjunto de todos los números positivos) indica evidencia en contra de la hipótesis nula. Los resultados del análisis de 98 muestras maternas correspondientes al cromosoma 21 con este método se muestran en la Figura 3.
Método estadístico 2: Remuestreo bivariado no paramétrico. El método de remuestreo(bootstrap)depende de la relación entre las variables aleatorias X (profundidad de lecturas de loslocide referencia) e Y (profundidad de lecturas de loslocide prueba). Aquí, tratamos la profundidad de lecturas de los señuelos en el grupo de referencia (variable aleatoria denotada por X) como la covariable independiente. El primer paso del procedimiento iterativo involucró un muestreo al azar con remuestreo(bootstrapping)de las profundidades de lecturas de loslocien los cromosomas de referencia, es decir, (x1,g1), ..., (xn,gn), donde el parámetro g es conocido y representa el contenido de GC del señuelo escogido. Luego, por cada señuelo de referencia seleccionado aleatoriamente (xi,gi), se generó una profundidad de lecturas correspondiente para unlocusgenéticamente apareado, a saber, (y 1,g1), ..., (yn,gn). Así, se obtuvieron los datos bivariados (x1,y1), (x2,y2), ..., (xn,yn), condicionalmente apareados en función de su contenido de GC (parámetro gi). Las diferencias entre las profundidades de lecturas de los valores remuestreados genéticamente apareados xi e yi se usaron para calcular el estadístico de interés en cada iteración. En una realización, esta medida estadística puede ser, sin carácter taxativo, la moda, la media o la mediana de las diferencias registradas, y/o múltiplos de dichos valores. El procedimiento se repitió la cantidad de veces necesarias para construir la distribución del estadístico de interés a partir de estas diferencias. Se asignó a la muestra una puntuación que corresponde a un percentil específico de la distribución construida (p. ej., el 5.° percentil). Bajo la hipótesis nula, la ploidía es la misma entre los cromosomas de los grupos de referencia y de prueba. Así, las muestras en las que la puntuación de un cromosoma en particular era mayor a un umbral predefinido, notado c2, se clasificaron como muestras en las que era estadísticamente improbable que la ploidía fuera la misma que en la referencia. También pueden emplearse otras medidas estadísticas. Los resultados del análisis de 98 muestras maternas correspondientes al cromosoma 21 con este método se muestran en la Figura 4.
Método estadístico 3: Prueba de permutaciones estratificadas. El estadístico de interés es la profundidad de lecturas estimada del cromosoma de prueba, denotada por f o6s, que se calcula a partir de todos loslocide los grupos genéticamente apareados de los cromosomas de prueba de la siguiente manera:
donde y es la profundidad de lecturas dellocus ique forma parte del grupo genéticamente apareadoj(es decir, loslocique pertenecen a un grupo específico en virtud de su contenido de GC),Njes la cantidad delocide prueba que son parte del grupo genéticamente apareado j y T la cantidad de grupos genéticamente apareados.
A continuación, se construyó una distribución nula para evaluarYobs.Para hacerlo, por cada grupoj,loslocide prueba y de referencia se combinaron (intercambiabilidad bajo la hipótesis nula) y cada grupojse muestreó aleatoriamente hastaNjveces sin reposición (permutación estratificada). Esto creó un vector de valores, notado yi, del cual se calculó el valor promedio, notadoy t.El procedimiento se repitió la cantidad de veces necesarias para construir la distribución nula. Por último,Yobs —se estudentizó respecto de la distribución nula con la siguiente fórmula:ZYcbs = Yobs~ v
dondeYy oy son el primer momento y la raíz cuadrada del segundo momento de todos los valores estadísticos y¡ permutados. En las muestras cuyos valores deZY0bseran mayores de un umbral predefinido, notado c3, era estadísticamente menos probable que la ploidía fuera la misma entre los grupos de referencia y de prueba. Los resultados del análisis de 98 muestras maternas correspondientes al cromosoma 21 con este método se muestran en la Figura 5.
En el caso de las pruebas asociadas con los tamaños de fragmentos, el algoritmo calcula la proporción de fragmentos pequeños en loslocide prueba y la compara con la correspondiente proporción en loslocide referencia, como se describe en el método estadístico 4, a continuación.
Método estadístico 4: Proporciones de tamaños de fragmentos. Por cada muestra, se extrae la cantidad y el tamaño de los fragmentos alineados al genoma humano de referencia en las coordenadas correspondientes a las TACS. Posteriormente, los datos se filtran para eliminar los tamaños de fragmentos que se consideran valores estadísticamente atípicos usando el método de detección de valores atípicos basado en la mediana. Específicamente, se definen como valores atípicos aquellos fragmentos cuyo tamaño es mayor o menor a los umbralesFthr,dados por la siguiente ecuación:
dondeFmedianes la mediana del tamaño de todos los fragmentos de una muestra, X es una variable que puede asumir valores en el conjunto R , eIQRes el rango intercuartílico de los tamaños de fragmentos. Posteriormente, se realiza una prueba binomial de proporciones para buscar evidencia en contra de la hipótesis nula, H0, definida de la siguiente manera:
H0: La proporción de fragmentos pequeños en la región de prueba no difiere de la proporción de fragmentos pequeños en la región de referencia.
En varias realizaciones de la invención, los fragmentos pequeños se definen como aquellos fragmentos cuyo tamaño es menor o igual a un subconjunto de1acotado superiormente por 160 bp. Si definimos como T el conjunto de todas las TACS, la región de prueba puede ser cualquier subconjunto propio S que defina la región investigada, y la región de referencia es el complemento relativo de S en T. Por ejemplo, en una realización de la invención, el conjunto S se define como el conjunto de todas las secuencias capturadas por TACS del cromosoma 21 y, por consiguiente, el conjunto de referencia se define como el conjunto de todos los fragmentos capturados por TACS en los cromosomas de referencia y/u otroslocide referencia.
La hipótesis alternativa, H1, se define de la siguiente manera:
H1: La proporción de fragmentos pequeños en la región de prueba difiere de la proporción de fragmentos pequeños en la región de referencia.
Así, teniendo en cuenta la corrección por continuidad, se calcula la siguiente puntuación (Brownet al.,Harrel):
donde
Fes la cantidad de fragmentos pequeños en la región de prueba,Frefes la cantidad de fragmentos pequeños en la región de referencia,Ntestes la cantidad total de fragmentos en la región de prueba yNrefes la cantidad total de fragmentos en la región de referencia.
Por cada muestra, el algoritmo contrasta secuencialmente la proporción de tamaños de fragmentos de las regiones investigadas (por ejemplo, sin carácter taxativo, el cromosoma 18, el cromosoma 21 y el cromosoma 13) contra las regiones de referencia, es decir, aquellas no investigadas en la prueba. Por cada muestra, se asigna una puntuación por cada prueba. Las puntuaciones superiores a un umbral, notado c4, proveen evidencia en contra de la hipótesis nula. Los resultados del análisis de 98 muestras maternas correspondientes al cromosoma 21 con este método se muestran en la Figura 6.
Método de puntuación ponderada 1: En una realización del método, se atribuyó a cada muestra s una puntuación ponderada, calculada como la suma ponderada de todos los métodos estadísticos de acuerdo con la siguiente fórmula:
dondeRses la puntuación corregida específica de la corrida obtenida de una contribución ponderada de cada método estadístico relacionado con la profundidad de lecturas de la muestra s, que se define como:
y~R¿es la mediana específica de la corrida, calculada a partir del vector de todas las puntuaciones no ajustadas ponderadas relacionadas con la profundidad de lecturas obtenidas de una única corrida de secuenciación, yares un múltiplo del desvío estándar de las puntuacionesRcalculado a partir de un conjunto de referencia de 100 muestras euploides. Los términos max{Fs, Fs} y min{Fs, Fs} denotan los valores máximo y mínimo del conjunto entre llaves, respectivamente.
Fses la puntuación corregida específica de la corrida obtenida del método estadístico relacionado con los tamaños de fragmentos y se define como:
dondeWtesttiene la misma definición que antes,R¡es la mediana específica de la corrida, calculada a partir del vector de todas las puntuaciones estadísticas no ajustadas relacionadas con los fragmentos obtenidas de una única corrida de secuenciación, yafes un múltiplo del desvío estándar de las puntuacionesFcalculado a partir de un conjunto de referencia de 100 muestras euploides.
Una puntuación de clasificación única inferior a un valor predefinido indica que no hay evidencia en los datos observados de que una muestra tenga un riesgo significativo de aneuploidía. En las Figuras 7 y 8, se muestran los resultados correspondientes a las 98 muestras maternas usando el enfoque de puntuación ponderada sobre un subconjunto de los métodos o sobre todos los métodos, respectivamente.
Método de puntuación ponderada 2: En otra realización del método, la puntuación ponderada obtenida de los métodos estadísticos descritos anteriormente se usó para asignar a cada muestra una puntuación única de riesgo de aneuploidía de acuerdo con la siguiente fórmula:
dondeRes el resultado de la puntuación ponderada, wy es el peso asignado al métodoj,t'¡la puntuación observada resultante del métodoj,y el umbral del métodoj.
Una puntuación de clasificación única inferior a un valor predefinido indica que no hay evidencia en los datos observados de que una muestra tenga un riesgo significativo de aneuploidía. En la Figura 9, se muestran los resultados de las 98 muestras maternas usando los métodos estadísticos 1 a 3 con el método de puntuación ponderada 2.
Dado que se asumió que todas las profundidades de lecturas de los señuelos del grupo de referencia provenían de la misma población, y para tener un umbral universal, se emplearon ajustes específicos de cada corrida para aliviar los sesgos específicos de cada corrida.
El/los método(s) mencionado(s) también es/son adecuado(s) para la detección de otras anomalías genéticas, incluidas, sin carácter taxativo, las anomalías subcromosómicas. Un ejemplo no taxativo es la pérdida parcial contigua de material cromosómico que da lugar a una microdeleción, o la incorporación parcial contigua de material cromosómico que da lugar a una microduplicación. Unlocusgenético conocido sujeto a ambas anomalías es el 7q11.23. En una realización del método estadístico 1, se evaluaron muestras de plasma sintéticas con un 5 %, 10 % y 20 % de material fetal para evaluar el aumento del riesgo de microdeleciones y/o microduplicaciones en ellocusgenético 7q11.23. Los resultados se ilustran en la Figura 10 en los casos de microdeleciones y en la Figura 11 en los casos de microduplicaciones.
En el caso de las mutaciones puntuales, se realizan varias pruebas binomiales que consideran la estimación de la fracción fetal de la muestra, notada f, la profundidad de lecturas del alelo menor, notada r, y la profundidad de lecturas total de la base secuenciada, notada n. Dos ejemplos frecuentes, pero no taxativos, involucran la evaluación del riesgo cuando la anomalía genética es una mutación puntual recesiva o una mutación puntual dominante.
En el ejemplo no taxativo de una mutación puntual recesiva, la hipótesis nula evaluada es que tanto la madre como el feto son heterocigotas (es decir, la frecuencia del alelo menor es de 0,5), en tanto que la hipótesis alternativa es que el feto es homocigota (es decir, la frecuencia del alelo menor es de 0,5-f/2). Un valorppequeño en la correspondiente prueba de cocientes de verosimilitudes(likelihood ratio)indicaría evidencia contraria a la hipótesis nula. En el ejemplo no taxativo de una mutación puntual dominante, la hipótesis nula evaluada es que tanto la madre como el feto son homocigotas en la posición dada, en tanto que la hipótesis alternativa es que solo el feto es heterocigota en la posición dada. Un valorppequeño en la correspondiente prueba de cocientes de verosimilitudes(likelihood ratio)indicaría evidencia contraria a la hipótesis nula.
Además de los anteriores, se desarrollaron métodos de determinación del sexo fetal, ejemplos no taxativos de los cuales se describen a continuación. En una realización de la invención, se asignó el sexo fetal a una muestra usando una prueba de Poisson dada por la siguiente fórmula:
donde 2 y f es la fracción fetal estimada de la muestra, B es la cantidad de secuencias blanco en el cromosoma Y, p es la profundidad de lecturas de la muestra y k es la suma de las lecturas obtenidas de todos los blancos B. La hipótesis nula de la prueba de Poisson fue que la muestra era masculina. Un valor de Pr(ry) menor a un umbral cy se consideró como evidencia suficiente para rechazar la hipótesis nula, es decir, concluir que la muestra no era masculina. En los casos en los que uno o más de los términos para calcular Pr(ry) no estaban disponibles, el sexo de la muestra se clasificó como no disponible (NA).
En otra realización de la invención, el sexo fetal se asignó usando la profundidad de lecturas promedio de las secuencias blanco en el cromosoma Y. Si la profundidad de lecturas promedio de las secuencias blanco era superior a un umbral predefinido (donde tal umbral puede definirse en función de otras características específicas de la muestra, como la profundidad de lecturas y la fracción fetal estimada), el sexo fetal se clasificó como masculino. Si la profundidad de lecturas promedio era inferior a dicho umbral, la muestra se clasificó como femenina.
Estimación de la fracción fetal
Se han desarrollado diversos métodos para estimar la fracción fetal que pueden aplicarse a embarazos simples y/o múltiples. Así, en función del tipo de embarazo, la fracción fetal estimada puede obtenerse de cualquiera de los métodos o como una estimación ponderada a partir de un subconjunto de los métodos desarrollados y/o de todos ellos. A continuación, se dan algunos ejemplos no taxativos.
En una realización, se desarrolló una técnica de aprendizaje computarizado basada en la inferencia bayesiana para calcular la distribucióna posterioride la fracción fetal de ADN empleando los recuentos alélicos en loslociheterocigotas del plasma materno de embarazos simples. Se utilizaron tres combinaciones informativas posibles de genotipos maternos/fetales dentro del modelo para identificar aquellos valores de fracción fetal de ADN con mayor respaldo de los datos observados.
Seafla fracción fetal de ADN. Si la madre es heterocigota en unlocusdado, el genotipo fetal puede ser heterocigota u homocigota, lo que resulta en frecuencias esperadas del alelo menor de0,5y0,5-f/2,respectivamente. Si la madre es homocigota y el feto es heterocigota, la frecuencia esperada del alelo menor será def/2.Se empleó un método de Monte Carlo basado en una cadena de Markov (algoritmo de Metropolis-Hastings) (The R Foundation (2015)The R Project for Statistical Computing) con una distribucióna priorino informativa o informativa (es decir, que incorporara información adicional como la edad gestacional, el peso materno, etc.) para obtener una secuencia de muestras aleatorias de la distribución de probabilidada posterioride la fracción fetal de ADN basada en un modelo de mezclas finitas.
En otra realización, la fracción fetal estimada se calcula únicamente a partir del clúster de frecuencia alélica menor (MAF) específico del feto, es decir, el clúster formado cuando la madre es homocigota y el feto es heterocigota en unlocusgenómico dado. Se asume que la media de la fracción fetal estimada tiene una distribución normalN(2x, a¿),dondexes la media de la MAF específica del feto y es el desvío estándar de la MAF específica del feto. Luego, la fracción fetal estimada se obtiene de los percentiles de la distribución calculada,N{2x, a¿).
En los embarazos de gestación múltiple —ejemplos no taxativos de los cuales incluyen los embarazos de gemelos monocigóticos y de mellizos dicigóticos, los embarazos de trillizos y distintos casos de donantes de óvulos y/o esperma— , la fracción fetal puede estimarse empleando información obtenida a partir delocigenéticos cuyo valor de m Af sea menor que un umbral, notadoMthresh,y derivada de posibles SNP específicos del feto. La persona razonablemente versada en la técnica apreciará que los SNP específicos del feto pueden originarse de cualquiera de los fetos, de cualquier combinación posible de los fetos o de todos los fetos de la gestación. Así, se ha desarrollado un algoritmo que estima la fracción fetal del feto con la menor contribución al contenido fetal total, teniendo en cuenta la contribución combinatoria de cada feto a los valores de MAF que definen los SNP específicos del feto, y también permite la contribución no homogénea de material fetal al contenido fetal total del material obtenido del plasma. Con este fin, el algoritmo emplea un enfoque de dos pasos.
En una realización del algoritmo, el embarazo múltiple considerado es un embarazo de mellizos dicigóticos. Como primer paso, la implementación algorítmica del modelo utiliza todos los SNP informativos y permite una contribución fetal no homogénea que puede explicarse con una diferencia relativa en las fracciones fetales estimadas respecto de un umbral definido, notado cf. Específicamente, si f1 y f2 representan las fracciones fetales de los fetos uno y dos, respectivamente, y f1 <= f2, la suposición es que f2 <= cf f1, donde cf es una constante real positiva mayor o igual a 1. Bajo esta hipótesis, los datos observados D, definidos como los recuentos de los alelos alternativo y de referencia en loslocide los SNP informativos, se suponen generados por una distribución combinada de tres binomiales (definidas por los parámetros f1/2, f2/2 y (f1+f2)/2), siendo la distribucióna posteriorip(f1,f2|D) proporcional al modelo de observación, que puede expresarse como p(f1|f2,D) p(f2|D). La distribucióna posteriorip(f1,f2|D) se muestra con un algoritmo de Metropolis-Hastings MCMC usando una distribucióna prioriuniforme. El enfoque de cuantiles empíricos se aplica al arreglo de datos generado para inferir las fracciones fetales.
Como segundo paso, el algoritmo ejecuta un algoritmo de agrupamiento(clustering)basado en un modelo (modelo de mezcla gausiana finita ajustado mediante el algoritmo EM; paquete mclust en R) para identificar si existe un clúster independiente de SNP atípicos del que se crea que está centrado en torno de f1/2. La existencia de tal clúster con una media que invalide la hipótesis cf >= f2/f1 lleva a la estimación de f1 usando únicamente SNP que son parte del clúster identificado.
Referencias
Chris Fraley y Adrian E. Raftery (2002). Model-based Clustering, Discriminant Analysis and Density Estimation. Journal of the American Statistical Association, 97:611-631
Chris Fraley, Adrian E. Raftery, T. Brendan Murphy y Luca Scrucca (2012). mclust Version 4 for R: Normal Mixture Modeling for Model-Based Clustering, Classification, and Density Estimation. Technical Report No. 597, Department of Statistics, University of Washington
Ejemplo 5 : Resultados del análisis de muestras maternas
Se analizaron noventa y ocho muestras maternas para evaluar el riesgo de trisomía del cromosoma 21 (T21) de acuerdo con las metodologías descritas en los Ejemplos 1 a 4. Los valores de puntuación del riesgo detectado de T21 en cada una de las 98 muestras con los métodos estadísticos 1, 2, 3 y 4 se muestran en los gráficos de las Figuras 3, 4, 5 y 6, respectivamente. Cada punto representa el valor de puntuación de una muestra individual. La línea representa el umbral “c” (c = 3,00 en el caso del método 1, c = 5,00 en el caso del método 2, c = 4,00 en el caso del método 3 y c = 0,91 en el caso del método 4). A las puntuaciones que superaron el umbral en la dirección positiva (es decir, valor de puntuación > c, puntos oscuros) se les asignó un riesgo alto de aneuploidía en comparación con las puntuaciones que no superaron el umbral (es decir, valor de puntuación < c, puntos claros). Con todos los métodos estadísticos, a cuatro muestras se les asignó un riesgo alto de aneuploidía T21. Todos los métodos estadísticos identificaron un riesgo elevado en las mismas muestras, a pesar de que las puntuaciones tenían distribuciones diferentes en los distintos métodos.
Las puntuaciones ponderadas resultantes de las combinaciones de los métodos estadísticos 1, 2, 3 y 4 del algoritmo (descritas en el Ejemplo 4) se representan en los gráficos de las Figuras 7 a 9, donde, una vez más, cada punto representa el valor de puntuación de una muestra individual y la línea representa el umbral. Los valores de puntuación ponderados identificaron un riesgo elevado en las mismas cuatro muestras. Las cuatro muestras en las que se identificó un riesgo elevado de T21 mediante los análisis anteriores se evaluaron de forma independiente y se verificó que se trataba de embarazos con un feto con trisomía 21, lo que confirma la exactitud del método para la evaluación del riesgo de T21. Los resultados del análisis de microdeleciones y microduplicaciones en muestras sintéticas se ilustran en las Figuras 10 y 11.

Claims (1)

REIVINDICACIONES
1.Un kit para realizar un método para evaluar el riesgo de una anomalía cromosómica en ADN fetal en una muestra combinada de ADN materno y fetal, donde el kit comprende componentes para:
(a) preparar una biblioteca de secuenciación a partir de la muestra combinada;
(b) hibridar la biblioteca de secuenciación a una mezcla de secuencias de captura de blancos (TACS) de doble hebra, donde la mezcla de TACS comprende secuencias que se unen a uno o más cromosomas de interés que comprenden una anomalía cromosómica, y donde:
(i) cada secuencia de la mezcla tiene entre 100 y 260 pares de bases de longitud;
(ii) cada secuencia de la mezcla se une al/a los cromosoma(s) de interés a una distancia de al menos 150 pares de bases, tanto en el extremo 5' como en el extremo 3', de regiones que presentan variaciones en el número de copias (CNV), duplicaciones segmentales o elementos de ADN repetitivo; y
(iii) el contenido de GC de las TACS se encuentra entre el 19 % y el 50 %;
(c) aislar aquellos miembros de la biblioteca de secuenciación que se unen a las TACS para obtener una biblioteca enriquecida;
(d) amplificar y secuenciar la biblioteca enriquecida; y
(e) realizar análisis estadísticos sobre las secuencias de la biblioteca enriquecida para determinar así un riesgo asociado con la anomalía cromosómica en el ADN fetal,
donde el kit comprende un contenedor que comprende la mezcla de TACS, donde la mezcla de TACS comprende secuencias de doble hebra que se unen a uno o más cromosomas de interés seleccionados de entre el grupo de los cromosomas 13, 18, 21, X e Y, comprendiendo los cromosomas una anomalía cromosómica, y donde:
(1) cada secuencia de la mezcla tiene entre 100 y 260 pares de bases de longitud;
(2) cada secuencia de la mezcla se une al/a los cromosoma(s) de interés a una distancia de al menos 150 pares de bases, tanto en el extremo 5' como en el extremo 3', de regiones que presentan variaciones en el número de copias (CNV), duplicaciones segmentales o elementos de ADN repetitivo; y
(3) el contenido de GC de las TACS se encuentra entre el 19 % y el 50 %.
ES19216148T 2015-05-22 2016-05-20 Análisis paralelo múltiplex de regiones genómicas blanco para análisis prenatales no invasivos Active ES2990200T3 (es)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
US201562165593P 2015-05-22 2015-05-22
US201562263320P 2015-12-04 2015-12-04

Publications (1)

Publication Number Publication Date
ES2990200T3 true ES2990200T3 (es) 2024-11-29

Family

ID=56409121

Family Applications (2)

Application Number Title Priority Date Filing Date
ES19216148T Active ES2990200T3 (es) 2015-05-22 2016-05-20 Análisis paralelo múltiplex de regiones genómicas blanco para análisis prenatales no invasivos
ES16738215T Active ES2790533T3 (es) 2015-05-22 2016-05-20 Análisis paralelo múltiplex de regiones genómicas blanco para análisis prenatales no invasivos

Family Applications After (1)

Application Number Title Priority Date Filing Date
ES16738215T Active ES2790533T3 (es) 2015-05-22 2016-05-20 Análisis paralelo múltiplex de regiones genómicas blanco para análisis prenatales no invasivos

Country Status (13)

Country Link
US (3) US11111538B2 (es)
EP (3) EP4428249A3 (es)
AU (1) AU2016269332B2 (es)
CA (1) CA2986200C (es)
CY (1) CY1122917T1 (es)
DK (1) DK3666902T3 (es)
EA (1) EA038117B1 (es)
ES (2) ES2990200T3 (es)
FI (1) FI3666902T3 (es)
PL (1) PL3666902T3 (es)
PT (1) PT3666902T (es)
WO (1) WO2016189388A1 (es)
ZA (1) ZA201707850B (es)

Families Citing this family (11)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
PT3649258T (pt) 2017-07-07 2022-05-25 Nipd Genetics Public Company Ltd Análise paralela multiplexada enriquecida com alvo para avaliação de amostras de adn fetal
EP3649259B1 (en) 2017-07-07 2022-05-25 Nipd Genetics Public Company Limited Target-enriched multiplexed parallel analysis for assessment of risk for genetic conditions
DK3649257T3 (da) 2017-07-07 2022-07-04 Nipd Genetics Public Company Ltd Berigelse af målrettede genomiske regioner til multiplekset parallel analyse
PL3649260T3 (pl) 2017-07-07 2022-10-17 Nipd Genetics Public Company Limited Multipleksowa analiza równoległa ze wzbogaceniem sekwencji docelowych do oznaczania biomarkerów nowotworowych
EP3696279A1 (en) * 2019-02-13 2020-08-19 Nipd Genetics Public Company Limited Methods for noninvasive prenatal testing of fetal abnormalities
CN114945685B (zh) * 2020-01-17 2025-07-04 深圳华大生命科学研究院 确定胎儿核酸浓度的方法以及胎儿基因分型方法
IL298458A (en) * 2020-05-22 2023-01-01 Aqtual Inc Methods for characterizing cell-free nucleic acid fragments
EP4464792A1 (en) 2023-05-17 2024-11-20 Medicover Biotech Ltd. Non-invasive in-vitro method of diagnosis
EP4464791A1 (en) 2023-05-17 2024-11-20 Medicover Biotech Ltd. Non-invasive in-vitro method for somatic mutation detection
WO2025228840A1 (en) 2024-05-02 2025-11-06 Medicover Biotech Ltd. Method for somatic mutation detection
WO2025228816A1 (en) 2024-05-02 2025-11-06 Medicover Biotech Ltd Method of targeted sequencing for diagnosis

Family Cites Families (32)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US3008018A (en) 1958-05-26 1961-11-07 John S Hammond Magnetic switch or valve operator
US3195415A (en) 1962-09-14 1965-07-20 Ray E Shorb T-slot strainer accessory
US3682594A (en) 1969-11-19 1972-08-08 Texas Instruments Inc Purification of silicon halides
AT319672B (de) 1971-02-15 1975-01-10 Muellender Gernot Verfahren zur Herstellung von Folienbogen zum Umkleiden von Rohrkrümmern
EP0791659A3 (en) 1989-11-13 1997-09-17 Children's Medical Center Corporation Antigen specific separation of nucleated fetal cells in non-invasive detection of fetal DNA
US6582908B2 (en) 1990-12-06 2003-06-24 Affymetrix, Inc. Oligonucleotides
GB9704444D0 (en) 1997-03-04 1997-04-23 Isis Innovation Non-invasive prenatal diagnosis
US6927028B2 (en) 2001-08-31 2005-08-09 Chinese University Of Hong Kong Non-invasive methods for detecting non-host DNA in a host using epigenetic differences between the host and non-host DNA
US20050282213A1 (en) 2003-09-22 2005-12-22 Trisogen Biotechnology Limited Partnership Methods and kits useful for detecting an alteration in a locus copy number
AU2004274724B2 (en) 2003-09-22 2009-09-10 Trisogen Biotechnology Limited Partnership Methods and kits useful for detecting an alteration in a locus copy number
EP1689884A4 (en) 2003-10-08 2007-04-04 Univ Boston PROCESS FOR THE PRENATAL DIAGNOSIS OF CHROMOSOMAL ABNORMALITIES
GB0413688D0 (en) 2004-06-18 2004-07-21 Novartis Forschungsstiftung Analysis of methylated nucleic acid
WO2006056480A2 (en) 2004-11-29 2006-06-01 Klinikum Der Universität Regensburg Means and methods for detecting methylated dna
US20090042195A1 (en) 2005-10-07 2009-02-12 Bradford Coffee Methods and systems for screening for and diagnosing dna methylation associated abnormalities and sex chromosome aneuploidies
HUE030215T2 (en) 2006-02-02 2017-04-28 Univ Leland Stanford Junior Non-invasive fetal genetic screening by digital analysis
US7901884B2 (en) 2006-05-03 2011-03-08 The Chinese University Of Hong Kong Markers for prenatal diagnosis and monitoring
HUE061020T2 (hu) 2007-07-23 2023-05-28 Univ Hong Kong Chinese Nukleinsav-szekvencia kiegyensúlyozatlanságának meghatározására
JP5322471B2 (ja) 2008-03-27 2013-10-23 シスメックス株式会社 メチル化dnaの解析方法及びプライマーセット
US8476013B2 (en) 2008-09-16 2013-07-02 Sequenom, Inc. Processes and compositions for methylation-based acid enrichment of fetal nucleic acid from a maternal sample useful for non-invasive prenatal diagnoses
ES2620012T3 (es) 2008-09-20 2017-06-27 The Board Of Trustees Of The Leland Stanford Junior University Diagnóstico no invasivo de la aneuploidia fetal por secuenciación
EP2473638B1 (en) 2009-09-30 2017-08-09 Natera, Inc. Methods for non-invasive prenatal ploidy calling
AU2010311535B2 (en) 2009-10-26 2015-05-21 Lifecodexx Ag Means and methods for non-invasive diagnosis of chromosomal aneuploidy
EA034241B1 (ru) 2009-11-06 2020-01-21 Те Чайниз Юниверсити Ов Гонконг Способ пренатальной диагностики дисбаланса последовательности
AU2010343277B2 (en) 2010-01-19 2015-05-28 Verinata Health, Inc. Method for determining copy number variations
US20120270739A1 (en) 2010-01-19 2012-10-25 Verinata Health, Inc. Method for sample analysis of aneuploidies in maternal samples
DK2529032T3 (en) 2010-01-26 2017-05-01 Nipd Genetics Ltd METHODS AND COMPOSITIONS FOR NON-INVASIVE PRE-NATIONAL DIAGNOSTICATION OF Fetal ANEUPLOIDITIES
US8825412B2 (en) 2010-05-18 2014-09-02 Natera, Inc. Methods for non-invasive prenatal ploidy calling
US20120034603A1 (en) 2010-08-06 2012-02-09 Tandem Diagnostics, Inc. Ligation-based detection of genetic variants
AU2011323478B2 (en) 2010-11-01 2015-09-10 Gen-Probe Incorporated Integrated capture and amplification of target nucleic acid for sequencing
US20120258892A1 (en) 2011-04-08 2012-10-11 Yan Wang Methods, Compositions, and Kits for Making Targeted Nucleic Acid Libraries
US9892230B2 (en) 2012-03-08 2018-02-13 The Chinese University Of Hong Kong Size-based analysis of fetal or tumor DNA fraction in plasma
US10643738B2 (en) * 2013-01-10 2020-05-05 The Chinese University Of Hong Kong Noninvasive prenatal molecular karyotyping from maternal plasma

Also Published As

Publication number Publication date
AU2016269332B2 (en) 2021-08-12
CA2986200C (en) 2025-05-13
ZA201707850B (en) 2021-03-31
US12480160B2 (en) 2025-11-25
HK1252710A1 (en) 2019-05-31
US11111538B2 (en) 2021-09-07
EP3298166A1 (en) 2018-03-28
CY1122917T1 (el) 2021-10-29
FI3666902T3 (fi) 2024-08-13
EP3298166B1 (en) 2020-02-12
EP4428249A2 (en) 2024-09-11
EA038117B1 (ru) 2021-07-08
PT3666902T (pt) 2024-09-19
CA2986200A1 (en) 2016-12-01
ES2790533T3 (es) 2020-10-28
AU2016269332A1 (en) 2018-01-04
EP3666902B1 (en) 2024-07-03
WO2016189388A1 (en) 2016-12-01
US20210130900A1 (en) 2021-05-06
PL3666902T3 (pl) 2025-02-03
EP4428249A3 (en) 2024-12-11
US20160340733A1 (en) 2016-11-24
EA201792570A1 (ru) 2018-05-31
EP3666902A1 (en) 2020-06-17
US12421551B2 (en) 2025-09-23
DK3666902T3 (da) 2024-09-09
US20220106642A1 (en) 2022-04-07

Similar Documents

Publication Publication Date Title
JP7646239B2 (ja) 超並列rna配列決定による母体血漿のトランスクリプトーム解析
ES2790533T3 (es) Análisis paralelo múltiplex de regiones genómicas blanco para análisis prenatales no invasivos
JP6392904B2 (ja) Dnaのサイズに基づく解析
TWI611186B (zh) 多重妊娠之分子檢驗
US20250115965A1 (en) Target-enriched multiplexed parallel analysis for assessment of tumor biomarkers
ES2920280T3 (es) Enriquecimiento de regiones genómicas blanco para análisis paralelo multiplexado
ES2924224T3 (es) Análisis paralelo multiplexado con enriquecimiento de blancos para la evaluación de muestras de ADN fetal
ES2925394T3 (es) Análisis paralelo multiplexado con enriquecimiento de blancos para la evaluación del riesgo de portar alteraciones genéticas
HK40113543A (en) Multiplexed parallel analysis of targeted genomic regions for non-invasive prenatal testing
HK40032387A (en) Multiplexed parallel analysis of targeted genomic regions for non-invasive prenatal testing
CA3068122C (en) Target-enriched multiplexed parallel analysis for assessment of tumor biomarkers
HK40032387B (en) Multiplexed parallel analysis of targeted genomic regions for non-invasive prenatal testing
HK1252710B (en) Multiplexed parallel analysis of targeted genomic regions for non-invasive prenatal testing