ES3047792T3 - Crispr/cas transcriptional modulation - Google Patents

Crispr/cas transcriptional modulation

Info

Publication number
ES3047792T3
ES3047792T3 ES15822737T ES15822737T ES3047792T3 ES 3047792 T3 ES3047792 T3 ES 3047792T3 ES 15822737 T ES15822737 T ES 15822737T ES 15822737 T ES15822737 T ES 15822737T ES 3047792 T3 ES3047792 T3 ES 3047792T3
Authority
ES
Spain
Prior art keywords
sgrna
sgrnas
dcas9
cells
target
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Active
Application number
ES15822737T
Other languages
English (en)
Inventor
Luke A Gilbert
Max Horlbeck
Martin Kampmann
Lei S Qi
Jonathan S Weissman
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
University of California Berkeley
University of California San Diego UCSD
Original Assignee
University of California Berkeley
University of California San Diego UCSD
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by University of California Berkeley, University of California San Diego UCSD filed Critical University of California Berkeley
Application granted granted Critical
Publication of ES3047792T3 publication Critical patent/ES3047792T3/es
Active legal-status Critical Current
Anticipated expiration legal-status Critical

Links

Classifications

    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12NMICROORGANISMS OR ENZYMES; COMPOSITIONS THEREOF; PROPAGATING, PRESERVING, OR MAINTAINING MICROORGANISMS; MUTATION OR GENETIC ENGINEERING; CULTURE MEDIA
    • C12N15/00Mutation or genetic engineering; DNA or RNA concerning genetic engineering, vectors, e.g. plasmids, or their isolation, preparation or purification; Use of hosts therefor
    • C12N15/09Recombinant DNA-technology
    • C12N15/10Processes for the isolation, preparation or purification of DNA or RNA
    • C12N15/1034Isolating an individual clone by screening libraries
    • C12N15/1079Screening libraries by altering the phenotype or phenotypic trait of the host
    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12NMICROORGANISMS OR ENZYMES; COMPOSITIONS THEREOF; PROPAGATING, PRESERVING, OR MAINTAINING MICROORGANISMS; MUTATION OR GENETIC ENGINEERING; CULTURE MEDIA
    • C12N15/00Mutation or genetic engineering; DNA or RNA concerning genetic engineering, vectors, e.g. plasmids, or their isolation, preparation or purification; Use of hosts therefor
    • C12N15/09Recombinant DNA-technology
    • C12N15/10Processes for the isolation, preparation or purification of DNA or RNA
    • C12N15/102Mutagenizing nucleic acids
    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12NMICROORGANISMS OR ENZYMES; COMPOSITIONS THEREOF; PROPAGATING, PRESERVING, OR MAINTAINING MICROORGANISMS; MUTATION OR GENETIC ENGINEERING; CULTURE MEDIA
    • C12N15/00Mutation or genetic engineering; DNA or RNA concerning genetic engineering, vectors, e.g. plasmids, or their isolation, preparation or purification; Use of hosts therefor
    • C12N15/09Recombinant DNA-technology
    • C12N15/10Processes for the isolation, preparation or purification of DNA or RNA
    • C12N15/1034Isolating an individual clone by screening libraries
    • C12N15/1082Preparation or screening gene libraries by chromosomal integration of polynucleotide sequences, HR-, site-specific-recombination, transposons, viral vectors
    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12NMICROORGANISMS OR ENZYMES; COMPOSITIONS THEREOF; PROPAGATING, PRESERVING, OR MAINTAINING MICROORGANISMS; MUTATION OR GENETIC ENGINEERING; CULTURE MEDIA
    • C12N15/00Mutation or genetic engineering; DNA or RNA concerning genetic engineering, vectors, e.g. plasmids, or their isolation, preparation or purification; Use of hosts therefor
    • C12N15/09Recombinant DNA-technology
    • C12N15/63Introduction of foreign genetic material using vectors; Vectors; Use of hosts therefor; Regulation of expression
    • CCHEMISTRY; METALLURGY
    • C12BIOCHEMISTRY; BEER; SPIRITS; WINE; VINEGAR; MICROBIOLOGY; ENZYMOLOGY; MUTATION OR GENETIC ENGINEERING
    • C12QMEASURING OR TESTING PROCESSES INVOLVING ENZYMES, NUCLEIC ACIDS OR MICROORGANISMS; COMPOSITIONS OR TEST PAPERS THEREFOR; PROCESSES OF PREPARING SUCH COMPOSITIONS; CONDITION-RESPONSIVE CONTROL IN MICROBIOLOGICAL OR ENZYMOLOGICAL PROCESSES
    • C12Q1/00Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions
    • C12Q1/68Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions involving nucleic acids
    • C12Q1/6897Measuring or testing processes involving enzymes, nucleic acids or microorganisms; Compositions therefor; Processes of preparing such compositions involving nucleic acids involving reporter genes operably linked to promoters

Landscapes

  • Life Sciences & Earth Sciences (AREA)
  • Health & Medical Sciences (AREA)
  • Genetics & Genomics (AREA)
  • Chemical & Material Sciences (AREA)
  • Engineering & Computer Science (AREA)
  • Organic Chemistry (AREA)
  • Zoology (AREA)
  • Wood Science & Technology (AREA)
  • General Engineering & Computer Science (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Biotechnology (AREA)
  • Biomedical Technology (AREA)
  • Physics & Mathematics (AREA)
  • Molecular Biology (AREA)
  • Biophysics (AREA)
  • Microbiology (AREA)
  • Biochemistry (AREA)
  • General Health & Medical Sciences (AREA)
  • Plant Pathology (AREA)
  • Crystallography & Structural Chemistry (AREA)
  • Proteomics, Peptides & Aminoacids (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Analytical Chemistry (AREA)
  • Immunology (AREA)
  • Virology (AREA)
  • Micro-Organisms Or Cultivation Processes Thereof (AREA)
  • Measuring Or Testing Involving Enzymes Or Micro-Organisms (AREA)
  • Pharmaceuticals Containing Other Organic And Inorganic Compounds (AREA)
  • Compositions Of Macromolecular Compounds (AREA)

Abstract

Se proporcionan métodos, composiciones y kits para la modulación transcripcional mediada por CRISPR/Cas. (Traducción automática con Google Translate, sin valor legal)

Description

[0001] DESCRIPCIÓN
[0003] Modulación transcripcional CRISPR/Cas
[0005] Antecedentes
[0007] Las secuencias de repeticiones palindrómicas cortas agrupadas y regularmente interespaciadas (CRISPR) están presentes en aproximadamente el 40 % de los genomas eubacterianos y casi todos los genomas arqueológicos secuenciados hasta la fecha, y consisten en repeticiones directas cortas (~24-48 nucleótidos) separadas por espaciadores únicos de tamaño similar. Generalmente están flanqueados por un conjunto de genes asociados a CRISPR (Cas) que codifican una nucleasa que es importante para el mantenimiento y la función de CRISPR. EnStreptococcus thermophilusyEscherichia coli,se ha demostrado que los loci CRISPR/Cas confieren inmunidad contra la infección por bacteriófagos mediante un mecanismo de interferencia que se basa en la identidad estricta entre los espaciadores CRISPR y las secuencias diana del fago. El mecanismo subyacente a esta inmunidad se basa en la escisión específica de la secuencia de ácidos nucleicos extraños por un complejo CRISPR:Cas que contiene un ARN guía que proporciona especificidad de secuencia objetivo a través de una región de unión monocatenaria y se deriva de las secuencias CRISPR y una nucleasa dependiente de ARN guía codificada por el gen Cas. La unión del complejo CRISPR:Cas a la secuencia objetivo da como resultado la escisión bicatenaria de la secuencia objetivo.
[0009] El sistema CRISPR/Cas se ha modificado para su uso en sistemas procariotas y eucariotas para la edición del genoma y la regulación transcripcional. Sin embargo, los métodos y composiciones conocidos en la técnica a menudo no proporcionan la actividad y especificidad necesarias para el uso rutinario. Por ejemplo, Cradick, et al., Nucleic Acids Res. Aug. 11, 2013; Pattanayak, et al., Nat Biotechnol. 2013 Sep;31(9):839-43; Mali, et al., Nat Biotechnol. 2013 Sep;31(9):833-8; and Hsu, et al., Nat Biotechnol. 2013 Sep;31(9):827-32, todos informan de una edición genómica significativa fuera del objetivo y de una eficiencia de edición variada en diferentes objetivos genéticos. También existen problemas similares cuando se utilizan los sistemas CRISPR/Cas conocidos para regular la transcripción.
[0011] La publicación de solicitud de patente internacional No. WO 2014/099744 A1 divulga un método para alterar una célula eucariota que incluye transfectar la célula eucariota con un ácido nucleico que codifica ARN complementario al ADN genómico de la célula eucariota, transfectar la célula eucariota con un ácido nucleico que codifica una enzima que interactúa con el ARN y escinde el ADN genómico de una manera específica del sitio, en la que la célula expresa el ARN y la enzima, el ARN se une al ADN genómico complementario y la enzima escinde el ADN genómico de una manera específica del sitio.
[0013] Mali et al., 2013, Nature Biotechnology 31:833-838 divulga activadores transcripcionales CAS9 para la detección de especificidad de objetivos y nickasas pareadas para la ingeniería genómica cooperativa.
[0015] Maeder et al., 2013, Nature Methods 10:977-979 divulga la activación guiada por ARN CRISPR de genes humanos endógenos.
[0017] La publicación de solicitud de patente internacional No. WO 2014/093655 A2 proporciona para la ingeniería y optimización de sistemas, métodos y composiciones para la manipulación de secuencias y/o actividades de secuencias objetivo, así como vectores y sistemas de vectores, algunos de los cuales codifican uno o más componentes de un complejo CRISPR, así como métodos para el diseño y uso de dichos vectores con dominios funcionales adicionales, y métodos para dirigir la formación de complejos CRISPR en células procariotas y eucariotas para asegurar una mayor especificidad para el reconocimiento del objetivo y evitar la toxicidad.
[0018] Breve resumen de la invención
[0020] La presente invención está dirigida al tema expuesto en las reivindicaciones adjuntas.
[0022] En particular, la presente invención está dirigida a un método de detección de uno o más elementos genéticos que modulan un fenotipo de interés, en el que cada elemento genético es una región entre 0 y 750 pb en la dirección ascendente del sitio de inicio de la transcripción de un gen que modula el fenotipo, el método comprende:
[0024] poner en contacto una pluralidad de células con una biblioteca de ARN guía pequeños (sgRNA) estructuralmente distintos que se dirigen a una pluralidad de elementos genéticos, generando así una pluralidad de células de prueba, en la que la pluralidad de células de prueba comprende:
[0026] células de prueba que tienen un ARN guía pequeño (sgRNA); y
[0028] una nucleasa mediada por sgRNA deficiente en nucleasa (dCas9),
[0030] en el que el dCas9 comprende un dominio dCas9 fusionado a un dominio de fusión de epítopo, en el que el dominio de fusión de epítopo comprende un epítopo GCN4, en la que la pluralidad de células de prueba comprende además un agente de afinidad, en el que el agente de afinidad tiene afinidad por el epítopo GCN4 y comprende un activador transcripcional,
[0032] seleccionar células de prueba de la pluralidad de células de prueba sobre la base del fenotipo para obtener una población de células de prueba seleccionadas; y
[0034] cuantificar la frecuencia de los sgRNA estructuralmente distintos dentro de la población de células de prueba seleccionadas, en el que los sgRNA que se dirigen a elementos genéticos que modulan el fenotipo se identifican como aquellos sobrerrepresentados en la población de células de prueba seleccionadas, en el que
[0036] (i) el método comprende opcionalmente además cultivar la pluralidad de células de prueba, opcionalmente en presencia de un agente de selección, seleccionando así las células sobre la base de la proliferación celular, y los sgRNA que están sobrerrepresentados en las células seleccionadas están sobrerrepresentados en relación con su frecuencia en la pluralidad de células de prueba en un punto de tiempo anterior en el cultivo de la pluralidad de células de prueba.
[0038] En algunos casos, la biblioteca de sgRNA contiene o contiene al menos 10; 100; 1,000; 10,000; o 1 millón de sgRNA estructuralmente distintos.
[0040] En algunos casos, los sgRNA se seleccionan para activar la transcripción de loci diana humanos (por ejemplo, dirigidos a sitios objetivo CRISPRa humanos optimizados), o activar la transcripción de loci objetivo de ratón (por ejemplo, dirigido a sitios objetivo CRISPRa optimizados para ratones).
[0042] El dCas9 comprende un dominio dCas9 y un dominio de fusión de epítopos, y en el que la pluralidad de células de prueba comprende además un agente de afinidad, en el que el agente de afinidad tiene afinidad por el dominio de fusión de epítopos y comprende un activador transcripcional. La biblioteca de sgRNA está dirigida a una región entre 0 y 750 pb en la dirección ascendente del sitio de inicio de la transcripción de los genes objetivo que modulan el fenotipo. En algunos casos, el activador transcripcional comprende un dominio VP16. En algunos casos, el activador transcripcional comprende un dominio VP64. En algunos casos, el activador transcripcional comprende una pluralidad de dominios VP64.
[0044] El dominio de fusión del epítopo comprende un epítopo GCN4 y el agente de afinidad tiene afinidad por el epítopo GCN4. En algunos casos, el dominio de fusión de epítopos comprende una pluralidad de epítopos GCN4. En algunos casos, el dCas9 comprende una secuencia de aminoácidos de SEQ ID NO: 4. En algunos casos, el agente de afinidad comprende una secuencia de aminoácidos de SEQ ID NO: 5.
[0046] En algunos casos, la cuantificación de la frecuencia implica una secuenciación profunda. En algunos casos, la secuenciación profunda comprende la secuenciación con una redundancia de al menos aproximadamente 10. En algunos casos, seleccionar las células de prueba de la pluralidad de células de prueba sobre la base del fenotipo comprende cultivar la pluralidad de células de prueba, seleccionando así las células de prueba sobre la base de la proliferación celular. En algunos casos, el cultivo se realiza en presencia de un agente de selección. En algunos casos, el agente de selección es un agente quimioterapéutico, un agente que daña el ADN, un agente citotóxico, un factor de crecimiento, un factor de transcripción, una quinasa, un fármaco, un gen exógeno bajo el control de un promotor heterólogo o una hormona. En algunos casos, la selección de las células de prueba en función del fenotipo comprende la selección de las células de prueba en función de la expresión de proteínas, la expresión de ARN o la actividad de proteínas. En algunos casos, la selección de las células de prueba en función del fenotipo comprende la selección basada en la motilidad celular.
[0048] Los sgRNA específicos que se dirigen a elementos genéticos que modulan el fenotipo se identifican como aquellos sobrerrepresentados en la población de células de prueba seleccionadas. En algunos casos, el método comprende además cultivar la pluralidad de células de prueba, opcionalmente en presencia de un agente de selección, seleccionando así las células sobre la base de la proliferación celular, y los sgRNA que están sobrerrepresentados en las células seleccionadas están sobrerrepresentados en relación con su frecuencia en la pluralidad de células de prueba en un punto de tiempo anterior en el cultivo de la pluralidad de células de prueba.
[0050] En algunos casos, el sgRNA está codificado por un casete de expresión en la célula, y el casete de expresión comprende un promotor unido operativamente a un polinucleótido que codifica el sgRNA. En algunos casos, el promotor unido operativamente al polinucleótido que codifica el sgRNA es inducible. En algunos casos, la nucleasa mediada por sgRNA deficiente en nucleasa (dCas9) está codificada por un casete de expresión en la célula, el casete de expresión comprende un promotor unido operativamente a un polinucleótido que codifica la dCas9. En algunos casos, el promotor unido operativamente al polinucleótido que codifica dCas9 es inducible. En algunos casos, la pluralidad de células de prueba comprende un transactivador de tetraciclina, y en donde el método comprende la expresión de dCas9 bajo el control de un promotor inducible por tetraciclina en ausencia de tetraciclina u otro inductor exógeno del promotor inducible por tetraciclina.
[0052] En algunas realizaciones, la presente invención proporciona un método para identificar elementos genéticos interactuantes, el método comprende: (i) realizar cualquiera de los métodos anteriores, identificando así una pluralidad de sgRNA estructuralmente distintos que se dirigen a elementos genéticos que modulan el fenotipo; (ii) poner en contacto una pluralidad de células de prueba de interacción con una biblioteca que comprende una pluralidad de combinaciones por pares de los sgRNA estructuralmente distintos identificados en (i) obtener una pluralidad de células de prueba contactadas; (iii) seleccionar células de prueba de la pluralidad de células de prueba contactadas sobre la base del fenotipo para obtener una población de células de prueba seleccionadas; y (iv) cuantificar la frecuencia de las combinaciones por pares de sgRNA estructuralmente distintos dentro de la población de células de prueba seleccionadas, en el que se predice que las combinaciones por pares de sgRNA estructuralmente distintos que están sobrerrepresentadas en la población de células de prueba seleccionadas se dirigen a elementos genéticos interactuantes, en el que cada elemento genético es una región entre 0 y 750 pb en la dirección ascendente del sitio de inicio de la transcripción de un gen que modula el fenotipo.
[0054] En algunos casos, las combinaciones de pares de sgRNA estructuralmente distintos comprenden un primer miembro y un segundo miembro del par, y en el que el primer miembro y el segundo miembro se dirigen a elementos genéticos no vinculados.
[0056] En algunas realizaciones, la presente invención proporciona un método para optimizar un sgRNA, el método comprende: realizar cualquiera de los métodos anteriores, en la que la pluralidad de sgRNA estructuralmente distintos se dirigen a diferentes regiones dentro o junto a un único elemento genético, en donde los sgRNA más sobrerrepresentados en las células seleccionadas se identifican como sgRNA optimizados que se dirigen al elemento genético, en el que cada elemento genético es una región entre 0 y 750 pb en la dirección ascendente del sitio de inicio de la transcripción de un gen que modula el fenotipo.
[0058] En algunas realizaciones, al menos una mayoría de los ARN guía pequeños (sgRNA) comprenden de 5' a 3': una región de horquilla 5', que comprende: un sitio de endonucleasa único; una región de horquilla 3'; y una secuencia de terminación de la transcripción, en el que el ARN guía pequeño está configurado para formar un complejo con una nucleasa mediada por ARN guía pequeño, el complejo tiene una mayor estabilidad o actividad en relación con un complejo que contiene una nucleasa mediada por ARN guía pequeño y un ARN guía pequeño que comprende al menos un 95 % de identidad con SEQ ID NO: 6 o un complemento del mismo.
[0059] En algunos casos, la región de horquilla 5' comprende menos de cuatro nucleótidos de uracilo consecutivos y una longitud de al menos 31 nucleótidos. En algunos casos, el sitio único de corte de la endonucleasa es un sitioBIpI.En algunos casos, el ARN guía pequeño tiene 19-25 o 21-28 nucleótidos entre el sitio de endonucleasa único y el extremo 5'.
[0061] En algunos casos, al menos 104 Los genes son el objetivo y la biblioteca contiene menos de 2.5x105, menos de 2x105, menos de 1x105, aproximadamente 5x104, o menos de 5x104 sgRNA estructuralmente distintos.
[0062] Breve descripción de los dibujos
[0064] Figura 1: Una prueba de sgRNA en mosaico define reglas para la actividad CRISPRi en genes endógenos en células humanas. (A) Describe la estrategia para la determinación masiva paralela de fenotipos de crecimiento o resistencia a toxinas causados por sgRNA expresados en células de mamíferos que también expresan dCas9 o construcciones de fusión derivadas de dCas9. Se pueden utilizar dos tipos de bibliotecas grandes para definir reglas para CRISPRi/a o para realizar análisis a escala del genoma para consultar la función de muchos genes en un análisis agrupado. (B) Un mapa que muestra la actividad CRISPRi para los 49 genes en ventanas definidas en relación con el TSS de cada gen. Los sgRNA dirigidos a la ventana de -50 a 350 pb alrededor del TSS de un gen tienen actividad máxima. (C) Un esquema que muestra la organización genómica, el contenido de GC y los elementos repetitivos alrededor del TSS del gen, VPS54, a lo largo de una ventana de 10 kb a la que se dirige la biblioteca de sgRNA en mosaico. Muchos sgRNA dirigidos a dCas9 (arriba) y dCas9-KRAB (abajo) en VPS54 promueven la resistencia a la ricina. Cada sgRNA está representado por un punto negro. Los datos se muestran como un puntaje Z con signo de fenotipo (consulte los métodos del Ejemplo 6). (D) Se muestra un promedio de ventana deslizante de 49 genes seleccionados en una biblioteca de sgRNA de prueba como una región sombreada (arriba y abajo). La línea variable entre el rango del percentil 95 y el percentil 5 muestra la actividad media de sgRNA en una ventana definida para cada gen. La región sombreada diferencialmente definida en la región central del gráfico inferior es la ventana promedio observada de actividad CRISPRi máxima. Los datos se muestran como un puntaje Z con signo de fenotipo. (E) Representa fenotipos de resistencia a la ricina comparando CRISPRi con RNAi para genes previamente establecidos que causan fenotipos de resistencia a la ricina cuando son eliminados por RNAi. Los datos se muestran como un puntaje Z con signo de fenotipo medio para 10 sgRNA o shRNA submuestreados.
[0066] Figura 2: La actividad CRISPRi es altamente sensible a los desajustes entre la secuencia de sgRNA y ADN. Se midió la actividad dentro y fuera del objetivo de dCas9, dCas9-KRAB y Cas9 para una serie de sgRNA con un número y posición variables de desajustes. La actividad fuera del objetivo medida de cada sgRNA con uno o más desajustes se muestra como porcentaje de la actividad en el objetivo para el sgRNA correspondiente con 0 desajustes. La serie sgRNA marcada con una estrella representa sgRNA con 3, 4 o 5 pares de bases no coincidentes distribuidos aleatoriamente en la región 3 de la secuencia de sgRNA. Los datos se muestran para cada posición de desajuste como la media de todos los sgRNA con ese desajuste; consulte la Figura 10 para ver las actividades individuales de sgRNA. Los sgRNA se incluyeron en el análisis solo si la guía totalmente coincidente era altamente activa (puntuación z con signo de fenotipo >= 4); N = 5 para dCas9, 11 para dCas9-KRAB y 10 para Cas9.
[0068] Figura 3: Una prueba de sgRNA en mosaico define reglas para la actividad CRISPRa en genes endógenos en células humanas. (A) Un esquema del sistema dCas9-SUNtag scFV-VP64 sgRNA para CRISPRa. Cada componente del sistema se expresa de forma estable en las células K562. (B) La actividad de los sgRNA en las células K562 que expresan cada componente de CRISPRa, en función de la distancia del sitio sgRNA al TSS del gen objetivo; la activación del gen da como resultado un puntaje de fenotipo de ricina negativa. Arriba, muchos sgRNA dirigidos a VPS54 sensibilizan las células a la ricina; abajo, el promedio de ventana deslizante de los 49 genes a los que se dirige nuestra biblioteca de pruebas se muestra sombreado. La actividad media se muestra con una línea variable, mientras que la ventana de actividad máxima se muestra como una región sombreada diferencialmente. Los datos se muestran como un puntaje z con signo de fenotipo. (C) Los fenotipos de resistencia a la ricina para CRISPRa están anticorrelacionados con los fenotipos para CRISPRi (dCas9-KRAB) para genes seleccionados. Para cada gen, se calcula un valor p utilizando la actividad de sgRNA CRISPRi/a en relación con una distribución de control negativo para 24 sgRNA submuestreados. (D) La inhibición de CRISPRi y la activación de CRISPRa del mismo gen pueden tener efectos opuestos en el fenotipo de resistencia a la ricina tanto en un análisis primario como en experimentos de validación de sgRNA único. Los datos se representan como media y desviación estándar de réplicas (N = 3). (E) La inhibición de CRISPRi y la activación de CRISPRa pueden modular los niveles de expresión de un gen (cuantificado mediante qPCR) en varios órdenes de magnitud.
[0070] Figura 4: Una prueba CRISPRi a escala del genoma divulga los genes necesarios para el crecimiento celular en células humanas. (A) Se realizó un análisis CRISPRi a escala del genoma por réplica en la estirpe celular humana K562. Se muestran tres clases de sgRNA de control negativo: sgRNA no dirigidos, sgRNA dirigidos a genes del cromosoma Y y sgRNA dirigidos a genes olfativos que no muestran fenotipos reproducibles. Un subconjunto de sgRNA en la biblioteca se agota fuertemente de manera reproducible (negro). (B) La coexpresión de sgRNA y dCas9-KRAB no es tóxica en las estirpes celulares K562 durante 16 días. (C) Se realizó un análisis de enriquecimiento del conjunto de genes para varios complejos celulares esenciales. Se muestra un histograma de la distribución de genes debajo de la curva GSEA. (D) Los 10 principales grupos de anotación DAVID identificados en nuestra pantalla de crecimiento están fuertemente enriquecidos con procesos celulares esenciales conocidos.
[0072] Figura 5: El silenciamiento genético CRISPRi es robustamente inducible, reversible y no tóxico. (A) Un esquema que representa el constructo de expresión lentiviral que codifica KRAB-dCas9 inducible. (B)Análisis de transferencia Western de KRAB-dCas9 inducible en ausencia, presencia y después del lavado de doxiciclina. Se recogieron muestras diariamente de las mismas células que expresaban sgRNA NegCtrl-4 procesadas para RT-qPCR en (C). (C) La represión genética mediada por CRISPRi es reversible. Las células K562 que expresan dos sgRNA dirigidos a RAB1A se cultivaron con o sin doxiciclina o doxiciclina durante 10 días o se retiró la doxiciclina el día 4. Los niveles de ARNm de RAB1A se midieron en cada punto de tiempo indicado mediante qPCR. (D) Ensayos de crecimiento competitivo realizados con células CRISPRi K562 inducibles transducidas con los sgRNA indicados en presencia y ausencia de doxiciclina. Los datos representan la media de réplicas (N=3) normalizadas a los resultados de NegCtrl-1. Las barras de error representan la desviación estándar. (E) Se realizó un análisis de subbiblioteca CRISPRi para determinar los efectos sobre el crecimiento celular con células CRISPRi K562 inducibles en presencia y ausencia de doxiciclina. (F) Las curvas de crecimiento acumulativo del cribado de subbiblioteca representada en E no muestran cambios masivos en el crecimiento causados por la inducción de KRAB-dCas9. Los datos representan la media de infecciones replicadas, cada una examinada por duplicado.
[0074] Figura 6: Un análisis CRISPRi a escala del genoma divulga rutas y complejos conocidos y nuevos que rigen la respuesta a una toxina de fusión del cólera y la difteria. (A) Un modelo propuesto para la unión de CTx-DTA, tráfico retrógrado, retrotranslocación y toxicidad celular. (B) El análisis de enriquecimiento del conjunto de genes de los principales resultados de dos pruebas CRISPRi a escala del genoma replicadas para genes que modulan la sensibilidad a CTx-DTA demuestra un fuerte enriquecimiento de genes en rutas del huésped conocidas secuestradas/objetivo de CTx-DTA. (C) Descripción general de los genes más afectados detectados mediante la prueba CTx-DTA. Muchos genes caen en rutas o codifican subunidades del mismo complejo físico. Las rutas esperadas en base al conocimiento previo de la acción de CTx-DTA (biosíntesis de gangliósidos, biosíntesis de diftamida, tráfico retrógrado, ERAD, proteasoma, traducción) están representadas cada una por varios resultados principales, lo que ilustra la solidez del cribado basado en CRISPRi.
[0076] Figura 7: CRISPRi reprime fuertemente la expresión genética dando como resultado fenotipos reproducibles robustos que permiten la compactación de una biblioteca de todo el genoma. (A-C) Un Western blot representativo y una cuantificación del tráfico de la toxina del cólera en células que expresan un sgRNA de control negativo o un sgRNA dirigido a SEL1L o B4GALNT1. La toxina del cólera se distribuye tanto en el fraccionamiento citosólico como en el de membrana en las células de control y, de acuerdo con su función propuesta en la unión de CTx, se bloquea cuando se reprime B4GALNT1 o CTx queda atrapado en el ER tras la represión de SEL1L. (D) Validación de fenotipos de detección de CTx-DTA con experimentos de nueva prueba de sgRNA único. Los datos se representan como media y desviación estándar de réplicas (N=3). (E) La eliminación mediante CRISPRi de 5 genes de impacto (15sgRNA) identificados en el análisis CTx-DTA se cuantificó mediante qPCR. La región sombreada en gris indica sgRNA que muestran al menos un 90 % de eliminación para cada gen. (F) Curva característica operativa del receptor (ROC) que muestra el rendimiento de un puntaje predictiva de sgRNA mejorada. (G) Simulación del rendimiento de la biblioteca con números decrecientes de sgRNA dirigidos a cada gen. El fenotipo de los genes afectados se calculó como el promedio de los 3 sgRNA más activos, y el rendimiento general de la biblioteca se expresó como el fenotipo medio de todos los genes afectados. El tamaño de la biblioteca se compactó computacionalmente submuestreando aleatoriamente los sgRNA o seleccionando los sgRNA en función del puntaje predictivo, y la actividad restante de la biblioteca se grafica como un porcentaje de la actividad total de la biblioteca de 10 sgRNA por gen.
[0077] Figura 8: Marco matemático para cuantificar el fenotipo y la actividad del sgRNA. (A) Las fórmulas para derivar el fenotipo celular a partir de mediciones de la fracción celular en una población en puntos temporales discretos. Las células con un genotipo determinado tienen una tasa de crecimiento intrínseca g, a menudo expresada como duplicaciones de células por día. El enriquecimiento log2 (log2e) de células con un genotipo específico en una población se puede calcular a partir de la fracción de células en la población en el punto final t versus esa fracción en t0. Para expresar esto como la tasa de crecimiento relativa al tipo silvestre<( y ),>log2e se normaliza al log2e mediano del conjunto de control negativo y luego dividido por t. De manera similar, el fenotipo de las células expuestas a una presión selectiva (por ejemplo, tratamiento con toxinas) se puede calcular a partir del log2e de poblaciones tratadas y no tratadas para obtener p, que es 1 para células completamente resistentes y -1 para células con una sensibilidad dos veces mayor a la presión en relación con el tipo silvestre. (B) Para cuantificar la fuerza de la actividad individual de sgRNA en relación con el ruido en el experimento, el fenotipo de sgRNA se dividió por la desviación estándar de los fenotipos de control negativo para obtener el puntaje z. Para los análisis de la fortaleza del sgRNA en pantallas de mosaico, en las que los genes tenían fenotipos de eliminación conocidos para la sensibilidad o la resistencia, los puntajes z se reasignaron para dar valores positivos cuando los fenotipos concordaban con el fenotipo esperado y valores negativos en caso contrario.
[0078] Figura 9: Los sgRNA CRISPRi altamente activos están cerca del TSS, son cortos y no contienen homopolímeros de nucleótidos. (A) Para varios genes de ejemplo, se representan los fenotipos observados para los sgRNA expresados en células dCas9 o dCas9-KRAB en función de su posición con respecto al TSS. Cada punto es un sgRNA. (B) Los sgRNA más cortos tienen, en promedio, una actividad significativamente mayor. Cada punto representa un sgRNA, con líneas que conectan sgRNA relacionados que se dirigen al mismo sitio PAM pero tienen una longitud de par de bases protoespaciador creciente. Las líneas negras representan la actividad media de los sgRNA de longitudes específicas. Los sgRNA se representan si hay varios sgRNA que se dirigen al mismo sitio y al menos un sgRNA en ese sitio es altamente activo (puntuación z con signo de fenotipo > 5). (C) La presencia de homopolímeros (AAAA, GGGG, UUUU) dentro de un sgRNA reduce la actividad en promedio. (D) Las secuencias de sgRNA con un contenido de GC muy alto o muy bajo son menos activas. (E) La cadena de ADN a la que se dirige un sgRNA no tiene efecto sobre la actividad. (F) Una comparación de un subconjunto de sgRNA seleccionados según las reglas de actividad CRISPRi versus nuestra biblioteca de shRNA publicada anteriormente. Para cada gen, se calculó el valor p de Mann-Whitney utilizando la actividad de sgRNA o shRNA en relación con una distribución de control negativo utilizando 24 shRNA o 24 sgRNA. Los 24 shRNA y sgRNA se seleccionaron aleatoriamente 100 veces de la biblioteca de shRNA y los sgRNA cumplieron con las reglas de posición y longitud, respectivamente, y se muestran la mediana y la SD del valor p log-10.
[0080] Figura 10: La actividad CRISPRi es altamente sensible a los desajustes entre la secuencia de sgRNA y ADN. Se midió la actividad dentro y fuera del objetivo de dCas9, dCas9-KRAB y Cas9 para una serie de sgRNA con un número y posición variables de desajustes. Cada sgRNA es un punto con la serie de desajustes relacionados conectados por líneas. La actividad fuera del objetivo medida de cada sgRNA con uno o más desajustes se muestra como porcentaje de la actividad en el objetivo para el sgRNA correspondiente con 0 desajustes. La serie sgRNA marcada con una estrella representa sgRNA con 3, 4 o 5 pares de bases no coincidentes distribuidos aleatoriamente en la región 3 de la secuencia de sgRNA. Los sgRNA se incluyeron en el análisis solo si la guía totalmente coincidente era altamente activa (puntaje z con signo de fenotipo >= 4); N = 5 para dCas9, 11 para dCas9-KRAB y 10 para Cas9.
[0082] Figura 11: Una prueba de sgRNA en mosaico define reglas para la actividad CRISPRa en genes endógenos en células humanas. (A) La actividad de los sgRNA en una estirpe celular CRISPRa en función de la distancia del sitio sgRNA al TSS del gen objetivo para cuatro genes de ejemplo. La activación de ARL1 y ST3GAL4 en la parte superior produce resistencia a la ricina; la activación de SURF4 y RAB1A en la parte inferior produce sensibilidad a la ricina. (B) Un promedio de ventana deslizante solo para genes con un fenotipo de resistencia a la ricina CRISPRa significativo al que se dirige nuestra biblioteca de pruebas se muestra como una región sombreada. La actividad media se muestra con una línea variable, mientras que la ventana de actividad máxima se muestra en una región sombreada diferencialmente. Los datos se muestran como un puntaje z con signo de fenotipo.
[0083] Figura 12: CRISPRi puede reprimir la transcripción de forma inducible y rápida. (A) Ensayos de crecimiento competitivo realizados con células CRISPRi K562 inducibles transducidas con los sgRNA dirigidos a RAB1A indicados en presencia de doxiciclina. Datos representados como media y desviación estándar de réplicas (N=3). (B) La atenuación mediante CRISPRi de los genes afectados identificados en el análisis de crecimiento a escala del genoma (9 sgRNA) se cuantificó mediante qPCR después de dos días de tratamiento con doxiciclina. La región sombreada en gris indica sgRNA que muestran al menos un 90 % de atenuación para cada gen. Véase también la Figura 5D.
[0085] Figura 13: Un análisis CRISPRi a escala del genoma divulga rutas y complejos conocidos y nuevos que rigen la respuesta a una toxina de fusión del cólera y la difteria. (A) Dos pruebas CRISPRi a escala del genoma replicadas para la sensibilidad CTx-DTA muestran alta reproducibilidad y enriquecimiento y sensibilización robustos para sgRNA individuales. (B) Descripción general de los genes más afectados detectados mediante la prueba CTx-DTA. Muchos genes caen en rutas o codifican subunidades del mismo complejo físico. Las rutas esperadas en base al conocimiento previo de la acción de CTx-DTA (biosíntesis de gangliósidos, biosíntesis de diftamida, tráfico retrógrado, ERAD, proteasoma, traducción) están representadas cada una por varios resultados principales, lo que ilustra la solidez del cribado basado en CRISPRi.
[0087] Figura 14: Reglas ejemplares para mejorar aún más el rendimiento de la biblioteca CRISPRi. (A) Los sgRNA con protoespaciadores más largos son menos activos. (B) Los sgRNA con homotrímeros, homotetrámeros o más de poli-U tienen una actividad disminuida. (C) El contenido general de purina de los sgRNA se correlaciona con una mayor actividad. (D) La actividad de sgRNA varía dependiendo de la base inmediatamente posterior al PAM. (E) La actividad de sgRNA es óptima dentro de una ventana de 25 a 100 pb.
[0089] Figura 15: Representa la actividad de sgRNA y la señal de la nucleasa microcócica (MNasa-seq) en función de la distancia al sitio de inicio de la transcripción (TSS), como lo indican los datos de FANTOM CAGE. La actividad de sgRNA (línea clara; unidades arbitrarias) se generó ajustando un regresor de vectores de soporte a los fenotipos de sgRNA en análisis de todo el genoma. La señal MNasa-seq (línea oscura) para K562 se obtuvo del proyecto ENCODE y se normalizó y sumó en 50 genes representativos.
[0091] Figura 16: Representa un diagrama de flujo para identificar secuencias codificantes de regiones de unión de sgRNA optimizadas.
[0093] Definiciones
[0095] Tal como se utiliza en esta especificación y en las reivindicaciones adjuntas, las formas singulares “un”, “un”, y “el” incluye referencia plural a menos que el contexto indique claramente lo contrario.
[0097] El término “ácido nucleico” o “polinucleótido” se refiere a ácidos desoxirribonucleicos (ADN) o ácidos ribonucleicos (ARN) y polímeros de los mismos en forma monocatenaria o bicatenaria. A menos que esté específicamente limitado, el término abarca ácidos nucleicos que contienen análogos conocidos de nucleótidos naturales que tienen propiedades de unión similares a las del ácido nucleico de referencia y se metabolizan de una manera similar a los nucleótidos naturales. A menos que se indique lo contrario, una secuencia de ácido nucleico particular también abarca implícitamente variantes modificadas de forma conservadora de la misma (por ejemplo, sustituciones de codones degenerados), alelos, ortólogos, SNP y secuencias complementarias, así como la secuencia indicada explícitamente. Específicamente, las sustituciones de codones degenerados se pueden lograr generando secuencias en las que la tercera posición de uno o más codones seleccionados (o todos) se sustituye con residuos de bases mixtas y/o desoxiinosina (Batzer et al., Nucleic Acid Res. 19:5081 (1991); Ohtsuka et al., J. Biol. Chem. 260:2605-2608 (1985); and Rossolini et al., Mol. Cell. Probes 8:91-98 (1994)). El término ácido nucleico se utiliza indistintamente con gen, ADNc y ARNm codificado por un gen.
[0098] El término “gene” significa el segmento de ADN involucrado en la producción de una cadena polipeptídica. Puede incluir regiones anteriores y posteriores a la región codificante (líder y final), así como secuencias intermedias (intrones) entre segmentos codificantes individuales (exones).
[0100] Un “promotor” Se define como un conjunto de secuencias de control de ácidos nucleicos que dirigen la transcripción de un ácido nucleico. Como se utiliza en este documento, un promotor incluye secuencias de ácidos nucleicos necesarias cerca del sitio de inicio de la transcripción, tal como, en el caso de un promotor de tipo polimerasa II, un elemento TATA. Un promotor también incluye opcionalmente elementos potenciadores o represores distales, que pueden ubicarse hasta varios miles de pares de bases desde el sitio de inicio de la transcripción.
[0102] Un “casete de expresión” es una construcción de ácido nucleico, generada de forma recombinante o sintética, con una serie de elementos de ácido nucleico específicos que permiten la transcripción de una secuencia de polinucleótidos particular en una célula huésped. Un casete de expresión puede ser parte de un plásmido, genoma viral o fragmento de ácido nucleico. Normalmente, un casete de expresión incluye un polinucleótido que se va a transcribir, unido operativamente a un promotor.
[0103] Un “gen indicador” codifica proteínas que son fácilmente detectables debido a sus características bioquímicas, como la actividad enzimática o las características quimiofluorescentes. Un ejemplo específico de dicho indicador es la proteína verde fluorescente. La fluorescencia generada a partir de esta proteína se puede detectar con varios sistemas de detección fluorescente disponibles comercialmente. Otros indicadores pueden detectarse mediante tinción. El indicador también puede ser una enzima que genera una señal detectable cuando entra en contacto con un sustrato apropiado. El indicador puede ser una enzima que cataliza la formación de un producto detectable. Las enzimas adecuadas incluyen, pero no se limitan a, proteasas, nucleasas, lipasas, fosfatasas e hidrolasas. El indicador puede codificar una enzima cuyos sustratos son sustancialmente impermeables a las membranas plasmáticas eucariotas, lo que permite controlar estrictamente la formación de señales. Los ejemplos específicos de genes indicadores adecuados que codifican enzimas incluyen, entre otros, CAT (chloramphenicol acetyl transferase; Alton and Vapnek (1979) Nature 282: 864-869); luciferase (lux); p-galactosidase; LacZ; p.-glucuronidase; and alkaline phosphatase (Toh, et al. (1980) Eur. J. Biochem. 182: 231-238; and Hall et al. (1983) J. Mol. Appl. Gen. 2: 101). Otros indicadores adecuados incluyen aquellos que codifican un epítopo particular que puede detectarse con un anticuerpo marcado que reconoce específicamente el epítopo.
[0105] El término “aminoácido” se refiere a aminoácidos naturales y sintéticos, así como a análogos de aminoácidos y miméticos de aminoácidos que funcionan de manera similar a los aminoácidos naturales. Los aminoácidos naturales son aquellos codificados por el código genético, así como aquellos aminoácidos que se modifican posteriormente, por ejemplo, hidroxiprolina, Y-carboxiglutamato y O-fosfoserina. Los análogos de aminoácidos se refieren a compuestos que tienen la misma estructura química básica que un aminoácido natural, es decir, un carbono a que está unido a un hidrógeno, un grupo carboxilo, un grupo amino y un grupo R, por ejemplo, homoserina, norleucina, sulfóxido de metionina, metilsulfonio de metionina. Estos análogos tienen grupos R modificados (por ejemplo, norleucina) o cadenas principales de péptidos modificados, pero conservan la misma estructura química básica que un aminoácido natural. “Miméticos de aminoácidos” se refiere a compuestos químicos que tienen una estructura diferente de la estructura química general de un aminoácido, pero que funcionan de manera similar a un aminoácido natural.
[0107] Existen varios métodos conocidos en la técnica que permiten la incorporación de un derivado o análogo de aminoácido no natural en una cadena polipeptídica de manera específica del sitio, véase, por ejemplo, documento WO 02/086075.
[0109] Los aminoácidos pueden ser referidos aquí mediante los símbolos de tres letras comúnmente conocidos o mediante los símbolos de una letra recomendados por la Comisión de Nomenclatura Bioquímica IUPAC-IUB. Los nucleótidos también pueden denominarse mediante sus códigos de una sola letra comúnmente aceptados.
[0110] “Polipéptido”, “péptido”, y “proteína” se utilizan indistintamente en este documento para referirse a un polímero de residuos de aminoácidos. Los tres términos se aplican a polímeros de aminoácidos en los que uno o más residuos de aminoácidos son miméticos químicos artificiales de un aminoácido natural correspondiente, así como a polímeros de aminoácidos naturales y polímeros de aminoácidos no naturales. Tal como se utilizan en este documento, los términos abarcan cadenas de aminoácidos de cualquier longitud, incluidas las proteínas de longitud completa, en los que los residuos de aminoácidos están unidos por enlaces peptídicos covalentes.
[0111] “Variantes modificadas de forma conservadora” Se aplica tanto a secuencias de aminoácidos como de ácidos nucleicos. Con respecto a secuencias particulares de ácidos nucleicos, “variantes modificadas de forma conservadora” se refiere a aquellos ácidos nucleicos que codifican secuencias de aminoácidos idénticas o esencialmente idénticas, o cuando el ácido nucleico no codifica una secuencia de aminoácidos, a secuencias esencialmente idénticas. Debido a la degeneración del código genético, una gran cantidad de ácidos nucleicos funcionalmente idénticos codifican cualquier proteína determinada. Por ejemplo, los codones GCA, GCC, GCG y GCU codifican el aminoácido alanina. Por lo tanto, en cada posición donde una alanina está especificada por un codón, el codón puede alterarse a cualquiera de los codones correspondientes descritos sin alterar el polipéptido codificado. Estas variaciones de ácido nucleico son “variaciones silenciosas”, que son un tipo de variaciones modificadas de forma conservadora. Cada secuencia de ácido nucleico aquí contenida que codifica un polipéptido también describe cada posible variación silenciosa del ácido nucleico. Una persona experta reconocerá que cada codón de un ácido nucleico (excepto AUG, que normalmente es el único codón para la metionina, y TGG, que normalmente es el único codón para el triptófano) puede modificarse para producir una molécula funcionalmente idéntica. Por consiguiente, cada variación silenciosa de un ácido nucleico que codifica un polipéptido está implícita en cada secuencia descrita.
[0113] En cuanto a las secuencias de aminoácidos, una persona experta reconocerá que las sustituciones, eliminaciones o adiciones individuales a una secuencia de ácido nucleico, péptido, polipéptido o proteína que altera, agrega o elimina un solo aminoácido o un pequeño porcentaje de aminoácidos en la secuencia codificada es una “variante modificada de forma conservadora” donde la alteración da como resultado la sustitución de un aminoácido por un aminoácido químicamente similar. Las tablas de sustitución conservadora que proporcionan aminoácidos funcionalmente similares son bien conocidas en la técnica. Estas variantes modificadas de forma conservadora se suman a, y no excluyen, las variantes polimórficas, los homólogos interespecies y los alelos de la divulgación. En algunos casos, las variantes modificadas de forma conservadora de Cas9 o sgRNA pueden tener una mayor estabilidad, ensamblaje o actividad como se describe aquí.
[0114] Los siguientes ocho grupos contienen cada uno aminoácidos que son sustituciones conservadoras entre sí: 1) Alanina (A), Glicina (G);
[0115] 2) Ácido aspártico (D), Ácido glutámico (E);
[0116] 3) Asparagina (N), Glutamina (Q);
[0117] 4) Arginina (R), Lisina (K);
[0118] 5) Isoleucina (I), Leucina (L), Metionina (M), Valina (V);
[0119] 6) Fenilalanina (F), Tirosina (Y), Triptófano (W);
[0120] 7) Serina (S), Treonina (T); y
[0121] 8) Cisteína (C), Metionina (M)
[0122] (ver, por ejemplo, Creighton, Proteins, WH Freeman and Co., NY (1984)).
[0123] Los aminoácidos pueden ser referidos aquí por sus símbolos comúnmente conocidos de tres letras o por los símbolos de una letra recomendados por la Comisión de Nomenclatura Bioquímica IUPAC-IUB. Los nucleótidos también pueden denominarse mediante sus códigos de una sola letra comúnmente aceptados.
[0124] En la presente solicitud, los residuos de aminoácidos se numeran de acuerdo con sus posiciones relativas a partir del residuo más a la izquierda, que está numerado 1, en una secuencia de polipéptido de tipo silvestre no modificada.
[0125] Tal como se utilizan en el presente documento, los términos “ idéntico” o porcentaje “identidad,” en el contexto de la descripción de dos o más secuencias de polinucleótidos o aminoácidos, se refiere a dos o más secuencias o subsecuencias que son iguales o tienen un porcentaje específico de residuos de aminoácidos o nucleótidos que son iguales. Por ejemplo, una secuencia de ARN guía pequeño (sgRNA) central responsable del ensamblaje y la actividad de un complejo sgRNA:nucleasa tiene al menos un 80 % de identidad, preferiblemente un 85 %, 90 %, 91 %, 92 %, 93 %, 94 %, 95 %, 96 %, 97 %, 98 %, 99 % o 100 % de identidad, con una secuencia de referencia, por ejemplo, uno de los SEQ ID NO: 6-11), cuando se comparan y alinean para lograr la máxima correspondencia en una ventana de comparación, o una región designada medida utilizando uno de los siguientes algoritmos de comparación de secuencias o mediante alineación manual e inspección visual. Como otro ejemplo, una secuencia Cas9 responsable del ensamblaje y la actividad de un complejo sgRNA:nucleasa tiene al menos un 80 % de identidad, preferiblemente un 85 %, 90 %, 91 %, 92 %, 93 %, 94%, 95%, 96%, 97%, 98%, 99% o 100% de identidad, con una secuencia de referencia, por ejemplo, uno de los SEQ ID NO: 1-4), cuando se comparan y alinean para lograr la máxima correspondencia en una ventana de comparación o una región designada medida utilizando uno de los siguientes algoritmos de comparación de secuencias o mediante alineación manual e inspección visual. Se dice entonces que dichas secuencias son “sustancialmente idénticas”. Con respecto a las secuencias de polinucleótidos, esta definición también se refiere al complemento de una secuencia de prueba. Con respecto a las secuencias de aminoácidos, preferiblemente, la identidad existe en una región que tiene al menos aproximadamente 50 aminoácidos o nucleótidos de longitud, o más preferiblemente en una región que tiene entre 75 y 100 aminoácidos o nucleótidos de longitud.
[0126] Para la comparación de secuencias, normalmente una secuencia actúa como secuencia de referencia, con la que se comparan las secuencias de prueba. Cuando se utiliza un algoritmo de comparación de secuencias, las secuencias de prueba y de referencia se ingresan en un ordenador, se designan las coordenadas de la subsecuencia, si es necesario, y se designan los parámetros del programa del algoritmo de secuencia. Se pueden utilizar parámetros de programa predeterminados o se pueden designar parámetros alternativos. Luego, el algoritmo de comparación de secuencias calcula el porcentaje de identidad de secuencia de las secuencias de prueba en relación con la secuencia de referencia, según los parámetros del programa. Para la comparación de secuencias de ácidos nucleicos y proteínas, se utilizan los algoritmos BLAST y BLAST 2.0 y los parámetros predeterminados que se analizan a continuación.
[0127] Una “ventana de comparación”, como se usa en este documento, incluye la referencia a un segmento de cualquiera de las posiciones contiguas seleccionadas del grupo que consiste de 20 a 600, usualmente alrededor de 50 a alrededor de 200, más usualmente alrededor de 100 a alrededor de 150 en el que una secuencia puede compararse con una secuencia de referencia de la misma cantidad de posiciones contiguas después de que las dos secuencias estén alineadas de manera óptima. Los métodos de alineación de secuencias para comparación son bien conocidos en la técnica. Se puede realizar una alineación óptima de secuencias para comparación, por ejemplo, por el algoritmo de homología local de Smith & Waterman, Adv.
[0128] Appl. Math. 2:482 (1981), by the homology alignment algorithm of Needleman & Wunsch, J. Mol. Biol. 48:443 (1970), by the search for similarity method of Pearson & Lipman, Proc. Nat'l. Acad. Sci. USA 85:2444 (1988), by computerized implementations of these algorithms (GAP, BESTFIT, FASTA, and TFASTA in the Wisconsin Genetics Software Package, Genetics Computer Group, 575 Science Dr., Madison, WI), or by manual alignment and visual inspection (ver, por ejemplo, Current Protocols in Molecular Biology (Ausubel et al., eds. 1995 supplement)).
[0130] Ejemplos de algoritmos que son adecuados para determinar el porcentaje de identidad de secuencia y similitud de secuencia son los algoritmos BLAST y BLAST 2.0, que se describen en Altschul et al., (1990) J. Mol. Biol.
[0131] 215: 403-410 and Altschul et al. (1977) Nucleic Acids Res. 25: 3389-3402, respectivamente. El software para realizar análisis BLAST está disponible públicamente en el sitio web del Centro Nacional de Información Biotecnológica, ncbi.nlm.nih.gov. El algoritmo implica primero identificar pares de secuencias de alta puntuación (HSP) identificando palabras cortas de longitud W en la secuencia de consulta, que coinciden o satisfacen un puntaje umbral de valor positivo T cuando se alinean con una palabra de la misma longitud en una secuencia de base de datos. T se denomina umbral de puntuación de palabras del vecindario (Altschul et al, supra). Estos resultados iniciales de palabras del vecindario actúan como semillas para iniciar búsquedas para encontrar HSP más largos que las contengan. Luego, los aciertos de palabras se extienden en ambas direcciones a lo largo de cada secuencia hasta donde se pueda aumentar el puntaje de alineación acumulativo. Los puntajes acumulativos se calculan utilizando, para las secuencias de nucleótidos, los parámetros M (puntaje de recompensa por un par de residuos coincidentes; siempre >0) y N (puntaje de penalización por residuos no coincidentes; siempre <0). Para las secuencias de aminoácidos, se utiliza una matriz de puntuación para calcular El puntaje acumulativa. La extensión de los aciertos de palabras en cada dirección se detiene cuando: el puntaje de alineación acumulada disminuye en la cantidad X desde su valor máximo alcanzado; el puntaje acumulada llega a cero o menos, debido a la acumulación de uno o más alineamientos de residuos con puntaje negativo; o se alcanza el final de cualquiera de las secuencias. Los parámetros W, T y X del algoritmo BLAST determinan la sensibilidad y la velocidad de la alineación. El programa BLASTN (para secuencias de nucleótidos) utiliza como valores predeterminados un tamaño de palabra (W) de 28, una expectativa (E) de 10, M=1, N=-2 y una comparación de ambas cadenas. Para las secuencias de aminoácidos, el programa BLASTP utiliza como valores predeterminados un tamaño de palabra (W) de 3, una expectativa (E) de 10 y la matriz de puntuación BLOSUM62 (ver Henikoff & Henikoff, Proc. Natl. Acad. Sci. USA 89:10915 (1989)).
[0133] El algoritmo BLAST también realiza un análisis estadístico de la similitud entre dos secuencias (ver, por ejemplo, Karlin & Altschul, Proc. Nat'l. Acad. Sci. USA 90:5873-5787 (1993)). Una medida de similitud proporcionada por el algoritmo BLAST es la probabilidad de suma más pequeña (P(N)), que proporciona una indicación de la probabilidad con la que se produciría por casualidad una coincidencia entre dos secuencias de nucleótidos o aminoácidos. Por ejemplo, un ácido nucleico se considera similar a una secuencia de referencia si la probabilidad de suma más pequeña en una comparación del ácido nucleico de prueba con el ácido nucleico de referencia es menor que aproximadamente 0.2, más preferiblemente menor que aproximadamente 0.01 y lo más preferiblemente menor que aproximadamente 0.001.
[0135] Una indicación de que dos secuencias de ácidos nucleicos o polipéptidos son sustancialmente idénticos es que el polipéptido codificado por el primer ácido nucleico es inmunológicamente reactivo de forma cruzada con los anticuerpos generados contra el polipéptido codificado por el segundo ácido nucleico, como se describe a continuación. Por lo tanto, un polipéptido suele ser sustancialmente idéntico a un segundo polipéptido, por ejemplo, cuando los dos péptidos difieren únicamente en sustituciones conservadoras. Otra indicación de que dos secuencias de ácidos nucleicos son sustancialmente idénticas es que las dos moléculas o sus complementos se hibridan entre sí en condiciones estrictas, como se describe a continuación. Otra indicación de que dos secuencias de ácidos nucleicos son sustancialmente idénticas es que se pueden utilizar los mismos cebadores para amplificar la secuencia. Otra indicación de que dos polipéptidos son sustancialmente idénticos es que ambos polipéptidos conservan una actividad idéntica o sustancialmente similar.
[0137] Una “secuencia de translocación” o “secuencia de transducción” se refiere a una secuencia de péptido o proteína (o fragmento o dominio activo del mismo) que dirige el movimiento de una proteína de un compartimento celular a otro, o del espacio extracelular a través de la célula o la membrana plasmática hacia el interior de la célula. Las secuencias de translocación que dirigen el movimiento de una proteína desde el espacio extracelular a través de la célula o la membrana plasmática hacia la célula son “péptidos de penetración celular”. Las secuencias de translocación que se localizan en el núcleo de una célula se denominan “localización nuclear” secuencias, señales, dominios, péptidos o similares. Los ejemplos de secuencias de translocación incluyen, sin limitación, el dominio de transducción TAT (véase, por ejemplo S. Schwarze et al., Science 285 (Sep. 3, 1999); penetratins or penetratin peptides (D. Derossi et al., Trends in Cell Biol. 8, 84-87); Herpes simplex virus type 1 VP22 (A. Phelan et al., Nature Biotech. 16, 440-443 (1998), and polycationic (por ejemplo). Se conocen otras secuencias de translocación en la técnica. Los péptidos de translocación se pueden fusionar (por ejemplo, en el extremo amino o carboxiterminal), conjugado o acoplado a un compuesto de la presente divulgación, para, entre otras cosas, producir un compuesto conjugado que puede pasar fácilmente a las células diana, o a través de la barrera hematoencefálica y a las células diana.
[0138] El sistema “CRISPR/Cas” se refiere a una clase ampliamente distribuida de sistemas bacterianos de defensa contra ácidos nucleicos extraños. Los sistemas CRISPR/Cas se encuentran en una amplia gama de organismos eubacterianos y arqueológicos. Los sistemas CRISPR/Cas incluyen subtipos tipo I, II y III. Los sistemas CRISPR/Cas de tipo II de tipo silvestre utilizan la nucleasa mediada por ARN, Cas9, en complejo con ARN guía y activador para reconocer y escindir el ácido nucleico extraño. Métodos y composiciones para controlar la inhibición y/o activación de la transcripción de genes diana, poblaciones de genes diana (por ejemplo, que controlan un transcriptoma o una porción del mismo) se describen, por ejemplo, en Cell. 2014 Oct 23;159(3):647-61.
[0140] Los homólogos de Cas9 se encuentran en una amplia variedad de eubacterias, incluidas, entre otras, bacterias de los siguientes grupos taxonómicos:Actinobacteria, Aquificae, Bacteroidetes-Chlorobi, Chlamydiae-Verrucomicrobia, Chlroflexi, Cyanobacteria, Firmicutes, Proteobacteria, Spirochaetes,yTermotogas.Una proteína Cas9 ejemplar es laStreptococcus pyogenesProteína Cas9. Se describen proteínas Cas9 adicionales y homólogos de las mismas en, por ejemplo, Chylinksi, et al., RNA Biol. 2013 May 1; 10(5): 726-737 ; Nat. Rev. Microbiol. 2011 June; 9(6): 467-477; Hou, et al., Proc Natl Acad Sci U S A. 2013 Sep 24;110(39):15644-9; Sampson et al., Nature. 2013 May 9;497(7448):254-7; and Jinek, et al., Science. 2012 Aug 17;337(6096):816-21.
[0142] Tal como se utiliza en el presente documento, “actividad” en el contexto de la actividad CRISPR/Cas, la actividad Cas9, la actividad sgRNA, la actividad sgRNA:nucleasa y similares, se refiere a la capacidad de unirse a un elemento genético objetivo y/o modular la transcripción en o cerca del elemento genético objetivo. Esta actividad se puede medir de diversas maneras, tal como se conoce en la técnica. Por ejemplo, se puede medir la expresión, actividad o nivel de un gen indicador, o la expresión o actividad de un gen codificado por el elemento genético.
[0144] Descripción detallada
[0146] 1. Introducción
[0148] Se describen aquí métodos y composiciones para modular la transcripción de regiones genómicas en o cerca de un elemento genético objetivo. La presente invención está definida por las reivindicaciones adjuntas; sin embargo, la siguiente divulgación proporciona enseñanzas que van más allá de la divulgación de la invención como tal, que está definida exclusivamente por las reivindicaciones adjuntas. Las enseñanzas se proporcionan para situar la invención real en un contexto técnico más amplio y para ilustrar posibles desarrollos técnicos relacionados. La información técnica adicional que no cae dentro del alcance de las reivindicaciones adjuntas no es parte de la invención. En particular, los términos “realización” y “aspecto” no deben interpretarse como necesariamente referidos a la invención reivindicada, a menos que el tema en cuestión esté dentro del alcance de las reivindicaciones. Los métodos y composiciones se basan en un sistema CRISPR/Cas que emplea un ARN guía pequeño optimizado (sgRNA) y una nucleasa mediada por sgRNA deficiente en nucleasa (dCas9) y/o una nucleasa mediada por sgRNA (Cas9). El sgRNA contiene una región de unión que proporciona una unión altamente específica al elemento genético objetivo. Las secuencias codificantes de la región de unión de sgRNA ejemplares pueden incluir, pero no se limitan a, secuencias que comprenden o consisten en los 19 nucleótidos en el extremo 3' de cualquiera de las SEQ ID NO: 26-857,995. Las secuencias codificantes de la región de unión de sgRNA ejemplares pueden incluir adicional o alternativamente, pero no se limitan a, secuencias que comprenden o consisten en una cualquiera de las SEQ ID NO: 26-857,995.
[0150] El sgRNA y el dCas9 pueden formar un complejo que se une específicamente al elemento genético objetivo o cerca de él. El dCas9 puede ser una fusión entre el dominio dCas9 deficiente en nucleasa y un dominio que proporciona una función de modulación transcripcional. Los métodos y composiciones se pueden utilizar para apuntar a elementos genéticos como se describe más adelante en este documento.
[0152] Por ejemplo, los métodos y composiciones se pueden utilizar para realizar cribados grandes (por ejemplo, de todo el genoma) para elementos genéticos implicados en la modulación de diversos fenotipos de interés. En algunos casos, las técnicas de detección anteriores no eran prácticas para realizar análisis a gran escala debido al tamaño de la biblioteca requerida. Por ejemplo, las pruebas de genoma mediante shRNA (por ejemplo, Bassik et al., Cell. 2013 Feb 14;152(4):909-22) puede requerir al menos 25 shRNA por gen objetivo para garantizar una alta probabilidad de reprimir transcripcionalmente cada gen. Como se describe en este documento, los presentes inventores han descubierto métodos para diseñar sgRNA y bibliotecas de sgRNA que se dirigen a elementos genéticos con una alta probabilidad de alterar la transcripción del elemento genético objetivo en un grado detectable. En algunos casos, los métodos y composiciones descritos en este documento pueden proporcionar una biblioteca de sgRNA de, de aproximadamente, o de menos de 25, 24, 23, 22, 21, 20, 15, 14, 13, 12, 11, 10, 9, 8, 7, 6, 5, 4, 3 o menos sgRNA por gen objetivo. En algunos casos, los sgRNA de la biblioteca están optimizados para tener una alta probabilidad de modular eficazmente (por ejemplo, activando o inhibiendo la transcripción) de genes diana. Debido a la alta probabilidad de modulación efectiva del gen objetivo, la biblioteca puede apuntar a una gran cantidad de genes sin requerir una gran cantidad de sgRNA por gen objetivo y, por lo tanto, sin volverse demasiado grande para una construcción y uso fáciles. En algunos casos, la biblioteca se dirige a una gran pluralidad de genes (por ejemplo, una biblioteca que se dirige al menos al 90 %, 95 %, 99 %, sustancialmente todos o todos los genes de un genoma).
[0154] II. Composiciones
[0156] Se describen aquí composiciones útiles como componentes de un sistema CRISPR/Cas para apuntar a elementos genéticos. Los componentes se pueden utilizar en un cribado para identificar elementos genéticos que modulan un fenotipo, para identificar interacciones genéticas, para desarrollar o identificar sgRNA optimizados o para el descubrimiento o mejora de compuestos líderes. Los componentes incluyen sgRNA, bibliotecas de sgRNA y andamiajes de sgRNA, y moduladores transcripcionales dCas9.
[0158] A. sgRNA
[0160] En este documento se describen sgRNA, andamiajes de sgRNA y bibliotecas de sgRNA. Los sgRNA pueden contener de 5' a 3': una región de unión, una región de horquilla 5', una región de horquilla 3' y una secuencia de terminación de la transcripción. El sgRNA se puede configurar para formar un complejo estable y activo con una pequeña nucleasa mediada por ARN guía (por ejemplo, Cas9 o dCas9). En algunos casos, el sgRNA se optimiza para mejorar la expresión de un polinucleótido que codifica el sgRNA en una célula huésped.
[0162] La región de horquilla 5' puede tener entre aproximadamente 15 y aproximadamente 50 nucleótidos de longitud (por ejemplo, aproximadamente 15, 16, 17, 18, 19, 20, 21,22, 23, 24, 25, 26, 27, 28, 29, 30, 31, 32, 33, 34, 35, 36, 37, 38, 39, 40, 41,42, 43, 44, 45, 46, 47, 48, 49, o aproximadamente 50 nucleótidos de longitud). En algunos casos, la región de la horquilla 5' tiene una longitud de entre 30-45 nucleótidos (por ejemplo, de unos 31, 32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44 o 45 nucleótidos de longitud). En algunos casos, la región de horquilla 5' tiene, o al menos aproximadamente, 31 nucleótidos de longitud (por ejemplo, tiene al menos aproximadamente 31, 32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44 o 45 nucleótidos de longitud). En algunos casos, la región de horquilla 5' contiene uno o más bucles o protuberancias, cada bucle o protuberancia de aproximadamente 1, 2, 3, 4, 5, 6, 7, 8, 9 o 10 nucleótidos. En algunos casos, la región de horquilla 5' contiene un tallo de entre aproximadamente 10 y 30 pares de bases complementarias (por ejemplo, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28, 29 o 30 pares de bases complementarios).
[0164] En algunas realizaciones, la región de horquilla 5' puede contener estructuras de unión a proteínas o de unión a moléculas pequeñas. En algunos casos, la función de horquilla 5' (por ejemplo, interactuando o ensamblándose con una nucleasa mediada por sgRNA) puede ser activado condicionalmente por medicamentos, factores de crecimiento, ligandos de moléculas pequeñas o una proteína que se une a la estructura de unión a proteínas del bucle de tallo 5'. En algunas realizaciones, la región de horquilla 5' puede contener nucleótidos no naturales. Por ejemplo, se pueden incorporar nucleótidos no naturales para mejorar la interacción proteína-ARN, o para aumentar la estabilidad térmica o la resistencia a la degradación del sgRNA.
[0165] En algunas realizaciones, la región de horquilla 5' contiene un sitio de endonucleasa único. En algunos casos, el sitio único de endonucleasa puede introducir una protuberancia (por ejemplo, un bulto de aproximadamente 1, 2, 3, 4, 5, 6, 7, 8, 9 o 10 nucleótidos). En una realización ejemplar, el sitio de endonucleasa único es un sitioBlpl.El sitio de endonucleasa único puede facilitar la clonación de una región de unión o una biblioteca de regiones de unión estructuralmente distintas en un andamiaje de sgRNA como se describe más adelante.
[0166] El sgRNA puede contener una secuencia intermedia entre las regiones de horquilla 5' y 3'. La secuencia intermedia entre las regiones de horquilla 5' y 3' puede tener entre aproximadamente 0 y aproximadamente 50 nucleótidos de longitud, preferiblemente entre aproximadamente 10 y aproximadamente 50 nucleótidos de longitud (por ejemplo, con una longitud de, o aproximadamente una longitud de 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28, 29, 30, 31, 32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44, 45, 46, 47, 48, 49 o 50 nucleótidos). En algunos casos, la secuencia intermedia está diseñada para ser lineal, no estructurada, sustancialmente lineal o sustancialmente no estructurada. En algunas realizaciones, la secuencia intermedia puede contener nucleótidos no naturales. Por ejemplo, se pueden incorporar nucleótidos no naturales para mejorar la interacción proteína-ARN o para aumentar la actividad del complejo sgRNA:nucleasa. Como otro ejemplo, se pueden incorporar nucleótidos naturales para mejorar la estabilidad térmica o la resistencia a la degradación del sgRNA.
[0168] La región de horquilla 3' puede contener un bucle de aproximadamente 3, 4, 5, 6, 7 u 8 nucleótidos y un tallo de aproximadamente 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24 o 25 nucleótidos o más. En algunos casos, la región de horquilla 3' puede contener una estructura de unión a proteínas, moléculas pequeñas, hormonas o metabolitos que puede estabilizar condicionalmente la estructura secundaria y/o terciaria del sgRNA. En algunas realizaciones, la región de horquilla 3' puede contener nucleótidos no naturales. Por ejemplo, se pueden incorporar nucleótidos no naturales para mejorar la interacción proteína-ARN o para aumentar la actividad del complejo sgRNA:nucleasa. Como otro ejemplo, se pueden incorporar nucleótidos naturales para mejorar la estabilidad térmica o la resistencia a la degradación del sgRNA.
[0170] En algunas realizaciones, el sgRNA incluye una estructura de terminación en su extremo 3'. En algunos casos, el sgRNA incluye una región de horquilla 3' adicional, por ejemplo, antes de la terminación y después de una primera región de horquilla 3', que puede interactuar con proteínas, moléculas pequeñas, hormonas,etc., paraestabilización o funcionalidad adicional, como estabilización condicional o regulación condicional del ensamblaje o actividad de sgRNA:nucleasa.
[0172] En algunas realizaciones, el sgRNA forma un complejo sgRNA:Cas9 o dCas9 que tiene mayor estabilidad y/o actividad en comparación con sgRNA conocidos previamente o un sgRNA sustancialmente idéntico a un sgRNA conocido previamente. En algunos casos, el sgRNA forma un complejo sgRNA:Cas9 o dCas9 que tiene mayor estabilidad y/o actividad en comparación con un sgRNA codificado por:
[0174] SEQ ID NO: 6 [N]5-100GUUUUAGAGCUAGAAAUAGCAAGUUAAAAUAAGGCUAGUCC GUUAUCAACUUGAAAAAGUGGCACCGAGUCGGUGCUUUUUUU, donde [N] representa una región de unión específica del objetivo de entre aproximadamente 5 y 100 nucleótidos (por ejemplo, aproximadamente 5, 10, 15, 20, 15, 30, 35, 40, 45, 50, 55, 60, 70, 80 o 90 nucleótidos) que es complementario o sustancialmente complementario al elemento genético objetivo. En algunas realizaciones, la región de unión del sgRNA tiene, o tiene aproximadamente, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28, 29, 30, 31, 32, 33, 34, 35, 36, 37, 38, 39 o 40 o más nucleótidos de longitud. En algunos casos, la región de unión del sgRNA tiene una longitud de entre aproximadamente 19 y 21 nucleótidos.
[0176] En general, la región de unión está diseñada para complementar (por ejemplo, complementan perfectamente) o complementan sustancialmente el elemento o elementos genéticos objetivo. En algunos casos, la región de unión puede incorporar bases oscilantes o degeneradas para unir múltiples elementos genéticos. En algunos casos, los 19 nucleótidos en el extremo 3' o 5' de la región de unión son perfectamente complementarios al elemento o elementos genéticos objetivo. En algunos casos, la región de unión se puede alterar para aumentar la estabilidad. Por ejemplo, se pueden incorporar nucleótidos no naturales para aumentar la resistencia del ARN a la degradación. En algunos casos, la región de unión se puede alterar o diseñar para evitar o reducir la formación de estructura secundaria en la región de unión. En algunos casos, la región de unión puede diseñarse para optimizar el contenido de G-C. En algunos casos, el contenido de G-C está preferiblemente entre aproximadamente el 40 % y aproximadamente el 60 % (por ejemplo, 40 %, 45 %, 50 %, 55 %, 60 %). En algunos casos, la región de unión puede seleccionarse para comenzar con una secuencia que facilite la transcripción eficiente del sgRNA. Por ejemplo, la región de unión puede comenzar en el extremo 5' con un nucleótido G. En algunos casos, la región de unión puede contener nucleótidos modificados tales como, sin limitación, nucleótidos metilados o fosforilados.
[0178] En algunos casos, los sgRNA descritos en este documento forman un complejo sgRNA:nucleasa con una estabilidad o actividad mejorada en comparación con SEQ ID NO: 6, o un sgRNA 90, 95, 96, 97, 98 o 99 % o más idéntico a SEQ ID NO: 6. En algunos casos, los sgRNA optimizados descritos en este documento forman un complejo sgRNA:nucleasa con una estabilidad o actividad mejorada en comparación con SEQ ID NO: 6, o un sgRNA con menos de 5, 4, 3, 2 o 1 sustituciones, adiciones o eliminaciones de nucleótidos de SEQ ID NO: 6.
[0179] Como se utiliza en este documento, la identidad de un sgRNA con otro sgRNA, como un sgRNA con SEQ ID NO: 6, se determina con referencia a la identidad con las secuencias de nucleótidos fuera de la región de unión. Por ejemplo, dos sgRNA con 0 % de identidad dentro de la región de unión y 100 % de identidad fuera de la región de unión son 100 % idénticos entre sí. De manera similar, como se usa en este documento, el número de sustituciones, adiciones o eliminaciones de un sgRNA en comparación con otro, como un sgRNA comparado con SEQ ID NO: 6, se determina con referencia a las secuencias de nucleótidos fuera de la región de unión. Por ejemplo, dos sgRNA con múltiples adiciones, sustituciones y/o eliminaciones dentro de la región de unión y 100% de identidad fuera de la región de unión se consideran que contienen 0 sustituciones, adiciones o eliminaciones de nucleótidos.
[0181] Tal como se utiliza en este documento, la distinción estructural de un sgRNA con respecto a otro sgRNA se determina con referencia a la región de unión. Así, por ejemplo, un sgRNA que es estructuralmente distinto en comparación con otro sgRNA tiene una secuencia de región de unión diferente. La secuencia puede ser diferente mediante una o más sustituciones, adiciones o eliminaciones dentro de la región de unión.
[0183] En algunas realizaciones, el sgRNA se puede optimizar para la expresión sustituyendo, eliminando o agregando uno o más nucleótidos. En algunos casos, una secuencia de nucleótidos que proporciona una transcripción ineficiente a partir de un ácido nucleico molde codificante puede eliminarse o sustituirse. Por ejemplo, en algunos casos, el sgRNA se transcribe a partir de un ácido nucleico unido operativamente a un promotor de la ARN polimerasa III. En tales casos, las secuencias de sgRNA que dan lugar a una transcripción ineficiente por la ARN polimerasa III, como las descritas en Nielsen et al., Science. 2013 Jun 28;340(6140):1577-80, se puede eliminar o sustituir. Por ejemplo, uno o más uracilos consecutivos pueden eliminarse o sustituirse de la secuencia de sgRNA. En algunos casos, los uracilos consecutivos están presentes en la porción del tallo de una estructura de tallo-bucle. En tales casos, uno o más de los uracilos consecutivos pueden sustituirse intercambiando el uracilo y su base complementaria. Por ejemplo, si el uracilo está unido por enlace de hidrógeno a una adenina correspondiente, la secuencia de sgRNA se puede alterar para intercambiar la adenina y el uracilo. Esta “inversión A-U” puede conservar la estructura y función general de la molécula de sgRNA al tiempo que mejora la expresión al reducir la cantidad de nucleótidos de uracilo consecutivos. En algunos casos, el sgRNA que contiene una inversión A-U está codificado por:
[0185] SEQ ID NO: 7 [Nk-100 GUUUAAGAGCUAGAAAUAGCAAGUUUAAAUAAGGCUAGUCC GUUAUCAACUUGAAAAAGUGGCACCGAGUCGGUGCUUUUUUU, donde los nucleótidos A-U invertidos están subrayados. En algunos casos, el sgRNA optimizado es al menos 90, 91, 92, 93, 94, 95, 96, 97, 98 o 99 % idéntico o más a SEQ ID NO: 7, o contiene menos de 10, 9, 8, 7, 6, 5, 4, 3 o 2 adiciones, eliminaciones o sustituciones de nucleótidos en comparación con SEQ ID NO: 7. Alternativamente, el par A-U puede ser reemplazado por un par G-C, C-G, A-C, G-U. En algunos casos, el sgRNA está diseñado de manera que, con la exclusión de la secuencia terminadora de la transcripción, no contenga ninguna secuencia de cuatro o más de A, U, G o C.
[0187] En algunas realizaciones, el sgRNA se puede optimizar para lograr estabilidad. La estabilidad se puede mejorar optimizando la estabilidad de la interacción sgRNA:nucleasa, optimizando el ensamblaje del complejo sgRNA:nucleasa, eliminando o alterando elementos de secuencia desestabilizadores del ARN o agregando elementos de secuencia estabilizadores del ARN. En algunas realizaciones, el sgRNA contiene una estructura de tallo-bucle 5' proximal o adyacente a la región de unión que interactúa con la nucleasa mediada por sgRNA. La optimización de la estructura del tallo-bucle 5' puede proporcionar una mayor estabilidad o ensamblaje del complejo sgRNA:nucleasa. En algunos casos, la estructura de tallo-bucle de 5' se optimiza aumentando la longitud de la porción de tallo de la estructura de tallo-bucle. Un sgRNA ejemplar que contiene una estructura de tallo-bucle 5' optimizada está codificado por: SEQ ID NO: 8 [N]5-100 GUUUUAGAGCUAUGCUGGAAACAGCAUAGCAAGUUAAAAU AAGGCUAGUCCGUUAUCAACUUGAAAAAGUGGCACCGAGUCGGUGCUUUUUU U, donde los nucleótidos que contribuyen a la porción del tallo alargado de la estructura del tallo-bucle 5' están subrayados. En algunos casos, el sgRNA optimizado es al menos 90, 91, 92, 93, 94, 95, 96, 97, 98 o 99% idéntico o más a SEQ ID NO: 8, o contiene menos de 10, 9, 8, 7, 6, 5, 4, 3 o 2 adiciones, eliminaciones o sustituciones de nucleótidos en comparación con SEQ ID NO: 8.
[0189] En algunas realizaciones, la optimización del bucle de tallo 5' se combina con mutaciones para aumentar la transcripción para proporcionar un sgRNA optimizado. Por ejemplo, se pueden combinar una inversión A-U y un bucle de tallo alargado para proporcionar un sgRNA optimizado. Un sgRNA ejemplar que contiene una inversión A-U y un bucle de tallo 5' alargado está codificado por:
[0191] SEQ ID NO: 9 [Nk-100 GUUUAAGAGCUAUGCUGGAAACAGCAUAGCAAGUUUAAAU AAGGCUAGUCCGUUAUCAACUUGAAAAAGUGGCACCGAGUCGGUGCUUUUUU U, donde los nucleótidos invertidos de A-U y los nucleótidos que contribuyen a la porción del tallo alargado de la estructura del tallo-bucle 5' están subrayados. En algunos casos, el sgRNA optimizado es al menos 90, 91, 92, 93, 94, 95, 96, 97, 98 o 99 % idéntico o más a SEQ ID NO: 9, o contiene menos de 10, 9, 8, 7, 6, 5, 4, 3 o 2 adiciones, eliminaciones o sustituciones de nucleótidos en comparación con SEQ ID NO: 9.
[0193] En algunas realizaciones, un ARN guía pequeño puede incluir un sitio de endonucleasa único para permitir la construcción de grandes bibliotecas con alta fidelidad. En algunas realizaciones, el sitio de endonucleasa único introduce una protuberancia de 1 pb en la región de horquilla 5'. Un sgRNA ejemplar que contiene un sitio de endonucleasa único y una protuberancia de 1 pb en la región de horquilla 5' está codificado por:
[0195] SEQ ID NO: 10 [Nk-100 GUUUAAGAGCUAAGCUGGAAACAGCAUAGCAAGUUUAAAUAAGGCUAGUCCGU UAUCAACUUGAAAAAGUGGCACCGAGUCGGUGCUUUUUU U, donde los nucleótidos invertidos de la A-U, el abultamiento de 1 pb y los nucleótidos que contribuyen a la porción de tallo alargada de la estructura de tallo-bucle 5' están subrayados. En algunos casos, el sgRNA optimizado es al menos 90, 91, 92, 93, 94, 95, 96, 97, 98 o 99 % idéntico o más a SEQ ID NO: 10, o contiene menos de 10, 9, 8, 7, 6, 5, 4, 3 o 2 adiciones, eliminaciones o sustituciones de nucleótidos en comparación con SEQ ID NO: 10.
[0197] En algunas realizaciones, el ARN guía pequeño está codificado por un polinucleótido que comprende o consiste en:
[0199] SEQ ID NO: 11 [N ] - ^ GUUUAAGAGCUAAGCUGGAAACAGCAUAGCAAGUUUAAAU AAGGCUAGUCCGUUAUCAACUUGAAAAAGUGGCACCGAGUCGGUGCUUUUUU U, donde los nucleótidos invertidos de la A-U, el abultamiento de 1 pb y los nucleótidos que contribuyen a la porción del tallo alargada de la estructura del tallo-bucle 5' están subrayados. En algunos casos, el sgRNA optimizado es al menos 90, 91, 92, 93, 94, 95, 96, 97, 98 o 99 % idéntico o más a SEQ ID NO: 11, o contiene menos de 10, 9, 8, 7, 6, 5, 4, 3 o 2 adiciones, eliminaciones o sustituciones de nucleótidos en comparación con SEQ ID NO: 11.
[0201] Los sgRNA pueden modificarse mediante métodos conocidos en la técnica. En algunos casos, las modificaciones pueden incluir, pero no se limitan a, la adición de uno o más de los siguientes elementos de secuencia: una tapa 5' (por ejemplo, una tapa de 7-metilguanilato); una cola poliadenilada 3'; una secuencia de riboswitch; una secuencia de control de estabilidad; una horquilla; una secuencia de localización subcelular; una secuencia o etiqueta de detección; o un sitio de unión para una o más proteínas. Las modificaciones también pueden incluir la introducción de nucleótidos no naturales, incluidos, entre otros, uno o más de los siguientes: nucleótidos fluorescentes y nucleótidos metilados.
[0203] En algunas realizaciones, los sgRNA se seleccionan de manera que no tengan efectos significativos fuera del objetivo. En algunos casos, se puede determinar la similitud de una región de unión de sgRNA con secuencias de elementos genéticos no deseados. Los sgRNA que tienen una alta similitud que excede un umbral previamente designado se pueden filtrar. En algunos casos, las regiones de unión candidatas, incluidas las secuencias de motivos adyacentes al protoespaciador (PAM), se pueden calificar utilizando una métrica de calificación de manera manual o automatizada. Luego, las regiones de unión de sgRNA que tienen una cantidad aceptable de desajustes fuera del objetivo se pueden seleccionar para la síntesis.
[0205] A continuación se proporciona una métrica de puntuación ejemplar: G1 del PAM (por ejemplo, NGG paraStreptococcus pyogensCas9) se le asigna un puntaje de 40 si está presente y un puntaje de 0 si está ausente. Al G2 del PAM se le asigna un puntaje de 19 si está presente y un puntaje de 0 si está ausente. Al N del PAM se le asigna un puntaje de 0, ya sea que esté presente o ausente. A la región I, correspondiente a los primeros 7 nucleótidos de la región de unión a partir del extremo 5', se le asigna un puntaje de 28 por cada desajuste presente. La Región II, correspondiente a los primeros 5 nucleótidos de la región de unión que comienza después del extremo 3' de la Región I, recibe un puntaje de 19 por cada desajuste presente. A la región III, correspondiente a los nucleótidos restantes entre la región II y el PAM, se le asigna un puntaje de 10 por cada desajuste presente. La unión fuera del objetivo en cualquier sitio determinado se puede estimar como 1-([I(mismatches*mismatch_score)]/40). En algunos casos, se seleccionan sgRNA que tienen un puntaje según la métrica anterior menor o igual a 0. Por lo tanto, de acuerdo con la métrica de puntuación ejemplar anterior, se seleccionaría un sgRNA que tenga un desajuste en PAM G1 y ningún otro desajuste. Sin embargo, un sgRNA que tenga un desajuste en PAM G1 y cualquier otro desajuste no sería seleccionado para la síntesis.
[0206] En algunas realizaciones, los sgRNA se dirigen a regiones específicas en un gen o cerca de él. Por ejemplo, un sgRNA puede dirigirse a una región en o cerca de la región 5' (arriba) de 0-750 pb del sitio de inicio de la transcripción de un gen. En algunos casos, la orientación de 0 a 750 pb de la región puede proporcionar, o proporcionar, una mayor activación transcripcional por un complejo sgRNA:dCas9. Por ejemplo, una célula puede ponerse en contacto con un dCas9 fusionado a un activador transcripcional o dominio de fusión de epítopos y un sgRNA, o biblioteca de sgRNA, dirigido a la región 5' de 0-750 pb del sitio de inicio de la transcripción de uno o más genes.
[0208] Como otro ejemplo, un sgRNA puede dirigirse a una región en o cerca de la región 3' (corriente abajo) de 0-1000 pb del sitio de inicio de la transcripción de un gen. En algunos casos, la focalización de 0 a 1000 pb de la región puede proporcionar, o proporcionar, una mayor represión transcripcional por un complejo sgRNA:dCas9. Por ejemplo, una célula puede ponerse en contacto con un dCas9 fusionado a un represor transcripcional o dominio de fusión de epítopos y un sgRNA, o biblioteca de sgRNA, dirigido a la región 3' de 0 a 1000 pb del sitio de inicio de la transcripción de uno o más genes.
[0210] En algunas realizaciones, los sgRNA se dirigen a una región en o cerca del sitio de inicio de la transcripción (TSS) según una base de datos automatizada o anotada manualmente. Por ejemplo, las transcripciones anotadas por Ensembl/GENCODE o el pipeline APPRIS (Rodriguez et al., Nucleic Acids Res. 2013 Jan;41(Database issue):D110-7 se puede utilizar para identificar el TSS y los elementos genéticos objetivo de 0 a 750 pb en la dirección ascendente (por ejemplo, para apuntar a uno o más dominios activadores de la transcripción) o 0-1000 pb en la dirección descendente (por ejemplo, para apuntar a uno o más dominios represores transcripcionales) del TSS.
[0212] En algunas realizaciones, los sgRNA se dirigen a una región genómica que se predice que estará relativamente libre de nucleosomas. Las ubicaciones y ocupaciones de los nucleosomas se pueden analizar mediante el uso de digestión enzimática con nucleasa microcócica (MNasa). La MNasa es una nucleasa endo-exo que digiere preferentemente el ADN desnudo y el ADN en los enlaces entre nucleosomas, enriqueciendo así el ADN asociado a los nucleosomas. Para determinar la organización de los nucleosomas en todo el genoma, se secuencia el ADN restante de la digestión con MNasa utilizando tecnologías de secuenciación de alto rendimiento (MNasa-seq). Por lo tanto, se predice que las regiones que tienen una señal MNasa-seq alta estarán relativamente ocupadas por nucleosomas y se predice que las regiones que tienen una señal MNasa-seq baja estarán relativamente desocupadas por nucleosomas. Por lo tanto, en algunas realizaciones, los sgRNA se dirigen a una región genómica que tiene una señal MNasa-Seq baja.
[0214] En algunos casos, los sgRNA se dirigen a una región que se prevé que sea altamente activa a nivel transcripcional. Por ejemplo, los sgRNA pueden dirigirse a una región que se prevé que tenga una ocupación relativamente alta para la ARN polimerasa II (PolII). Estas regiones se pueden identificar mediante secuenciación de inmunoprecipitación de cromatina PolII (ChIP-seq), que incluye la purificación por afinidad de las regiones de ADN unidas a PolII utilizando un anticuerpo anti-PolII y la identificación de las regiones purificadas mediante secuenciación. Por lo tanto, se predice que las regiones que tienen una señal PolII Chip-seq alta serán altamente activas transcripcionalmente. Por lo tanto, en algunos casos, los sgRNA se dirigen a regiones que tienen una señal PolII ChIP-seq alta, como se describe en la base de datos PolII ChIP-seq publicada por ENCODE (Landt, et al., Genome Research, 2012 Sep;22(9): 1813-31)
[0216] Como otro ejemplo, los sgRNA pueden dirigirse a una región que se predice que es altamente activa transcripcionalmente, como se identifica mediante secuenciación continua o secuenciación continua global (GRO-seq). GRO-seq implica la incubación de células o núcleos con un nucleótido marcado y un agente que inhibe la unión de la nueva ARN polimerasa a los sitios de inicio de la transcripción (por ejemplo, sarcosilo). Por lo tanto, sólo los genes con una ARN polimerasa activa producen transcripciones marcadas. Después de un período de tiempo suficiente para permitir que se realice la transcripción global, se extrae el ARN marcado y se identifican los genes transcritos correspondientes mediante secuenciación. Por lo tanto, se predice que las regiones que tienen una señal GRO-seq alta serán altamente activas transcripcionalmente. Por lo tanto, en algunos casos, los sgRNA se dirigen a regiones que tienen una señal GRO-seq alta, como se divulga en datos GRO-seq publicados (por ejemplo, Core et al., Science. 2008 Dec 19;322(5909):1845-8; and Hah et al., Genome Res. 2013 Aug;23(8): 1210-23).
[0218] También se describen aquí casetes de expresión y vectores para producir sgRNA en una célula huésped. Los casetes de expresión pueden contener un promotor (por ejemplo, un promotor heterólogo) unido operativamente a un polinucleótido que codifica un sgRNA. El promotor puede ser inducible o constitutivo. El promotor puede ser específico del tejido. En algunos casos, el promotor es un promotor de repetición terminal larga del virus formador de focos del bazo (SFFV), U6, H1. En algunos casos, el promotor es un promotor mamífero débil en comparación con el promotor del factor de elongación 1 humano (EF1A). En algunos casos, el promotor mamífero débil es un promotor de ubiquitina C o un promotor de la fosfoglicerato quinasa 1 (PGK). En algunos casos, el promotor mamífero débil es un promotor TetOn en ausencia de un inductor. En algunos casos, cuando se utiliza un promotor TetOn, la célula huésped también se pone en contacto con un transactivador de tetraciclina. En algunas realizaciones, la fuerza del promotor sgRNA seleccionado se selecciona para expresar una cantidad de sgRNA que es proporcional a la cantidad de Cas9 o dCas9. El casete de expresión puede estar en un vector, como un plásmido, un vector viral, un vector lentiviral, etc. En algunos casos, el casete de expresión se encuentra en una célula huésped. El casete de expresión de sgRNA puede ser episomal o integrado en la célula huésped.
[0220] También se describen en este documento andamios de sgRNA. Los andamios de sgRNA son porciones de un sgRNA que pueden servir como receptor de una región de unión, o porción de la misma, para facilitar la clonación u otra manipulación. En algunas realizaciones, el andamiaje de sgRNA comprende todas las regiones del sgRNA (por ejemplo, región de horquilla 5', región intermedia, horquilla 3' y secuencia de terminación) excepto la región de unión. Por tanto, el andamiaje del sgRNA comprende todas las regiones constantes del sgRNA. En algunos casos, el andamio contiene un sitio de endonucleasa único en o cerca del extremo 5' de la región de horquilla 5'. Un sitio de endonucleasa único ejemplar es un sitioBlp,como se muestra por ejemplo en SEQ ID NO: 11. En algunos casos, el andamio está presente en un vector o casete de expresión. Por ejemplo, el andamio se puede configurar para estar vinculado operativamente a un promotor (por ejemplo, un promotor heterólogo) después de la ligadura de una región de unión. En algunos casos, el andamio puede estar presente en una lanzadera o vector de clonación intermedio. Por ejemplo, el andamio puede estar presente en un vectorE. colide clonación, y configurado para aceptar la ligadura de una región de unión, proporcionando así un sgRNA que puede ser extirpado del vectorE. coliy ligado a un vector de expresión de célula huésped adecuado. I
[0222] En algunas realizaciones, partes del andamiaje de sgRNA están codificadas en diferentes casetes de expresión, diferentes vectores o diferentes polinucleótidos de clonación intermedios. Por ejemplo, una porción del andamiaje de sgRNA que contiene la región de horquilla 5' y un sitio de restricción único puede residir en un vector de clonaciónE. coli. Se puede clonar una región de unión, o una biblioteca de regiones de unión, en la porción de estructura del sgRNA. Luego, la región de unión y la región de horquilla 5' se pueden digerir y ligar en un vector de destino (por ejemplo, un vector de expresión de célula huésped) que proporciona una o más de una región intermedia, una región de horquilla 3' y/o una secuencia de terminación 3'.
[0224] El andamiaje de sgRNA se puede utilizar para generar bibliotecas de sgRNA estructuralmente distintos. Por ejemplo, se puede sintetizar o generar una biblioteca de polinucleótidos que codifican regiones de unión estructuralmente distintas utilizando métodos conocidos en la técnica que incluyen, entre otros, la síntesis de ADN en fase sólida. En algunos casos, la síntesis en fase sólida se realiza en un portaobjetos o chip de micromatriz. La biblioteca de polinucleótidos que codifican las regiones de unión se puede recuperar y, opcionalmente, purificar (por ejemplo, HPLC o PAGE) y se clonan en un andamiaje de sgRNA para generar polinucleótidos que codifican una biblioteca de sgRNA estructuralmente distintos. De esta forma, se puede realizar la síntesis en fase sólida para generar el corto (por ejemplo, región de unión de 19-21 nucleótidos), mientras que las regiones constantes son proporcionadas por el andamio. En algunas realizaciones, esta combinación de síntesis en fase sólida de la región de unión y clonación en un andamio puede aumentar en gran medida la calidad de la biblioteca en comparación con la síntesis de una porción más grande del sgRNA. Por ejemplo, la región sintetizada puede contener menos errores de incorporación incorrecta (por ejemplo, oligonucleótidos sintetizados de longitud N-1) que surgen durante la síntesis de polinucleótidos largos.
[0225] En consecuencia, también se describen aquí bibliotecas de sgRNA, en donde la biblioteca contiene una gran cantidad de sgRNA que tienen regiones de unión estructuralmente distintas. La biblioteca puede contener al menos 10, 100; 1,000; 10,000; 50,000; o más sgRNA estructuralmente distintos. En algunas realizaciones, la biblioteca contiene menos de aproximadamente el 50 %, 25 %, 15 %, 10 %, 1 % o menos de incorporación incorrecta (por ejemplo, oligonucleótidos sintetizados de longitud N-1) errores.
[0227] En algunas realizaciones, la biblioteca contiene sgRNA que se dirigen a elementos genéticos que están separados por al menos 5 pb en el genoma de un organismo. En algunos casos, los sgRNA completamente o casi superpuestos pueden enriquecerse para el mismo fenotipo o uno similar. Por lo tanto, imponer una distancia entre los elementos genéticos objetivo de los sgRNA puede proporcionar una biblioteca de sgRNA con una mayor variedad de fenotipos posibles en comparación con una biblioteca del mismo tamaño que tenga sgRNA superpuestos. En algunos casos, una mayoría, una mayoría sustancial o al menos el 90 % (por ejemplo, Al menos el 90, 95 o 99 %) de los sgRNA de una biblioteca de sgRNA están dirigidos a elementos genéticos no superpuestos (por ejemplo, elementos genéticos que están separados por al menos 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19 o 20 pb).
[0229] En algunas realizaciones, la biblioteca contiene una pluralidad de sgRNA, donde la pluralidad de sgRNA comprende regiones de unión que están diseñadas de acuerdo con uno o más de los siguientes criterios: diseñadas para apuntar a un elemento genético que está al menos a 5 pb de distancia de un elemento genético al que se dirige otro sgRNA de la biblioteca; diseñadas para comenzar con un nucleótido “G”; diseñadas para tener una métrica de puntuación de desajuste para elementos genéticos fuera del objetivo por debajo de un umbral previamente designado (por ejemplo, diseñado para tener una métrica de puntuación de desajuste menor o igual a 0); diseñado para apuntar a una región entre, o entre aproximadamente, 0 y aproximadamente 750 pb en la dirección ascendente del sitio de inicio de la transcripción (TSS), o en donde una mayoría, una mayoría sustancial o al menos el 90 % (por ejemplo, al menos el 90, 95 o 99 %) de los sgRNA están dirigidos a una región entre, o entre aproximadamente, 0 y aproximadamente 1,000 pb en la dirección descendente del TSS de un gen; diseñados para dirigirse a una región entre, o entre aproximadamente, 0 y aproximadamente 1,000 pb en la dirección descendente del sitio de inicio de la transcripción (TSS), o en el que una mayoría, una mayoría sustancial o al menos el 90 % (por ejemplo, al menos el 90, 95 o 99 %) de los sgRNA están dirigidos a una región entre, o entre aproximadamente, 0 y aproximadamente 100 pb en la dirección descendente del TSS de un gen; diseñados para dirigirse a regiones en la dirección ascendente o en la dirección descendente del TSS según lo anotado por Ensemble/ENCODE o Pipeline APPRIS; diseñados para carecer de cualquier región que contenga cuatro o más nucleótidos U, A, G y/o C consecutivos; diseñados para tener un porcentaje de GC de entre aproximadamente 25 % y 100 %, o entre aproximadamente 30 % y 95 %; diseñados para dirigirse a elementos genéticos que tienen una señal MNasa-seq baja; diseñados para dirigirse a elementos genéticos que tienen una señal PolII ChIP-seq alta; o diseñados para dirigirse a elementos genéticos que tienen una señal GRO-seq alta.
[0231] En algunas realizaciones, las bibliotecas de sgRNA pueden apuntar a una pluralidad de elementos genéticos con una alta probabilidad de modular sustancialmente el nivel de expresión de uno o más genes, o porciones de los mismos, en o cerca del elemento genético objetivo o modular el nivel de expresión del elemento genético. En algunas realizaciones, las bibliotecas de sgRNA pueden proporcionar una alta probabilidad de modulación transcripcional sustancial a pesar de tener un número relativamente bajo de sgRNA dirigidos a un gen o elemento genético. Por ejemplo, la biblioteca de sgRNA puede tener menos de, o menos de aproximadamente, 20, 19, 18, 17, 16, 15, 14, 13, 12, 11, 10, 9, 8, 7, 6, 5, 4, 3 o 2 sgRNA dirigidos a cada gen, región genómica o elemento genético. En comparación, otras técnicas agrupadas para la modulación transcripcional a gran escala, como los métodos que utilizan bibliotecas de shRNA, pueden requerir un mayor nivel de redundancia para garantizar una alta probabilidad de modulación transcripcional de genes o elementos genéticos específicos. En algunas realizaciones, la biblioteca de sgRNA tiene una probabilidad media prevista de proporcionar un fenotipo detectable, medida utilizando un puntaje Z con signo de al menos, o al menos aproximadamente, 0.1, 0.2, 0.3, 0.4, 0.5, 0.6, 0.7, 0.8, 0.9 o superior. En algunos casos, El puntaje Z está entre, o entre aproximadamente, 0.1 y 2, 0.1 y 1, 0.1 y 0.9 o 1, 0.2 y 0.9 o 1, 0.3 y 0.9 o 1, 0.4 y 0.9 o 1, o 0.5 y 0.9 o 1.
[0233] En algunas realizaciones, El puntaje Z se calcula utilizando un método descrito en Kampmann et al., Proc Natl Acad Sci U S A. 2013 Jun 18;110(25):E2317-26, o Bassik et al., Cell. 2013 Feb 14;152(4):909-22. Por ejemplo, se puede cuantificar el fenotipo de cada sgRNA, para el crecimiento (“gamma”) o la resistencia al tratamiento (“rho”). Para normalizar estos fenotipos, el valor cuantificado de gamma o rho se divide por la desviación estándar de los fenotipos de sgRNA de control negativo. Estos fenotipos estandarizados representan las “puntajes z”.
[0235] En algunas realizaciones, las bibliotecas de sgRNA pueden ser bibliotecas de doble sgRNA. Por ejemplo, la biblioteca puede ser una pluralidad de polinucleótidos que codifican cada uno dos sgRNA. Los sgRNA pueden ser combinaciones de pares de sgRNA que ya han sido identificados como moduladores de un fenotipo. Estas bibliotecas pueden ser útiles para identificar interacciones genéticas entre los elementos genéticos a los que se dirige cada sgRNA del par.
[0237] B. Cas9
[0238] Se describen aquí nucleasas dependientes de ARN guía y derivados de las mismas. En algunos casos, la nucleasa mediada por sgRNA es una proteína Cas9. Por ejemplo, la nucleasa mediada por sgRNA puede ser una proteína Cas9 tipo I, II o III. En algunos casos, la nucleasa mediada por sgRNA puede ser una proteína Cas9 modificada. Las proteínas Cas9 pueden modificarse mediante cualquier método conocido en la técnica. Por ejemplo, la proteína Cas9 puede optimizarse con codones para su expresión en una célula huésped o en un sistema de expresión in vitro. Además, o alternativamente, la proteína Cas9 se puede diseñar para lograr estabilidad, una mejor unión al objetivo o una menor agregación.
[0240] La Cas9 puede ser una Cas9 defectuosa en la nucleasa (es decir, dCas9). Por ejemplo, ciertas mutaciones de Cas9 pueden proporcionar una nucleasa que no corta ni mella, o que no corta ni mella sustancialmente la secuencia objetivo. Las mutaciones ejemplares que reducen o eliminan la actividad de la nucleasa incluyen una o más mutaciones en las siguientes ubicaciones: D10, G12, G17, E762, H840, N854, N863, H982, H983, A984, D986 o A987, o una mutación en una ubicación correspondiente en un homólogo u ortólogo de Cas9. Las mutaciones pueden incluir la sustitución con cualquier gen natural (por ejemplo, alanina) o aminoácido no natural, o deleción. Una proteína dCas9 defectuosa en nucleasa ejemplar es Cas9D10A&H840A (Jinek, et al., Science. 2012 Aug 17;337(6096):816-21; Qi, et al., Cell. 2013 Feb 28;152(5):1173-83).
[0242] Las proteínas dCas9 que no cortan ni mellan la secuencia objetivo se pueden utilizar en combinación con un sgRNA, como uno o más de los sgRNA descritos en este documento, para formar un complejo que es útil para la modulación transcripcional de ácidos nucleicos objetivo como se explica más adelante. El dCas9 puede dirigirse a uno o más elementos genéticos en virtud de las regiones de unión codificadas en uno o más sgRNA. Por lo tanto, el reclutamiento de dCas9 puede proporcionar el reclutamiento de funciones efectoras adicionales proporcionadas por los polipéptidos fusionados al dominio dCas9. Por ejemplo, un polipéptido que comprende una función efectora se puede fusionar al extremo N y/o C de un dominio dCas9. En algunos casos, el polipéptido codifica un activador o represor transcripcional. En otros casos, el polipéptido codifica una fusión de epítopos que puede utilizarse para reclutar una o más copias de un agente de afinidad. En algunos casos, el agente de afinidad se fusiona a un activador o represor transcripcional.
[0244] En una realización, el dCas9 es un activador transcripcional y comprende un dominio dCas9 y un dominio activador transcripcional. En algunos casos, el dominio dCas9 se fusiona a un dominio de activación p65 (p65AD). SEQ ID NO: 1 es un dominio dCas9 ejemplar fusionado a p65AD. En algunos casos, el dCas9 fusionado a p65AD es al menos aproximadamente 90 %, 95 % o 99 % idéntico, o idéntico, a SEQ ID NO: 1.
[0245] En algunos casos, el activador transcripcional del dominio dCas9 comprende un dominio dCas9 fusionado a una o más copias de un dominio de activación VP8 (por ejemplo, fusionado a un dominio VP8, VP16 o VP64). SEQ ID NO: 2 es un dominio dCas9 ejemplar fusionado a VP16 o VP64. En algunos casos, el dCas9 fusionado a un dominio VP16 es al menos aproximadamente 90 %, 95 % o 99 % idéntico, o idéntico, a SEQ ID NO: 2.
[0246] En algunas realizaciones, el dCas9 es un represor transcripcional y comprende un dominio dCas9 y un dominio represor transcripcional. En algunos casos, el dominio dCas9 se fusiona a un dominio represor de caja asociada a Krüppel (KRAB). SEQ ID NO: 3 es un dominio dCas9 ejemplar fusionado a un dominio KRAB. En algunos casos, el dCas9 fusionado a un dominio KRAB es al menos aproximadamente 90 %, 95 % o 99 % idéntico, o idéntico, a SEQ ID NO: 3.
[0248] En algunas realizaciones, el dCas9 es un represor transcripcional y comprende un dominio dCas9 y un dominio represor transcripcional. En algunos casos, el dominio dCas9 se fusiona a un dominio represor de sombra cromosómica. s Eq ID NO: 12 es un dominio dCas9 ejemplar fusionado a un dominio cromosombra. En algunos casos, el dCas9 fusionado a un dominio cromosombra es al menos aproximadamente 90 %, 95 % o 99 % idéntico, o idéntico, a SEQ ID NO: 12.
[0250] En algunas realizaciones, el modulador transcripcional dCas9 es un dominio dCas9 fusionado a un polipéptido de fusión de epítopos. El polipéptido de fusión de epítopos puede contener una o más copias (por ejemplo, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20 o más copias) de un epítopo. En algunos casos, el polipéptido de fusión de epítopo contiene múltiples copias de un epítopo separadas por una o más secuencias de enlace. En algunos casos, el enlazador está configurado para permitir la unión de agentes de afinidad a epítopos adyacentes sin impedimento estérico sustancial o sin él. En algunos casos, las secuencias de enlace están configuradas para proporcionar una región no estructurada o lineal del polipéptido. Por ejemplo, la secuencia de enlace puede comprender una o más glicinas y/o serinas. Las secuencias de enlace pueden tener una longitud de al menos 2, 3, 4, 5, 6, 7, 8, 9, 10 o más aminoácidos. En algunos casos, las secuencias de enlace son, o comprenden, uno o más de los enlaces divulgados en la red mundial en parts.igem.org/Protein_domains/Linker.
[0252] La secuencia de aminoácidos del epítopo puede ser cualquier secuencia que sea reconocida específicamente por un agente de afinidad correspondiente. Por lo tanto, el dominio dCas9 fusionado al polipéptido de fusión del epítopo reclutará una o más copias del agente de fusión correspondiente. Esto puede resultar en una amplificación de cualquier señal o función efectora proporcionada por el agente de afinidad. Por ejemplo, el agente de afinidad puede ser una proteína de fusión que comprende un dominio de afinidad y un dominio de modulación transcripcional. La fusión del epítopo dCas9 puede formar un complejo con un sgRNA específico para un elemento genético objetivo y reclutar múltiples copias del dominio de modulación transcripcional a través del dominio de afinidad al elemento genético objetivo.
[0254] En algunos casos, el dominio dCas9 fusionado a un polipéptido de fusión de epítopo contiene una o más copias de un epítopo GCN4. En algunos casos, el polipéptido de fusión de epítopo contiene múltiples copias de un epítopo GCN4 separadas por una o más copias de una o más secuencias de enlace. En algunos casos, el enlazador está configurado para permitir la unión de agentes de afinidad a epítopos GCN4 adyacentes sin impedimento estérico sustancial o sin él. Un dCas9 ejemplar fusionado a un dominio de fusión de epítopo GCN4 es o comprende SEQ ID NO: 4. En algunos casos, el dCas9 fusionado a un dominio de fusión del epítopo GCN4 es al menos aproximadamente 90 %, 95 % o 99 % idéntico, o idéntico, a SEQ ID NO: 4.
[0256] En algunas realizaciones, el polipéptido de fusión de epítopos contiene una o más copias de dos o más epítopos diferentes. En tales casos, el dCas9 puede reclutar múltiples funciones efectoras diferentes. Por ejemplo, el polipéptido de fusión de epítopo puede contener un primer epítopo que recluta un agente de afinidad fusionado a un activador transcripcional. El polipéptido de fusión de epítopo puede contener además un segundo epítopo que recluta un agente de afinidad fusionado a una función efectora diferente. En algunos casos, el polipéptido de fusión de epítopos que contiene una o más copias de dos o más epítopos diferentes se puede utilizar para mejorar la especificidad de una interacción CRISPR/Cas. Por ejemplo, un epítopo puede reclutar un agente de afinidad fusionado a la mitad de un dominio efector de dímero obligado, mientras que el otro epítopo recluta un agente de afinidad fusionado a la otra mitad del dominio efector de dímero obligado.
[0258] En algunos casos, el polipéptido de fusión del epítopo recluta una o más copias de una proteína fluorescente dímera obligada (por ejemplo, GFP), una recombinasa dimérica obligada (por ejemplo, c Re recombinasa), una luciferasa dimérica obligada, una timidina quinasa dimérica obligada, una proteasa TEV dimérica obligada o una dihidrofolato reductasa dimérica obligada (DHFR). En algunos casos, el polipéptido de fusión del epítopo recluta una o más copias de una combinación de dominios efectores o enzimas que promueven o afectan la transcripción. Por ejemplo, el polipéptido de fusión de epítopos puede reclutar una o más copias de enzimas u otros dominios efectores que regulan la metilación del ADN, la metilación o desmetilación de histonas, la desacetilación de histonas, la desfosforilación de la ARN polII o promueven un aumento en la compactación de nucleosomas medida por una hipersensibilidad reducida a la ADNasa 1 o una accesibilidad disminuida a la nucleasa microcócica. Una combinación de dominios efectores de activación o enzimas que podrían promover la transcripción podría incluir desmetilasas de ADN, desmetilasas o metilasas de histonas, acetilasas de histonas, fosforilasas de ARN polII o enzimas o dominios efectores que reducen la compactación de nucleosomas medida por una mayor hipersensibilidad a la ADNasa 1 o aumentan la accesibilidad de las nucleasas microcócicas, o promueven un bucle cromosómico natural o no natural entre elementos potenciadores distales y elementos promotores proximales.
[0260] También se describen en este documento casetes de expresión y vectores para producir Cas9 o dCas9, incluidas las proteínas de fusión Cas9 o dCas9, en una célula huésped. Los casetes de expresión pueden contener un promotor (por ejemplo, un promotor heterólogo) unido operativamente a un polinucleótido que codifica Cas9 o dCas9. El promotor puede ser inducible o constitutivo. El promotor puede ser específico del tejido. En algunos casos, el promotor es un promotor mamífero débil en comparación con el promotor del factor de elongación 1 humano (EF1A). En algunos casos, el promotor mamífero débil es un promotor de ubiquitina C, unvavpromotor, o un promotor de la fosfoglicerato quinasa 1 (PGK). En algunos casos, el promotor mamífero débil es un promotor TetOn en ausencia de un inductor. En algunos casos, cuando se utiliza un promotor TetOn, la célula huésped también se pone en contacto con un transactivador de tetraciclina.
[0262] En algunas realizaciones, la fuerza del promotor dCas9 o Cas9 se selecciona para expresar una cantidad de Cas9 o dCas9 (por ejemplo, Proteína de fusión del epítopo Cas9 o dCas9) que es proporcional a la cantidad de sgRNA o cantidad de expresión de sgRNA. En algunas realizaciones, la fuerza del promotor sgRNA seleccionado se selecciona para expresar una cantidad de ARN guía pequeño que es proporcional a la cantidad de agente de afinidad correspondiente o la cantidad de Cas9 o dCas9 (por ejemplo, proteína de fusión del epítopo Cas9 o dCas9). Por ejemplo, si una proteína de fusión del epítopo dCas9 contiene diez copias de un epítopo, entonces el promotor dCas9 se puede seleccionar para expresar 1/10° la cantidad de dCas9 en comparación con el agente de afinidad correspondiente (o menos). En algunos casos, se puede seleccionar un promotor débil para reducir la citotoxicidad inducida por la expresión del gen Cas9 o dCas9.
[0264] En algunos casos, el polinucleótido que codifica una pequeña nucleasa mediada por ARN guía del casete de expresión codifica además una o dos secuencias de localización (por ejemplo, secuencias de localización nuclear). Por ejemplo, el polinucleótido puede codificar una proteína Cas9 o dCas9 que tenga una secuencia de localización nuclear en el extremo N y/o C. El casete de expresión puede estar en un vector, como un plásmido, un vector viral, un vector lentiviral,etc.En algunos casos, el casete de expresión se encuentra en una célula huésped. El casete de expresión puede ser episomal o integrado en la célula huésped.
[0266] C. Agentes de afinidad
[0267] Se describen aquí agentes de afinidad para reclutar funciones efectoras para las proteínas de fusión del epítopo dCas9. Se puede utilizar una amplia variedad de agentes de afinidad. Generalmente, el agente de afinidad es estable en las condiciones reductoras presentes en el entorno intracelular de la célula. Además, el agente de afinidad debe unirse específicamente a su epítopo correspondiente con una reactividad cruzada mínima. En algunos casos, el agente de afinidad es un anticuerpo, como un scFv. En algunos casos, el agente de afinidad es un anticuerpo (por ejemplo, scFv) que ha sido optimizado para la estabilidad en el entorno intracelular. Por ejemplo, el agente de afinidad (por ejemplo, scFv) puede ser un intracuerpo (ver, por ejemplo, Lo et al., Handb. Exp. Pharm. 2008;(181):343-73). Un agente de afinidad ejemplar comprende el dominio scFv anti-GCN4 de SEQ ID NO: 5.
[0269] El agente de afinidad puede contener uno o más dominios que mejoran la solubilidad. Por ejemplo, el agente de afinidad se puede fusionar en el extremo N y/o C a un polipéptido altamente soluble y/o altamente estable. Los dominios de mejora de la solubilidad ejemplares incluyen, sin limitación, la supercarpeta GFP (Pédelacq et al., Nat Biotechnol. 2006 Jan;24(1):79-88), proteína de unión a maltosa, albúmina, lisozima de clara de huevo de gallina, glutatión S-transferasa, el dominio B1 de la proteína G, proteína D, el dominio Z de la proteína A, tiorredoxina, bacterioferritina, DhaA, HaloTag y GrpE.
[0271] En algunas realizaciones, el agente de afinidad comprende un dominio modulador transcripcional. Por ejemplo, el agente de afinidad puede contener un dominio de afinidad (por ejemplo, un dominio scFv) y un modulador transcripcional (por ejemplo, dominio activador o represor transcripcional). En algunos casos, el agente de afinidad contiene un dominio de afinidad fusionado a una o más copias de un dominio VP8, VP16 o VP64. En algunos casos, el agente de afinidad contiene un dominio de afinidad anti-GCN4 fusionado a una o más copias de un dominio VP8, VP16 o VP64. Un agente de afinidad ejemplar que contiene un dominio modulador transcripcional comprende SEQ ID NO: 13.
[0273] También se describen en este documento casetes de expresión y vectores para producir uno o más agentes de afinidad descritos en este documento en una célula huésped. Los casetes de expresión pueden contener un promotor (por ejemplo, un promotor heterólogo) unido operativamente a un polinucleótido que codifica un agente de afinidad. El promotor puede ser inducible o constitutivo. El promotor puede ser específico del tejido. En algunos casos, el promotor es un promotor fuerte. Por ejemplo, el promotor puede ser un promotor CMV, un promotor de repetición terminal larga SFFV o el promotor del factor de elongación humano 1 (EF1A). En algunos casos, el polinucleótido que codifica un agente de afinidad del casete de expresión codifica además una o dos secuencias de localización nuclear. Por ejemplo, el polinucleótido puede codificar un agente de afinidad que tenga una secuencia de localización nuclear en el extremo N y/o C. El casete de expresión puede estar en un vector, como un plásmido, un vector viral, un vector lentiviral, etc. En algunos casos, el casete de expresión se encuentra en una célula huésped. El casete de expresión puede ser episomal o integrado en la célula huésped.
[0275] III. Métodos
[0277] Se describen aquí métodos de uso de CRISPR/Cas para modular la transcripción de uno o más genes o elementos genéticos. Los métodos se pueden utilizar para optimizar los sgRNA probando una biblioteca agrupada de sgRNA que se dirigen a un solo gen y seleccionando aquellos que producen un fenotipo deseado. Los métodos también se pueden utilizar a pequeña, mediana o gran escala (por ejemplo, detección a nivel de todo el genoma de elementos genéticos que contribuyen a un fenotipo seleccionado. Los métodos también se pueden utilizar para identificar genes interactuantes y redes de genes. Los métodos también se pueden utilizar para identificar objetivos para el desarrollo terapéutico o compuestos líderes.
[0279] A. Detección de elementos genéticos que modulan un fenotipo
[0281] Se describe un método de detección de uno o más elementos genéticos que modulan un fenotipo. El método se puede realizar poniendo en contacto una pluralidad de células con una biblioteca de ARN guía pequeños (sgRNA) estructuralmente distintos que se dirigen a una pluralidad de elementos genéticos, como cualquiera de los sgRNA o bibliotecas de sgRNA descritas en este documento. El contacto de la pluralidad de células con una pluralidad de sgRNA puede generar de este modo una pluralidad de células de prueba, cada una de estas células de prueba comprende: un ARN guía pequeño (sgRNA); y una nucleasa mediada por sgRNA deficiente en nucleasa (dCas9), en donde el dCas9 comprende un dominio dCas9 fusionado a un modulador transcripcional o un dominio dCas9 fusionado a un dominio de fusión de epítopos. El método incluye seleccionar las células en función del fenotipo y cuantificar la frecuencia de los sgRNA estructuralmente distintos dentro de la población de células seleccionadas. Los sgRNA que se dirigen a elementos genéticos que modulan el fenotipo pueden estar sobrerrepresentados o subrepresentados en las células seleccionadas. En algunos casos, las células también se ponen en contacto con una pluralidad (por ejemplo, aproximadamente 2, 3, 4, 5, 6, 7, 8, 9, 10, 15, 20, 25, 30, 50, 75, 100, 150, 200, 250, 300, 350, 400, 500, 750, 1000 o más) de sgRNA de control. Por ejemplo, los sgRNA de control pueden tener regiones de unión que no se unen a ninguna región genómica o transcripción. Alternativamente, los sgRNA de control pueden unirse a una región genómica que se sabe que no produce ni afecta el fenotipo de interés. Como otra alternativa, los sgRNA de control pueden afectar a un fenotipo de control alternativo.
[0282] El fenotipo puede ser crecimiento, supervivencia o proliferación celular. En algunos casos, el fenotipo es el crecimiento, la supervivencia o la proliferación celular en presencia de un agente, como un agente citotóxico, un oncogén, un supresor tumoral, un factor de transcripción, una quinasa (por ejemplo, un receptor de tirosina quinasa), un gen (por ejemplo, un gen exógeno) bajo el control de un promotor (por ejemplo, un promotor heterólogo), un gen de punto de control o un regulador del ciclo celular, un factor de crecimiento, una hormona, un agente que daña el ADN, un fármaco o un quimioterapéutico.
[0284] Por ejemplo, las células de prueba que contienen sgRNA y dCas9 se pueden cultivar en presencia de un factor de crecimiento como el factor de crecimiento epidérmico. Las células se pueden recolectar después de un período de cultivo suficiente. Los sgRNA, o polinucleótidos que codifican los sgRNA, se pueden extraer de las células y cuantificar mediante, por ejemplo, secuenciación. De este modo, se puede determinar la frecuencia de los sgRNA. Los sgRNA que aumentan el crecimiento, la proliferación, la viabilidad o la supervivencia celular en presencia del factor de crecimiento epidérmico se pueden identificar como aquellos que están sobrerrepresentados. Los sgRNA que disminuyen el crecimiento, la proliferación, la viabilidad o la supervivencia de las células en presencia del factor de crecimiento epidérmico se pueden identificar como aquellos que están subrepresentados. La sobrerrepresentación y la subrepresentación pueden ser relativas a su frecuencia en la biblioteca que estuvo en contacto con las células, relativas a la frecuencia de los sgRNA en las células (o una subpoblación de células) antes de la selección (o al principio del período de selección), o relativas a una frecuencia en células de control que no están sujetas a la selección o que están sujetas a una selección alternativa. De este modo, los elementos genéticos diana de dichos sgRNA sobrerrepresentados o subrepresentados pueden identificarse como elementos genéticos que modulan el fenotipo.
[0286] El fenotipo también puede ser expresión de proteínas, expresión de ARN, actividad de proteínas o motilidad celular, migración o invasividad. Por ejemplo, una pluralidad de células que expresan una proteína de superficie celular particular asociada con la malignidad tumoral se pueden poner en contacto con una pluralidad de sgRNA y moduladores transcripcionales dCas9 (activadores y/o represores). Las células pueden incubarse durante un tiempo suficiente para permitir la formación del complejo sgRNA:dCas9 y la modulación transcripcional. Las células pueden luego ponerse en contacto con un anticuerpo que reconoce la proteína de superficie celular asociada a la malignidad. El anticuerpo se puede utilizar para seleccionar células, o seleccionar contra células, que expresan la proteína de la superficie celular, por ejemplo, mediante clasificación celular activada por fluorescencia o utilizando purificación en fase sólida (por ejemplo, con proteína A agarosa). Los sgRNA que están sobrerrepresentados o subrepresentados en las células seleccionadas pueden identificarse como alteradores de la expresión de la proteína asociada a la malignidad en la superficie celular. Como otro ejemplo, la motilidad, migración o invasividad celular se pueden seleccionar utilizando una cámara de Boyden utilizando métodos conocidos en la técnica.
[0288] La frecuencia de sgRNA en células de prueba y/o de control que se cuantifican en varios métodos descritos en este documento se puede determinar de diversas maneras. En una realización, los sgRNA se cuantifican mediante secuenciación profunda. Como se utiliza en este documento, “secuenciación profunda” se refiere a la secuenciación altamente redundante de un ácido nucleico o una familia de ácidos nucleicos, como una familia de sgRNA o una familia de polinucleótidos que codifican sgRNA. La redundancia(es decir,La profundidad) de la secuenciación está determinada por la longitud de la secuencia a determinar (X), el número de lecturas de secuenciación (N) y la longitud de lectura promedio (L). La redundancia es entonces NxL/X. En el caso de los sgRNA, la longitud de la secuencia puede ser la longitud de la región de unión, la longitud completa del sgRNA o la longitud de una porción del sgRNA que contiene la región de unión. La profundidad de secuenciación puede ser, o ser al menos aproximadamente 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28, 29, 30, 31, 32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44, 45, 46, 47, 48, 49, 50, 51, 52, 53, 54, 55, 56, 57, 58, 59, 60, 70, 80, 90, 100, 110, 120, 130, 150, 200, 300, 500, 500, 700, 1000, 2000, 3000, 4000, 5000 o más. La secuenciación profunda puede proporcionar un número preciso de la frecuencia relativa de los sgRNA. La secuenciación profunda también puede proporcionar un alto nivel de confianza en que incluso los sgRNA que rara vez están presentes en una población de células (por ejemplo, Se puede identificar una población de células de prueba seleccionadas).
[0290] En algunas realizaciones, el cribado es un cribado de interferencia. En algunos casos, si el cribado es un cribado de interferencia, la pluralidad de células se puede poner en contacto con una biblioteca de sgRNA, en donde una mayoría, una mayoría sustancial o al menos el 90 % (por ejemplo, Al menos el 90, 95 o 99 %) de los sgRNA se dirigen al sitio de inicio del TSS de un gen, o en la dirección ascendente (5') del TSS de un gen. En algunos casos, una mayoría, una mayoría sustancial o al menos el 90 % (por ejemplo, Al menos el 90, 95 o 99 %) de los sgRNA se dirigen a una región entre, o entre aproximadamente, 0 y aproximadamente 750 pb en la dirección ascendente del TSS de un gen.
[0292] Si el cribado es un cribado de interferencia, la pluralidad de células puede ponerse en contacto con un dCas9 que contiene un dominio dCas9. La unión de un dominio dCas9 en complejo con un sgRNA puede interferir con la transcripción en o cerca del elemento genético al que se dirige (está unido a) el complejo sgRNA:dCas9. Sin querer limitarnos a ninguna teoría, se cree que el complejo sgRNA:dCas9 puede competir con la ARN polimerasa u otra maquinaria transcripcional para suprimir la transcripción en el elemento genético objetivo o cerca de él.
[0293] Alternativamente, si el cribado es un cribado de interferencia, la pluralidad de células puede ponerse en contacto con un dCas9 que contiene un dominio dCas9 fusionado a una o más copias de un represor transcripcional. Los represores transcripcionales ejemplares incluyen, sin limitación, un dominio KRA<b>, un dominio cromosombra, un dominio SID o un dominio de represión EAR (SRDX). El represor transcripcional puede optimizarse mediante codones para una expresión eficiente en la célula huésped.
[0295] Como otra alternativa, si el cribado es un cribado de interferencia, la pluralidad de células se puede poner en contacto con un dCas9 que contiene un dominio dCas9 fusionado a un dominio de fusión de epítopo. En tales casos, la pluralidad de células también puede ponerse en contacto con un agente de afinidad que tenga afinidad por el epítopo de la proteína de fusión del epítopo. El agente de afinidad puede contener un dominio de afinidad (por ejemplo, un scFv) o un dominio de afinidad fusionado a un represor transcripcional. La unión del complejo sgRNA:dCas9 a un elemento genético objetivo puede entonces reclutar una o más copias del agente de afinidad al sitio del elemento genético objetivo. En los casos en que el agente de afinidad no está fusionado a un represor transcripcional, el tamaño mejorado del complejo sgRNA:dCas9: agente de afinidad puede suprimir aún más la expresión en o cerca del elemento genético objetivo en relación con un complejo de sgRNA y un dominio dCas9. En los casos en que el agente de afinidad se fusiona a un represor transcripcional, el reclutamiento de múltiples copias del represor transcripcional puede suprimir aún más la expresión en o cerca del elemento genético objetivo en relación con los represores transcripcionales descritos previamente.
[0297] En algunas realizaciones, el cribado es un cribado de activación. En tales casos, la pluralidad de células se puede poner en contacto con una biblioteca de sgRNA, en donde una mayoría, una mayoría sustancial o al menos el 90 % (por ejemplo, Al menos el 90, 95 o 99 %) de los sgRNA se dirigen al sitio de inicio del TSS de un gen, o en la dirección descendente (3') del TSS de un gen. En algunos casos, una mayoría, una mayoría sustancial o al menos el 90 % (por ejemplo, Al menos el 90, 95 o 99 %) de los sgRNA se dirigen a una región entre, o entre aproximadamente, 0 y aproximadamente 1000 pb en la dirección descendente del TSS de un gen.
[0299] En algunos casos, cuando el cribado es un cribado de activación, la pluralidad de células puede ponerse en contacto con un dCas9 que contiene un dominio dCas9 fusionado a una o más copias de un activador transcripcional. Los represores transcripcionales ejemplares incluyen, sin limitación, un dominio de activación p65 (p65AD), o una o más copias de un dominio VP8, VP16 o VP64. El represor transcripcional puede optimizarse mediante codones para una expresión eficiente en la célula huésped.
[0301] Como otra alternativa, la pluralidad de células puede ponerse en contacto con un dCas9 que contenga un dominio dCas9 fusionado a un dominio de fusión de epítopo. En tales casos, la pluralidad de células también puede ponerse en contacto con un agente de afinidad que tenga afinidad por el epítopo de la proteína de fusión del epítopo. El agente de afinidad puede contener un dominio de afinidad fusionado a un activador transcripcional, como cualquiera de los activadores descritos en este documento. La unión del complejo sgRNA:dCas9 a un elemento genético objetivo puede entonces reclutar una o más copias del agente de afinidad al sitio del elemento genético objetivo. El reclutamiento de múltiples copias del agente de afinidad y, por lo tanto, de múltiples copias del activador transcripcional, puede activar aún más la expresión en el elemento genético objetivo o cerca de él, en relación con la activación proporcionada por un dCas9 fusionado a un activador transcripcional.
[0303] En algunas realizaciones, se puede realizar una activación y un cribado de interferencia al mismo tiempo. Por ejemplo, se pueden poner en contacto varias células con una biblioteca de sgRNA. La pluralidad de células puede además ponerse en contacto con moduladores de interferencia de dCas9 y moduladores de activación transcripcional de dCas9. Por ejemplo, la interferencia de dCas9 puede ser proporcionada por un dominio dCas9, un dominio dCas9 fusionado a un represor transcripcional, o un dCas9 fusionado a una proteína de fusión de epítopo y un agente de afinidad fusionado a un represor transcripcional. Como otro ejemplo, la interferencia puede ser proporcionada por una nucleasa Cas9 que corta o mella el ácido nucleico objetivo.
[0304] Como otro ejemplo, la activación de dCas9 puede ser proporcionada por un dominio dCas9 fusionado a un activador transcripcional, o un dCas9 fusionado a una proteína de fusión de epítopo y un agente de afinidad fusionado a un activador transcripcional. En algunos casos, una porción de la pluralidad de células puede contener un activador transcripcional dCas9 y una porción puede contener un represor transcripcional. Por lo tanto, los sgRNA que forman complejos con un activador pueden activar elementos genéticos específicos, y los sgRNA que forman complejos con un represor pueden reprimir elementos genéticos específicos.
[0306] Como otro ejemplo más, la pluralidad de células se puede poner en contacto con una biblioteca de sgRNA y una biblioteca de shRNA y un activador transcripcional dCas9. El activador transcripcional dCas9 puede ser un dominio dCas9 fusionado a un activador transcripcional o un dCas9 fusionado a un dominio de fusión de epítopo que está unido a una o más copias de un agente de afinidad fusionado a un activador transcripcional. De este modo, los shRNA reprimen elementos genéticos diana y los sgRNA activan elementos genéticos diana.
[0308] Luego, los sgRNA y/o shRNA que se dirigen a elementos genéticos que modulan un fenotipo se pueden identificar como se describe en este documento. Por ejemplo, se pueden identificar sgRNA y/o shRNA que están sobrerrepresentados o subrepresentados en células seleccionadas. En algunos casos, el método puede incluir además la asociación de si los sgRNA sobrerrepresentados o sobrerrepresentados se encuentran en células que proporcionan interferencia de dCas9 o activación de dCas9.
[0310] B. Identificación de dianas farmacológicas y compuestos líderes o terapéuticos
[0312] En este documento se describen métodos para identificar objetivos para el desarrollo de fármacos o identificar compuestos líderes. A modo de ejemplo, los métodos descritos en este documento se pueden utilizar para identificar genes diana o elementos genéticos cuya modulación transcripcional produce un fenotipo deseado. El objetivo identificado puede luego servir como objetivo para la identificación, selección o desarrollo de compuestos líderes.
[0314] En algunas realizaciones, el método incluye realizar una prueba de sgRNA, tal como cualquiera de las pruebas de sgRNA descritas en este documento, en una pluralidad de células utilizando una biblioteca de sgRNA, tal como cualquiera de los sgRNA o bibliotecas descritas en este documento para identificar un gen o elemento genético que modula un fenotipo. Por ejemplo, el fenotipo puede ser un crecimiento, proliferación, supervivencia o viabilidad de una célula tumoral. En algunos casos, la prueba puede identificar elementos genéticos cuya modulación transcripcional afecta el crecimiento, la proliferación, la supervivencia o la viabilidad de la célula tumoral. En algunos casos, los elementos genéticos codifican o regulan objetivos proteicos, o porciones de ellos, para los que se conocen inhibidores o activadores farmacéuticos. En algunos casos se conocen activadores o inhibidores, pero no son agentes farmacéuticos terapéuticos adecuados. En tales casos, los activadores o inhibidores pueden servir como compuestos líderes para el desarrollo posterior de agentes farmacéuticos terapéuticos.
[0316] En algunos casos, los elementos genéticos codifican o regulan objetivos proteicos o partes de ellos para los cuales aún no se han identificado activadores o inhibidores. Sin embargo, la identificación de los elementos genéticos puede permitir el desarrollo de métodos de cribado para la identificación o desarrollo de compuestos líderes y/o agentes farmacéuticos. Por ejemplo, el elemento genético, o una región genómica que contiene el elemento genético, puede estar vinculado operativamente a un gen indicador. La actividad del gen indicador se puede analizar en presencia de una gran cantidad de compuestos candidatos diferentes para identificar un compuesto principal.
[0318] C. Identificación de elementos genéticos en interacción
[0320] La identificación de interacciones genéticas (GI) entre conjuntos de elementos genéticos ha permitido la exploración sistemática de la función genética en varios organismos. En este documento se describen métodos para realizar análisis a gran escala e imparciales de interacciones genéticas por pares utilizando sgRNA. Por ejemplo, se puede poner en contacto una pluralidad de sgRNA con una pluralidad de células para identificar elementos genéticos objetivo de alta confianza para un fenotipo determinado y sgRNA efectivos. Se pueden construir bibliotecas de doble sgRNA a partir de esta lista de elementos genéticos objetivo de alta confianza para medir sistemáticamente los GI entre resultados.
[0322] En algunos casos, la pluralidad de sgRNA se puede seleccionar o diseñar para apuntar a cada gen, elemento genético o región genómica con múltiples sgRNA (por ejemplo, aproximadamente, o al menos aproximadamente, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24 o 25 sgRNA por gen objetivo, región genómica o elemento genético). Estas bibliotecas altamente complejas aumentan la probabilidad de apuntar a cada gen con varios sgRNA efectivos, reduciendo así la tasa de falsos negativos. Además, requerir varios sgRNA efectivos para identificar un gen impactado reduce la tasa de falsos positivos, ya que es poco probable que varios sgRNA dirigidos a un gen no impactado tengan efectos fuera del objetivo relevantes para el fenotipo de interés.
[0324] Por lo tanto, en algunos casos, la pluralidad de sgRNA se puede seleccionar o diseñar para apuntar a cada gen, elemento genético o región genómica con un número mínimo de sgRNA efectivos (por ejemplo, aproximadamente, o menos de aproximadamente, 25, 24, 23, 22, 21,20, 19, 18, 17, 16, 15, 14, 13, 12, 11, 10, 9, 8, 7, 6 o 5 sgRNA por gen objetivo, región genómica o elemento genético). Estas bibliotecas mínimamente complejas pueden resultar ventajosas para permitir un cribado eficiente y a gran escala. Por ejemplo, si se requieren 100 sgRNA por gen objetivo para una detección de alta confianza, una biblioteca debe ser 10 veces más grande que una biblioteca que requiere solo 10 sgRNA por gen objetivo para una detección de alta confianza.
[0326] La capacidad de generar rápidamente mapas GI puede identificar funciones genéticas previamente no reconocidas e informar el diseño de terapias combinadas basadas en pares sinérgicos. Por ejemplo, los pares de genes que exhiben letalidad sintética en células cancerosas, pero no en células sanas, son objetivos ideales para terapias combinadas destinadas a limitar la aparición de resistencia a medicamentos en células que evolucionan rápidamente. Como otro ejemplo, si un primer gen y un segundo gen forman una interacción genética sinérgica inesperada para un fenotipo indeseable (por ejemplo, crecimiento tumoral), entonces se puede diseñar una terapia combinada que inhiba ambos objetivos.
[0327] En algunas realizaciones, se espera que cada sgRNA de un par en una prueba de sgRNA doble contribuya de manera aditiva a un fenotipo de interés en ausencia de interacción genética. Así, por ejemplo, si un primer sgRNA único está subrepresentado en promedio en un 50 % después de la selección para un fenotipo de interés y un segundo sgRNA único está sobrerrepresentado en promedio en un 50 % después de la selección para un fenotipo de interés, entonces se esperaría que un par que no interactúe carezca de sobrerrepresentación o subrepresentación significativa. De este modo, los genes interactuantes, las regiones genómicas o los elementos genéticos se identifican como correspondientes a aquellos pares de sgRNA que están presentes después de un evento de selección como combinaciones por pares que se desvían en frecuencia de la relación aditiva esperada a partir de la frecuencia determinada en la selección inicial de sgRNA individual.
[0328] D. Identificación de reglas para la orientación óptima de elementos genéticos con CRISPR/Cas
[0329] En este documento se describen métodos para analizar la eficiencia de focalización de los sgRNA (por ejemplo, cortar, mellar, interferir o activar). Estos ensayos se pueden utilizar para desarrollar o descubrir reglas para un diseño de sgRNA óptimo u optimizado. En algunas realizaciones, se puede generar una biblioteca o grupo de sgRNA que se dirigen a un solo gen, región genómica o elemento genético. La biblioteca se puede utilizar para probar qué sgRNA producen un fenotipo deseado y/o tienen la mayor eficiencia de focalización. La secuencia del sgRNA (por ejemplo, La secuencia de la región de unión) y la información sobre el elemento genético objetivo se pueden combinar para descubrir reglas de diseño de sgRNA. En algunos casos, el grupo de sgRNA se puede diseñar para contener sgRNA con pares de bases no coincidentes para usarlos como controles o para determinar el efecto de los desajustes en la eficiencia de focalización de los sgRNA.
[0330] En algunos casos, el gen objetivo es un gen indicador (por ejemplo, que codifica una proteína fluorescente, una luciferasa o un gen que confiere resistencia a un agente de selección). En algunos casos, el gen indicador está presente en un plásmido. En otros casos, el gen indicador se integra en el genoma de una célula huésped. En algunos casos, analizar la eficiencia de la orientación del sgRNA contra un gen endógeno o heterólogo que se encuentra en el genoma de una célula huésped puede permitir el análisis o el descubrimiento de reglas específicas del contexto genómico para la orientación del sgRNA. Por ejemplo, se pueden examinar las reglas para la conformación óptima de la cromatina o el posicionamiento del sitio potenciador. En algunos casos, analizar la eficiencia de la focalización del sgRNA contra un gen episomal o basado en plásmidos puede permitir la generación de señales robustas para examinar variaciones sutiles en la eficiencia de la focalización.
[0331] IV. Kits
[0332] Se describen aquí kits para realizar la modulación transcripcional de sgRNA. Los kits se pueden utilizar para realizar pruebas de sgRNA como se describe en este documento. En una realización, el kit contiene un andamio de sgRNA y un polinucleótido que codifica una Cas9 o dCas9 (por ejemplo, un dCas9 activador o represor). En otra realización, el kit contiene una biblioteca de polinucleótidos que codifican sgRNA estructuralmente distintos y un polinucleótido que codifica un Cas9 o dCas9. En algunos casos, el kit contiene un polinucleótido que codifica un activador de dCas9 y un represor de dCas9. En algunos casos, el kit contiene un polinucleótido que codifica un agente de afinidad, como un agente de afinidad que tiene afinidad por un epítopo fusionado a un dominio dCas9. En algunos casos, un agente de afinidad que tiene afinidad por un epítopo fusionado a un dominio dCas9 se fusiona a un activador o represor transcripcional. En algunos casos, los polinucleótidos (por ejemplo, polinucleótidos que codifican sgRNA, o nucleasas mediadas por sgRNA) están en casetes de expresión y unidos operativamente a un promotor. En algunos casos, los casetes de expresión están en vectores adecuados. En algunos casos, uno o más de los vectores o casetes de expresión se encuentran en una célula huésped.
[0333] En algunos casos, el kit contiene una pluralidad de células huésped, cada célula contiene un casete de expresión que codifica un Cas9 o dCas9 y, opcionalmente, un casete de expresión que codifica un agente de afinidad. El kit puede contener además un andamio de sgRNA. El kit se puede utilizar para clonar una biblioteca de regiones de unión de sgRNA (por ejemplo, regiones de unión complementarias a) en el andamiaje de sgRNA y transforman la pluralidad de células huésped. Las células huésped se pueden seleccionar en función de un fenotipo de interés y, de ese modo, realizar cualquiera de las pruebas de sgRNA descritas en este documento.
[0334] Ejemplos
[0335] Los siguientes ejemplos pueden proporcionar enseñanzas que van más allá de la divulgación de la invención como tal, pero dichas enseñanzas se proporcionan para ubicar la invención real en un contexto técnico más amplio e ilustrar posibles desarrollos técnicos relacionados. La información técnica adicional que no cae dentro del alcance de las reivindicaciones adjuntas no es parte de la invención.
[0336] Ejemplo1 :sgRNA modulares
[0337] El sitioBIpIse introdujo en la región de horquilla 5' de un andamio de sgRNA. Se sintetizó una biblioteca de regiones de unión de sgRNA utilizando técnicas de síntesis en fase sólida. Las regiones de unión tienen un extremo 3' que se puede ligar a un sitio de corteBIpI.El andamio de sgRNA se cortó conBIpIy se purificó. Las regiones de unión sintetizadas se recuperaron y se ligaron al andamio de sgRNA de corte para producir una biblioteca de sgRNA.
[0339] Ejemplo 2: Sistema CRISPRi inducible
[0341] Se construyó un sistema CRISPRi inducible que permite el control dinámico de la expresión genética. Este conjunto optimizado de proteínas de fusión posiciona un dominio efector represor transcripcional (KRAB) en el extremo N utilizando un dominio enlazador optimizado y elimina la etiqueta fluorescente de dCas9 a través de un péptido de autoescisión. El sistema CRISPRi optimizado muestra una actividad mejorada de 4 a 15 veces en un indicador GFP El sistema CRISPRi implica la administración de 3 genes o productos genéticos (por ejemplo, un sgRNA optimizado, un transactivador de tet y un constructo represor dCas9 inducible por tet).
[0342] Ejemplo 3: Sistema inducible para la multimerización de dominios efectores en el ADN con CRISPR
[0343] Se construye un sistema Cas9 inducible para la multimerización controlable de dominios efectores en el ADN. Este sistema implica la entrega de 4 genes o productos genéticos (por ejemplo, un sgRNA optimizado, un transactivador de tet y la proteína de fusión del epítopo dCas9-GCN4 inducible por tet, y un anticuerpo de fragmento de cadena variable de cadena única recombinante que se une al epítopo GCN4 fusionado a sfGFP y VP64 (scFVVP64)).
[0345] La activación se puede ajustar a un nivel deseado variando la cantidad de epítopos GCN4 en la proteína de fusión dCas9-GCN4. Se construyen proteínas de fusión con 6, 10 o 24 copias de epítopos (sitios de unión de anticuerpos). La relación entre la proteína dCas9 y scFVVP64 también se puede ajustar, por ejemplo, mediante la selección adecuada de promotores e inductores. La concentración de anticuerpo y proteína efectora normalmente debe superar la concentración de la proteína de fusión dCas9 por la cantidad de sitios de unión del epítopo en la fusión dCas9. Por ejemplo, una construcción que expresa al menos 10 veces más scFV-VP64 que dCas9-10xGCN4 puede, en teoría, saturar cada proteína de fusión dCas9-10xGCN4 con dominios efectores entregados por anticuerpos. Este sistema de fusión dCas9 inducible se puede expresar en ausencia de doxiciclina para lograr niveles de proteína de fusión dCas9 suficientemente bajos.
[0347] Estabilidad de los anticuerpos intracelulares (por ejemplo, macroagregación o microagregación) en presencia y/o ausencia de dCas9 también se pueden optimizar. Una fusión de anticuerpos con solubilidad y estabilidad optimizadas se obtiene seleccionando clones de células utilizando una función de discriminación con reglas definidas para los niveles adecuados y la localización del anticuerpo. Una expresión excesiva o insuficiente de anticuerpos puede dar lugar a un sistema de multimerización no funcional.
[0349] Para optimizar un sistema de multimerización funcional, se utilizan datos de citometría de flujo de células individuales para seleccionar una serie de construcciones candidatas para lograr un nivel de expresión, estabilidad y actividad adecuados. Se analizan genes de prueba como CXCR4, que está desactivado en las células K562, para determinar su activación en una población de células con diferentes proteínas de fusión dCas9GCN4 y diferentes anticuerpos scFV. Se mide tanto la activación media como la mediana de la transcripción para determinar los niveles de expresión óptimos de los componentes del sgRNA:dCas9:agente de afinidad para activar de forma óptima la transcripción en todas las células. Se consigue una inducción de 50 veces en proteínas de genes que están completamente desactivados, como CXCR4 en células K562. La activación es unimodal y sólo alrededor del ~2 % de las células muestran una activación débil o nula.
[0351] Ejemplo 4: Establecimiento de reglas para la orientación del sgRNA
[0353] Se construyó un grupo complejo de ~55.000 sgRNA dirigidos a 10 kb alrededor de los sitios de inicio de la transcripción de 50 genes que se sabe que influyen en la resistencia/sensibilidad a la toxina ricina. Este grupo (o “biblioteca”) incluía todos los sgRNA posibles de entre 19 y 25 pb de longitud, comenzando con una G (para una transcripción eficiente) y teniendo una región de unión (y por lo tanto una secuencia objetivo correspondiente que termina inmediatamente antes de un NGG (un motivo adyacente al protoespaciador paraStreptococcus pyogenesCas9). Se espera que sgRNA que tuvieran sitios de unión fuera del objetivo significativos en otras partes del genoma. Esto se hizo estableciendo una métrica de puntuación de la siguiente manera: PAM G1 = 40; PAM G2 = 19; PAM N = 0; Región I = 28; Región II = 19; Región III = 10. La unión fuera del objetivo en cualquier sitio determinado se puede estimar como:
[0355] 1-suma(desajustes*puntuación de desajuste)/40. Para su inclusión en esta biblioteca, ninguna discordancia fue mayor a 0. La biblioteca también incluyó aproximadamente 1000 sgRNA diseñados contra secuencias objetivo desordenadas que se estimó que no tenían ningún sitio de unión en ninguna parte del genoma como controles negativos.
[0357] La biblioteca se probó en células K562 que expresaban dCas9, dCas9-Krap, dCas9-VP64 y Cas9 activa por nucleasa, impulsada por promotores constitutivos e inducibles por tretaciclina, y se analizó la sensibilidad a la ricina como se describe (Bassik et al., Cell. Feb 14, 2013; 152(4): 909-922; Kampmann et al., Proc Natl Acad Sci U S A. Jun 18, 2013; 110(25): E2317-E2326).
[0358] Estas pruebas establecieron reglas para seleccionar sgRNA que son críticos para la represión mediada por KRAB y la detección de la activación mediada por VP64, como se describe aquí. Al buscar la ventana óptima para la represión mediada por dCas9-Krab, se determinó que una ventana de 50 pb en la dirección ascendente del sitio de inicio de la transcripción (TSS) a 300 pb en la dirección descendente era la más efectiva, y una ventana de 50 a 400 pb en la dirección ascendente del TSS era la más efectiva para la activación mediada por dCas9.
[0359] Se probó la longitud de las regiones de unión de sgRNA y se determinó que las guías más cortas de 19-21 pb son más efectivas que las guías más largas.
[0360] Se determinó que las transcripciones de conjunto anotadas mediante el proceso APPRIS tenían más probabilidades de exhibir un fenotipo.
[0361] Se encontró que los sgRNA que contienen regiones de unión con cuatro o más nucleótidos consecutivos son generalmente perjudiciales, siendo el supuesto terminador PolIII poli-U el peor y el poli-C el menos.
[0362] La fuerza de la guía (graficada como puntuación Z) generalmente es consistente en un rango de porcentaje de GC (eje x), pero se determinó que los valores extremadamente altos o bajos eran peores en promedio.
[0363] Los sgRNA superpuestos o casi superpuestos (con una separación de 0-0 y de 1 a 4 pb) se enriquecieron con fenotipos que tienen poca o ninguna diferencia, lo que sugiere que las bibliotecas deberían diseñarse para imponer una separación de al menos 5 pb entre las secuencias objetivo de sgRNA.
[0364] Los sgRNA que se dirigen a secuencias con una señal de MNasa-seq baja se correlacionaron con puntajes Z guía promedio más fuertes, lo que indica que los sgRNA deberían dirigirse a elementos genéticos con una señal de MNasa-seq baja.
[0365] Se observó una fuerte concordancia entre la señal PolII ChIP-seq publicada por ENCODE y el fenotipo CRISPRi, lo que sugiere que los sgRNA CRISPRi deberían dirigirse a regiones donde la señal PolII ChIP-seq es alta. De manera similar, como gran parte de la señal de PolII en el TSS no está asociada con la transcripción productiva, el filtrado donde PolII es más activo con datos publicados de secuenciación global Run-on (GRO-seq) refinó aún más las reglas de orientación de sgRNA. La aplicación de un umbral para la longitud de la guía junto con las señales MNasa, PolII y GRO-seq, cada una sola o en combinación, mejoró El puntaje Z media de las guías hasta 10 veces.
[0366] Ejemplo 5: Utilización de reglas de selección de sgRNA establecidas en una máquina de vectores de soporte
[0367] Las reglas establecidas en el Ejemplo 4 se utilizaron para entrenar una máquina de regresión de vectores de soporte (SVR) para predecir las guías más activas para cada gen en el genoma de una célula objetivo. Se utilizaron la posición de la guía, la longitud, la señal PolII y la señal MNasa para entrenar el SVR en el 25 % de los datos. Se realizó una validación cruzada del SVM omitiendo cada gen y probando la capacidad de la máquina para predecir la actividad de sgRNA para ese gen basándose en los otros genes en el conjunto de entrenamiento. La selección de 25 guías superiores por gen predichas por el SVR versus 24 shRNA dio valores p más fuertes en casi todos los casos para CRISPRi y CRISPRa.
[0368] Ejemplo 5: Multimerización de proteínas CRISPRa
[0369] Las células se pusieron en contacto con un sgRNA, una fusión de epítopo dCas9-10x y una fusión scFv-VP64 con afinidad por el epítopo. Las células K562 en contacto con dCas9-GCN4-10x y scFv-sfGFP-VP64 y 1,2 o 3 sgRNA diferentes dirigidos al locus CXCR4 muestran una fuerte inducción de la activación de CXCR4. Las células en contacto con la fusión dCas9-VP64 y 1, 2 o 3 sgRNA diferentes dirigidos al locus CXCR4 muestran una activación moderada de CXCR4. Las células K562 en contacto con 3 sgRNA diferentes dirigidos al locus CXCR4 y scFv-sfGFP-VP64 exhiben una fuerte expresión de CXCR4 en la superficie celular como se demuestra mediante citometría de flujo. Las células en contacto con la fusión dCas9-VP64 y 3, 2 o 1 sgRNA diferentes dirigidos al locus CXCR4 y scFv-sfGFP-VP64 muestran niveles crecientes de migración celular.Ejemplo 6
[0370] I. Resumen
[0371] Si bien el catálogo de transcripciones de mamíferos y sus niveles de expresión en diferentes tipos de células y estados de enfermedad se está expandiendo rápidamente, nuestra comprensión de su función está muy rezagada. Se presenta aquí una tecnología robusta que permite la investigación sistemática de las consecuencias celulares de reprimir o inducir cualquier transcripción. Se identificaron reglas para la orientación eficiente y específica de represores transcripcionales (CRISPRi) o activadores (CRISPRa) a genes endógenos a través de Cas9 deficiente en endonucleasas, lo que permite la modulación de la expresión en un rango de ~1000 veces. Utilizando estas reglas, se construyó una biblioteca CRISPRi a escala del genoma y se validó con dos pantallas agrupadas. Una prueba basada en el crecimiento identificó de manera sólida conjuntos de genes esenciales. Una prueba de sensibilidad a una toxina de fusión del cólera y la difteria proporcionó información amplia sobre los mecanismos moleculares de entrada de la toxina, la retrotranslocación y la toxicidad. Es importante destacar que CRISPRi tiene efectos mínimos fuera del objetivo, reprime enérgicamente la transcripción (normalmente alcanzando entre el 90 y el 99 %) y es no tóxico y reversible. Juntos, CRISPRi y CRISPRa representan herramientas clave para definir la función genética en los metazoos.
[0372] II. Introducción
[0374] Los espectaculares avances en la tecnología de secuenciación han catalogado un universo de transcripciones de ARN (que superan ampliamente el número de marcos de lectura abiertos (ORF) codificantes de proteínas canónicas) que colectivamente son responsables de llevar a cabo la instrucción codificada en el genoma (ID de PubMed: 22955620, 24670764, 20220758, 24037378, 19812545). Un desafío central ahora es comprender el papel biológico de estas transcripciones y cómo las diferencias cuantitativas en su expresión definen los estados celulares en el desarrollo normal y en la enfermedad. A pesar de los intensos esfuerzos, la función de muchos genes codificadores de proteínas sigue estando mal definida, y se sabe aún menos sobre los roles biológicos de la mayoría de las transcripciones no canónicas, como los a Rn potenciadores, los ARN antisentido ascendentes, los lncRNA u otros ARN intergénicos (ID de PubMed: 24679528, 24267885). Los esfuerzos para abordar esta deficiencia en nuestro conocimiento se verían enormemente facilitados por técnicas capaces de controlar de forma dinámica y precisa la expresión de transcripciones individuales.
[0376] Una forma de explorar la función genética es interrumpir la expresión de la transcripción mediante eliminación o represión. Sin embargo, la herramienta dominante para la supresión programada de ARNm, la interferencia de ARN (RNAi), tiene problemas generalizados con efectos fuera del objetivo, que pueden ser especialmente confusos en el contexto de análisis a gran escala (ID de Pubmed: 23394947, 16929316, 15042091, 15960972, 17572676, 19012953, 12754523, 22344029). Además, debido a que el RNAi está mediado por proteínas argounauta citoplasmáticas, el silenciamiento génico a través de este enfoque es el más adecuado para el agotamiento de los objetivos del ARNm citosólico.
[0378] Una estrategia alternativa emergente son los métodos de edición genómica programable que eliminan o modifican permanentemente el ADN utilizando endonucleasas específicas de secuencia y diseñables, como las proteínas de dedo de zinc, TALEN o CRISPR (repeticiones palindrómicas cortas agrupadas y regularmente interespaciadas)/Cas9 (proteína 9 asociada a CRISPR) (ID de PubMed: 20717154, 20660643, 21179091, 22745249, 23386978, 23287718, 23287722, 23360966, 23360964, 23360965, 23643243). Una serie de estudios elegantes explotaron recientemente la naturaleza fácilmente programable de Cas9, en la que la especificidad está determinada por un ARN guía corto (sg), para permitir pruebas de pérdida de función en todo el genoma (ID de Pubmed: 24336569, 24336571,24535568, 24717434). Estos establecieron el corte CRISPR como una poderosa tecnología de detección complementaria al RNAi (especialmente cuando se necesitan inactivaciones completos para ver fenotipos) o las pruebas de mutagénesis haploide (ID de Pubmed: 19965467). Sin embargo, los métodos de detección basados en la edición del genoma se centran actualmente en estudios de pérdida de función que implican alteraciones irreversibles del marco de lectura, lo que limita su utilidad para el estudio de genes esenciales y ARN no codificantes. Además, las roturas del ADN bicatenario pueden ser citotóxicas (ID de Pubmed: 24584192, 12016139, 11048728. 8643488). Finalmente, la formación de indeles a partir de reparaciones de ADN propensas a errores a menudo conduce a deleciones o inserciones dentro del marco variables y cortas, lo que limita la capacidad de desactivar de manera confiable todos los alelos de un gen.
[0380] Una proteína de unión al ADN programable que puede reclutar un dominio efector para activar y desactivar la transcripción de manera dinámica y cuantitativa ofrece, en principio, una herramienta más flexible para interrogar las numerosas transcripciones en genomas complejos. Experimentos pioneros con proteínas de dedo de zinc quiméricas y TALE diseñadas y fusionadas a dominios efectores de transcripción demuestran que este enfoque puede modular la transcripción de genes endógenos (ID de Pubmed: 9843940, 10660690, 21248753, 23664777, 23396285, 23377379, 23877069). Sin embargo, como cada objetivo de transcripción requiere una proteína de fusión única, ampliar estos métodos a escala del genoma es arduo.
[0382] Recientemente, se han utilizado proteínas de fusión Cas9 catalíticamente inactivas (dCas9) guiadas por sgRNA específicos de genes para localizar dominios efectores en secuencias de ADN específicas para reprimir (CRISPRi) o activar (CRISPRa) la transcripción de genes objetivo (ID de Pubmed: 23452860, 23849981, 24360272, 23979020, 23892898, 23977949, 23892895, 23761437, 23907171). Hasta la fecha, se ha probado una cantidad muy pequeña de sgRNA, lo que deja sin respuesta si CRISPRi/a es una estrategia viable para interrogar globalmente la función genética y, de ser así, cuál es la mejor manera de apuntar a un gen para activar o reprimir la transcripción mientras se minimizan los efectos fuera del objetivo.
[0384] Aquí se describe el desarrollo y la aplicación de un método para la modulación de alta especificidad y de todo el genoma de la transcripción de genes endógenos en células humanas utilizando CRISPRi/a. Para lograr esto, se realizó un cribado de saturación en la que se probó la actividad de cada sgRNA no redundante que se extiende a lo largo de 49 kilobases de ADN alrededor de los sitios de inicio de la transcripción de 49 genes que se sabe que modulan la susceptibilidad celular a la ricina. A partir de esto, se extrajeron reglas distintas sobre cómo y dónde CRISPRi o CRISPRa cambian al máximo la expresión de genes endógenos en células humanas, así como reglas para predecir efectos fuera del objetivo, proporcionando un algoritmo para diseñar una biblioteca a escala del genoma dirigida a cada gen con 10 sgRNA. Esta biblioteca se validó primero mediante la detección de genes esenciales para el crecimiento o la supervivencia celular y, en un segundo experimento, mediante la detección de genes que regulan la respuesta a una toxina de fusión quimérica del cólera y la difteria (CTx-DTA) (22123862). El primero enriquece de forma robusta las categorías conocidas de genes esenciales y el segundo proporciona información exhaustiva sobre los mecanismos moleculares de la intoxicación por CTx-DTA. Estos experimentos demuestran que nuestra plataforma de detección CRISPRi/a es sólida y muestra una reproducibilidad y actividad muy altas con una toxicidad intrínseca indetectable.
[0386] De manera más general, estos experimentos establecen que el control transcripcional CRISPRi/a es inducible, reversible y puede apuntar a genes esenciales. CRISPRi y CRISPRa se pueden utilizar para controlar los niveles de transcripción de genes endógenos en un alto rango dinámico (hasta ~1000 veces). También se proporciona amplia evidencia de que los reactivos CRISPRi/a diseñados adecuadamente muestran una especificidad exquisita. Como tal, este método representa una herramienta transformadora para definir la función de la transcripción en toda la amplitud de las transcripciones codificadas por el genoma humano.
[0387] III. Resultados
[0389] A. Un cribado en mosaico de alto rendimiento define las reglas para la actividad CRISPRi en genes endógenos
[0390] CRISPRi puede reprimir la transcripción bloqueando directamente la actividad de la ARN polimerasa (dCas9) o mediante el silenciamiento transcripcional mediado por el dominio efector (dCas9-KRAB). Para comprender y optimizar mejor la actividad CRISPRi, se utilizó un análisis agrupado de alto rendimiento para definir reglas que determinan la represión CRISPRi de genes endógenos. 49 genes que previamente habían demostrado modular la susceptibilidad celular a la toxina AB ricina (Pubmed ID: 23394947) fueron el objetivo. El fenotipo de resistencia (protector o sensibilizante) para estos 49 genes había sido catalogado previamente mediante la eliminación mediada por RNAi en células K562, mostrando que la cantidad de represión genética para estos genes típicamente tiene una relación monótona, casi lineal, con el fenotipo de resistencia a la ricina. Esta observación permitió el uso de un puntaje de resistencia a la ricina calculado midiendo las frecuencias de sgRNA en un cribado agrupada para medir cuánto dCas9 o dCas9-KRAB reprimieron la transcripción de miles de sgRNA.
[0392] Utilizando una síntesis masiva de oligonucleótidos en paralelo, se generó una biblioteca de sgRNA que teseló el ADN en una ventana de 10 kilobases alrededor del sitio de inicio de la transcripción de estos 49 genes (54,000 sgRNA en total) (ID de Pubmed: 19448642) (Figura 1A). Se predijo que los sgRNA tendrían actividad fuera del objetivo y se excluyeron según un puntaje provisional que se desarrolló utilizando datos de la actividad Cas9 y dCas9 publicada en sitios de unión de ADN casi consensuados que contienen desajustes (consulte a continuación una medida empírica de especificidad) (ID de Pubmed: 23873081, 23792628, 23452860). Este corte filtró la mayoría de los sgRNA asignados a elementos SINE o LINE repetitivos. Para determinar cómo la longitud del sgRNA afecta la función CRISPRi, se incluyeron sgRNA de entre 19 y 25 pares de bases de longitud, incluidos sgRNA de longitud variable superpuestos que comparten el mismo motivo adyacente al protoespaciador (PAM). También se incluyeron 1.000 sgRNA de control negativo que se seleccionaron según los mismos principios que los sgRNA específicos, pero que se derivaron de secuencias pseudogenómicas desordenadas y se predijo que no se dirigirían a ningún sitio en el genoma humano.
[0394] Esta biblioteca de prueba de sgRNA se empaquetó en partículas lentivirales y se utilizó para transducir células de leucemia mieloide humana K562 que expresan de forma estable dCas9 o una proteína de fusión dCas9-KRAB (ID de Pubmed: 23849981). Para garantizar que la mayoría de las células no expresaran más de un sgRNA, la multiplicidad de infección se limitó a 0.3. Las poblaciones de células que expresan esta biblioteca de sgRNA se recolectaron al comienzo del experimento, se cultivaron en condiciones estándar o se trataron con ricina. Se realizaron dos réplicas biológicas de cada pantalla. Luego se contó la frecuencia de cada sgRNA en la biblioteca después del crecimiento en cada condición utilizando secuenciación profunda para determinar cómo cada sgRNA en la biblioteca modula el crecimiento celular y la susceptibilidad celular a la ricina, fenotipos que se definieron cuantitativamente como gamma y rho, respectivamente (ver Figura 8 y Pubmed ID: 23739767).
[0396] La inspección inicial de los datos reveló que muchos sgRNA reprimen potentemente la expresión genética, como lo demuestra su impacto en la sensibilidad a la ricina (Figura 1C y Figura 9A). Al representar gráficamente estos datos para los 49 genes, se mostró que los sgRNA activos se agrupan alrededor o justo en la dirección descendente del sitio de inicio de la transcripción de cada gen para dCas9-KRAB y dCas9, respectivamente (Figura 1D). Este patrón de actividad es consistente con el dominio KRAB actuando como un represor de la transcripción y dCas9 inhibiendo la transcripción al interferir con la actividad de la ARN polimerasa (ID de Pubmed: 23452860, 23849981).
[0397] Se obtuvo una fuerte actividad CRISPRi al apuntar dCas9-KRAB a una ventana de ADN de -50 a 350 pb en relación con el sitio de inicio de la transcripción de un gen, con un máximo en la región de ~50-100 pb justo en la dirección descendente del TSS (Figura 1B, D). Esto sugirió que la actividad óptima aprovecha la actividad combinada de la interferencia de dCas9 junto con la represión del dominio KRAB. También se observó que los sgRNA con longitudes de protoespaciador de 18-21 pares de bases eran significativamente más activos que los sgRNA que contenían protoespaciadores más largos (Figura 9B). Los homopolímeros de nucleótidos tuvieron un efecto fuertemente negativo en la actividad del sgRNA (Figura 9C). Sin embargo, ni la cadena de ADN seleccionada ni el contenido de GC de sgRNA en un amplio rango se correlacionaron fuertemente con la actividad de sgRNA (Figura 9D-E).
[0399] Para evaluar la viabilidad de los análisis genéticos de todo el genoma basados en CRISPRi, se comparó la fuerza de los fenotipos obtenidos con CRISPRi con una biblioteca de RNAi publicada previamente, aplicando las reglas descritas anteriormente y luego submuestreando aleatoriamente los datos de la biblioteca de mosaico de sgRNA para seleccionar conjuntos de 10 sgRNA. Se calculó un puntaje z de fenotipo normalizado dividiendo los fenotipos medios de cada gen por la desviación estándar de los fenotipos de los sgRNA del conjunto de control no objetivo (Figura 8). Se observaron fenotipos de ricina significativos para cada uno de los 49 genes. Además, en prácticamente todos los casos el fenotipo de ricina normalizado fue más fuerte (en muchos casos mucho más fuerte) que el observado con una biblioteca de shRNA de tamaño comparable (generada mediante un submuestreo de nuestros datos publicados). Por lo tanto, CRISPRi supera significativamente a la biblioteca de RNAi publicada (Figura 1E y Figura 9F). Como se analiza más adelante, esto se debe a una combinación de alta eficacia y bajos efectos no deseados.
[0401] B. El silenciamiento transcripcional CRISPRi es altamente sensible a los desajustes entre el sitio de ADN objetivo y el sgRNA
[0403] Para definir reglas para la actividad fuera del objetivo de CRISPRi en genes endógenos, se seleccionó un conjunto de sgRNA altamente activos de la biblioteca de prueba. Para cada uno de estos sgRNA, se probó la actividad de una serie de sgRNA derivados con un número y posición variables de desajustes (Figura 2). Este experimento permitió medir la cantidad de represión de genes fuera del objetivo para sgRNA con apareamiento de bases incorrecto en relación con sgRNA para los que se estableció una alta actividad en el objetivo. Incluso un único desajuste en el extremo 3' del protoespaciador disminuyó la actividad CRISPRi, mientras que los sgRNA que pasaron el filtro bioinformático fuera del objetivo mostraron muy poca actividad (Figura 2 y Figura 10). Las proteínas dCas9 y dCas9-KRAB mostraron una mayor sensibilidad a los desajustes entre el sgRNA y el ADN objetivo que la observada con la eliminación de genes mediada por Cas9. A partir de este análisis, se concluyó que CRISPRi tiene una actividad mínima de represión transcripcional fuera del objetivo en sitios con 3 o más desajustes, incluso si el sitio de unión de sgRNA está cerca de un sitio de inicio de la transcripción (Figura 2).
[0405] C. Un cribado de alto rendimiento en mosaico define reglas para la actividad CRISPRa en genes endógenos
[0406] dCas9 fusionado al dominio VP16 del virus del herpes puede activar la transcripción cuando se dirige en la dirección ascendente del sitio de inicio de la transcripción de un gen (ID de Pubmed: 23849981). Los experimentos iniciales de CRISPRa sugirieron que una activación robusta de la transcripción requería múltiples sitios de unión de sgRNA en el promotor de un gen o múltiples sgRNA dirigidos a un promotor, lo que limitaría la utilidad de CRISPRa para las pruebas basadas en bibliotecas (ID de PubMed: 23849981, 23979020, 23892898, 23977949, 23892895, 23907171). Sin embargo, existe un método CRISPRa mejorado, denominado sunCas9, en el que la expresión de un único sgRNA con un sitio de unión es suficiente para activar de forma robusta la transcripción. En el sistema sunCas9, una única proteína de fusión dCas9 unida al ADN recluta múltiples copias del dominio efector activador, amplificando así nuestra capacidad de inducir la transcripción.
[0407] Para definir las reglas para CRISPRa, se utilizó la biblioteca de mosaicos dirigida a genes que modulan la sensibilidad celular a la ricina para definir cómo y dónde CRISPRa activa la transcripción. Anteriormente se había demostrado que para 5 de los 49 genes de esta biblioteca de mosaicos, la eliminación y la sobreexpresión del plásmido daban como resultado fenotipos de ricina opuestos. Por ejemplo, la eliminación de SEC23A sensibilizó a las células a la ricina, mientras que la sobreexpresión de SEC23A desensibilizó a las células a la ricina. Esta observación proporcionó genes de control positivo interno para la actividad CRISPRa (ID de Pubmed: 23394947).
[0409] Las células K562 se transdujeron para expresar de forma estable el sistema sunCas9 (Figura 3A) con la biblioteca de mosaico sgRNA y se analizaron para detectar fenotipos de ricina como se describió anteriormente para CRISPRi. El análisis de datos de genes individuales o datos promedio de los 49 genes demostró que muchos sgRNA de cada gen afectaban la resistencia a la ricina, lo que sugiere que muchos sgRNA activan potentemente la expresión genética (Figura 3B y Figura 11A-B). Es importante destacar que los sgRNA de control negativo mostraron muy poca actividad y no se correlacionaron entre los exámenes de réplica biológica, lo que sugiere que la actividad CRISPRa es específica. Se observó un pico de sgRNA activos para CRISPRa entre -400 y -50 pb en la dirección ascendente del sitio de inicio de la transcripción (Figura 3B). Este patrón de actividad se ajusta a un modelo en el que cada dominio VP16 puede unirse al complejo mediador y reclutar maquinaria de transcripción basal, que activa la transcripción cuando está espaciada apropiadamente desde un sitio de inicio de transcripción (ID de Pubmed: 14657022). Con este sistema se pueden activar genes que están poco expresados y aumentar la expresión de genes bien expresados. En algunos casos, cuando un gen bien expresado está sólo modestamente activado, este aumento en la expresión genética puede modular fuertemente la sensibilidad celular a la ricina. Estas pantallas de mosaico CRISPRi/a proporcionaron reglas sobre cómo CRISPRi/a controla la expresión de genes endógenos. Estas bibliotecas de sgRNA en mosaico podrían usarse como herramienta para evaluar la actividad y especificidad de futuras proteínas de fusión dCas9 o iteraciones adicionales de CRISPRi/a.
[0411] D. Una serie alélica CRISPRi/a de activación y represión de transcripciones demuestra que la abundancia de proteínas modula dinámicamente la respuesta celular a la ricina.
[0413] Para muchos genes, se desconoce cómo se relaciona la abundancia relativa de la proteína codificada con su función. Se observó una fuerte anticorrelación en nuestras pruebas de ricina entre los fenotipos CRISPRa y los fenotipos CRISPRi o RNAi para genes individuales (Figura 3C). Este resultado sugiere que la abundancia de muchas proteínas puede modular tanto la resistencia como la sensibilidad a una toxina. Como los genes seleccionados por la biblioteca de prueba se seleccionaron en función de un fenotipo de supresión, todos los genes mostraron fenotipos en el cribado CRISPRi, pero solo un subconjunto mostró fenotipos en el cribado CRISPRa. Ningún gen muestra el mismo fenotipo cuando se sobreexpresa que cuando se reprime.
[0415] Los resultados de las pruebas CRISPRi y CRISPRa se validaron de la siguiente manera. Se seleccionó una serie alélica de sgRNA por fenotipo a partir del cribado y cada sgRNA se volvió a analizar individualmente. Para cada sgRNA, se cuantificaron tanto los fenotipos de ricina como el cambio en la abundancia de la transcripción objetivo (Figura 3D-E). Los resultados muestran que las pruebas CRISPRi/a produjeron puntajes fenotípicas confiables que se reprodujeron de manera sólida en experimentos de nueva prueba. CRISPRi/a puede activar y reprimir la transcripción de genes endógenos en un amplio rango dinámico (hasta ~1000 veces) (Figura 3E). De este modo, CRISPRi/a se puede utilizar para producir una serie alélica de sobreexpresión y supresión de genes endógenos, lo que permite la interrogación sistemática de cómo la dosis genética controla las funciones celulares de interés (Figura 3D-E).
[0417] E. Una plataforma de cribado CRISPRi robusta y altamente específica a escala genómica
[0419] Los resultados de la prueba de detección CRISPRi demostraron la capacidad de seleccionar sgRNA activos con baja actividad fuera del objetivo y proporcionaron un conjunto de reglas que permiten el diseño de una biblioteca de sgRNA robusta a escala del genoma. Se eligió un tamaño de biblioteca de 10 sgRNA/gen por las siguientes razones. Más de la mitad de los sgRNA que cumplen estas reglas dieron fenotipos de ricina claros, lo que sugiere que, para una biblioteca con 10 sgRNA por gen, el 94 % de los genes tendrían 2 o más sgRNA altamente activos. Además, la validación mediante qPCR de la serie alélica CRISPRi para ST3GAL4 demostró que el 40 % de los sgRNA seleccionados por nuestro algoritmo de actividad mostraron una reducción de al menos 10 veces en la expresión del gen objetivo. Finalmente, el submuestreo computacional de los datos fenotípicos de los datos de sgRNA de la biblioteca de mosaico a 10 sgRNA por gen y el cálculo de los valores p para los genes coincidentes indicaron que una biblioteca con 10 sgRNA por gen detectaría de manera confiable los genes coincidentes.
[0421] Se sintetizó y clonó una biblioteca de sgRNA CRISPRi a escala del genoma dirigida a 15,997 genes codificadores de proteínas humanas (10 sgRNA por TSS, dirigida a 19,000 TSS) con 11,000 sgRNA de control no dirigidos para un total de 211,894 sgRNA. Los sgRNA de biblioteca se diseñaron como protoespaciadores de 18-21 pares de bases que apuntan al sitio (o sitios) de inicio de la transcripción de cada gen en una ventana de -50 a 350 pares de bases con reglas de espaciado para evitar secuencias de sgRNA superpuestas y excluir sgRNA con actividad fuera del objetivo prevista según lo definido por el análisis de series de sgRNA de desajuste.
[0423] La biblioteca se evaluó mediante una primera selección de genes esenciales para el crecimiento celular en células K562s. Brevemente, la biblioteca CRISPRi a escala del genoma se transdujo (usando lentivirus) en células K562 que expresaban de manera estable dCas9-KRAB. Luego se examinó toda la biblioteca a escala del genoma cultivando células durante 10 días con una cobertura de biblioteca mínima de 3,750 veces en un solo matraz agitador. Se realizaron dos réplicas biológicas para estimar la variación.
[0425] Para caracterizar la metodología de selección y el diseño de la biblioteca, se examinó la correlación entre las réplicas de selección y las distribuciones de control negativo. Los fenotipos de sgRNA observados en cada réplica biológica estaban sorprendentemente bien correlacionados, lo que indica que la prueba es altamente reproducible (Figura 4A). Los sgRNA individuales mostraron un agotamiento dramático (hasta 256 veces) durante un análisis de 10 días, lo que demuestra que los sgRNA individuales pueden tener efectos profundos en el crecimiento celular. La distribución de los sgRNA de control negativo fue muy estrecha con poca correlación entre las réplicas, lo que sugiere que la actividad fuera del objetivo de estos controles es muy baja (Figura 4A). Si bien el 99.7 % de los controles negativos estaban esencialmente inactivos, una cantidad muy pequeña de sgRNA mostró una actividad significativa que se correlacionó entre los análisis replicados.
[0426] Para explorar más a fondo la prevalencia de efectos fuera del objetivo, se examinaron dos clases de genes que no deberían mostrar ninguna actividad en el objetivo en la prueba: los receptores olfativos y los genes del cromosoma Y Los sgRNA que se dirigen a estos genes se diseñaron y seleccionaron de la misma manera que el resto de la biblioteca; sin embargo, los receptores olfativos no deberían expresarse en este tipo de célula y, como las células K562 son femeninas, los sgRNA que se dirigen a los genes del cromosoma Y no tienen ningún objetivo de ADN. Ambos conjuntos de genes de control negativo no mostraron en promedio ningún fenotipo y muy poca correlación entre réplicas, lo que sugiere que los pocos fenotipos observados se deben al ruido estocástico (Figura 4A). Además, no se observó evidencia de toxicidad no específica debido a la expresión de dCas9-KRAB o la biblioteca sgRNA en K562, lo que sugiere que dCas9 unido al genoma no es tóxico en estas condiciones (Figura 4B). Estos datos sugieren que CRISPRi es altamente específico y no tóxico.
[0428] F. Definición de genes, complejos y rutas esenciales en células humanas mediante CRISPRi
[0430] Para identificar los genes afectados en esta pantalla, se utilizó una métrica de fenotipo de crecimiento promedio (Y) para los tres sgRNA principales para cada gen (ver métodos). Utilizando esta métrica, se observó que muchos genes involucrados en procesos celulares esenciales se agotaban fuertemente. Las principales categorías funcionales de genes agotados fueron la maquinaria de transcripción, empalme y traducción, y las rutas biosintéticas y metabólicas (Figura 4C). Los sgRNA dirigidos a componentes del ribosoma, el proteasoma y la maquinaria de replicación del ADN estaban fuertemente agotados (Figura 4D). Estos datos validan el algoritmo de actividad sgRNA y demuestran que CRISPRi puede utilizarse como método de detección de pérdida de función.
[0432] G. Control dinámico de la expresión genética con CRISPRi
[0434] La capacidad de ajustar de forma reversible la expresión de transcripciones seleccionadas es una herramienta poderosa para evaluar la función de la transcripción, especialmente en el contexto de modelos animales utilizados para estudiar el desarrollo normal y la enfermedad. Para evaluar la aplicabilidad de CRISPRi a este propósito, se clonó un constructo de expresión lentiviral que coloca una proteína de fusión KRAB-dCas9 optimizada bajo el control de un promotor inducible por doxiciclina. Se probó la capacidad de este constructo de expresión para controlar dinámicamente la expresión genética en células humanas (Figura 5A). La expresión de KRAB-dCas9 a partir de este constructo se activó fuertemente en presencia de doxiciclina (Figura 5B) y en células transducidas con cualquiera de los dos sgRNA dirigidosRABIA(validado en este estudio), esta inducción de KRAB-dCas9 agotó de forma robustaRABIAARNm (Figura 5C). La represión inducida fue reversible después de la retirada de la doxiciclina del medio de cultivo celular, lo que demuestra que KRAB-dCas9 no crea un estado de cromatina permanentemente represivo en los promotores seleccionados.
[0435] Para evaluar el control dinámico de los fenotipos mediados por CRISPRi, se evaluó la inducibilidad de los defectos de crecimiento causados por la represión de varios genes identificados en la prueba de crecimiento CRISPRi a escala del genoma. Estos genes incluían C3orf17, que no tiene ninguna función descrita. Para cada gen, se seleccionaron 2 o 3 sgRNA y se cuantificaron los efectos sobre el crecimiento de cada uno con y sin inducción de KRAB-Cas9 (Figura 5D). Las células que expresaban estos sgRNA casi no mostraron fenotipo de crecimiento en ausencia de doxiciclina, pero se agotaron rápidamente y de forma robusta de la población luego de la adición de doxiciclina (Figura 5D). En los casos más fuertes, más del 95 % de las células que expresaban sgRNA con KRAB-dCas9 inducido se agotaron en 10 días (sgAARS-1 y sgHSPA9-1).
[0437] Para probar el control dinámico de la expresión genética de genes esenciales a mayor escala, se clonó una subbiblioteca dirigida a 426 genes seleccionados manualmente (10 sgRNA/TSS o 5,773 sgRNA en total, con 750 controles no seleccionados). Estos se identificaron en el cribado de crecimiento a escala del genoma o se predijo que serían necesarios para el crecimiento celular según conjuntos de datos publicados (ID de Pubmed: 23394947). Los sgRNA presentes en esta biblioteca se seleccionaron independientemente de la biblioteca CRISPRi a escala del genoma, pero se diseñaron utilizando el mismo algoritmo de actividad de sgRNA. Esta biblioteca se transdujo en células K562 que expresaban de forma estable nuestra proteína de fusión inducible KRAB-dCas9 y se evaluó su efecto sobre el crecimiento celular en presencia y ausencia de doxiciclina. En consonancia con los resultados individuales, solo 4 sgRNA se agotaron fuertemente en ausencia de doxiciclina; sin embargo, con la inducción de KRAB-dCas9, muchos sgRNA se agotaron fuertemente (Figura 5E). Los sgRNA de control negativo produjeron una distribución estrecha de fenotipos que no estaba correlacionada entre las réplicas biológicas con o sin doxiciclina (Figura 5D). Además, no se encontró evidencia de que el KRAB-dCas9 dirigido generalmente disminuya el crecimiento celular (Figura 5F). En conjunto, estos resultados demuestran que CRISPRi no es tóxico, es inducible y reversible.
[0439] H. Una prueba CRISPRi a escala genómica divulga rutas y complejos que regulan la respuesta a las toxinas del cólera y la difteria.
[0441] Para probar el desempeño del método CRISPRi para la detección de genes que controlan un fenotipo celular más complejo, se realizó una prueba CRISPRi a escala del genoma para detectar genes que modulan la sensibilidad a una toxina quimérica compuesta por la subunidad catalítica A de la toxina de la difteria unida covalentemente a la toxina del cólera (CTx-DTA, Figura 6A). Se caracterizan parcialmente el mecanismo de entrada celular y la toxicidad tanto de la toxina del cólera como de la toxina de la difteria. Además, los genes que controlan la sensibilidad CTx-DTA se han identificado previamente utilizando un enfoque de mutagénesis haploide (Pubmed ID: 22123862). La subunidad B de la toxina del cólera se une a los gangliósidos GM1 en la superficie celular y esta interacción es necesaria para la internalización de la toxina (Figura 6A) (ID de Pubmed: 22919642, 22069586, 7000782). Después de la endocitosis, la subunidad B media el tráfico retrógrado a través del Golgi hasta el retículo endoplásmico (ER), donde se reduce un enlace disulfuro entre las fracciones A1 y A2 de la toxina del cólera. Se cree que la maquinaria de degradación asociada a ER (ERAD) media la retrotranslocación de la subunidad A1 y la subunidad A de la toxina diftérica fusionada al citosol. Una vez que la toxina quimérica se localiza en el citoplasma, la subunidad catalítica de la difteria, ADP-ribosila el residuo de diftamida en el factor de elongación 2, deteniendo la traducción y matando la célula (Figura 6A).
[0443] Las células K562 que expresan de forma estable dCas9-KRAB fueron transducidas con una biblioteca CRISPRi a escala del genoma. Las células que expresan esta biblioteca de sgRNA se cultivaron en condiciones estándar o se trataron con varios pulsos de CTx-DTA en el transcurso de 10 días. Esta prueba se realizó en dos réplicas biológicas (Figura 13A). Se observó un fuerte enriquecimiento y agotamiento altamente correlacionado de muchos sgRNA, lo que indica que CRISPRi puede identificar genes que modulan tanto la resistencia como la sensibilidad a una presión selectiva. Estos resultados demuestran que el método de selección produce resultados reproducibles en pruebas en las que se aplica una fuerte presión selectiva.
[0445] Para evaluar la validez biológica del análisis, los genes se clasificaron según el fenotipo promedio de sus tres sgRNA más fuertes, y los 50 resultados con el efecto protector más fuerte y los 50 resultados con el efecto sensibilizador más fuerte se definieron como “resultados principales” (todos estos están muy fuera del rango observado con sgRNA de control negativo coincidentes de otro modo). Análisis de enriquecimiento del conjunto de genes (GSEA) (ID de Pubmed: 12808457) reveló que las dos rutas KEGG más significativas enriquecidas con los principales genes protectores fueron “Infección con vibrio cholerae” y “Biosíntesis de glucoesfingolípidos, serie ganglionar” (Figura 6B) en consonancia con el requisito del receptor de gangliósidos para la captación de la toxina del cólera. Entre las tres rutas KEGG más enriquecidas en genes sensibilizadores superiores estaban el “ribosoma” y el “proteasoma” (Figura 6B). Dado que la subunidad catalítica de la toxina de la difteria inhibe la traducción de proteínas, se puede esperar que el agotamiento del ribosoma sensibilice a las células a la toxina. La sensibilización de las células mediante la eliminación del proteasoma sugiere que éste contrarresta la toxicidad del CTx-DTA después de que ingresa al citosol. Recientemente se demostró una función similar del proteosoma en la degradación de la ricina, otra toxina retrotranslocadora (Pubmed ID: 23394947). En conjunto, el análisis GSEA imparcial respalda la alta especificidad en la identificación de genes afectados mediante nuestro enfoque CRISPRi.
[0447] Los genes más afectados se caracterizaron aún más asignándolos a rutas celulares y complejos proteicos de acuerdo con sus funciones previamente caracterizadas (Figura 6C y Figura 13B). El cribado CRISPRi identificó un efecto protector de derribo para todos los resultados principales recuperados en el cribado de mutagénesis haploide publicada anteriormente (señalada con una estrella blanca). Las dos rutas principales identificadas mediante mutagénesis haploide como moduladoras de la sensibilidad celular a CTx-DTA son la vía de biosíntesis de diftamida (necesaria para generar eEF-2-diftamida, el objetivo de la toxina de la difteria) y la vía de biosíntesis de gangliósidos (necesaria para producir GM1, el receptor de la superficie celular para la toxina del cólera). El cribado CRISPRi validó los resultados principales del cribado de mutagénesis haploide e identificó muchos componentes centrales adicionales de cada vía. Si bien la eliminación de todos los impactos en la vía de biosíntesis de diftamida tuvo un efecto protector, los resultados para los genes de biosíntesis de gangliósidos mostraron un patrón diferenciado: la eliminación de las enzimas involucradas en la producción de GM1a fue protectora, mientras que la eliminación de las enzimas que catalizan la producción de otras especies de gangliósidos (incluido GM1b) fue sensibilizante. Estos resultados sugieren que GM1a es el receptor de superficie celular relevante para CTx-DTA e ilustran más ampliamente el valor de poder detectar de manera confiable genes sensibilizadores y protectores para analizar rutas biológicas.
[0449] Muchos de los principales éxitos son componentes de rutas celulares y complejos proteicos que previamente se identificaron en experimentos de biología celular y bioquímica específicos como importantes para el tráfico retrógrado y la retrotranslocación de otras toxinas como la ricina y la toxina Shiga (ID de Pubmed: 19678899, 23394947). Sin embargo, aún no está claro cómo se transporta Ctx a través de la red de Golgi (ID de Pubmed: 22069586). El estudio realizado reveló un papel crítico para los complejos COG y GARP en el transporte retrógrado CTx-DTA; la focalización de la gran mayoría de las subunidades de estos complejos conduce a una fuerte resistencia. Estos dos complejos unen los endosomas tardíos a la red trans-Golgi o modulan el transporte retrógrado intra-Golgi (Pubmed ID: 16936697). Se ha propuesto que la retrotranslocación de la cadena catalítica de CTx esté mediada por la vía de degradación asociada al ER (ERAD), aunque esta vía no se identificó en estudios genéticos anteriores. En consonancia con este papel propuesto para la maquinaria ERAD, la eliminación de los miembros del complejo ubiquitina ligasa ERAD E3,<S y V N 1>(que codifica Hrd1) y SEL1L (el homólogo mamífero de la levadura Hrd3) hizo que las células fueran resistentes a CTx-DTA. Los factores que median la degradación citosólica de los sustratos de ERAD (en particular UBXN4, también conocido como UBXD2/erasina y el proteasoma) fueron factores de sensibilización, lo que sugiere que pueden reducir los niveles citosólicos de las cadenas de toxinas catalíticas en las células WT.
[0450] Otros genes de alto impacto estaban agrupados estrechamente en varios complejos proteicos implicados en la expresión genética, incluido el complejo Integrador, factores implicados en la escisión y adenilación del ARNm y la remodelación de la cromatina. La represión de todos los componentes canónicos del complejo del factor estimulante de escisión y la mayoría de los componentes centrales del complejo del factor de especificidad de escisión y poliadenilación protegieron a las células de CtxDTA (ver a continuación la validación de uno de estos genes afectados). Esto ilustra la capacidad de las pantallas CRISPRi imparciales para identificar complejos que modulan procesos específicos con una saturación muy alta. Estas rutas no habían sido implicadas previamente en el control de la sensibilidad a la toxina del cólera o de la difteria. La capacidad de identificar de forma sólida nuevas rutas en un proceso tan intensamente estudiado como la entrada de toxinas resalta el potencial de CRISPRi como plataforma de descubrimiento.
[0451] I. Fenotipos potentes y niveles de eliminación alcanzados por la biblioteca CRISPRi a escala genómica Para validar el papel sugerido de los factores ERAD identificados en la retrotranslocación de toxinas desde el ER al citosol, las células K562 incubadas se transfectaron transitoriamente (90 min) con CTx no modificado y se cuantificó la cantidad de cadenas de CTx en las fracciones de citosol y membrana. La eliminación de SEL1L resultó en una reducción drástica del CTx-A1 citosólico, mientras que los niveles en la fracción de membrana se vieron mucho menos afectados (Figura 7A-C). Por el contrario, la eliminación de B4GALNT1, una enzima necesaria para la síntesis del receptor CTx GM1a, resultó en una ausencia casi completa de cadenas CTx tanto de la fracción citosólica como de la de membrana (Figura 7A-C). Este bloqueo altamente eficiente de la unión y captación de CTx por un único sgRNA, que se refleja en la fuerte resistencia CTx-DTA lograda mediante la eliminación de B4GALNT1 (Figura 7D), subraya la capacidad de la biblioteca CRISPRi descrita en este documento para lograr potentes fenotipos de pérdida de función.
[0452] Para validar técnicamente los resultados de esta prueba, se volvieron a analizar los sgRNA que supuestamente modulan la respuesta celular a CTx-DTA de maneras mecanísticamente diversas. Para cada sgRNA, se cuantificaron los fenotipos de ricina, así como el cambio en la abundancia de la transcripción objetivo mediante qPCR. Los experimentos de nueva prueba estuvieron altamente correlacionados con los datos de la prueba primaria (Figura 7D). En los experimentos de validación en 5 pantallas y 75 sgRNA, las actividades de 74 de los 75 sgRNA se volvieron a probar de manera robusta y estuvieron altamente correlacionadas (RA2=0.879) con los resultados obtenidos en el cribado primario, lo que demuestra la confiabilidad de los puntajes de fenotipo obtenidos en las pantallas primarias. Los datos de qPCR mostraron una represión robusta, con un 80-99 % de eliminación para cada sgRNA y al menos un 90 % para cada gen (Figura 7E).
[0453] J. El refinamiento de las reglas de sgRNA permite un diseño más compacto de futuras bibliotecas CRISPRi Los resultados de CRISPRi a escala del genoma para el crecimiento y la resistencia a CTx-DTA proporcionaron un conjunto de sgRNA activos e inactivos para un grupo más grande de genes. Estos datos se utilizaron como conjunto de entrenamiento para discernir otras reglas que pudieran predecir la actividad del sgRNA.
[0454] La tendencia de los sgRNA más cortos a mostrar mayor actividad se confirmó para los sgRNA en la biblioteca de todo el genoma (Figura 14A). Los sgRNA que contienen el homotrímero UUU dieron como resultado fenotipos menos pronunciados que otros sgRNA (Figura 14B). En general, un mayor contenido de purina fue predictivo de una mayor actividad de sgRNA (Figura 14C). El impacto negativo de las pirimidinas específicamente en el extremo 3' del sgRNA que se había informado previamente (Pubmed ID: 24336569) no se observó. Se observó una disminución de la actividad de los sgRNA dirigidos a sitios genómicos en los que el PAM (NGG) fue seguido por una G (Figura 14D). Finalmente, un análisis de metagenes reveló una actividad máxima de sgRNA en una ventana de 25 a 100 pb en la dirección descendente del TSS (Figura 14E), en consonancia con observaciones anteriores (Figura 14C).
[0455] Utilizando regresión logística paso a paso, estas reglas se integraron en un puntaje cuantitativa que predijo la actividad de sgRNA con un área ROC bajo la curva de 0.687 (Figura 14, consulte Materiales y métodos para obtener más detalles). Para validar la hipótesis de que este puntaje predictivo permitirá el diseño de bibliotecas CRISPRi potentes y compactas en el futuro, se submuestrearon computacionalmente los fenotipos de dos pruebas CRISPRi a escala del genoma eligiendo subconjuntos aleatorios de sgRNA para cada gen o seleccionando subconjuntos según el algoritmo refinado (Figura 14G). Al seleccionar 6 de 10 sgRNA por gen según el puntaje predictivo, se mantuvo > 93 % de la actividad de la biblioteca, cuantificada mediante la métrica utilizada para identificar los genes afectados en los análisis (fenotipo promedio de los 3 sgRNA más fuertes por gen). La compactación de la biblioteca CRISPRi a escala del genoma en un 40 % facilita aún más los análisis agrupados al reducir la escala de las poblaciones de células y la cantidad de lecturas de secuenciación necesarias para el análisis.
[0456] IV. Discusión
[0457] En este trabajo se establece que CRISPRi y CRISPRa son métodos robustos para activar y desactivar sistemáticamente la transcripción de genes endógenos en células humanas. CRISPRi/a se puede utilizar para detectar rápidamente fenotipos de pérdida y ganancia de función en un formato agrupado. De esta forma se pueden identificar genes conocidos e inesperados necesarios para el crecimiento o que modulan la sensibilidad a una toxina (CTx-DTA). También se puede crear una serie alélica de expresión genética que abarque un amplio rango, desde una represión de ~100 veces hasta una inducción de ~10 veces, para examinar y definir cómo se relaciona la abundancia de una proteína con la función.
[0459] Los experimentos descritos en este documento demuestran que una característica clave de CRISPRi es la muy baja incidencia de efectos fuera del objetivo, como lo evidencia la casi ausencia de actividad para tres clases grandes y distintas de sgRNA de control negativo en la biblioteca CRISPRi a escala del genoma. Esta característica simplifica la validación y la interpretación de los resultados de detección. La especificidad observada proviene de dos propiedades distintas del sistema. En primer lugar, los complejos CRISPRi/a unidos fuera de una ventana estrecha alrededor del TSS en gran medida no logran modular la transcripción; esto reduce drásticamente el espacio de la secuencia en todo el genoma donde la unión fuera del objetivo producirá una actividad fuera del objetivo significativa. Además, la actividad CRISPRi es muy sensible a los desajustes entre el sgRNA y el ADN objetivo, lo que sugiere que la unión fuera del objetivo observada en los experimentos Chip-Seq (ID de Pubmed: 24752079, 24837660, 24980957) es demasiado transitoria para afectar la transcripción. La combinación de estrictos requisitos de secuencia y reglas posicionales hace que la actividad CRISPRi sea exquisitamente específica.
[0461] Una implementación actual de CRISPRa descrita en este documento utiliza la proteína de fusión sunCas9 para reclutar múltiples copias de un dominio de activación para activar directamente la maquinaria de transcripción basal. Se pueden reclutar muchas copias de un solo dominio efector o de múltiples dominios utilizando enfoques similares para crear potenciadores artificiales altamente activos o heterocromatina silenciada para modular la expresión genética en un rango aún más amplio. El enfoque de detección basado en fenotipos agrupados proporciona una herramienta para evaluar las actividades dentro y fuera del objetivo de futuras variaciones en CRISPRi y CRISPRa.
[0463] La detección mediante CRISPRa proporciona un nuevo enfoque para explorar la diversidad de transcripciones en genomas complejos. Clásicamente, la activación genética se ha utilizado para analizar el componente limitante de un proceso bioquímico (Pubmed ID: 22419077). Por ejemplo, las pruebas de sobreexpresión se han utilizado para identificar el objetivo molecular de un fármaco o para activar pasos clave que limitan la velocidad en una vía. Dos ejemplos tempranos de tales pruebas en células eucariotas son la identificación de DPAGT1 como el objetivo de la tunicamicina y MyoD como el componente limitante de la diferenciación de fibroblastos a mioblastos (ID de PubMed: 6316322, 3690668). Más recientemente, una prueba de activación combinatoria identificó cuatro genes que, cuando se coexpresan, reprograman los fibroblastos para convertirlos en células madre pluripotentes (Pubmed ID: 16904174). CRISPRa debería acelerar enormemente búsquedas similares de combinaciones de factores con propiedades emergentes. Además, CRISPRa probablemente proporcionará información sobre las rutas celulares donde la redundancia dificulta los enfoques genéticos de pérdida de función. Las series alélicas de sgRNA que activan y reprimen cuantitativamente la expresión genética también pueden proporcionar una comprensión más profunda de cómo los polimorfismos genéticos, la variación del número de copias o las mutaciones fuera del exoma contribuyen a la susceptibilidad a las enfermedades (Pubmed ID: 17597780).
[0465] La capacidad de controlar la transcripción con alta especificidad proporcionada aquí simplifica el análisis y la validación de datos de detección de alto rendimiento. La biblioteca CRISPRi a escala del genoma que se describe en este documento contiene 10 sgRNA/TSS; el tamaño de la biblioteca resultante permite analizarla en una población de células cultivadas en un solo matraz de centrifugación. Sin embargo, la alta especificidad observada y una mayor comprensión de las reglas que rigen la actividad del sgRNA deberían permitir la creación de bibliotecas de sgRNA más compactas. Al compactar las bibliotecas de todo el genoma, se pueden examinar un mayor número de estirpes celulares, compuestos químicos, puntos temporales o construcciones de indicadores. Alternativamente, una biblioteca de sgRNA diseñada para activar o reprimir una gama más amplia de transcripciones en el genoma humano puede divulgar la función de muchos ARN no canónicos codificados en el genoma humano. Como la mayoría de las transcripciones no codificantes son nucleares y carecen de un marco de lectura abierto, los métodos que modulan directamente la transcripción son óptimamente adecuados para interrogar la función de estos ARN (Pubmed ID: 22955988).
[0467] Los mapas sistemáticos de interacción genética (GI) han demostrado ser herramientas poderosas para divulgar funciones genéticas dentro de rutas o complejos ( iD de PubMed: 23394947, 14764870, 16487579, 20093466, 16269340, 17314980, 17510664, 24906158). Un mapa GI CRISPRa o un mapa GI combinado CRISPRi/a podría producir una biología novedosa y rica que dilucide cómo las redes de proteínas dictan la función celular (Pubmed ID: 21572441). De manera más general, los métodos cuantitativos de activación y desactivación de una o varias transcripciones representan una herramienta fundamental para comprender cómo la expresión de los genes codificados en nuestros genomas controla la función y el destino de las células.
[0469] V. Métodos
[0471] A. Diseño y construcción de plásmidos
[0472] Los vectores descritos previamente se utilizaron para expresar dCas9, dCas9-KRAB y el sistema CRISPRa sunCas9. Utilizando la clonación de Gibson se clonó una proteína de fusión CRISPRi optimizada. La proteína se expresa a partir del promotor inducible TRE3G (Clontech) en una estructura lentiviral pHR (Addgene). Utilizando este vector, se expresó una molécula de ARNm que codifica la proteína de fusión CRISPRi y mCherry separada por una secuencia viral T2A. La fusión CRISPRi codifica codones de mamíferos optimizadosStreptococcus pyogenesdCas9 (ADN 2.0) se fusionó en el extremo N con el dominio KRAB de Kox1 y en el extremo C con dos secuencias de localización nuclear (NLS) de SV40. Para generar un plásmido de expresión de Cas9 compatible con un constructo de fusión lentiviral dCas9-BFP, los residuos 10 y 840 se revirtieron de alanina a ácido aspártico e histidina utilizando mutagénesis de cambio rápido estándar (Agilent). El sgRNA optimizado se describió previamente (ID de Pubmed: 24360272). Brevemente, el sgRNA se expresó utilizando un vector de expresión lentiviral basado en U6 derivado de pSico que coexpresa BFP, GFP o mCherry y un casete de resistencia a la puromicina separado por una secuencia T2A del promotor CMV o EflAlpha. La región constante de sgRNA se modificó para clonar la biblioteca CRISPRi a escala del genoma alterando un par de bases en la secuencia madre de sgRNA que introduce unBlp1sitio de restricción. Este cambio no disminuye la actividad del sgRNA como se probó usando un indicador GFP como se describió anteriormente (datos no mostrados) (ID de Pubmed: 23849981). Los plásmidos de expresión de sgRNA para experimentos de validación se clonaron mediante PCR a partir de una plantilla de sgRNA existente utilizando un cebador 3' común y un cebador 5' único que contenía el protoespaciador deseado. El producto de PCR y el vector de expresión basado en lentivirus U6 se digirieron con BstXI y XhoI y los dos fragmentos de ADN se ligaron juntos.
[0474] B. Especificaciones de la biblioteca CRISPRi TSS
[0476] Los genes fueron seleccionados de todo el conjunto de genes codificadores de proteínas. Se excluyó un subconjunto de genes no asignados y Membrane_Protein que probablemente no se expresen en la mayoría de las células y con un RPKM de 0 en los datos de expresión de ARN-seq de K562. El total final de genes objetivo fue 15.977. Los sitios de inicio de la transcripción se seleccionaron a partir de las transcripciones de GencodeV19/Ensembl release 74, seleccionando todas las transcripciones anotadas por el pipeline appris cuando fue posible, o todas las transcripciones del mismo biotipo ('protein_coding', 'processed_transcript', etc.) que el gen correspondiente. En todos los casos se utilizaron únicamente transcripciones “CONOCIDAS” o “NUEVAS”, a menos que no existiera ninguna o el gen en sí fuera “PUTATIVO”. Cuando no se encontraron transcripciones que cumplieran con estos criterios, se utilizaron todas las transcripciones de Refseq (consultado el 19/11/2013) con números de acceso NM.
[0478] Para 50 pb en la dirección ascendente y 300 pb en la dirección descendente de cada TSS, se calculó cada guía adyacente a un PAM NGG, que comenzaba con una G y tenía una longitud de 18-25. Las guías se calificaron según su singularidad en el genoma, según lo determinado por una métrica de puntuación derivada empíricamente (y verificada mediante CRISPRicin): PAM G1 = 40, PAM G2 = 19, PAM N = 0, Región I = 28, Región II = 19, Región III = 10. Si suma(desajustes*puntaje de desajuste) < umbral, el sitio no coincidente se considera fuera del objetivo. El umbral se redujo sistemáticamente para permitir que se consideraran guías menos exclusivas cuando fuera necesario. En algunos casos, el umbral se mantuvo estricto y se aumentó el número de objetivos permitidos para tolerar familias de genes muy similares. A cada ID de guía se le asignó una cadena de unicidad correspondiente al umbral (bandera e del bowtie) y los objetivos permitidos (bandera m). En orden decreciente de rigor: e39m1, e30m1, e20m1, e11m1, e1m1, e39m2, e39m3, no aprobado.
[0479] Para cada gen se seleccionaron un mínimo de 10 guías. El script intentó apuntar a cada TSS con 10 guías (las guías individuales se contabilizaron para múltiples TSS cuando correspondía), aunque en los casos en que esto condujo a >25 guías para un gen, el script pasó a requerir solo al menos 3 guías para cada TSS. Los guías fueron clasificados de la siguiente manera: 1. singularidad según El puntaje fuera del objetivo, 2. la cantidad de TSS que la guía está en el rango de objetivo (de alto a bajo), 3. la cantidad de genes a los que se dirige la guía (de bajo a alto; para la gran mayoría de guías, esto fue 1, pero en los casos en que las guías estaban cerca de 2 genes, esas guías se evitaron), 4. las guías de longitud 18-21 se consideraron “cortas” y se clasificaron en primer lugar, mientras que las guías de longitud 22-25 se consideraron “largas” y se clasificaron de acuerdo con su longitud (de bajo a alto), 5. se aplicó una clasificación aleatoria para elegir entre guías equivalentes en los criterios 1-4. Las guías no se seleccionaron si estaban separadas de otra guía aceptada por menos de 5 bases, según lo define el “ lado izquierdo” de la secuencia (extremo 5' para oligos de cadena, extremo 3' para - cadena). Sólo unos ~40 genes no cumplieron completamente este estándar.
[0481] A medida que el contenido de GC aumenta en los sitios de inicio de la transcripción y la ubicación de sgRNA depende del motivo 3' NGG, el conjunto de sgRNA se enriqueció particularmente con sgRNA en esta región. Para protegerse de los sitios de inicio de la transcripción anotados incorrectamente, se seleccionaron sgRNA para la biblioteca de todo el genoma en una ventana de -50 a 350 pb en relación con el sitio de inicio de la transcripción de cada gen. Esta ventana es más amplia que el pico máximo absoluto de actividad CRISPRi de 50 a 100, pero protege contra TSS alternativos muy espaciados o TSS anotados incorrectamente.
[0483] Se diseñaron guías de control negativo en regiones TSS de genes esenciales humanos aleatorizados y luego se seleccionaron utilizando las mismas reglas mencionadas anteriormente.
[0484] Las secuencias diana CRISPR ejemplares identificadas usando una o más de las reglas descritas en este documento para la activación o represión se proporcionan en la lista de secuencias presentada conjuntamente como Tabla 2 para dianas de sgRNA CRSPRa humano, Tabla 3 para dianas de sgRNA CRISPRi humano y Tabla 4 para dianas de sgRNA CRISPRi de ratón.
[0486] C. Clonación de la biblioteca CRISPRi/a
[0488] Las bibliotecas CRISPRi/a se prepararon mediante métodos similares a los descritos previamente para las bibliotecas de shRNA (ID de Pubmed: 19448642, 24992097). Los grupos de oligonucleótidos complejos se sintetizaron mediante Agilent o Custom Array. Cada biblioteca se amplificó mediante PCR, se digirió con BstX1 y Xho1 o BstX1 y Blp1 y se clonó en un vector de expresión sgRNA.
[0490] D. Cultivo celular, transfecciones de ADN y producción viral y construcción de estirpes celulares CRISPRi/a
[0491] Las células HEK293 se mantuvieron en medio de Eagle modificado de Dulbecco (DMEM) en 10 % de FBS, 2 mM de glutamina, 100 unidades/mL de estreptomicina y 100 pg/mL de penicilina. Las células K562 se cultivaron en RPMI-1640 con 25 mM de HEPES y 2.0 g/L de NaHCo3 en 10% de FBS, 2 mM de glutamina, 100 unidades/mL de estreptomicina y 100 pg/mL de penicilina. El lentivirus se produjo transfectando HEK293 con vectores de empaquetamiento estándar utilizando TransIT®-Reactivo de transfección LTI (Mirus, MIR 2306). El sobrenadante viral se recogió 72 horas después de la transfección y se filtró a través de un filtro de jeringa de PVDF de 0.45 pm.
[0493] Para construir estirpes celulares CRISPRi/a, las células K562 se transdujeron lentiviralmente para expresar Cas9, dCas9, dCas9-KRAB, scFV-sfGFP-VP64 o el rtTA del promotor SFFV, o dCas9-GCN4-10x del promotor TRE3G. Las poblaciones policlonales puras de cada estirpe celular CRISPRi/a se clasificaron mediante citometría de flujo utilizando un BD FACS Aria2 para la expresión estable de GFP, BFP o mCherry. Para CRISPRa, se aislaron clones de células individuales y se analizaron como se describió anteriormente.
[0495] Para construir la estirpe celular CRISPRi K562 inducible, se generó una estirpe celular K562 clonal que expresa de manera constitutiva un transactivador inducible por doxiciclina estándar sin un marcador de selección mediante transducción lentiviral y se identificó mediante análisis de transferencia Western. Luego, estas células fueron transducidas con una proteína de fusión KRAB-dCas9 inducible marcada por P2A-mCherry (pHR-Tre3G-KRAB-dCas9-P2A-mCherry). Se añadió doxiciclina después de la infección y se utilizó citometría de flujo para clasificar las células que expresaron mCherry. Luego, estas células se cultivaron en ausencia de doxociclina hasta que mCherry volvió a los niveles no inducidos.
[0497] E. Cribado CRISPRi/a agrupado de alto rendimiento
[0499] Las estirpes celulares CRISPRi/a K562 se infectaron con bibliotecas de sgRNA como se describió previamente (ID de Pubmed: 23394947). La infección se escaló para lograr una multiplicidad de infección de un sgRNA por célula. Dos días después de la infección, las células se seleccionaron con 0.65-0.75 pg/mL de puromicina (Tocris) durante 3 días y luego se lavaron en medio fresco para una recuperación de ~24 a 48 horas. Cada prueba de crecimiento o de toxina se llevó a cabo hasta que las células no tratadas experimentaron 12 duplicaciones de población y logramos una diferencia de al menos 6 duplicaciones de población entre las células no tratadas y las tratadas con toxina. Para las pruebas de detección de ricina mediante mosaico CRISPRi/a, las células se pasaron o se trataron con 3 o 4 pulsos de 0.5 ng/mL de ricina durante 16 días. Para el crecimiento a escala del genoma CRISPRi y la prueba CTx-DTA, las células se pasaron o se trataron con dos pulsos de 0.4 nM de CTx-DTA durante 10 días. Para ambas toxinas, centrifugamos las células hasta obtener la toxina a las 24 horas y las resuspendimos en medio fresco. Las células se mantuvieron a una densidad de entre 500,000 y 1,000,000 de células/mL manteniendo continuamente una cobertura de biblioteca de al menos 1,000 células por sgRNA. Las células se recolectaron para la extracción de ADN genómico inmediatamente después de que las poblaciones de células que expresaban esta biblioteca de sgRNA se recolectaran al comienzo del experimento (el punto temporal t0), se cultivaran en condiciones estándar (sin tratar) o se trataran con toxina. Se extrajo ADN genómico de todas las muestras; luego, las regiones codificantes de sgRNA se amplificaron mediante PCR y se secuenciaron en un Illumina HiSeq-2500 utilizando cebadores personalizados con protocolos descritos previamente con alta cobertura. Se realizaron dos réplicas biológicas de cada pantalla. A partir de estos datos, se cuantificaron las frecuencias de células que expresaban diferentes sgRNA en cada muestra. A partir de estos datos se cuantificó el fenotipo de cada sgRNA, previamente definido para crecimiento (“gamma”) o resistencia al tratamiento (“rho”). Para calcular un puntaje z normalizada para estos fenotipos, gamma o rho se dividieron por la desviación estándar de los fenotipos de sgRNA de control negativo.
[0501] F. Análisis bioinformático de genes de éxito
[0503] Los genes afectados se clasificaron según el fenotipo promedio de los 3 sgRNA más extremos a los que se dirigen. Se identificaron rutas y conjuntos de genes enriquecidos entre los genes afectados utilizando el software GSEA y DAVID. En el experimento de teselado de sgRNA se observó que la mitad de los sgRNA en la ventana de máxima actividad tenían un puntaje Z superior a 2, lo que sugiere que la gran mayoría de genes tienen tres o más sgRNA activos en la biblioteca CRISPRi. Los datos a escala del genoma se analizaron utilizando la métrica del fenotipo promedio de los 3 sgRNA principales. El uso de más sgRNA puede diluir la señal con sgRNA inactivo, mientras que el uso de menos podría no aprovechar el conjunto completo de sgRNA activos. Luego, se puede evaluar la significancia estadística del fenotipo promedio basándose en una clara diferenciación de la señal observada para los sgRNA de control no dirigidos.
[0505] G. Nueva prueba individual de fenotipos de sgRNA y represión y activación de la transcripción CRISPRi/a
[0506] Se realizaron experimentos de nueva prueba de fenotipo individual para sgRNA de las pruebas de mosaico de ricina CRISPRi/a, las pruebas de cólera a escala del genoma CRISPRi y la prueba de subbiblioteca de genes esenciales como experimentos de crecimiento competitivo en poblaciones parcialmente transducidas de células K562. Brevemente, las células fueron transducidas parcialmente entre un -25-60 %. Tres o cuatro días después de la infección, se contaron las células y se sembraron en placas de 24 pocillos a razón de 0.25 a 0.5 millones de células/mL. Se cultivaron muestras triplicadas de cada sgRNA en condiciones estándar o, para experimentos de desafío con toxinas, se trataron con 0.5 ng/mL de ricina o 0.4 nM CTx-DTA. Se dejó que cada población de células creciera o se recuperara durante 6 días. Para ambas toxinas, las células se separaron de la toxina a las 24 horas y se resuspendieron en medio fresco. Se midió el número absoluto de células y el porcentaje de células que expresan BFP (lo que indica la expresión de sgRNA) para cada muestra al principio y al final del experimento. Los puntajes Rho se calcularon como se describe. Para los experimentos de nueva prueba de proliferación celular, las células se cultivaron en condiciones estándar en presencia y ausencia de doxiciclina. La concentración de doxiciclina se ajustó diariamente a 50 ng/mL asumiendo una vida media de 24 horas. La proliferación celular relativa se determinó mediante el porcentaje de células que mantuvieron la expresión de mCherry (como sustituto de KRAB-dCas9 inducido) y BFP (que indica la expresión de sgRNA).
[0507] Para determinar la cantidad de inhibición o activación de genes para sgRNA individuales, se seleccionaron células parcialmente transducidas que expresaban sgRNA individuales, que se usaron para experimentos de nueva prueba, con un máximo de 3 ug/mL de puromicina durante 4-5 días. Se dejó que las células se recuperaran de la selección y luego se recolectaron para RT-qPCR directamente o se trataron con doxiciclina (para inducir KRAB-dCas9) antes de la recolección.
[0509] H. Cribado de selección negativa de subbibliotecas de genes esenciales
[0511] El lentivirus se preparó mediante cotransfección de ADN plasmídico de biblioteca con vectores de empaquetamiento lentiviral (que expresan Gag, Pol, Rev y Tat) en células 293T utilizando TransIT®-Reactivo de transfección LTI (Mirus, m Ir 2306). Al día siguiente se cambió el medio de comunicación. El sobrenadante viral se cosechó el segundo día después de la transfección, se filtró a través de un filtro de jeringa de PVDF de 0.45 |jm y se procesó para su almacenamiento a -80 °C de dos maneras: (réplica de pantalla 1) congelación instantánea directa en nitrógeno líquido, (réplica de pantalla 2) concentración utilizando solución de precipitación Alstem (Alstem, VC100), de acuerdo con las instrucciones del fabricante, seguido de tratamiento con 50 U/mL Benzonase Nuclease (Sigma, E1014-25KU) durante 30 minutos a 37 °C antes de la congelación instantánea.
[0513] Las células KRAB-dCas9 K562 inducibles se infectaron con el virus de pantalla como se describió previamente (ID de Pubmed: 23394947). La infección se escaló para lograr una multiplicidad objetivo de infección de (% de infección) en la representación de la subbiblioteca de 5776 elementos. Dos días después de la infección, las células se seleccionaron con 0.65 jg/m L de PURO durante 3 días y luego se lavaron en medio fresco para una recuperación de aproximadamente 24 horas. Las células se cultivaron durante 13 días, se mantuvieron a una densidad de ~500,000 a 1,000,000 células/mL con una representación de > 1,000 veces, en presencia o ausencia de doxiciclina. Durante todo el estudio, la dosis diaria de doxiciclina se ajustó a 50 ng/mL asumiendo una vida media de 24 horas. Se recolectaron células para la extracción de ADN genómico inmediatamente antes de la adición de doxiciclina y nuevamente 13 días después. Las infecciones replicadas se examinaron por duplicado y se promediaron los datos de estos puntos finales duplicados.
[0515] I. RT-PCR cuantitativa
[0517] Se recolectaron las células y se aisló el ARN total utilizando NucleoSpin RNA II (Macherey-Nagel), de acuerdo con las instrucciones del fabricante. El ARN se convirtió en ADNc utilizando la transcriptasa inversa AMV en condiciones estándar con cebadores oligo dT y RNasin (Promega). Las reacciones de PCR cuantitativa se prepararon con una mezcla maestra 2x de acuerdo con las instrucciones del fabricante (Quanta Biosciences). Las reacciones se ejecutaron en un ciclador térmico LightCycler (Roche).
[0519] J. Western Blot
[0521] Las células se lizaron en TBS (20 mM Tris, 150 mM NaCl) suplementado con 0.5 % de Igepal, inhibidor de proteasa 1X (Roche) y 500 U/mL de Benzonasa Nucleasa (Sigma, E1014-25KU). Los lisados de células enteras se procesaron en un gel de poliacrilamida Bis-Tris 4-12% prefabricado (Life Technologies) en condiciones desnaturalizantes y se transfirieron a una membrana de PVDF. Se utilizaron anticuerpos contra la hemaglutinina de la influenza humana (HA) y la alfa-tubulina (Sigma, T5168) para detectar proteínas. Las manchas se obtuvieron imágenes utilizando el sistema de imágenes LI-COR Odyssey.
[0523] K. Ensayo de captación y retrotranslocación de la toxina del cólera
[0525] Un ensayo descrito previamente (ID de Pubmed: 18094046) fue adaptado. Brevemente, alícuotas de 2 millones de células K562 que expresaban dCas9-KRAB y sgRNA dirigidos a genes de interés se resuspendieron en 3 ml de solución salina equilibrada de Hank (HBSS) y se añadieron 10 nM de CTx (Millipore, 227036). Las células se incubaron con la toxina durante 90 min a 37 °C. Tras tres lavados en HBSS, se lisaron en tampón HCN (HEPES 50 mM, pH 7.5, NaCl 150 mM, CaCl22 mM y N-etil maleimida [NEM] 10 mM, e inhibidores de proteasas) con un 0.02% de digitonina. Después de la incubación en hielo durante 10 minutos, los lisados fueron sometidos a centrifugación (16.000 g durante 10 minutos a 4 °C). Se eliminó el sobrenadante y representa la fracción citosólica. El pellet se lavó una vez en PBS y luego se resuspendió en tampón RIPA (150 mM NaCl, 1 % Triton X-100, 0.5 % desoxicolato de sodio, 0.1 % SDS, 50 mM Tris-HCl pH 8.0, inhibidores de proteasa). Después de la incubación en hielo durante 10 minutos, las muestras fueron sometidas a centrifugación. (16,000 g durante 10 min a 4 °C). Se eliminó el sobrenadante y representa la fracción de membrana. Las fracciones citosólica y de membrana se sometieron a SDS-PAG<e>no reductora y Western Blotting. Las cadenas CTx se detectaron utilizando un anticuerpo policlonal anti-CTx (Abcam ab123129). Como controles de fraccionamiento y para la normalización de las muestras, se utilizaron los siguientes anticuerpos: anti-PDI (Santa Cruz Biotechnology, sc-20132) para la normalización de la señal de la fracción de membrana, y anti-Hsp90 (One World Lab ADI-SPA-846-D) para la normalización de la señal de la fracción citosólica.
[0526] L. Aprendizaje automático
[0528] Se identificaron conjuntos definidos de genes de éxito genuinos para las pruebas de crecimiento CRISPRi y de sensibilidad CT<x>-DT<a>. Para cada uno de estos genes, los fenotipos de sgRNA se normalizaron dividiendo cada uno por el fenotipo del sgRNA más fuerte. Luego se investigaron diversas características del sgRNA para determinar si cada una de ellas estaba correlacionada con una actividad mayor (o menor) del sgRNA. Para combinar características relevantes en un único puntaje cuantitativa predictiva de la actividad del sgRNA, se utilizó una regresión logística progresiva, en la que un sgRNA con un fenotipo normalizado de 0.75 o mayor se clasificó como activo. El puntaje final se incorporó las siguientes características correlacionadas positivamente con la actividad del sgRNA: longitud más corta del sgRNA, fracción de purinas en el sgRNA, sgRNA dirigido a la región de 25 pb a 100 pb en relación con el TSS, ausencia de homotrímeros UUU en el sgRNA, la base que sigue al PAM en el ADN genómico no es una G. Un método alternativo para el diseño de bibliotecas y/o la identificación de objetivos de sgRNA incorpora información de la señal de la nucleasa micrococal. Se predice que los sgRNA dirigidos a regiones que tienen una señal de nucleasa micrococal baja tienen una actividad más alta que los sgRNA dirigidos a regiones que tienen una señal de nucleasa micrococal alta. Ver figura 15. En la Figura 16 se muestra un método alternativo para predecir la actividad de sgRNA que utiliza tanto aprendizaje automático como datos de actividad empírica e incorpora características adicionales correlacionadas positivamente con la actividad de sgRNA.
[0530] Se utilizan el aprendizaje automático y la validación empírica para predecir las siguientes secuencias codificantes de la región de unión de sgRNA altamente activas: Se predice que las SEQ ID NO: 26-205,305 codifican regiones de unión de sgRNA que proporcionan una orientación CRISPRi altamente activa de loci genómicos humanos; se predice que las SEQ ID NO: 205,306-410,595 codifican regiones de unión de sgRNA que proporcionan una orientación CRISPRa altamente activa de loci genómicos humanos; se predice que las SEQ ID NO: 410,596-633,445 codifican regiones de unión de sgRNA que proporcionan una orientación CRISPRi altamente activa de loci genómicos de ratón; se predice que las SEQ ID NO: 633,446-857,995 codifican regiones de unión de sgRNA que proporcionan una orientación CRISPRa altamente activa de loci genómicos de ratón. En algunos casos, se predice que los sgRNA que son altamente activos en la inhibición o activación de un locus objetivo comprenden regiones de unión que comprenden o consisten en los 19 nucleótidos en el extremo 3' de cualquiera de las SEQ ID NO: 26-857,995. Se puede construir o utilizar una biblioteca de dichos sgRNA altamente activos, o un subconjunto o combinación de los mismos, en los métodos descritos en este documento.

Claims (9)

1. REIVINDICACIONES
1. Un método de detección de uno o más elementos genéticos que modulan un fenotipo de interés, en el que cada elemento genético es una región entre 0-750 pb en la dirección ascendente del sitio de inicio de la transcripción de un gen que modula el fenotipo, el método comprende:
poner en contacto una pluralidad de células con una biblioteca de ARN guía pequeños (sgRNA) estructuralmente distintos que se dirigen a una pluralidad de elementos genéticos, generando así una pluralidad de células de prueba, en donde la pluralidad de células de prueba comprende:
células de prueba que tienen un ARN guía pequeño (sgRNA); y
una nucleasa mediada por sgRNA deficiente en nucleasa (dCas9),
en el que el dCas9 comprende un dominio dCas9 fusionado a un dominio de fusión de epítopo, en el que el dominio de fusión de epítopo comprende un epítopo GCN4, en la que la pluralidad de células de prueba comprende además un agente de afinidad, en el que el agente de afinidad tiene afinidad por el epítopo GCN4 y comprende un activador transcripcional,
seleccionar células de prueba de la pluralidad de células de prueba sobre la base del fenotipo para obtener una población de células de prueba seleccionadas; y
cuantificar la frecuencia de los sgRNA estructuralmente distintos dentro de la población de células de prueba seleccionadas, en el que los sgRNA que se dirigen a elementos genéticos que modulan el fenotipo se identifican como aquellos sobrerrepresentados en la población de células de prueba seleccionadas, en el que
(i) el método comprende opcionalmente además cultivar la pluralidad de células de prueba, opcionalmente en presencia de un agente de selección, seleccionando así las células sobre la base de la proliferación celular, y los sgRNA que están sobrerrepresentados en las células seleccionadas están sobrerrepresentados en relación con su frecuencia en la pluralidad de células de prueba en un punto de tiempo anterior en el cultivo de la pluralidad de células de prueba.
2. El método de la reivindicación 1, en el que
el activador transcripcional comprende un dominio VP16, en el que preferiblemente el activador transcripcional comprende un dominio VP64, en el que preferiblemente el activador transcripcional comprende una pluralidad de dominios VP64,
el dominio de fusión de epítopos comprende una pluralidad de epítopos GCN4,
el dCas9 comprende una secuencia de aminoácidos de SEQ ID NO: 4, o
el agente de afinidad comprende una secuencia de aminoácidos de SEQ ID NO: 5.
3. El método de la reivindicación 1, en el que la selección de las células de prueba de la pluralidad de células de prueba sobre la base del fenotipo comprende
cultivar la pluralidad de células de prueba, seleccionando así las células de prueba sobre la base de la proliferación celular, en el que preferiblemente el cultivo se realiza en presencia de un agente de selección, en el que preferiblemente el agente de selección es un quimioterapéutico, un agente que daña el ADN, un agente citotóxico, un factor de crecimiento, un factor de transcripción, una quinasa, un fármaco, un gen exógeno bajo el control de un promotor heterólogo o una hormona, o
seleccionar las células de prueba en función de la expresión de proteínas, la expresión de ARN o la actividad de proteínas, o
seleccionar las células de prueba en función de la motilidad celular.
4. El método de la reivindicación 1, en el que la cuantificación de la frecuencia comprende una secuenciación profunda, en el que la secuenciación profunda comprende preferiblemente una secuenciación con una redundancia de al menos aproximadamente 10.
5. Un método para identificar elementos genéticos interactuantes, el método comprende:
(i) realizar cualquiera de los métodos de las reivindicaciones 1 a 4, identificando así una pluralidad de sgRNA estructuralmente distintos que se dirigen a elementos genéticos que modulan el fenotipo;
(ii) poner en contacto una pluralidad de células de prueba de interacción con una biblioteca que comprende una pluralidad de combinaciones por pares de los sgRNA estructuralmente distintos identificados en (i) obtener una pluralidad de células de prueba contactadas;
(iii) seleccionar células de prueba de la pluralidad de células de prueba contactadas sobre la base del fenotipo para obtener una población de células de prueba seleccionadas; y
(iv) cuantificar la frecuencia de las combinaciones por pares de sgRNA estructuralmente distintos dentro de la población de células de prueba seleccionadas, en el que se predice que las combinaciones por pares de sgRNA estructuralmente distintos que están sobrerrepresentados en la población de células de prueba seleccionadas se dirigen a elementos genéticos interactuantes,
en el que cada elemento genético es una región entre 0-750 pb en la dirección ascendente del sitio de inicio de la transcripción de un gen que modula el fenotipo.
6. El método de la reivindicación 5, en el que
Las combinaciones de pares de sgRNA estructuralmente distintos comprenden un primer miembro y un segundo miembro del par, y en donde el primer miembro y el segundo miembro se dirigen a elementos genéticos no vinculados.
7. Un método para optimizar un sgRNA, el método comprende:
realizar cualquiera de los métodos de las reivindicaciones 1 a 4,
en el que la pluralidad de sgRNA estructuralmente distintos se dirigen a diferentes regiones dentro o junto a un único elemento genético,
en el que los sgRNA más sobrerrepresentados en las células seleccionadas se identifican como sgRNA optimizados que se dirigen al elemento genético, en el que cada elemento genético es una región entre 0-750 pb en la dirección ascendente del sitio de inicio de la transcripción de un gen que modula el fenotipo.
8. El método de la reivindicación 1, en el que al menos una mayoría de los sgRNA comprenden de 5' a 3': • una región de horquilla 5', que comprende un sitio de endonucleasa único;
• una región de horquilla de 3'; y
• una secuencia de terminación de la transcripción,
en el que el ARN guía pequeño está configurado para formar un complejo con una nucleasa mediada por ARN guía pequeño, el complejo tiene una mayor estabilidad o actividad en relación con un complejo que contiene una nucleasa mediada por ARN guía pequeño y un ARN guía pequeño que comprende al menos un 95 % de identidad con SEQ ID NO: 6 o un complemento del mismo.
9. El método de la reivindicación 1, en el que al menos 104 Los genes son el objetivo y la biblioteca contiene menos de 2.5 x 105 sgRNA estructuralmente distintos.
ES15822737T 2014-07-14 2015-07-14 Crispr/cas transcriptional modulation Active ES3047792T3 (en)

Applications Claiming Priority (2)

Application Number Priority Date Filing Date Title
US201462024373P 2014-07-14 2014-07-14
PCT/US2015/040449 WO2016011080A2 (en) 2014-07-14 2015-07-14 Crispr/cas transcriptional modulation

Publications (1)

Publication Number Publication Date
ES3047792T3 true ES3047792T3 (en) 2025-12-04

Family

ID=55079163

Family Applications (1)

Application Number Title Priority Date Filing Date
ES15822737T Active ES3047792T3 (en) 2014-07-14 2015-07-14 Crispr/cas transcriptional modulation

Country Status (5)

Country Link
US (2) US11254933B2 (es)
EP (1) EP3169776B1 (es)
CA (2) CA2954791C (es)
ES (1) ES3047792T3 (es)
WO (1) WO2016011080A2 (es)

Families Citing this family (185)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US10323236B2 (en) 2011-07-22 2019-06-18 President And Fellows Of Harvard College Evaluation and improvement of nuclease cleavage specificity
WO2013163628A2 (en) 2012-04-27 2013-10-31 Duke University Genetic correction of mutated genes
US9828582B2 (en) 2013-03-19 2017-11-28 Duke University Compositions and methods for the induction and tuning of gene expression
SG11201600853UA (en) 2013-08-05 2016-03-30 Twist Bioscience Corp De novo synthesized gene libraries
US9163284B2 (en) 2013-08-09 2015-10-20 President And Fellows Of Harvard College Methods for identifying a target site of a Cas9 nuclease
US9359599B2 (en) 2013-08-22 2016-06-07 President And Fellows Of Harvard College Engineered transcription activator-like effector (TALE) domains and uses thereof
US9228207B2 (en) 2013-09-06 2016-01-05 President And Fellows Of Harvard College Switchable gRNAs comprising aptamers
US9322037B2 (en) 2013-09-06 2016-04-26 President And Fellows Of Harvard College Cas9-FokI fusion proteins and uses thereof
US9526784B2 (en) 2013-09-06 2016-12-27 President And Fellows Of Harvard College Delivery system for functional nucleases
US20150165054A1 (en) 2013-12-12 2015-06-18 President And Fellows Of Harvard College Methods for correcting caspase-9 point mutations
EP3690044B1 (en) 2014-02-11 2024-01-10 The Regents of the University of Colorado, a body corporate Crispr enabled multiplexed genome engineering
EP3122880B1 (en) 2014-03-26 2021-05-05 Editas Medicine, Inc. Crispr/cas-related methods and compositions for treating sickle cell disease
US10077453B2 (en) 2014-07-30 2018-09-18 President And Fellows Of Harvard College CAS9 proteins including ligand-dependent inteins
KR20170055474A (ko) * 2014-07-31 2017-05-19 아카데미아 시니카 길항 pd-1 압타머 및 암 요법 관련 적용에서의 그의 적용
GB201418965D0 (es) 2014-10-24 2014-12-10 Ospedale San Raffaele And Fond Telethon
US10669304B2 (en) 2015-02-04 2020-06-02 Twist Bioscience Corporation Methods and devices for de novo oligonucleic acid assembly
WO2016130600A2 (en) 2015-02-09 2016-08-18 Duke University Compositions and methods for epigenome editing
US9981239B2 (en) 2015-04-21 2018-05-29 Twist Bioscience Corporation Devices and methods for oligonucleic acid library synthesis
US10676723B2 (en) 2015-05-11 2020-06-09 David Gordon Bermudes Chimeric protein toxins for expression by therapeutic bacteria
US10954513B2 (en) 2015-06-18 2021-03-23 University Of Utah Research Foundation RNA-guided transcriptional regulation and methods of using the same for the treatment of back pain
EP3350314A4 (en) 2015-09-18 2019-02-06 Twist Bioscience Corporation OLIGONUCLEIC ACID VARIANT LIBRARIES VARIANT AND SYNTHESIS THEREOF
KR102794025B1 (ko) 2015-09-22 2025-04-09 트위스트 바이오사이언스 코포레이션 핵산 합성을 위한 가요성 기판
EP4089175A1 (en) 2015-10-13 2022-11-16 Duke University Genome engineering with type i crispr systems in eukaryotic cells
IL310721B2 (en) 2015-10-23 2025-11-01 Harvard College Nucleobase editors and uses thereof
US20190062752A1 (en) * 2015-10-29 2019-02-28 Whitehead Institute For Biomedical Research Transcription Factor Trapping by RNA in Gene Regulatory Elements
CN115491373A (zh) 2015-10-30 2022-12-20 爱迪塔斯医药公司 治疗单纯疱疹病毒的crispr/cas相关方法及组合物
PT3380615T (pt) * 2015-11-25 2021-04-01 Nogra Pharma Ltd Oligonucleótidos antissentido il-34 e métodos de utilização dos mesmos
KR102787119B1 (ko) 2015-11-30 2025-03-27 듀크 유니버시티 유전자 편집에 의한 인간 디스트로핀 유전자의 교정을 위한 치료용 표적 및 사용 방법
CN115920796A (zh) 2015-12-01 2023-04-07 特韦斯特生物科学公司 功能化表面及其制备
WO2017093969A1 (en) 2015-12-04 2017-06-08 Novartis Ag Compositions and methods for immunooncology
KR20180118111A (ko) * 2015-12-23 2018-10-30 크리스퍼 테라퓨틱스 아게 근위축성 측색 경화증 및/또는 전두측두엽 퇴행의 치료 물질 및 방법
US20190038780A1 (en) * 2016-02-05 2019-02-07 Regents Of The University Of Minnesota Vectors and system for modulating gene expression
US20210207131A1 (en) * 2016-02-18 2021-07-08 President And Fellows Of Harvard College Multiplex Alteration of Cells Using a Pooled Nucleic Acid Library and Analysis Thereof
US11514289B1 (en) 2016-03-09 2022-11-29 Freenome Holdings, Inc. Generating machine learning models using genetic data
EP3219799A1 (en) 2016-03-17 2017-09-20 IMBA-Institut für Molekulare Biotechnologie GmbH Conditional crispr sgrna expression
US20190127713A1 (en) 2016-04-13 2019-05-02 Duke University Crispr/cas9-based repressors for silencing gene targets in vivo and methods of use
WO2017178193A1 (en) * 2016-04-14 2017-10-19 MAX-PLANCK-Gesellschaft zur Förderung der Wissenschaften e.V. Method for the identification of random polynucleotide or polypeptide sequences with biological activity
AU2017280353B2 (en) 2016-06-24 2021-11-11 Inscripta, Inc. Methods for generating barcoded combinatorial libraries
WO2018002730A1 (en) * 2016-06-29 2018-01-04 Crispr Therapeutics Ag Materials and methods for treatment of apolipoprotein c3 (apociii)-related disorders
AU2017286835B2 (en) * 2016-06-29 2023-12-14 Crispr Therapeutics Ag Compositions and methods for gene editing
EP4484443A3 (en) * 2016-06-29 2025-03-26 CRISPR Therapeutics AG Materials and methods for treatment of friedreich ataxia and other related disorders
EP3481432A4 (en) * 2016-07-05 2020-05-06 The U.S.A. as represented by the Secretary, Department of Health and Human Services Diagnosing col6-related disorders and methods for treating same
JP7490211B2 (ja) 2016-07-19 2024-05-27 デューク ユニバーシティ Cpf1に基づくゲノム編集の治療適用
JP2019523009A (ja) 2016-07-29 2019-08-22 リジェネロン・ファーマシューティカルズ・インコーポレイテッドRegeneron Pharmaceuticals, Inc. C末端切断型フィブリリン−1の発現をもたらす変異を有するマウス
CN110214183A (zh) 2016-08-03 2019-09-06 哈佛大学的校长及成员们 腺苷核碱基编辑器及其用途
WO2018031683A1 (en) 2016-08-09 2018-02-15 President And Fellows Of Harvard College Programmable cas9-recombinase fusion proteins and uses thereof
EP3500672A4 (en) * 2016-08-22 2020-05-20 Twist Bioscience Corporation DE NOVO SYNTHETIZED NUCLEIC ACID LIBRARIES
US11542509B2 (en) 2016-08-24 2023-01-03 President And Fellows Of Harvard College Incorporation of unnatural amino acids into proteins using base editing
US10417457B2 (en) 2016-09-21 2019-09-17 Twist Bioscience Corporation Nucleic acid based data storage
KR102622411B1 (ko) 2016-10-14 2024-01-10 프레지던트 앤드 펠로우즈 오브 하바드 칼리지 핵염기 에디터의 aav 전달
US11129906B1 (en) 2016-12-07 2021-09-28 David Gordon Bermudes Chimeric protein toxins for expression by therapeutic bacteria
GB2573069A (en) 2016-12-16 2019-10-23 Twist Bioscience Corp Variant libraries of the immunological synapse and synthesis thereof
WO2018119359A1 (en) 2016-12-23 2018-06-28 President And Fellows Of Harvard College Editing of ccr5 receptor gene to protect against hiv infection
TW201839136A (zh) 2017-02-06 2018-11-01 瑞士商諾華公司 治療血色素異常症之組合物及方法
US11730828B2 (en) 2017-02-07 2023-08-22 The Regents Of The University Of California Gene therapy for haploinsufficiency
EP3585895A1 (en) * 2017-02-22 2020-01-01 CRISPR Therapeutics AG Compositions and methods for gene editing
EP4556433A3 (en) 2017-02-22 2025-08-06 Twist Bioscience Corporation Nucleic acid based data storage
EP3585900B1 (en) * 2017-02-22 2022-12-21 CRISPR Therapeutics AG Materials and methods for treatment of spinocerebellar ataxia type 2 (sca2) and other spinocerebellar ataxia type 2 protein (atxn2) gene related conditions or disorders
EP3592853A1 (en) 2017-03-09 2020-01-15 President and Fellows of Harvard College Suppression of pain by gene editing
US12390514B2 (en) 2017-03-09 2025-08-19 President And Fellows Of Harvard College Cancer vaccine
US11542496B2 (en) 2017-03-10 2023-01-03 President And Fellows Of Harvard College Cytosine to guanine base editor
WO2018170184A1 (en) 2017-03-14 2018-09-20 Editas Medicine, Inc. Systems and methods for the treatment of hemoglobinopathies
WO2018170169A1 (en) 2017-03-15 2018-09-20 Twist Bioscience Corporation Variant libraries of the immunological synapse and synthesis thereof
WO2018175636A2 (en) 2017-03-22 2018-09-27 Novartis Ag Compositions and methods for immunooncology
KR20240116572A (ko) 2017-03-23 2024-07-29 프레지던트 앤드 펠로우즈 오브 하바드 칼리지 핵산 프로그램가능한 dna 결합 단백질을 포함하는 핵염기 편집제
TWI626309B (zh) * 2017-03-31 2018-06-11 國立清華大學 大量表現目標蛋白系統及其方法
JP2020517247A (ja) 2017-04-18 2020-06-18 イエール ユニバーシティ Tリンパ球ゲノム操作のためのプラットフォームおよびそのインビボハイスループットスクリーニング法
EP3622070A2 (en) 2017-05-10 2020-03-18 Editas Medicine, Inc. Crispr/rna-guided nuclease systems and methods
WO2018209014A1 (en) * 2017-05-10 2018-11-15 Regents Of The University Of Minnesota Programmable transcription factors and methods
US11560566B2 (en) 2017-05-12 2023-01-24 President And Fellows Of Harvard College Aptazyme-embedded guide RNAs for use with CRISPR-Cas9 in genome editing and transcriptional activation
WO2018231872A1 (en) 2017-06-12 2018-12-20 Twist Bioscience Corporation Methods for seamless nucleic acid assembly
WO2018231864A1 (en) 2017-06-12 2018-12-20 Twist Bioscience Corporation Methods for seamless nucleic acid assembly
KR20180136905A (ko) * 2017-06-15 2018-12-26 주식회사 툴젠 반복 확장 돌연변이에 대한 게놈 편집 시스템
US10011849B1 (en) 2017-06-23 2018-07-03 Inscripta, Inc. Nucleic acid-guided nucleases
US9982279B1 (en) 2017-06-23 2018-05-29 Inscripta, Inc. Nucleic acid-guided nucleases
CN109136351A (zh) * 2017-06-27 2019-01-04 华中农业大学 一种通过扩增子高通量测序技术检测sgRNA活性和特异性的方法
US20210130817A1 (en) * 2017-07-14 2021-05-06 Cure Genetics Co., Ltd. Gene Editing System and Gene Editing Method
US11866726B2 (en) 2017-07-14 2024-01-09 Editas Medicine, Inc. Systems and methods for targeted integration and genome editing and detection thereof using integrated priming sites
GB201711782D0 (en) * 2017-07-21 2017-09-06 Ucl Business Plc Diagnostic and Prognostic methods
CN111801345A (zh) 2017-07-28 2020-10-20 哈佛大学的校长及成员们 使用噬菌体辅助连续进化(pace)的进化碱基编辑器的方法和组合物
EP3663310A4 (en) 2017-08-04 2021-08-11 Peking University TALE RVD SPECIFICALLY RECOGNIZING A DNA BASE MODIFIED BY METHYLATION AND CORRESPONDING APPLICATION
WO2019028686A1 (zh) 2017-08-08 2019-02-14 北京大学 基因敲除方法
WO2019046304A1 (en) 2017-08-28 2019-03-07 Matthias Wagner MICROFLUIDIC LASER ACTIVATED INTRACELLULAR ADMINISTRATION SYSTEMS AND METHODS
EP3676376B1 (en) 2017-08-30 2025-01-15 President and Fellows of Harvard College High efficiency base editors comprising gam
US20190076814A1 (en) * 2017-09-11 2019-03-14 Synthego Corporation Biopolymer synthesis system and method
US11407837B2 (en) 2017-09-11 2022-08-09 Twist Bioscience Corporation GPCR binding proteins and synthesis thereof
KR20250107288A (ko) 2017-10-16 2025-07-11 더 브로드 인스티튜트, 인코퍼레이티드 아데노신 염기 편집제의 용도
CN111565834B (zh) 2017-10-20 2022-08-26 特韦斯特生物科学公司 用于多核苷酸合成的加热的纳米孔
JP7097440B2 (ja) 2017-11-10 2022-07-07 リジェネロン・ファーマシューティカルズ・インコーポレイテッド Slc30a8変異を含む非ヒト動物および使用方法
WO2019103984A1 (en) * 2017-11-22 2019-05-31 Memorial Sloan Kettering Cancer Center Compositions including fatp1, fatp3, fatp4, fatp5, and/or fatp6 inhibitors and uses thereof
US12406749B2 (en) 2017-12-15 2025-09-02 The Broad Institute, Inc. Systems and methods for predicting repair outcomes in genetic engineering
EP3727469A4 (en) * 2017-12-22 2021-12-01 The Broad Institute, Inc. NEW CRISPR ENZYMES AND SYSTEMS
US20200318106A1 (en) * 2017-12-22 2020-10-08 Bio-Rad Laboratories, Inc. Controlling phenotype of organisms with crispr/cas gene targeting
US20210017544A1 (en) * 2017-12-22 2021-01-21 Novozymes A/S Counter-Selection by Inhibition of Conditionally Essential Genes
KR102804057B1 (ko) 2018-01-04 2025-05-07 트위스트 바이오사이언스 코포레이션 Dna 기반 디지털 정보 저장
EP3740580A4 (en) 2018-01-19 2021-10-20 Duke University GENOME ENGINEERING WITH CRISPR-CAS SYSTEMS IN EUKARYONTS
MA51869A (fr) * 2018-02-16 2020-12-23 Bayer Healthcare Llc Compositions et méthodes pour l'édition génique par ciblage du fibrinogène-alpha
EP3762496A2 (en) * 2018-03-07 2021-01-13 Editas Medicine, Inc. Systems and methods for the treatment of hemoglobinopathies
KR102907245B1 (ko) 2018-03-14 2026-01-05 에디타스 메디신, 인코포레이티드 혈색소병증 치료를 위한 시스템 및 방법
US20190284553A1 (en) 2018-03-15 2019-09-19 KSQ Therapeutics, Inc. Gene-regulating compositions and methods for improved immunotherapy
EP3592140A1 (en) 2018-03-19 2020-01-15 Regeneron Pharmaceuticals, Inc. Transcription modulation in animals using crispr/cas systems
WO2019185750A1 (en) * 2018-03-27 2019-10-03 Danmarks Tekniske Universitet A high-throughput platform to select for regulators of crispr-cas associated activity
JP2021522188A (ja) * 2018-04-18 2021-08-30 イエール ユニバーシティ 内因性遺伝子活性化を用いる多重腫瘍ワクチン接種のための組成物および方法
KR102922694B1 (ko) 2018-04-19 2026-02-03 더 리젠츠 오브 더 유니버시티 오브 캘리포니아 유전자 편집을 위한 조성물 및 방법
CA3100050A1 (en) 2018-05-11 2019-11-14 Lupagen, Inc. Systems and methods for closed loop, real-time modifications of patient cells
CA3100739A1 (en) 2018-05-18 2019-11-21 Twist Bioscience Corporation Polynucleotides, reagents, and methods for nucleic acid hybridization
US12157760B2 (en) 2018-05-23 2024-12-03 The Broad Institute, Inc. Base editors and uses thereof
CN108707635B (zh) * 2018-05-29 2022-02-15 华东师范大学 用于核苷酸序列修饰的组合物、方法与应用
CA3101481A1 (en) * 2018-05-30 2019-12-05 The Governing Council Of The University Of Toronto Methods and kits for identifying a protein associated with receptor-ligand interactions
EP3823633A4 (en) 2018-06-29 2023-05-03 Editas Medicine, Inc. SYNTHETIC LEAD MOLECULES, COMPOSITIONS AND METHODS RELATED THERETO
US12522807B2 (en) 2018-07-09 2026-01-13 The Broad Institute, Inc. RNA programmable epigenetic RNA modifiers and uses thereof
CN112534055A (zh) 2018-07-13 2021-03-19 豪夫迈·罗氏有限公司 用于调节rtel1表达的寡核苷酸
US11608519B2 (en) * 2018-07-30 2023-03-21 Tokitae Llc Specific detection of deoxyribonucleic acid sequences using novel CRISPR enzyme-mediated detection strategies
US20200032324A1 (en) * 2018-07-30 2020-01-30 Tokitae Llc Specific detection of ribonucleic acid sequences using novel crispr enzyme-mediated detection strategies
MX2021001070A (es) * 2018-07-31 2021-05-27 Intellia Therapeutics Inc Composiciones y métodos para editar el gen hidroxiácido oxidasa 1 (hao1) para tratar la hiperoxaluria primaria tipo 1 (ph1).
US12497611B2 (en) * 2018-08-17 2025-12-16 Yale University Compositions and methods for high-throughput activation screening to boost T cell effector function
KR102769565B1 (ko) 2018-09-19 2025-02-20 애로우헤드 파마슈티컬스 인코포레이티드 17베타-HSD 유형 13- (HSD17B13)의 발현을 억제하기 위한 RNAi 작용제, 그의 조성물, 및 사용 방법
EP3628735A1 (en) * 2018-09-25 2020-04-01 Centre National De La Recherche Scientifique Antisense rna targeting pmp22 for the treatment of charcot-marie-tooth 1a disease
CN110951777A (zh) * 2018-09-26 2020-04-03 中国科学技术大学 一种基因转录调控体系及其应用
US12331320B2 (en) 2018-10-10 2025-06-17 The Research Foundation For The State University Of New York Genome edited cancer cell vaccines
US12410428B2 (en) * 2018-10-18 2025-09-09 University Of Utah Research Foundation RNA-guided transcriptional regulation and methods of using the same for the treatment of back pain
AU2019360270B2 (en) 2018-10-18 2025-08-07 Intellia Therapeutics, Inc. Compositions and methods for expressing factor IX.
UY38427A (es) 2018-10-26 2020-05-29 Novartis Ag Métodos y composiciones para terapia con células oculares
WO2020092453A1 (en) 2018-10-29 2020-05-07 The Broad Institute, Inc. Nucleobase editors comprising geocas9 and uses thereof
EP3874045A4 (en) 2018-10-31 2022-09-07 The Regents of The University of California Methods and kits for identifying cancer treatment targets
WO2020092725A1 (en) * 2018-11-01 2020-05-07 Montana State University Gene modulation with crispr system type i
EP3877748A4 (en) 2018-11-06 2022-11-09 Cellino Biotech, Inc. Systems for cell control
WO2020139871A1 (en) 2018-12-26 2020-07-02 Twist Bioscience Corporation Highly accurate de novo polynucleotide synthesis
US12351837B2 (en) 2019-01-23 2025-07-08 The Broad Institute, Inc. Supernegatively charged proteins and uses thereof
BR112021013369A2 (pt) 2019-01-31 2021-09-21 Ionis Pharmaceuticals, Inc. Moduladores de expressão de yap1
EP3924514A4 (en) * 2019-02-11 2022-12-28 Tokitae LLC SOLUTION-PHASE TRANSACTIVATED REPORTER SYSTEMS FOR USE IN CRISPR-BASED NUCLEIC ACID SEQUENCE DETECTION
JP7624728B2 (ja) * 2019-02-25 2025-01-31 ユニバーシティ オブ マサチューセッツ Dna結合ドメイントランスアクチベーター及びその使用
CN113766930B (zh) 2019-02-26 2025-07-22 特韦斯特生物科学公司 Glp1受体的变异核酸文库
JP2022522668A (ja) 2019-02-26 2022-04-20 ツイスト バイオサイエンス コーポレーション 抗体を最適化するための変異体核酸ライブラリ
CN120648640A (zh) 2019-03-18 2025-09-16 瑞泽恩制药公司 用于鉴定tau接种或聚集的基因修饰因子的CRISPR/Cas筛选平台
EP3769090B1 (en) 2019-03-18 2023-11-15 Regeneron Pharmaceuticals, Inc. Crispr/cas dropout screening platform to reveal genetic vulnerabilities associated with tau aggregation
WO2020191233A1 (en) 2019-03-19 2020-09-24 The Broad Institute, Inc. Methods and compositions for editing nucleotide sequences
US12473543B2 (en) 2019-04-17 2025-11-18 The Broad Institute, Inc. Adenine base editors with reduced off-target effects
US11332738B2 (en) 2019-06-21 2022-05-17 Twist Bioscience Corporation Barcode-based nucleic acid sequence assembly
WO2021021677A1 (en) * 2019-07-26 2021-02-04 The Regents Of The University Of California Control of mammalian gene dosage using crispr
JP2022545462A (ja) * 2019-08-19 2022-10-27 デューク ユニバーシティ Crispr/cas9ベースの転写活性化因子による骨格筋芽細胞前駆細胞系譜特定
EP4034566A4 (en) 2019-09-23 2024-01-24 Twist Bioscience Corporation VARIANT NUCLEIC ACID BANKS FOR CRTH2
JP2022548783A (ja) 2019-09-23 2022-11-21 ツイスト バイオサイエンス コーポレーション 単一ドメイン抗体のバリアント核酸ライブラリー
US20220364124A1 (en) * 2019-10-02 2022-11-17 Duke University Epigenetic modulation of genomic targets to control expression of pws-associated genes
US12435330B2 (en) 2019-10-10 2025-10-07 The Broad Institute, Inc. Methods and compositions for prime editing RNA
JP2023501352A (ja) * 2019-11-08 2023-01-18 アイオーニス ファーマシューティカルズ, インコーポレーテッド Spdef発現を低減するための化合物及び方法
WO2021113788A1 (en) * 2019-12-06 2021-06-10 Pairwise Plants Services, Inc. Recruitment methods and compounds, compositions and systems for recruitment
BR112022011235A2 (pt) 2019-12-09 2022-12-13 Twist Bioscience Corp Bibliotecas de variantes de ácido nucleico para receptores de adenosina
US11859172B2 (en) 2020-01-02 2024-01-02 The Trustees Of Columbia University In The City Of New York Programmable and portable CRISPR-Cas transcriptional activation in bacteria
JPWO2021167101A1 (es) * 2020-02-21 2021-08-26
WO2021178769A1 (en) * 2020-03-06 2021-09-10 Ionis Pharmaceuticals, Inc. Compounds and methods for modulating kcnq2
EP4142801A4 (en) * 2020-04-27 2024-09-25 The Trustees of The University of Pennsylvania Compositions and methods for reducing nuclease expression and off-target activity using a promoter with low transcriptional activity
JP2023522784A (ja) 2020-04-27 2023-05-31 ノバルティス アーゲー 眼細胞療法のための方法及び組成物
US20240401032A1 (en) * 2020-05-04 2024-12-05 The Board Of Trustees Of The Leland Stanford Junior University Compositions, systems, and methods for the generation, identification, and characterization of effector domains for activating and silencing gene expression
IL297761A (en) 2020-05-08 2022-12-01 Broad Inst Inc Methods and compositions for simultaneously editing two helices of a designated double-helix nucleotide sequence
CN115698335A (zh) 2020-05-22 2023-02-03 因斯特罗公司 使用机器学习模型预测疾病结果
WO2022008557A2 (en) * 2020-07-08 2022-01-13 UCB Biopharma SRL Modulation of cftr expression
CN111979226B (zh) * 2020-09-01 2022-11-08 广州鼓润医疗科技有限公司 一种可批量进行体外脱靶检测及sgRNA筛选的方法
JP2023542889A (ja) 2020-09-17 2023-10-12 キュー-ステート バイオサイエンシーズ, インコーポレイテッド 複数の標的を介して疼痛を処置するための治療用組成物
BR112023007024A2 (pt) * 2020-10-15 2023-10-03 Univ Northeastern Células modificadas para produção aumentada de colágeno
MX2023009429A (es) * 2021-02-11 2023-09-27 Ionis Pharmaceuticals Inc Compuestos y metodos para reducir la expresion de pln.
WO2022226377A1 (en) * 2021-04-22 2022-10-27 Molecular Axiom, Llc Compositions and methods for modulating sos gene expressions
US20240279649A1 (en) * 2021-05-11 2024-08-22 Seattle Children's Hospital D/B/A Seattle Children's Research Institute Gene editing for expression of functional factor viii for the treatment of hemophilia
AU2022276078A1 (en) 2021-05-17 2024-01-04 Nogra Pharma Limited Il-34 antisense agents and methods of using same
EP4367242A2 (en) * 2021-07-07 2024-05-15 Omega Therapeutics, Inc. Compositions and methods for modulating secreted frizzled receptor protein 1 (sfrp1) gene expression
CN115704040A (zh) * 2021-08-06 2023-02-17 华东理工大学 基于CRISPRi和CRISPRa的转录调控系统、其建立方法及应用
US20240263173A1 (en) * 2021-08-11 2024-08-08 The Board Of Trustees Of The Leland Stanford Junior University High-throughput precision genome editing in human cells
WO2023044412A1 (en) * 2021-09-17 2023-03-23 Ionis Pharmaceuticals, Inc. Compounds and methods for reducing dnm1l or drp1 expression
KR20240117571A (ko) 2021-12-08 2024-08-01 리제너론 파마슈티칼스 인코포레이티드 돌연변이 마이오실린 질환 모델 및 이의 용도
KR20240126870A (ko) 2021-12-22 2024-08-21 캠프4 테라퓨틱스 코포레이션 조절 rna들을 표적으로 하는 안티센스 올리고뉴클레오티드를 사용한 유전자 전사의 조절
KR102856419B1 (ko) * 2021-12-27 2025-09-10 중앙대학교 산학협력단 CRISPRi 시스템 기반 표적 유전자 스크리닝 방법 및 이의 용도
US20250064974A1 (en) * 2022-01-06 2025-02-27 Ucl Business Ltd Endogenous gene regulation to treat neurological disorders and diseases
WO2023172783A2 (en) * 2022-01-07 2023-09-14 The Government Of The United States, As Represented By The Secretary Of The Army Hemostatic composition containing recombinant human clotting factors, and method of producing
US20250134999A1 (en) * 2022-01-14 2025-05-01 Tune Therapeutics, Inc. Compositions, systems, and methods for programming t cell phenotypes through targeted gene activation
EP4282964A1 (en) * 2022-05-23 2023-11-29 Universitat de Valéncia Oligonucleotides conjugated to oleic acid and uses thereof
US20250333732A1 (en) * 2022-05-23 2025-10-30 Empirico Inc. Treatment of sos2 related diseases and disorders
IL317874A (en) 2022-06-24 2025-02-01 Tune Therapeutics Inc Compounds, systems and methods for reducing low density lipoproteins through targeted gene suppression
WO2024158825A2 (en) 2023-01-23 2024-08-02 Engine Biosciences Pte. Ltd. Methods to modulate tau for treatment of tauopathies
KR20250165443A (ko) 2023-02-17 2025-11-25 화이트헤드 인스티튜트 포 바이오메디칼 리서치 후성유전학적 변형 제조를 위한 조성물 및 방법
WO2024233712A2 (en) * 2023-05-09 2024-11-14 Novascope Biochips Inc. Method and sensor for detecting bacterial nucleic acid
WO2024238698A2 (en) * 2023-05-15 2024-11-21 The Regents Of The University Of California Transcription factor 4 gene editing system
WO2024238691A2 (en) * 2023-05-15 2024-11-21 The Regents Of The University Of California Andp gene editing system
WO2025061842A1 (en) 2023-09-19 2025-03-27 Charité - Universitätsmedizin Berlin Gene editing tgm1 mutations for treating autosomal recessive congenital ichthyosis (arci)
WO2026015647A1 (en) * 2024-07-09 2026-01-15 Tune Therapeutics, Inc. Compositions, systems, and methods for cell differentiation using targeted gene activation of dll4 and/or vcam1
WO2026078664A1 (en) * 2024-10-10 2026-04-16 Instituto De Biologia Experimental E Tecnológica (Ibet) Transcription factor enhancing recombinant adeno-associated virus production, products, methods and uses thereof

Family Cites Families (18)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
US20070224663A1 (en) * 1997-03-07 2007-09-27 Human Genome Sciences, Inc. Human Secreted Proteins
WO2002085923A2 (en) 2001-04-19 2002-10-31 The Scripps Research Institute In vivo incorporation of unnatural amino acids
TW201302793A (zh) * 2010-09-03 2013-01-16 Glaxo Group Ltd 新穎之抗原結合蛋白
NO2748201T3 (es) * 2011-08-23 2018-05-12
CA2843158A1 (en) * 2011-08-26 2013-03-07 Merrimack Pharmaceuticals, Inc. Tandem fc bispecific antibodies
AU2013266968B2 (en) * 2012-05-25 2017-06-29 Emmanuelle CHARPENTIER Methods and compositions for RNA-directed target DNA modification and for RNA-directed modulation of transcription
CN104540382A (zh) * 2012-06-12 2015-04-22 弗·哈夫曼-拉罗切有限公司 用于产生条件性敲除等位基因的方法和组合物
JP6401700B2 (ja) 2012-06-29 2018-10-10 マサチューセッツ インスティテュート オブ テクノロジー 超並列コンビナトリアル遺伝学
AU2013293270B2 (en) * 2012-07-25 2018-08-16 Massachusetts Institute Of Technology Inducible DNA binding proteins and genome perturbation tools and applications thereof
AU2013335451C1 (en) * 2012-10-23 2024-07-04 Toolgen Incorporated Composition for cleaving a target DNA comprising a guide RNA specific for the target DNA and Cas protein-encoding nucleic acid or Cas protein, and use thereof
PL3360964T3 (pl) * 2012-12-06 2020-03-31 Sigma-Aldrich Co. Llc Modyfikacja i regulacja genomu oparta na crispr
US8697359B1 (en) * 2012-12-12 2014-04-15 The Broad Institute, Inc. CRISPR-Cas systems and methods for altering expression of gene products
EP2931899A1 (en) * 2012-12-12 2015-10-21 The Broad Institute, Inc. Functional genomics using crispr-cas systems, compositions, methods, knock out libraries and applications thereof
WO2014093655A2 (en) 2012-12-12 2014-06-19 The Broad Institute, Inc. Engineering and optimization of systems, methods and compositions for sequence manipulation with functional domains
DK2931891T3 (da) 2012-12-17 2019-08-19 Harvard College Rna-styret modificering af menneskelige genomer
RU2662932C2 (ru) * 2013-03-14 2018-07-31 Карибо Биосайенсиз, Инк. Композиции и способы с участием нуклеиновых кислот, нацеленных на нуклеиновые кислоты
WO2015048690A1 (en) 2013-09-27 2015-04-02 The Regents Of The University Of California Optimized small guide rnas and methods of use
US20150376586A1 (en) * 2014-06-25 2015-12-31 Caribou Biosciences, Inc. RNA Modification to Engineer Cas9 Activity

Also Published As

Publication number Publication date
WO2016011080A3 (en) 2016-03-03
CA2954791A1 (en) 2016-01-21
EP3169776A4 (en) 2018-07-04
WO2016011080A2 (en) 2016-01-21
US20230042624A1 (en) 2023-02-09
US20170204407A1 (en) 2017-07-20
EP3169776B1 (en) 2025-09-03
US11254933B2 (en) 2022-02-22
EP3169776C0 (en) 2025-09-03
CA3284652A1 (en) 2026-03-02
EP3169776A2 (en) 2017-05-24
CA2954791C (en) 2025-11-18

Similar Documents

Publication Publication Date Title
ES3047792T3 (en) Crispr/cas transcriptional modulation
US12460203B2 (en) CRISPR RNA targeting enzymes and systems and uses thereof
Percharde et al. A LINE1-nucleolin partnership regulates early development and ESC identity
Kaneko et al. Interactions between JARID2 and noncoding RNAs regulate PRC2 recruitment to chromatin
Spengler et al. Functional microRNAs and target sites are created by lineage-specific transposition
Lim et al. Uridylation by TUT4 and TUT7 marks mRNA for degradation
Dönertas et al. Drosophila Gtsf1 is an essential component of the Piwi-mediated transcriptional silencing complex
Chalertpet et al. Argonaute 4 as an effector protein in RNA-directed DNA methylation in human cells
Wongtrakoongate et al. Association of the long non-coding RNA steroid receptor RNA activator (SRA) with TrxG and PRC2 complexes
CN105451778A (zh) Rna-导向的转录调控
Luo et al. Global profiling of cellular substrates of human Dcp2
ES2969026T3 (es) Plataforma de detección de abandonos CRISPR/CAS para revelar vulnerabilidades genéticas asociadas con la agregación de tau
Cencioni et al. Zeb1-Hdac2-eNOS circuitry identifies early cardiovascular precursors in naive mouse embryonic stem cells
Chary et al. Mechanistic divergence of piRNA biogenesis in Drosophila
Toomer et al. Long Non-coding RNAs Diversity in Form and Function: From Microbes to Humans
WO2025216732A1 (en) Methods and compositions relating to ecdna biogenesis
Huelga Comprehensive discovery and analysis of RNA binding protein-dependent post-transcriptional events in mammalian systems
Farhangmehr Development and Application of a Dual-Targeting CRISPR System Reveals Intron-level Gene Functions
Chang A Programable CRISPR System to Methylate and Demethylate N6-Methlyadenosine on Specific Transcripts in Mammalian Cells
de Santiago Algarra DISSECTION OF THE COORDINATED INTERFERON RESPONSE BY PROMOTER ELEMENTS WITH ENHANCER ACTIVITY
Aydin DEAD-box ATPase Dbp2 participates in a specific mRNP assembly checkpoint during RNA biogenesis in S. pombe
D’Orso et al. KAP1 is a Chromatin Reader that Couples Steps of RNA Polymerase II Transcription to Sustain Oncogenic Programs
Easterwood An Exploration of Cell Type-Specific Enhancer RNAs
Lee et al. Nuclear Retention and Rna Editing Suppress the Recognition of Undegraded Intron Lariats as Non-Self
Dehmer A novel USP11-TCEAL1-mediated mechanism protects transcriptional elongation by RNA Polymerase II