Alineamiento de dos secuencias Descubre las seis diferencias
Alineamiento de dos secuencias Descubre las seis diferencias
Alineamiento de dos secuencias Dos secuencias siempre se pueden alinear y son muchos los posibles alineamientos. Multitud de alineamientos posibles
Alineamiento de dos secuencias Para alinear dos secuencias de longitud n y m, respectivamente, se colocan una encima de la otra de manera que el número de símbolos coincidentes sea máximo. Si es necesario, se introducen huecos (gaps). indel * Un sistema de puntuación Alineamiento de dos secuencias
Alineamiento de dos secuencias En cada una de las posiciones de un alineamiento de secuencias se puede encontrar: Un símbolo idéntico (match) que se ha conservado a lo largo de la evolución Un símbolo distinto (mismatch) que ha sido sustituido (o que ha mutado) a lo largo de la evolución Un hueco (gap), que es el resultado de la desaparicón (deletion) de un símbolo en una secuencia o de la inserción (insertion) de un símbolo en la otra. Como ambos casos son indistinguibles, también se les llama indels. Indels Las tres posibilidades: match, mismatch, gap
Alineamiento de dos secuencias 1. - Alineamiento global Un alineamiento global se extiende por toda la longitud de la secuencia Homología 2. - Alineamiento local Un alineamiento local se limita a una región concreta de la secuencia Motivos conservados 3. - Alineamiento semiglobal Un alineamiento semiglobal se produce entre el final de una secuencia y el inicio de otra Ensamblaje de secuencias Tipos de alineamiento de dos secuencias
Alineamiento de dos secuencias Un alineamiento global intenta alinear cada residuo de una secuencia con un residuo (o un indel) de la otra. Permite (1) establecer relaciones de homología y (2) hacer un análisis filogenético. Es especialmente adecuado cuando: • Se comparan genes o proteínas con una misma función • Las secuencias tienen aproximadamente la misma longitud • Las secuencias están estrechamente relacionadas • Los dominios conservados se encuentran en el mismo orden Para hacer un alineamiento global se utiliza el algoritmo de Needleman y Wunsch Alineamiento global
Alineamiento de dos secuencias https: //www. ebi. ac. uk/Tools/psa/emboss_needle/ EMBOSS Needle reads two input sequences (DNA, RNA or proteins) and writes their optimal global sequence alignment to file. La herramienta EMBOSS Needle (EBI)
Alineamiento de dos secuencias En un alineamiento local, una o más regiones de una secuencia se alinean con una o más regiones de la otra. Permite (1) detectar pequeñas regiones conservadas de similitud local (centros activos, dominios proteicos, exones) y (2) distinguir entre exones e intrones. Es especialmente adecuado cuando: • Se comparan secuencias muy divergentes (de igual longitud o no) • No se conoce el orden de los dominios conservados • Se compara ADNc (o ESTs) con el ADN genómico Para hacer un alineamiento local se utiliza el algoritmo de Smith y Waterman Alineamiento local
Alineamiento de dos secuencias https: //www. ebi. ac. uk/Tools/psa/emboss_water/ EMBOSS Water reads two input sequences (DNA, RNA or proteins) and writes their optimal global sequence alignment to file. La herramienta EMBOSS Water (EBI)
Alineamiento de dos secuencias Uso principal: búsqueda de secuencias en BD
Alineamiento de dos secuencias https: //blast. ncbi. nlm. nih. gov/Blast. cgi La herramienta Blast (NCBI)
Alineamiento de dos secuencias Un alineamiento semiglobal se utiliza para alinear secuencias con una longitud muy distinta Un alineamiento semiglobal permite (1) ensamblar contigs a partir de fragmentos más pequeños y (2) comparar ADNc (o ESTs) con el ADN genómico para establecer la estructura del gen Es especialmente adecuado cuando: • se comparan secuencias de muy distinta longitud • el final de una secuencia se solapa con el inicio de la otra • quiero encontrar dominios conservados en una secuencia mucho más larga Para hacer un alineamiento semiglobal se utiliza una variante del algoritmo de Smith y Waterman que no aplica penalizaciones ni al principio ni al final de la secuencia Alineamiento semiglobal
Alineamiento de dos secuencias Ensamblaje de un contig a partir de las lecturas obtenidas durante el proceso de secuenciación de ADN. Uso principal de los alineamientos semiglobales
Alineamiento de dos secuencias http: //doua. prabi. fr/software/cap 3 La herramienta CAP 3
Alineamiento de dos secuencias https: //www. genome. jp/tools-bin/eassembler 4. cgi La herramienta EGassembler
Alineamiento de dos secuencias Existen diversos métodos para el alineamiento de dos secuencias: 1. - El algoritmo de la fuerza bruta 2. - Matrices de puntos (dot plots) 3. - El algoritmo de programación dinámica 4. - Métodos heurísticos (FASTA, BLAST) Estrategias para alinear dos secuencias
Alineamiento de dos secuencias O (2 n × 2 m)
Alineamiento de dos secuencias A lo bestia: el algoritmo de fuerza bruta
Alineamiento de dos secuencias Trata de encontrar la secuencia común de mayor tamaño entre dos secuencias X e Y de longitudes m y n, respectivamente. Se determinan todas las subsecuencias posibles de X (2 m) y se comparan con todas las subsecuencias posibles de Y (2 n) En total, hay que hacer 4(m+n) comparaciones Con gaps, hay que repetir los cálculos 2 N veces para examinar la presencia de gaps en todas las posiciones posibles de las dos secuencias Según Waterman (1989) comparar dos secuencias de 300 aminoácidos requiere examinar 1088 posibilidades, casi el mismo número de partículas elementales que hay en el Universo. En la práctica, resulta imposible, tanto por el tiempo que se necesita como por los recursos de memoria que le harían falta al ordenador Con alineamientos locales es aún peor
Alineamiento de dos secuencias O (m × n)
Alineamiento de dos secuencias Dot plot (Gibbs and Mc. Intyre, 1970)
Alineamiento de dos secuencias Ejemplos de dot plot
Alineamiento de dos secuencias Aplicaciones de los dot plots
Alineamiento de dos secuencias 1. - Se necesitan dos secuencias: A (de longitud = m) y B (de longitud = n). 2. - Se escribe la secuencia A en la fila superior (longitud = m) y la secuencia B (longitud = n) en la columna de la izquierda. 3. - Se construye una matriz con m columnas y n filas (m n). 4. - Se compara cada letra de la secuencia A con cada letra de la secuencia B. Si coinciden los caracteres se marca esa posición con un punto. Si no, se deja en blanco. El algoritmo
Alineamiento de dos secuencias Construcción de la matriz
Alineamiento de dos secuencias Rellenado de la matriz
Alineamiento de dos secuencias Es un método visual que detecta todas las coincidencias posibles entre dos secuencias. Es tarea del investigador determinar cuáles son relevantes. No proporciona un alineamiento de las secuencias pero nos da una idea de qué regiones deberían estar alineadas después de utilizar cualquiera de los otros métodos y nos puede ayudar a decidir cuál es el alineamiento óptimo. Detecta relaciones entre las secuencias, o dentro de una misma secuencia que, de otra forma, serían muy difíciles de encontrar Características del dot plot
Alineamiento de dos secuencias Secuencia horizontal: gen/proteína c 2 del fago P 22 Secuencia vertical: gen/proteína c. I del fago l ADN Proteína Como sólo hay 4 nucleótidos, aparecen muchas coincidencias por mero azar que generan ruido Como hay 20 aminoácidos, hay muchas menos coincidencias por azar y presenta mucho menos ruido DNA vs. proteína
Alineamiento de dos secuencias Se puede eliminar el ruido mediante un filtrado - Secuencia horizontal: gen c 2 del fago P 22 - Secuencia vertical: gen c. I del fago l Sin filtrar Tras aplicar un filtro Filtrado de los datos
Alineamiento de dos secuencias La ventana deslizante se define mediante dos parámetros: Ventanas deslizantes (t = 11 y r = 7) - TAMAÑO (t): es el número de símbolos que abarca la ventana. Suele ser 15 en el caso del ADN y 2 ó 3 en el caso de proteínas. - RIGOR (r) (stringency): es el mínimo número de coincidencias que debe haber entre las dos ventanas para colocar un punto en la matriz Se colocará un punto en la posición correspondiente al centro de la ventana cuando entre ambas ventanas exista, como mínimo, el número de coincidencias indicado por el parámetro r. Reducción del ruido: filtrado mediante ventanas deslizantes
Alineamiento de dos secuencias En general, hay que utilizar una ventana del tamaño del elemento que quiero localizar - Al comparar secuencias de ácidos nucleicos: - Se utilizan ventanas largas y con rigor elevado (t = 15 y r = 10, por ejemplo) - Al comparar secuencias de proteínas: - Muchas veces no se filtra la matriz (t = 1 y r = 1). - Si se filtra, se utilizan ventanas cortas con un rigor muy pequeño: (t = 2 y r = 2), (t = 3 y r = 2) - Si intento buscar dominios cortos con similitud parcial en secuencias largas usaré una ventana larga y un rigor medio (t = 20 y r = 5, por ejemplo) - A la hora de filtrar, también se pueden utilizar matrices de puntuación (PAM o BLOSUM) o se puede tener en cuenta la similitud entre las cadenas laterales de los aminoácidos. Valores apropiados para los parámetros de filtrado
Alineamiento de dos secuencias Secuencia horizontal: gen c 2 del fago P 22 Secuencia vertical: gen c. I del fago l (t = 1 y r = 1) (t = 11 y r = 7) (t = 23 y r = 15) (sin filtrado) Ejemplo de la reducción del ruido
Alineamiento de dos secuencias Ventajas de los dot plots
Alineamiento de dos secuencias Limitaciones de los dot plots
Alineamiento de dos secuencias Comparación de una secuencia (ADN o proteína) consigo misma
Alineamiento de dos secuencias P 01130 (Receptor LDL humano) - Aparece una diagonal de lado a lado (identity diagonal) - Hay simetría respecto a esa diagonal - Las líneas paralelas a ambos lados de la diagonal corresponden a repeticiones de la secuencia. - Las repeticiones invertidas o las secuencias palindrómicas aparecen como líneas perpendiculares a la diagonal principal - Las áreas con alta densidad de puntos son repeticiones cortas de un mismo nucleótido o aminoácido (regiones de poca complejidad) - Se ve mejor con un filtrado Comparación de una secuencia consigo misma (1)
Alineamiento de dos secuencias Región de poca complejidad Regiones repetidas Repeticiones invertidas (t = 1 y r =1) (t = 23 y r =7) (t = 1 y r =1) Receptor LDL humano (sin filtrar) Receptor LDL humano (filtrado) Factor de transcripción humano (P 56270) Comparación de una secuencia consigo misma (2)
Alineamiento de dos secuencias Proteína SLIT de Drosophila melanogaster (P 24014) - En el extremo amino hay 4 regiones repetidas, ricas en leucina (A) - En el extremo carboxilo hay otro dominio que se repite 6 veces en un tramo pequeño y otra vez más al final de la secuencia (B). Se trata del dominio EGF. Secuencias repetidas
Alineamiento de dos secuencias. . . ABCDEFGEFGHIJKLMNO. . . EFGEFG Repetición en tándem de un fragmento de la secuencia Repetición en tándem
Alineamiento de dos secuencias R 1 R 2 R 3 R 4 R 6 R 10 Repetición en tándem
Alineamiento de dos secuencias Repeticiones invertidas y palíndromos
Alineamiento de dos secuencias Las repeticiones invertidas se pueden encontrar en: - Secuencias implicadas en la unión de los factores de transcripción - Transposones de plantas - Genes de retrovirus insertados en el genoma del huésped - Genes duplicados - Estructuras secundarias (stem-loop) del RNA (horquillas de terminación de la transcripción) Ejemplos de repeticiones invertidas
Alineamiento de dos secuencias Horquilla de terminación en la secuencia del gen UTPglucosa-1 -fosfato uridililtransferasa de Bacillus subtilis - En un dot plot, si comparamos una secuencia que contiene apareamientos locales (como las estructuras stem-loop) consigo misma, aparecerá una diagonal perpendicular a la diagonal principal, que no la atraviesa ya que, en la región del bucle, la secuencia directa no coincide con la de la inversa complementaria. Horquilla de terminación de la transcripción
Alineamiento de dos secuencias En las secuencias palindrómicas, la secuencia de una hebra se lee igual que la de su hebra complementaria. Las secuencias diana de las endonucleasas de restricción son palindrómicas : 5' GGCGCC 3' 3' CCGCGG 5' En un dot plot, si comparamos una secuencia palindrómica consigo misma aparecerá una diagonal perpendicular a la diagonal principal y que la atraviesa. Dianas de restricción
Alineamiento de dos secuencias Los programas para representar dot plots suelen utilizar ventanas para reducir el ruido. Por eso, al comparar una secuencia que tiene repeticiones invertidas consigo misma no se verá nada. Se vería si el tamaño de la ventana fuese 1, pero entonces, lo más probable es que el ruido no permita observar nada. Lo que se hace en estos casos es comparar la secuencia con su inversa complementaria. No habrá diagonal principal y las repeticiones invertidas aparecerán reflejadas como segmentos paralelos a la diagonal principal. ¡¡Cuidado con las repeticiones invertidas!!
Alineamiento de dos secuencias P 01130 (Receptor LDL humano) - Las regiones de baja complejidad aparecen como zonas con una elevada densidad de puntos Regiones con poca complejidad
Alineamiento de dos secuencias P 21997: Sulfated surface glycoprotein 185 - En estas regiones de poca complejidad hay un aminoácido que se repite mucho más de lo normal. En este caso es la prolina. - En el dot plot, estas regiones aparecen como cuadrados con una elevada densidad de puntos. Regiones con poca complejidad
Alineamiento de dos secuencias Comparación de dos secuencias (de ADN o de proteína) similares, pero no idénticas
Alineamiento de dos secuencias Es un método visual que detecta rápidamente todas las coincidencias - Las regiones similares aparecen como diagonales (puede haber más de una) paralelas a la diagonal principal. - Los indel provocan desplazamientos de la diagonal (en vertical u horizontal) - Las transposiciones y las secuencias repetidas aparecen como diagonales paralelas a la principal - Las repeticiones en tándem provocan solapamientos en las diagonales - Las repeticiones inversas aparecen como líneas perpendiculares a la diagonal principal - Las regiones con poca complejidad dan lugar a zonas con una elevada densidad de puntos Lo que se puede detectar con un dot-plot
Alineamiento de dos secuencias - La diagonal principal corresponde a las regiones similares que pueden alinearse Diagonal principal Huecos - Estas regiones suelen corresponder a dominios proteicos conservados. - Los huecos corresponden a las regiones que no son similares y que, por tanto, no podrían alinearse. Dominios conservados
Alineamiento de dos secuencias indel - Un indel provoca un desplazamiento de la diagonal principal. - El desplazamiento se puede producir en sentido vertical u horizontal. - El desplazamiento es paralelo a la secuencia que presenta la inserción indel - Si se compara un ADNc con el ADN genómico, se pueden identificar los intrones y los exones Indels (insertion/deletions)
Alineamiento de dos secuencias - Una región repetida en tándem provoca un solapamiento en las diagonales. Región repetida Secuencias repetidas en tándem
Alineamiento de dos secuencias - Una repetición invertida genera una línea perpendicular a la diagonal. Repetición invertida
Alineamiento de dos secuencias Comparación de una secuencia de proteína con su gen de ADN
Alineamiento de dos secuencias - Secuencia horizontal: gen J 05545. 1 (traducida según una de las 6 pautas de lectura posibles) - Secuencia vertical: proteína P 60204 (una calmodulina) proteína ADN - Al comparar un gen con su producto proteico se pueden diferenciar los exones y los intrones. * En rojo: exones. * En azul: intrones. - También se pueden diferenciar intrones y exones al comparar un ADNc, un EST (expressed sequence tag) o un ARNm con el ADN genómico Identificación de los intrones y exones
Alineamiento de dos secuencias Interpretación de los dot plots
Alineamiento de dos secuencias Principales características detectadas por el dot plot
Alineamiento de dos secuencias http: //myhits. sib. swiss/cgi-bin/dotlet La herramienta Dotlet
Alineamiento de dos secuencias http: //dotlet. vital-it. ch/ La herramienta Dotlet JS (versión beta)
Alineamiento de dos secuencias https: //www. ebi. ac. uk/Tools/seqstats/emboss_dottup/ http: //www. bioinformatics. nl/cgi-bin/emboss/dotmatcher Las herramientas dotmatche y dottup
Alineamiento de dos secuencias http: //www. bioinformatics. nl/cgi-bin/emboss/polydot http: //www. bioinformatics. nl/cgi-bin/emboss/dotpath La herramientas dotpath y polydot
Alineamiento de dos secuencias http: //sonnhammer. sbc. su. se/Dotter. html Descárgate el programa (varias plataformas) El programa Dotter
Alineamiento de dos secuencias Hay que registrarse (es gratis) https: //virology. uvic. ca/virology-ca-tools/jdotter/ El programa JDotter
Alineamiento de dos secuencias Interfaz del programa JDotter
Alineamiento de dos secuencias http: //ugene. net/ El programa UGENE permite hacer dot plots
Alineamiento de dos secuencias
Alineamiento de dos secuencias Se pueden hacer dot plots a escala genómica
Alineamiento de dos secuencias http: //bioinfo. lifl. fr/yass. php YASS is a genomic similarity search tool, for nucleic (DNA or RNA) sequences in Fasta or plain text format. La herramienta Yass
Alineamiento de dos secuencias Secuencia 1 = NC_014267. 1 Secuencia 2 = NC_014287 Resultados de la herramienta Yass
Alineamiento de dos secuencias https: //zpicture. dcode. org/ La herramienta z. Picture
Alineamiento de dos secuencias Secuencia 1 = NC_014267. 1 Secuencia 2 = NC_014287 Resultados de la herramienta z. Picture
Alineamiento de dos secuencias http: //lastweb. cbrc. jp/ La herramienta LAST y resultados
- Slides: 72