Cómo leer un árbol filogenético: longitudes de rama, valores de soporte, enraizamiento y cómo se construye

Qué afirma un árbol filogenético y qué no, en qué orden leerlo, qué dicen la barra de escala y los números de los nodos, cómo se infiere un árbol a partir de datos de secuencia y qué exige una revista cuando el árbol se convierte en figura.

Scientific Figure Team
Compartir

Un árbol filogenético carga más información que un cladograma, y cada elemento añadido admite una lectura equivocada. Esto es lo que afirman la longitud de rama, la barra de escala, la raíz y los valores de soporte, de dónde salen esas afirmaciones y cómo dibujar el resultado para que sobreviva a una reducción a 89 mm.

Una planta de secuenciación de noche: una hilera de secuenciadores de sobremesa y un investigador frente a una pantalla mural donde se ve un árbol circular sin etiquetas, el momento en que un genoma se convierte en una hipótesis sobre la ascendencia.
Una planta de secuenciación de noche: una hilera de secuenciadores de sobremesa y un investigador frente a una pantalla mural donde se ve un árbol circular sin etiquetas, el momento en que un genoma se convierte en una hipótesis sobre la ascendencia. Imagen generada con Scientific Figure

Respuesta rápida

Un árbol filogenético se lee en cuatro pasadas. Localice la raíz y avance hacia afuera, porque esa dirección es el tiempo. Lea el anidamiento, nunca el orden de los extremos: todo lo que queda más allá de un nodo comparte un ancestro común que no comparte con nada de lo que queda fuera. Busque la barra de escala, que dice si la longitud de rama vale sustituciones por sitio, tiempo transcurrido o nada. Después lea los números de los nodos, tras comprobar en el pie de figura si son bootstrap o probabilidades posteriores, porque el mismo número no significa lo mismo.

¿Qué muestra un árbol filogenético?

Un árbol filogenético representa las relaciones evolutivas entre un conjunto de organismos o grupos de organismos llamados taxones. Esa es la definición que emplea el Museo de Paleontología de la Universidad de California en su material Understanding Evolution, y conviene tomarla al pie de la letra: el árbol muestra relaciones, no organismos ni la historia en sí.

Leer una filogenia se parece bastante a leer un árbol genealógico. La raíz representa el linaje ancestral y los extremos de las ramas representan a los descendientes de ese ancestro, de modo que moverse de la raíz hacia los extremos es avanzar en el tiempo. Donde un linaje se divide, un único linaje ancestral ha dado lugar a dos o más linajes hijos. Cada linaje tiene una parte de su historia que le pertenece solo a él y partes que comparte con otros.

De ahí salen dos cosas que pillan desprevenido a mucha gente. La primera es que los extremos no son necesariamente especies. Según cuánta parte del árbol se esté mirando, los descendientes de los extremos pueden ser poblaciones distintas de una misma especie, especies distintas o clados que contienen cada uno muchas especies. Un árbol rotulado con nombres de género y otro rotulado con identificadores de cepa hacen el mismo trabajo a escalas distintas.

La segunda es que un árbol publicado es una hipótesis con su margen de error, no una fotografía del pasado. Todo lo que viene a continuación —las longitudes de rama, los valores de soporte, la posición de la raíz— existe para decirle cuánto de esa hipótesis sostenían realmente los datos.

Las partes de un árbol filogenético

El vocabulario que se comparte con cualquier diagrama ramificado se despacha rápido. Los extremos son los taxones. Cada nodo es el ancestro común de los linajes que salen de él. Dos descendientes que se separan en el mismo nodo son grupos hermanos y son los parientes más cercanos entre sí en ese árbol. Un clado es un grupo que contiene un ancestro común y todos sus descendientes; Understanding Evolution propone la prueba física de imaginar que se recorta una sola rama del árbol, de modo que todo lo que queda en la rama recortada forma un clado. Los clados se anidan dentro de otros clados y forman una jerarquía.

Lo que un árbol filogenético añade a ese vocabulario es donde la lectura se complica de verdad, porque cada añadido es una afirmación cuantitativa distinta hecha en un lenguaje visual distinto.

GibónOrangutánGorilaHumanoChimpancé100 / 10096 / 9971 / 880,02 sustituciones por sitio1234561Raíz — la base, y el sentido del tiempo2Nodo — un ancestro común3Longitud de rama — una cantidad, leída contra la escala4Valor de soporte — cuánto respaldan los datos esa división5Barra de escala — qué vale una unidad de rama6Grupo externo — el taxón que da raíz al árbol
Las seis cosas que carga un árbol filogenético y que un cladograma no. Fíjese en que las ramas terminan a profundidades distintas y se unen a la columna de etiquetas mediante líneas de puntos: los extremos de un filograma no se alinean, y esas guías son la forma en que todo visor de árboles mantiene las etiquetas legibles pese a ello. Los valores de soporte aparecen aquí como SH-aLRT / bootstrap ultrarrápido; el nodo que une los dos extremos más próximos incumple los dos umbrales que recomienda IQ-TREE. La topología sigue la filogenia estándar de los grandes simios; las longitudes de rama son geometría ilustrativa, no estimaciones de ningún análisis.

Aquí solo el eje horizontal lleva información. El orden vertical de los extremos es una convención de dibujo: iTOL, por ejemplo, ordena las hojas por defecto de manera que los clados con menos hojas queden arriba, únicamente porque el resultado escalonado queda más limpio. Girar las ramas en un nodo cambia la imagen y no cambia nada de la hipótesis, que es el error de lectura más frecuente en cualquier árbol y que nuestra guía sobre cómo leer un cladograma desarrolla en detalle.

Qué significa la longitud de rama y por qué lo decide la barra de escala

La longitud de rama es la diferencia entre un árbol filogenético y un cladograma, y es el único elemento cuyo significado tiene que declarar la figura, porque el dibujo no puede hacerlo.

Tipo de árbolQué significa la longitud de ramaQué debe llevar la figura
CladogramaNada. La extensión horizontal es lo que la maquetación necesitaba para alinear los extremosSin barra de escala, porque no hay nada que escalar
FilogramaCantidad de cambio evolutivo a lo largo del linaje, por convención en sustituciones por sitioUna barra de escala en esas unidades
Cronograma (árbol calibrado en el tiempo)Tiempo transcurridoUn eje, normalmente en millones de años

La distinción no es académica, porque el mismo archivo produce los tres. iTOL muestra por defecto como filograma cualquier árbol que contenga información de longitud de rama, y convertir ese mismo árbol en cladograma es cuestión de un ajuste: ponga Branch lengths en Ignore y las longitudes se descartan de la visualización. Nada ha cambiado en el árbol subyacente. Solo ha cambiado la afirmación que hace la imagen.

Por eso la barra de escala es estructural. Un árbol sin barra de escala ni eje temporal no hace ninguna afirmación cuantitativa mediante sus longitudes de rama, y leer que un linaje está más evolucionado porque su rama es larga es leer la maquetación en lugar de los datos. Cuando es usted quien dibuja la figura, una barra de escala ausente no es una omisión cosmética: le quita al lector la capacidad de interpretar el eje que todo el análisis sirvió para producir.

Enraizado, no enraizado y para qué sirve un grupo externo

La mayoría de los árboles que uno ve están enraizados. La mayoría de los árboles tal como salen de una inferencia estándar no lo están.

Es una propiedad real de los modelos, no una limitación del software. IQ-TREE 1 solo podía inferir árboles no enraizados porque los modelos de sustitución que usaba asumen reversibilidad temporal, y un modelo reversible no puede decir qué dirección a lo largo de una rama es hacia adelante. La inferencia enraizada llegó con IQ-TREE 2 mediante modelos no reversibles en el tiempo, junto con una búsqueda de raíz que la desplaza a las ramas vecinas y conserva la posición de mayor verosimilitud. Mientras no se aporte la dirección desde fuera, un árbol no enraizado afirma parentesco sin afirmar ascendencia.

La forma habitual de aportarla es un grupo externo: un taxón situado fuera del grupo de interés, elegido de modo que todos los miembros de ese grupo estén más emparentados entre sí de lo que cualquiera lo está con él. El grupo externo sale por tanto de la base del árbol, y de paso indica aproximadamente en qué punto del árbol de la vida se sitúa su grupo.

Dónde va la raíz no es una decisión de presentación.

a. No enraizado — relaciones, sin direcciónABCDEbcLos círculos marcan la raíz de los paneles b y cb. Enraizado en EEABCDA+B y C+D son pares hermanos; E es el grupo externoc. Enraizado en la rama que lleva a AABECDE pasa a ser hermano de C+D; A pasa a ser el grupo externo
Un árbol no enraizado, dos posiciones de raíz, dos afirmaciones biológicas distintas. Los paneles b y c contienen exactamente las mismas ramas que el panel a: no se ha añadido, quitado ni reestimado nada. Enraizar en la rama que lleva a E convierte a A+B y C+D en pares hermanos; enraizar en la rama que lleva a A convierte en cambio a E en hermano de C+D. Los círculos del panel a marcan dónde se ha colocado cada raíz.

Cuando no hay un grupo externo defendible, los visores ofrecen el enraizamiento en el punto medio; iTOL tiene la función en su menú de nodo, aplicable con independencia del nodo que se haya pulsado. Trátela como una comodidad de visualización y no como un resultado. Coloca la raíz solo por la geometría de las longitudes de rama, así que una única rama larga —justo lo que produce un taxón lejano o de evolución rápida— puede arrastrar la raíz a la rama equivocada y devolverle la disposición del panel c.

Qué significa realmente el número de un nodo

Los números junto a los nodos son la parte más citada y peor entendida de un árbol publicado, sobre todo porque dos cantidades muy distintas se imprimen en el mismo sitio sin diferencia visual alguna.

Las proporciones de bootstrap salen de remuestrear con reemplazo las columnas del alineamiento, reconstruir el árbol a partir de cada conjunto remuestreado y contar cuántas veces reaparece cada clado. El remuestreo tiene una consecuencia que conviene retener: como los sitios se extraen con reemplazo, un alineamiento bootstrap contiene de media solo unos dos tercios de los sitios originales. El número describe la constancia con que los datos apoyan una agrupación, no es un valor p.

Las probabilidades posteriores salen de la inferencia bayesiana, donde una cadena MCMC muestrea árboles en proporción a su probabilidad posterior y la frecuencia de un clado en esa muestra se convierte en su soporte. MrBayes anota el árbol consenso con esas frecuencias de particiones y clados, junto con edades de nodo y tasas por rama, mediante su orden sumt.

Y luego está la regla del 70 por ciento, repetida en todas partes y casi nunca con sus condiciones. Procede del estudio de simulación que Hillis y Bull publicaron en 1993 en Systematic Biology, y su resultado real era más estrecho que el folclore. Bajo tasas de cambio iguales, filogenias simétricas y un cambio internodal del 20 por ciento de los caracteres o menos, las proporciones de bootstrap del 70 por ciento o más solían corresponder a una probabilidad del 95 por ciento o más de que el clado fuera real. Fuera de esas condiciones el artículo es tajante: cuando las tasas de cambio internodal son muy altas, o las tasas entre taxones muy desiguales, las proporciones por encima del 50 por ciento sobreestiman la exactitud. El mismo estudio halló que como medida de repetibilidad una proporción de bootstrap es insesgada pero tan imprecisa que resulta prácticamente inservible.

De ahí salen dos consecuencias prácticas.

Un porcentaje no significa nada mientras no se sepa qué método lo produjo. La documentación de IQ-TREE afirma directamente que no deben compararse los porcentajes de bootstrap estándar con los de bootstrap ultrarrápido, porque estos últimos están menos sesgados: un 95 por ciento de UFBoot corresponde aproximadamente a una probabilidad del 95 por ciento de que el clado sea verdadero, y la indicación es fiarse de una rama solo a partir del 95 por ciento. El bootstrap estándar es más conservador con el mismo número. La recomendación es ejecutar la prueba SH-aLRT en paralelo y considerar bien soportado un clado cuando SH-aLRT alcanza el 80 por ciento o más y el UFBoot el 95 por ciento o más.

Esos umbrales solo valen para árboles de un solo gen. IQ-TREE señala que en un análisis concatenado sobre muchos genes tanto el UFBoot como el bootstrap de Felsenstein, más conservador, tienden al 100 por ciento en todas partes, y recomienda calcular en su lugar concordance factors para cualquier análisis filogenómico. Un árbol filogenómico con un 100 por ciento de soporte en cada nodo no es un resultado sólido: es un estadístico saturado.

Medida de soporteUmbral para leer una rama como soportadaOrigen del umbral
Bootstrap estándar (simulaciones con parsimonia)≥ 70 %, bajo tasas iguales, filogenias simétricas y ≤ 20 % de cambio internodalHillis & Bull 1993, Syst. Biol. 42(2)
Bootstrap ultrarrápido (UFBoot)≥ 95 %Documentación de IQ-TREE
SH-aLRT, junto con el UFBoot≥ 80 % con UFBoot ≥ 95 %Documentación de IQ-TREE
Cualquiera de los anteriores en un árbol filogenómico concatenadoNo aplicable — use concordance factorsDocumentación de IQ-TREE

Una politomía —un nodo del que salen más de dos linajes— es la otra manera que tiene un árbol de hablar de su incertidumbre, y la expresa estructuralmente en lugar de numéricamente. Understanding Evolution señala que normalmente significa que no había datos suficientes para determinar cómo se relacionan esos linajes, y que al dejar el nodo sin resolver los autores le están pidiendo que no extraiga conclusiones de él. A veces significa lo contrario: varios eventos de especiación realmente simultáneos, en cuyo caso el artículo debería decirlo. Las dos lecturas existen, así que el pie de figura es el único sitio donde se resuelve cuál está viendo.

¿En qué orden se lee un árbol filogenético?

En este orden, y el orden importa porque cada paso cambia cómo se lee el siguiente.

  1. Localice la raíz. Todo es relativo a ella, y de la raíz a los extremos es el tiempo.
  2. Lea solo el anidamiento. En cada nodo, todo lo que queda más allá comparte un ancestro común que no comparte con nada de fuera. Dos linajes que salen de un mismo nodo están igual de emparentados con todo lo demás del árbol.
  3. Busque la barra de escala o el eje temporal. Le dirá si el eje horizontal son sustituciones por sitio, tiempo transcurrido o nada.
  4. Compruebe en el pie de figura qué son los números de los nodos. Bootstrap y probabilidad posterior no son intercambiables, ni tampoco bootstrap estándar y ultrarrápido.
  5. Localice el grupo externo y confirme que está realmente fuera del grupo que se discute.
  6. Busque politomías y léalas como las declaraciones de incertidumbre que suelen ser.
  7. Ignore el orden vertical de los extremos. Dos extremos contiguos no son necesariamente parientes cercanos, y un extremo situado arriba no es primitivo.

Cómo se construye un árbol a partir de secuencias

Entre un alineamiento y una figura hay cuatro pasos, y detectar cuál se saltó un artículo suele ser la forma de juzgar su árbol.

Alineamiento. Primero hay que colocar las posiciones homólogas en las mismas columnas, porque todo método posterior lee una columna como un conjunto de caracteres que comparten un ancestro. Un error de alineamiento es un error filogenético que ninguna cantidad de réplicas bootstrap sacará a la luz.

Selección de modelo. Un modelo de sustitución describe cómo cambian los caracteres, y elegirlo es un paso por derecho propio: IQ-TREE 2 admite por sí solo más de 200 modelos reversibles en el tiempo, además de modelos particionados, de mezcla y de heterotaquia para datos filogenómicos, y su componente ModelFinder existe precisamente para elegir entre ellos. MrBayes toma el camino alternativo de integrar la incertidumbre del modelo durante la ejecución, muestreando las 203 matrices de tasas reversibles posibles según su probabilidad posterior en lugar de comprometerse con una de antemano.

Búsqueda de árbol. La máxima verosimilitud busca la topología y las longitudes de rama que hacen más probable el alineamiento observado bajo el modelo elegido; la inferencia bayesiana muestrea árboles en proporción a su probabilidad posterior mediante MCMC. Los métodos de distancia como neighbour-joining reducen antes el alineamiento a distancias por pares, lo cual es rápido y explica que sobrevivan como punto de partida y no como resultado.

Soporte. Réplicas bootstrap, bootstrap ultrarrápido, SH-aLRT o probabilidades posteriores de la misma cadena MCMC que produjo el árbol.

Los datos filogenómicos añaden un quinto paso, porque los árboles de genes se infieren locus a locus y después se reconcilian. IQ-TREE 2 infiere árboles por locus exactamente para eso, y alimenta con ellos los análisis coalescentes o de concordancia posteriores.

Newick: el árbol entero en una línea de texto

Casi todos los árboles que llegará a manejar se guardan en formato Newick, que representa un árbol mediante paréntesis anidados, una correspondencia que Felsenstein atribuye a Arthur Cayley, quien la observó en 1857. Las reglas son lo bastante breves como para aprenderlas de una sentada.

ElementoCómo se escribeEjemplo
Fin del árbolUn punto y coma(B,(A,C,E),D);
Nodo internoUn par de paréntesis emparejados(A,C,E)
Nombre de extremoCualquier carácter imprimible salvo espacios, dos puntos, punto y coma, paréntesis y corchetesHomo_sapiens
Un espacio dentro de un nombreUn guion bajosea_lion
Longitud de ramaDos puntos y un número real tras el nodo(A:5.0,C:3.0,E:4.0):5.0
Nombre de nodo internoEl texto que sigue inmediatamente al paréntesis de cierre(A:5.0,C:3.0)Ancestor1:5.0

Dos propiedades del formato generan más confusión que su sintaxis.

Newick no es una representación única. El orden de izquierda a derecha de los descendientes de un nodo cambia la cadena sin cambiar el árbol, de modo que (A,(B,C),D);, (A,(C,B),D);, (D,(C,B),A); y ((C,B),A,D); son el mismo árbol para un biólogo. Comparar dos cadenas Newick carácter a carácter no le dirá nada sobre si dos árboles coinciden.

El formato está definido para árboles enraizados, y los no enraizados se guardan enraizándolos de forma arbitraria. Así, (B,(A,D),C); y (A,(B,C),D); representan el mismo árbol no enraizado. Una posición de raíz en un archivo no prueba que nadie la eligiera deliberadamente.

Queda además una ambigüedad real que el estándar nunca resolvió, y merece conocerse porque corrompe figuras en silencio. La especificación de Felsenstein coloca los nombres de nodos internos tras el paréntesis de cierre. El software coloca por convención los valores de soporte en esa misma posición: iTOL documenta (A:0.1,(B:0.1,C:0.1)90:0.1)98:0.3); con 90 y 98 como valores de bootstrap. El archivo por sí solo no puede decirle cuál es cuál, ni si un número dado es un bootstrap, una probabilidad posterior o una etiqueta que alguien escribió. Es una limitación real y no un descuido nuestro: como recoge Felsenstein, el estándar Newick nunca ha tenido una publicación formal. Lo adoptó un comité informal convocado durante el congreso de 1986 de la Society for the Study of Evolution, y toma su nombre del restaurante de Dover, en Nuevo Hampshire, donde se celebró la segunda sesión. Cuando el significado de un número importa, el pie de figura es la única autoridad.

Para metadatos más ricos, iTOL lee además Nexus, PhyloXML y Jplace, e interpreta las anotaciones de MrBayes y NHX cuando están presentes.

Un árbol de genes no es un árbol de especies

Que genes distintos den árboles distintos es rutinario, y el primer instinto —que alguien se ha equivocado— suele ser erróneo. Las historias evolutivas son genuinamente discordantes a lo largo del genoma, y esa discordancia hay que tenerla en cuenta en lugar de promediarla.

La clasificación incompleta de linajes (ILS) es la causa omnipresente. Bajo el modelo del coalescente multiespecie, las ramas de un árbol de especies son poblaciones dentro de las cuales coalescen los linajes génicos; los que no lo consiguen antes de que termine una rama pasan a la rama parental, donde pueden coalescer en un orden que el árbol de especies nunca siguió.

Árbol de especies, con un gen trazado a través de élA y C coalescen primeroABCEl árbol de genes resultanteACBA y C son hermanos — el árbol de especies dice lo contrario
Cómo un árbol de genes acaba contradiciendo al árbol de especies sin que nadie cometa un error. Las bandas claras son poblaciones y las líneas finas trazan hacia atrás la ascendencia de un gen. Los linajes A y B entran en la población ancestral sin coalescer, de modo que A queda libre para coalescer antes con C, lo que produce un árbol de genes en el que A y C son hermanos mientras el árbol de especies dice que lo son A y B. Esquema; la geometría es ilustrativa.

La escala de esto en datos reales se subestima con facilidad. En el conjunto de datos aviar de 48 genomas usado para evaluar ASTRAL-III, las relaciones dentro de Neoaves muestran niveles extremadamente altos de discordancia entre árboles de genes a lo largo de 14 446 loci, atribuidos a una radiación rápida en sus ancestros. Los métodos de resumen como ASTRAL lo abordan de frente buscando el árbol de especies que comparte el mayor número de topologías de cuartetos con los árboles de genes de entrada.

Un hallazgo contraintuitivo de ese mismo trabajo merece llevarse a los análisis propios: contraer en los árboles de genes de entrada las ramas con soporte muy bajo —por debajo de aproximadamente el 3 al 10 por ciento— mejoró la exactitud del árbol de especies, mientras que un filtrado agresivo al 50 o al 75 por ciento empeoró los resultados. Descartar señal poco soportada no es automáticamente la opción segura.

Dibujar un árbol filogenético para un artículo, un póster o una tesis

Una filogenia concentra más texto pequeño y más líneas finas por centímetro cuadrado que cualquier otra figura de la biología, y las revistas reducen las figuras para encajarlas en sus columnas. Esa combinación explica que los árboles vuelvan de producción más a menudo que casi cualquier otra cosa.

La guía de envío final de Nature es concreta sobre el objetivo, y sus números son una aproximación razonable para la mayoría de revistas aunque cada una fije los suyos.

EspecificaciónRequisito de NaturePor qué un árbol lo incumple antes que nada
Ancho de figura89 mm a una columna, 183 mm a dos, 120–136 mm a columna y mediaLas etiquetas de los extremos están dimensionadas para el ancho de dibujo, no de impresión
Alto de página247 mmUn árbol de 60 extremos necesita presupuestar el alto antes de componer las etiquetas
RotulaciónDe palo seco, preferiblemente Helvetica o Arial, la misma en todas las figuras del artículoLos visores de árboles usan por defecto la tipografía que ofrezca el sistema
Cuerpo de textoMínimo 5 pt, máximo 7 pt salvo etiquetas de panel; los paneles en 8 pt negritaLas etiquetas de extremos y los valores de soporte suelen ser el texto más pequeño del artículo
Grosor de líneaDe 0,25 a 1 pt en el tamaño final; por debajo de 0,25 pt la línea puede desaparecer al imprimirLas ramas se reducen con la figura, y las ramas capilares se esfuman
FormatoVectorial — Illustrator, PostScript, EPS o PDF para trazo; no rasterizar ni convertir el texto a curvasUn árbol es dibujo de trazo, y uno rasterizado no se puede reetiquetar en pruebas

Fíjese en lo que la guía no dice. No hay ninguna regla sobre cuántos extremos puede llevar la figura de un árbol, ningún requisito sobre dónde colocar los valores de soporte y ninguna instrucción sobre si mostrar barra de escala. Son convenciones del campo y no política editorial, y ninguna revista que hayamos consultado publica una especificación propia para árboles. Lo que sí obliga es el cuerpo de texto, el grosor de línea y el formato.

Para un árbol en concreto, de aquí salen cuatro cosas.

  • Fije primero el ancho y después la tipografía. Dibuje desde el principio a 89 mm o 183 mm. Exportar un árbol del tamaño de la pantalla y reducirlo multiplica todos los incumplimientos a la vez.
  • Cuente los extremos frente al alto disponible. Con un mínimo de 5 pt y un interlineado razonable, una columna de 247 mm admite unos 100 extremos antes de que las etiquetas choquen. Pasado ese punto, colapse clados: iTOL puede hacerlo por longitud media de rama, por umbral de soporte o por clase de nodo.
  • Adelgace los valores de soporte antes que el cuerpo de texto. Mostrar el soporte solo donde cae por debajo de su umbral, y decirlo en el pie de figura, elimina la mayor parte del texto más pequeño sin eliminar información.
  • Exporte en vectorial y compruebe al tamaño final. La propia Nature aconseja verificar, al tamaño más pequeño al que pueda imprimirse la figura, que la rotulación siga siendo legible y las líneas sigan saliendo con nitidez.

La misma disciplina vale para todas las figuras del artículo, y las reglas generales están reunidas en nuestra guía sobre cómo hacer figuras científicas. Para un ejemplo trabajado de principio a fin con una sola revista, vea nuestro desglose de los requisitos de figuras de Scientific Reports.

Preguntas frecuentes

¿Qué es un árbol filogenético? Un diagrama ramificado de las relaciones evolutivas entre un conjunto de taxones. Los extremos son taxones descendientes, los nodos sus ancestros comunes, dos descendientes que salen de un nodo son grupos hermanos y la raíz es el linaje ancestral. Ir de la raíz a los extremos es avanzar en el tiempo, y cualquier nodo con todos sus descendientes es un clado.

¿Cómo se lee un árbol filogenético? Localice la raíz y avance hacia afuera. Lea el anidamiento en lugar del orden de los extremos: todo lo que queda más allá de un nodo comparte un ancestro común que no comparte con nada de fuera. Después busque la barra de escala o el eje temporal, compruebe en el pie de figura qué son los números de los nodos y localice el grupo externo. Ignore el orden vertical de los extremos.

¿Qué significan las longitudes de rama? Lo que declare la figura. Sustituciones por sitio en un filograma, tiempo transcurrido en un cronograma, nada en un cladograma. La barra de escala o el eje dan la conversión, y un árbol que no lleva ninguno de los dos no hace ninguna afirmación cuantitativa mediante sus ramas.

¿Qué es un grupo externo? Un taxón situado fuera del grupo de interés, elegido de modo que cada miembro de ese grupo esté más emparentado con los demás que con él. Sale de la base del árbol y su función es colocar la raíz, lo cual importa porque los modelos reversibles estándar infieren árboles no enraizados y la posición de la raíz cambia qué taxones declara hermanos el árbol.

¿Qué significa un valor de bootstrap de 70? Viene de Hillis y Bull 1993 y lleva condiciones: bajo tasas de cambio iguales, filogenias simétricas y un cambio internodal del 20 por ciento o menos, las proporciones del 70 por ciento o más solían corresponder a al menos un 95 por ciento de probabilidad de que el clado fuera real. Bajo tasas muy altas o muy desiguales, las proporciones por encima del 50 por ciento sobreestiman la exactitud. Es una regla empírica conservadora salida de simulaciones con parsimonia, no una prueba de significación.

¿Un bootstrap ultrarrápido del 95 por ciento equivale a un bootstrap del 95 por ciento? No. La documentación de IQ-TREE dice que ambos no se comparan directamente. El ultrarrápido está menos sesgado, de modo que el 95 por ciento corresponde aproximadamente a una probabilidad del 95 por ciento de que el clado sea verdadero y marca el punto a partir del cual fiarse de una rama; el estándar es más conservador con el mismo número. Ejecutar SH-aLRT en paralelo y exigir un 80 por ciento de SH-aLRT con un 95 por ciento de UFBoot es la recomendación documentada.

¿Por qué genes distintos dan árboles distintos? Porque las historias difieren realmente a lo largo del genoma. La clasificación incompleta de linajes hace que dos linajes que entran en una población ancestral sin coalescer puedan coalescer en un orden que el árbol de especies nunca siguió. En el conjunto aviar de 48 genomas que hay detrás de ASTRAL-III, Neoaves presenta una discordancia altísima entre árboles de genes a lo largo de 14 446 loci. Los métodos de resumen infieren el árbol de especies teniéndolo en cuenta.

¿Por qué mi árbol se vuelve ilegible al reducirlo? Porque los árboles cargan más texto pequeño y más líneas finas que ningún otro tipo de figura. Nature fija anchos estándar de 89 mm y 183 mm, rotulación mínima de 5 pt y trazos de 0,25 a 1 pt, advirtiendo de que por debajo de 0,25 pt la línea puede desaparecer. Dibuje al ancho final, exporte en vectorial y compruebe cada etiqueta a ese tamaño.

Por dónde seguir

Referencias

  1. Understanding Evolution — Reading trees: A quick reviewUniversity of California Museum of Paleontologyhttps://evolution.berkeley.edu/phylogenetic-systematics/reading-trees-a-quick-review/Consultado el 18 ago 2026
  2. Understanding Evolution — Understanding phylogeniesUniversity of California Museum of Paleontologyhttps://evolution.berkeley.edu/evolution-101/the-history-of-life-looking-at-the-patterns/understanding-phylogenies/Consultado el 18 ago 2026
  3. Understanding Evolution — Phylogenetic pitchforksUniversity of California Museum of Paleontologyhttps://evolution.berkeley.edu/phylogenetic-systematics/reading-trees-a-quick-review/phylogenetic-pitchforks/Consultado el 18 ago 2026
  4. The Newick tree formatJoseph Felsenstein / PHYLIPhttps://phylipweb.github.io/phylip/newicktree.htmlConsultado el 18 ago 2026
  5. iTOL — Help and documentationEuropean Molecular Biology Laboratoryhttps://itol.embl.de/help.cgiConsultado el 18 ago 2026
  6. IQ-TREE — Frequently asked questionsIQ-TREE developershttps://iqtree.github.io/doc/Frequently-Asked-QuestionsConsultado el 18 ago 2026
  7. Hillis & Bull 1993 — An empirical test of bootstrapping as a method for assessing confidence in phylogenetic analysis, Systematic Biology 42(2):182–192Oxford University Press / Society of Systematic Biologistshttps://doi.org/10.1093/sysbio/42.2.182Consultado el 18 ago 2026
  8. Minh et al. 2020 — IQ-TREE 2: new models and efficient methods for phylogenetic inference in the genomic era, Molecular Biology and Evolution 37(5)Oxford University Press / PubMed Centralhttps://pmc.ncbi.nlm.nih.gov/articles/PMC7182206/Consultado el 18 ago 2026
  9. Zhang et al. 2018 — ASTRAL-III: polynomial time species tree reconstruction from partially resolved gene trees, BMC Bioinformatics 19(S6):153BioMed Central / PubMed Centralhttps://pmc.ncbi.nlm.nih.gov/articles/PMC5998893/Consultado el 18 ago 2026
  10. Ronquist et al. 2012 — MrBayes 3.2: efficient Bayesian phylogenetic inference and model choice across a large model space, Systematic Biology 61(3):539–542Oxford University Press / PubMed Centralhttps://pmc.ncbi.nlm.nih.gov/articles/PMC3329765/Consultado el 18 ago 2026
  11. Nature — Final submission and figure preparationSpringer Naturehttps://www.nature.com/nature/for-authors/final-submissionConsultado el 18 ago 2026

Los nombres de revistas, congresos y productos son marcas de sus respectivos titulares. Esta página es contenido editorial independiente y no está afiliada, autorizada ni respaldada por ellos. Las especificaciones cambian: comprueba cada requisito en las fuentes oficiales enlazadas arriba antes de enviar o imprimir.

Sigue leyendo

Tu próxima figura está a 30 segundos

Comienza gratis con 50 créditos: sin tarjeta de crédito ni conocimientos de diseño.