Введение

Диаграмма, используемая для отображения взаимосвязей между группами организмов с общим происхождением.

Кладограмма (от греческого clados – «ветвь» и gramma – «характер») – это диаграмма, используемая в кладистике для отображения взаимосвязей между организмами. Однако кладограмма не является эволюционным деревом, поскольку она не показывает, как предки связаны с потомками, и не отражает степень их изменений, поэтому множество различных эволюционных деревьев могут соответствовать одной и той же кладограмме. Кладограмма использует линии, которые разветвляются в разных направлениях, заканчиваясь кладой – группой организмов, имеющих последнего общего предка. Существует множество форм кладограмм, но все они содержат линии, ответвляющиеся от других линий. Эти линии можно проследить до точек их ответвления. Эти точки ответвления представляют собой гипотетического предка (не реальную сущность), свойства которого можно вывести на основе общих признаков терминальных таксонов, расположенных выше него. Этот гипотетический предок может дать представление о последовательности эволюции различных признаков, адаптаций и других эволюционных сценариев, касающихся предков. Хотя традиционно кладограммы создавались в основном на основе морфологических признаков, данные секвенирования ДНК и РНК, а также вычислительная филогенетика в настоящее время широко используются для построения кладограмм, как самостоятельно, так и в сочетании с морфологическими данными.

Молекулярные и морфологические данные

Характеристики, используемые для создания кладограммы, можно грубо разделить на морфологические (например, строение черепа синапсид, теплокровность, хорда, одноклеточность и т.д.) и молекулярные (ДНК, РНК или другая генетическая информация). До появления секвенирования ДНК кладистический анализ в основном опирался на морфологические данные. Также могут использоваться поведенческие данные (для животных). С удешевлением и упрощением секвенирования ДНК молекулярная систематика стала все более популярным способом построения филогенетических гипотез. Использование принципа экономии – лишь один из нескольких методов вывода филогенетических деревьев на основе молекулярных данных. Подходы, такие как метод максимального правдоподобия, включающие явные модели эволюции последовательностей, являются нехеннигианскими способами оценки данных о последовательностях. Другим мощным методом реконструкции филогений является использование геномных ретротранспозонных маркеров, которые, как считается, менее подвержены проблеме обратных мутаций, свойственной данным о последовательностях. Также обычно предполагается, что они характеризуются низкой частотой гомоплазий, поскольку ранее считалось, что их интеграция в геном происходит совершенно случайно; однако, по крайней мере, иногда это оказывается не так.

Плезиоморфии и синапоморфии

Исследователи должны определить, какие состояния признаков являются предковыми (плезиоморфии), а какие – производными (синапоморфии), поскольку только производные состояния признаков предоставляют доказательства группировки. Это определение обычно выполняется путем сравнения с состояниями признаков одной или нескольких внешних групп. Состояния, общие для внешней группы и некоторых представителей внутренней группы, являются симплезиоморфиями; состояния, присутствующие только в подмножестве внутренней группы, – синапоморфии. Важно отметить, что состояния признаков, уникальные для отдельного терминала (аутапоморфии), не предоставляют доказательств группировки. Выбор внешней группы – критически важный этап кладистического анализа, поскольку разные внешние группы могут приводить к деревьям с принципиально отличающимися топологиями.

Гомоплазии

Гомоплазия – это состояние признака, разделяемое двумя или более таксонами по причине, отличной от общего происхождения. Два основных типа гомоплазии – это конвергенция (эволюция "одинакового" признака как минимум в двух различных линиях) и реверсия (возврат к предковому состоянию признака). Признаки, которые явно гомопластичны, такие как белая шерсть у разных линий арктических млекопитающих, не следует включать в качестве признака в филогенетическом анализе, поскольку они не вносят вклад в наше понимание родственных связей. Однако гомоплазия часто не очевидна при непосредственном изучении самого признака (например, последовательности ДНК) и обнаруживается по его несогласованности (неэкономному распределению) на наиболее экономной кладограмме. Важно отметить, что гомопластичные признаки все же могут содержать филогенетический сигнал. Хорошо известным примером гомоплазии, вызванной конвергентной эволюцией, является признак "наличие крыльев". Хотя крылья птиц, летучих мышей и насекомых выполняют одну и ту же функцию, каждое из них эволюционировало независимо, что видно по их анатомии. Если птицу, летучую мышь и крылатое насекомое оценили бы по признаку "наличие крыльев", в набор данных была бы внесена гомоплазия, которая потенциально могла бы запутать анализ и, возможно, привести к ошибочной гипотезе о родственных связях. Разумеется, гомоплазия распознается только благодаря наличию других признаков, которые указывают на закономерность родственных связей, выявляющую ее гомопластичное распределение.

Что не является кладограммой

Кладограмма – это диаграмматический результат анализа, который группирует таксоны исключительно на основе синапоморфий. Существует множество других филогенетических алгоритмов, которые обрабатывают данные несколько иначе и приводят к филогенетическим деревьям, которые выглядят как кладограммы, но таковыми не являются. Например, фенетические алгоритмы, такие как UPGMA и Neighbor Joining, группируют по общей схожести, рассматривая как синапоморфию, так и симплезиоморфию в качестве свидетельства группировки. Получаемые диаграммы – это фенограммы, а не кладограммы. Аналогично, результаты методов, основанных на моделях (подходы максимального правдоподобия или байесовские подходы), учитывающие как порядок ветвления, так и «длину ветви», рассматривают как синапоморфию, так и аутапоморфию как доказательство в пользу или против группировки. Диаграммы, полученные в результате подобных анализов, также не являются кладограммами.

Выбор кладограммы

Существует несколько алгоритмов для определения "лучшей" кладограммы. Большинство алгоритмов используют метрику для оценки соответствия кандидатной кладограммы данным. Большинство алгоритмов кладограмм используют математические методы оптимизации и минимизации. Как правило, алгоритмы генерации кладограмм должны быть реализованы в виде компьютерных программ, хотя некоторые алгоритмы можно выполнять вручную при небольших наборах данных (например, для нескольких видов и нескольких признаков). Некоторые алгоритмы полезны только при молекулярных данных о признаках (ДНК, РНК), другие – только при морфологических данных. Существуют также алгоритмы, которые можно использовать при наличии как молекулярных, так и морфологических данных о признаках. Алгоритмы для кладограмм или других типов филогенетических деревьев включают метод наименьших квадратов, метод присоединения соседей, метод экономии признаков, метод максимального правдоподобия и байесовский вывод. Биологи иногда используют термин "экономия признаков" для обозначения конкретного типа алгоритма генерации кладограммы, а иногда и как общий термин для всех филогенетических алгоритмов. Алгоритмы, выполняющие задачи оптимизации (например, построение кладограмм), могут быть чувствительны к порядку представления входных данных (списка видов и их признаков). Изменение порядка ввода данных может привести к тому, что один и тот же алгоритм выдаст разные "лучшие" кладограммы. В таких случаях пользователю следует вводить данные в разном порядке и сравнивать результаты. Использование различных алгоритмов на одном и том же наборе данных иногда может приводить к разным "лучшим" кладограммам, поскольку каждый алгоритм может иметь собственное определение "лучшего". Из-за астрономического числа возможных кладограмм алгоритмы не могут гарантировать, что найденное решение является оптимальным. Неоптимальная кладограмма будет выбрана, если программа остановится на локальном минимуме, а не на желаемом глобальном минимуме. Для решения этой проблемы многие алгоритмы кладограмм используют метод имитации отжига, чтобы повысить вероятность выбора оптимальной кладограммы. Базальное положение – это направление основания (или корня) укорененного филогенетического дерева или кладограммы. Базальный клад – это самый ранний клад (данного таксономического ранга[a]), ответвляющийся внутри более крупного клада.

Испытание на несоответствие разности длины (или испытание на однородность раздела)

Тест разности длины при несоответствии (ILD) – это измерение того, как комбинация различных наборов данных (например, морфологических и молекулярных, пластидных и ядерных генов) влияет на увеличение длины филогенетического дерева. Он измеряется путем первоначального вычисления общей длины дерева для каждой партиции и их суммирования. Затем создаются повторы путем случайного объединения исходных партиций. Длины суммируются. P-значение 0,01 достигается при 100 повторах, если у 99 повторов наблюдается большая суммарная длина дерева.

Индекс согласованности

Индекс согласованности (CI) измеряет, насколько хорошо дерево соответствует набору данных – это мера минимального количества гомоплазии, подразумеваемого этим деревом. Он рассчитывается путем подсчета минимального числа изменений в наборе данных и деления его на фактическое число изменений, необходимых для кладограммы. На него, в меньшей степени, влияют количество символов в наборе данных и способ кодирования аддитивных символов, что снижает его применимость. CI принимает значения от 1 до 1/[n. taxa/2] для двоичных символов при равномерном распределении состояний; его минимальное значение увеличивается при неравномерном распределении состояний. Эта метрика претендует на измерение количества гомоплазии, но также показывает, насколько хорошо синапоморфии объясняют структуру дерева. Он вычисляется как разность между максимальным и фактическим числом изменений на дереве, деленная на разность между максимальным числом изменений на дереве и минимальным числом изменений в наборе данных. Пересчитанный индекс согласованности (RC) получается умножением CI на RI; это расширяет диапазон CI, так что его минимально возможное теоретическое значение пересчитывается до 0, а максимальное остается равным 1. Значение 1 указывает на отсутствие гомоплазии; 0 соответствует уровню гомоплазии, который наблюдался бы в полностью случайном наборе данных, а отрицательные значения указывают на еще больший уровень гомоплазии (и обычно встречаются только в искусственно созданных примерах).