Введение
PHYLogeny Inference Package (PHYLIP) – это бесплатный вычислительный пакет программ для вывода эволюционных деревьев (филогенетики). Он состоит из 65 переносимых программ, то есть исходный код написан на языке программирования C. Начиная с версии 3.696, он лицензирован как программное обеспечение с открытым исходным кодом; версии 3.695 и более ранние были проприетарным программным обеспечением. Выпуски доступны как исходный код, так и в виде предварительно скомпилированных исполняемых файлов для многих операционных систем, включая Windows (95, 98, ME, NT, 2000, XP, Vista), Mac OS 8, Mac OS 9, OS X, Linux (Debian, Red Hat) и FreeBSD от FreeBSD.org. Полная документация написана для всех программ в пакете и включена в него. Программы в пакете PHYLIP были написаны профессором Джозефом Фелленштейном из Департамента геномных наук и Департамента биологии Университета Вашингтона в Сиэтле. Методы (реализуемые каждой программой), доступные в пакете, включают методы экономии признаков, матрицы расстояний и методы максимального правдоподобия, включая бутстрэп-анализ и деревья консенсуса. Типы данных, которые могут быть обработаны, включают молекулярные последовательности, частоты генов, сайты и фрагменты рестрикции, матрицы расстояний и дискретные признаки. Программы IQ TREE используют формат PHYLIP или его незначительную модификацию, называемую расслабленным форматом PHYLIP. Расслабленный формат PHYLIP (последовательный):
5 42
Turkey AAGCTNGGGCATTTCAGGGTGAGCCCGGGCAATACAGGGTAT
Salmo schiefermuelleri AAGCCTTGGCAGTGCAGGGTGAGCCGTGGCCGGGCACGGTAT
H sapiens ACCGGTTGGCCGTTCAGGGTACAGGTTGGCCGTTCAGGGTAA
Chimp AAACCCTTGCCGTTACGCTTAAACCGAGGCCGGGACACTCAT
Gorilla AAACCCTTGCCGGTACGCTTAAACCATTGCCGGTACGCTTAA
Основное отличие расслабленного формата PHYLIP заключается в отсутствии ограничения в 10 символов для названий таксонов и отсутствии необходимости заполнять названия пробелами до достижения этой длины (хотя заполнение названий для выравнивания матрицы символов может улучшить читаемость). В этом примере расслабленного формата используются подчеркивания вместо пробелов в названиях таксонов, а также пробелы между названиями и выровненными данными о символах; часто хорошей практикой является избегать пробелов в названиях таксонов и отделять данные о символах от имени при создании файлов. Как и файлы в строгом формате PHYLIP, файлы в расслабленном формате PHYLIP могут быть в переставленном формате и включать пробелы и переносы строк в данных последовательности. Программы, использующие данные о расстоянии, такие как программа "neighbor", реализующая метод присоединения соседей, также используют простой формат матрицы расстояний, который включает только количество таксонов, их названия и числовые значения расстояний:
Матрица расстояний PHYLIP:
7
Bovine 0.0000 1.6866 1.7198 1.6606 1.5243 1.6043 1.5905
Mouse 1.6866 0.0000 1.5232 1.4841 1.4465 1.4389 1.4629
Gibbon 1.7198 1.5232 0.0000 0.7115 0.5958 0.6179 0.5583
Orang 1.6606 1.4841 0.7115 0.0000 0.4631 0.5061 0.4710
Gorilla 1.5243 1.4465 0.5958 0.4631 0.0000 0.3484 0.3083
Chimp 1.6043 1.4389 0.6179 0.5061 0.3484 0.0000 0.2692
Human 1.5905 1.4629 0.5583 0.4710 0.3083 0.2692 0.0000
Число указывает на количество таксонов, и существуют те же ограничения для названий таксонов. Обратите внимание, что эта матрица симметрична, а диагональ содержит значения 0 (поскольку расстояние между таксоном и самим собой по определению равно нулю). Программы, использующие деревья в качестве входных данных, принимают деревья в формате Newick, неформальном стандарте, согласованном в 1986 году авторами семи основных пакетов филогенетики. Выход записывается в файлы с именами, такими как outfile и outtree. Деревья, записанные в outtree, имеют формат Newick.
5 42
Turkey AAGCTNGGGCATTTCAGGGTGAGCCCGGGCAATACAGGGTAT
Salmo schiefermuelleri AAGCCTTGGCAGTGCAGGGTGAGCCGTGGCCGGGCACGGTAT
H sapiens ACCGGTTGGCCGTTCAGGGTACAGGTTGGCCGTTCAGGGTAA
Chimp AAACCCTTGCCGTTACGCTTAAACCGAGGCCGGGACACTCAT
Gorilla AAACCCTTGCCGGTACGCTTAAACCATTGCCGGTACGCTTAA
The primary difference in relaxed phylip format is the absence of the 10 character limit and the removal of the need to blank fill names to reach that length (although filling names to start the character matrix at the same position can improve readability for user). This example of relaxed uses underscores rather than spaces in the names and uses spaces between the names and the aligned character data; it is often good practice to avoid white space within taxon names and to separate the character data from the name when generating files. Like strict phylip format files, relaxed phylip format files can be in interleaved format and include spaces and endlines within the sequence data. The programs that use distance data, like the neighbor program that implements the neighbor joining method, also use a simple distance matrix format the includes only the number of taxa, their names, and numerical values for the distances:
Phylip distance matrix:
7
Bovine 0.0000 1.6866 1.7198 1.6606 1.5243 1.6043 1.5905
Mouse 1.6866 0.0000 1.5232 1.4841 1.4465 1.4389 1.4629
Gibbon 1.7198 1.5232 0.0000 0.7115 0.5958 0.6179 0.5583
Orang 1.6606 1.4841 0.7115 0.0000 0.4631 0.5061 0.4710
Gorilla 1.5243 1.4465 0.5958 0.4631 0.0000 0.3484 0.3083
Chimp 1.6043 1.4389 0.6179 0.5061 0.3484 0.0000 0.2692
Human 1.5905 1.4629 0.5583 0.4710 0.3083 0.2692 0.0000
The number indicates the number of taxa and same limitations for taxon names exist. Note that this matrix is symmetric and the diagonal has values of 0 (since the distance between a taxon and itself is zero by definition). Programs that use trees as input accept the trees in Newick format, an informal standard agreed to in 1986 by authors of seven major phylogeny packages. Output is written onto files with names like outfile and outtree. Trees written onto outtree are in the Newick format.
Компонентные программы
protpars Оценивает филогении пептидных последовательностей методом максимальной экономии признаков (парсимонии).
dnapars Оценивает филогении последовательностей ДНК методом максимальной экономии признаков (парсимонии).
dnapenny Метод поиска по ветвям и границам для максимальной экономии признаков (парсимонии) ДНК, находит все наиболее экономные филогении для нуклеиновых последовательностей с помощью поиска по ветвям и границам.
dnamove Интерактивное построение филогений из нуклеиновых последовательностей с их оценкой методом максимальной экономии признаков (парсимонии) ДНК, с оценкой совместимости и отображением реконструированных предковых оснований.
dnacomp Оценивает филогении на основе данных нуклеиновых последовательностей, используя критерий совместимости.
dnaml Оценивает филогении из нуклеотидных последовательностей методом максимального правдоподобия.
dnamlk Метод максимального правдоподобия ДНК с молекулярными часами; совместное использование dnaml и dnamlk позволяет провести тест отношения правдоподобия для гипотезы о молекулярных часах.
proml Оценивает филогении из аминокислотных последовательностей белков, используя метод максимального правдоподобия.
promlk Метод максимального правдоподобия последовательностей белков с молекулярными часами.
restml Оценка филогений методом максимального правдоподобия с использованием данных об участках рестрикции; не из фрагментов рестрикции, а по наличию или отсутствию отдельных участков.
dnainvar Для данных нуклеиновых последовательностей по четырем видам вычисляет филогенетические инварианты Лейка и Кавендера, которые проверяют альтернативные топологии деревьев.
dnadist Метод расстояний ДНК, который вычисляет четыре различных расстояния между видами из нуклеиновых последовательностей; расстояния затем могут быть использованы в программах матрицы расстояний.
protdist Метод расстояний белковых последовательностей, который вычисляет меру расстояния для последовательностей, используя оценки максимального правдоподобия на основе матрицы Dayhoff PAM, приближения Кимуры 1983 года к ней или модели на основе генетического кода плюс ограничение на изменение в другую категорию аминокислот.
restdist Расстояния, рассчитанные на основе данных об участках рестрикции или фрагментах рестрикции.
seqboot Программа бутстрэппинга и джекнайфинга; считывает набор данных и выдает из него несколько наборов данных с помощью бутстрэп-перевыборки.
fitch Метод матрицы расстояний Fitch-Margoliash; оценивает филогении из данных матрицы расстояний в соответствии с аддитивной моделью дерева, согласно которой расстояния должны равняться сумме длин ветвей между видами.
kitsch Метод матрицы расстояний Fitch-Margoliash с молекулярными часами; оценивает филогении из данных матрицы расстояний в соответствии с ультраметрической моделью, которая аналогична аддитивной модели дерева, за исключением того, что предполагается эволюционная шкала времени.
neighbor Реализация методов присоединения соседей (neighbor joining) и UPGMA.
contml Максимальное правдоподобие для непрерывных признаков и частот генов; оценивает филогении из данных о частоте генов методом максимального правдоподобия в модели, в которой вся дивергенция обусловлена генетическим дрейфом в отсутствие новых мутаций; также выполняет анализ максимального правдоподобия непрерывных признаков, которые развиваются по модели броуновского движения, предполагая, что признаки развиваются с одинаковой скоростью и некоррелированным образом; не учитывает корреляции признаков.
contrast Считывает дерево из файла дерева и набор данных с непрерывными признаками и выдает независимые контрасты для этих признаков для использования в любом пакете многомерной статистики.
gendist Программа генетических расстояний, которая вычисляет одну из трех различных формул генетических расстояний из данных о частоте генов.
pars Метод максимальной экономии признаков (парсимонии) для неупорядоченных многосостоятельных дискретных признаков.
mix Оценивает филогении некоторыми методами максимальной экономии признаков (парсимонии) для дискретных данных с признаками с двумя состояниями (0, 1); позволяет использовать методы: Wagner, Camin-Sokal или произвольные смеси.
penny Метод поиска по ветвям и границам, который находит все наиболее экономные филогении для дискретных данных с признаками с двумя состояниями для критериев Wagner, Camin-Sokal и смешанной парсимонии с использованием метода поиска по ветвям и границам точного поиска.
move Интерактивное построение филогений из дискретных данных с признаками с двумя состояниями (0, 1); оценивает критерии парсимонии и совместимости для этих филогений и отображает реконструированные состояния по всему дереву.
dollop Оценивает филогении по критериям парсимонии Dollo или полиморфизма для дискретных данных с признаками с двумя состояниями (0, 1).
dolpenny Находит все или наиболее экономные филогении для дискретных данных с признаками с двумя состояниями для критериев парсимонии Dollo или полиморфизма с использованием метода поиска по ветвям и границам точного поиска.
dolmove Интерактивное построение филогений из дискретных данных с признаками с двумя состояниями (0, 1) с использованием критериев парсимонии Dollo или полиморфизма; оценивает критерии парсимонии и совместимости для этих филогений; отображает реконструированные состояния по всему дереву.
clique Находит наибольший клик взаимосовместимых признаков и филогению, которую они рекомендуют, для дискретных данных с признаками с двумя состояниями (0, 1); наибольший клик (или все клики в заданном диапазоне размеров наибольшего) находятся с помощью быстрого метода поиска по ветвям и границам.
factor Программа перекодирования признаков, которая принимает дискретные многосостоятельные данные с деревьями состояний признаков и выдает соответствующий набор данных с двумя состояниями (0, 1).
drawgram Программа рисования корневых деревьев, которая строит корневые филогении, кладограммы и фенограммы в самых разнообразных форматах, контролируемых пользователем. Программа интерактивна и позволяет предварительно просматривать дерево на экранах графики ПК или Macintosh, а также на терминалах Tektronix или Digital graphics.
drawtree Программа рисования не корневых деревьев, аналогичная DRAWGRAM, но сочетающая филогении.
consense Программа консенсусного дерева, которая вычисляет деревья методом дерева с большинством правил, что также позволяет легко найти строгое консенсусное дерево; не может вычислить консенсусное дерево Адамса.
treedist Вычисляет симметричное расстояние Робинсона-Фоулдса между деревьями, что позволяет различать топологию дерева.
retree Интерактивная программа переустройства дерева, которая считывает дерево (с длинами ветвей, если это необходимо) и позволяет перераспределять дерево, переворачивать ветви, изменять названия видов и длины ветвей, а затем записывать результат; может использоваться для преобразования между корневыми и нераспределенными деревьями.