Введение
Использование стохастической матрицы для моделирования эволюции в биоинформатике. В биоинформатике и эволюционной биологии матрица подстановок описывает частоту, с которой символ в нуклеотидной или аминокислотной последовательности изменяется на другие символы в ходе эволюции. Информация часто представляется в виде логарифма отношения вероятностей обнаружения двух конкретных символов в выравнивании и зависит от предполагаемого числа эволюционных изменений или степени различия между сравниваемыми последовательностями. Это применение стохастической матрицы. Матрицы подстановок обычно используются при выравнивании аминокислотных или ДНК-последовательностей для расчета оценок сходства между выровненными последовательностями.
In bioinformatics and evolutionary biology, a substitution matrix describes the frequency at which a character in a nucleotide sequence or a protein sequence changes to other character states over evolutionary time. The information is often in the form of log odds of finding two specific character states aligned and depends on the assumed number of evolutionary changes or sequence dissimilarity between compared sequences. It is an application of a stochastic matrix. Substitution matrices are usually seen in the context of amino acid or DNA sequence alignments, where they are used to calculate similarity scores between the aligned sequences.
Матрица идентификации
Самая простая возможная матрица подстановок будет состоять из того, что каждая аминокислота считается максимально похожей на саму себя, но не может превращаться ни в какую другую аминокислоту. Эта матрица будет выглядеть следующим образом:
Эта единичная матрица успешно справится с выравниванием очень похожих аминокислотных последовательностей, но будет совершенно бесполезна при выравнивании двух отдалённо родственных последовательностей. Нам необходимо определить все вероятности более строгим образом. Оказывается, что эмпирическое исследование ранее выровненных последовательностей даёт наилучшие результаты.
Матрицы логарифмических шансов
Мы выражаем вероятности трансформации в виде логарифмов отношения шансов (log odds scores). Матрица оценок S определяется как
где – вероятность того, что аминокислота преобразуется в аминокислоту , а , – частоты аминокислот i и j. Основание логарифма не имеет значения, и одна и та же матрица подстановок часто представляется в разных основаниях.
ПАМ
Одна из первых матриц замещения аминокислот, матрица PAM (Point Accepted Mutation), была разработана Маргарет Дейхофф в 1970-х годах. Эта матрица рассчитывается на основе анализа различий в тесно связанных белках. Поскольку в качестве основы используются очень близкие гомологи, наблюдаемые мутации не должны существенно изменять общие функции белков. Таким образом, наблюдаемые замены (в результате точечных мутаций) рассматриваются как допустимые естественным отбором. Одна единица PAM определяется как 1% измененных аминокислотных позиций. Для создания матрицы замещения PAM1 выбирается группа очень близкородственных последовательностей с частотами мутаций, соответствующими одной единице PAM. На основе собранных данных о мутациях в этой группе последовательностей выводится матрица замещения. Матрица PAM1 оценивает скорость замещения, которая ожидается при изменении 1% аминокислот. Матрица PAM1 служит основой для расчета других матриц, исходя из предположения, что повторные мутации будут следовать той же закономерности, что и в матрице PAM1, и что в одной и той же позиции может произойти несколько замещений. При этом допущении матрицу PAM2 можно оценить, возводя вероятности в квадрат. Используя эту логику, Дейхофф вывела матрицы вплоть до PAM250. Обычно используются PAM 30 и PAM70.
ЦВЕТ
Методология Дейхоффа по сравнению близкородственных видов оказалась недостаточно эффективной для выравнивания эволюционно сильно различающихся последовательностей. Изменения в последовательностях на протяжении длительных эволюционных периодов времени плохо описываются как суммирование небольших изменений, происходящих на коротких промежутках времени. Серия матриц BLOSUM (BLOCK SUbstitution Matrix) решает эту проблему. Хеникофф и Хеникофф построили эти матрицы, используя множественные выравнивания эволюционно дивергентных белков. Вероятности, используемые при расчете матрицы, определяются путем анализа "блоков" консервативных последовательностей, обнаруженных в множественных выравниваниях белков. Считается, что эти консервативные последовательности важны для функции родственных белков и, следовательно, имеют более низкую скорость замещения, чем менее консервативные области. Чтобы уменьшить влияние близкородственных последовательностей на скорости замещения, сегменты в блоке с идентичностью последовательностей выше определенного порога были объединены в кластеры, что уменьшило вес каждого такого кластера (Хеникофф и Хеникофф). Для матрицы BLOSUM62 этот порог был установлен на уровне 62%. Частоты пар затем подсчитывались между кластерами, то есть пары учитывались только между сегментами, имеющими менее 62% идентичности. Для выравнивания двух близкородственных последовательностей следует использовать матрицу BLOSUM с более высоким номером, а для более дивергентных последовательностей – с более низким. Оказалось, что матрица BLOSUM62 отлично обнаруживает сходства в далеких последовательностях, и именно она используется по умолчанию в большинстве современных программ выравнивания, таких как BLAST.
Различия между PAM и BLOSUM
Матрицы PAM основаны на явной эволюционной модели (то есть замены учитываются на ветвях филогенетического дерева, используя принцип максимальной экономии признаков), в то время как матрицы BLOSUM основаны на неявной модели эволюции. Матрицы PAM построены на основе мутаций, наблюдаемых при глобальном выравнивании, включая как высококонсервативные, так и высокомутабельные регионы. Матрицы BLOSUM основаны только на высококонсервативных областях в сериях выравниваний, не допускающих наличия пропусков. Метод подсчета замен различен: в отличие от матрицы PAM, процедура BLOSUM использует группы последовательностей, в которых мутации не учитываются с одинаковым весом. Более высокие числа в обозначениях матрицы PAM указывают на большее эволюционное расстояние, а более высокие числа в обозначениях матрицы BLOSUM указывают на большее сходство последовательностей и, следовательно, меньшее эволюционное расстояние. Например, PAM150 используется для более далёких последовательностей, чем PAM100, а BLOSUM62 – для более близких, чем BLOSUM50.
Новые матрицы
Для устранения недостатков в более ранних конструкциях было предложено несколько новых матриц подстановки. JTT, опубликованный в том же году, что и BLOSOM, также выполняет кластеризацию и использует неявную модель. Это может помочь снизить систематическую ошибку, возникающую при использовании метода максимальной экономии (МЭ), но также приводит к потере информации о последовательности.
Специализированные матрицы замещения и их расширения
Реальные скорости замещения в белке зависят не только от идентичности аминокислоты, но и от конкретного структурного или последовательного контекста, в котором она находится. Для таких контекстов было разработано множество специализированных матриц, например, для трансмембранных альфа-спиралей, для комбинаций состояний вторичной структуры и доступности растворителю, или для локальных структурных контекстов последовательности. Эти контекстно-специфические матрицы замещения обычно улучшают качество выравнивания, но требуют больших вычислительных затрат и пока не получили широкого распространения. В последнее время были разработаны оценки сходства аминокислот, специфичные для контекста последовательности, которые не требуют использования матриц замещения, а опираются на библиотеку контекстов последовательности. На основе этой идеи было продемонстрировано, что контекстное расширение популярной программы BLAST (CS BLAST) позволяет добиться двукратного увеличения чувствительности при поиске отдалённо родственных последовательностей, сохраняя при этом сопоставимую скорость работы.
Терминология
Хотя "матрица перехода" часто используется как синоним "матрицы замещения" в областях, отличных от биоинформатики, первый термин является проблематичным в биоинформатике. В отношении нуклеотидных замещений, термин "переход" также используется для обозначения замещений между двумя пуринами с двойным кольцом (A → G и G → A) или между пиримидинами с одинарным кольцом (C → T и T → C). Поскольку эти замещения не требуют изменения количества колец, они происходят чаще, чем другие. "Трансверсия" – термин, используемый для обозначения замещений, происходящих с более низкой скоростью, которые изменяют пурин на пиримидин или наоборот (A ↔ C, A ↔ T, G ↔ C и G ↔ T).