Введение

Процесс в биоинформатике, который идентифицирует эквивалентные участки в молекулярных последовательностях. В биоинформатике выравнивание последовательностей – это способ упорядочения последовательностей ДНК, РНК или белков для выявления областей сходства, которые могут быть результатом функциональных, структурных или эволюционных взаимосвязей между последовательностями. Выровненные последовательности нуклеотидных или аминокислотных остатков обычно представляются в виде строк в матрице. Пробелы вставляются между остатками таким образом, чтобы идентичные или сходные символы располагались в последовательных столбцах. Выравнивание последовательностей также применяется к небиологическим последовательностям, например, для вычисления расстояния между строками в естественном языке или для отображения финансовых данных.

Интерпретация

Если две последовательности в выравнивании имеют общего предка, несовпадения могут интерпретироваться как точечные мутации, а пробелы – как инделы (то есть мутации вставки или делеции), возникшие в одной или обеих ветвях после их расхождения. При выравнивании последовательностей белков, степень сходства аминокислот, занимающих определенную позицию в последовательности, может служить приблизительной мерой консервативности определенного региона или последовательного мотива у разных линий. Отсутствие замен или наличие только очень консервативных замен (то есть замена аминокислот, боковые цепи которых обладают схожими биохимическими свойствами) в определенном участке последовательности указывает на то, что этот участок имеет структурное или функциональное значение. Хотя нуклеотидные основания ДНК и РНК более схожи между собой, чем аминокислоты, сохранение пар оснований может свидетельствовать об аналогичной функциональной или структурной роли.

Методы выравнивания

Очень короткие или очень похожие последовательности можно выровнять вручную. Однако, для решения большинства интересных задач требуется выравнивание длинных, сильно варьирующихся или чрезвычайно многочисленных последовательностей, которое невозможно осуществить исключительно усилиями человека. Вместо этого, человеческие знания используются при разработке алгоритмов для получения высококачественных выравниваний последовательностей, а иногда и для корректировки конечных результатов с учетом закономерностей, которые сложно представить алгоритмически (особенно в случае нуклеотидных последовательностей). Вычислительные подходы к выравниванию последовательностей обычно делятся на две категории: глобальное и локальное выравнивание. Расчет глобального выравнивания представляет собой форму глобальной оптимизации, которая "заставляет" выравнивание охватывать всю длину всех запрошенных последовательностей. В отличие от этого, локальное выравнивание определяет области сходства в длинных последовательностях, которые в целом часто сильно различаются. Локальное выравнивание часто предпочтительнее, но его может быть сложнее вычислить из-за дополнительной задачи идентификации областей сходства. Для решения задачи выравнивания последовательностей применяются различные вычислительные алгоритмы, включая медленные, но формально корректные методы, такие как динамическое программирование, а также эффективные эвристические алгоритмы или вероятностные методы, предназначенные для масштабного поиска в базах данных, которые не гарантируют нахождение наилучших соответствий.

Представительства

Выравнивания обычно представляются как графически, так и в текстовом формате. Почти во всех представлениях выравнивания последовательностей, последовательности записываются строками, расположенными таким образом, чтобы выровненные остатки располагались в последовательных столбцах. В текстовых форматах выровненные столбцы, содержащие идентичные или сходные символы, обозначаются системой символов консервации. Как показано на изображении выше, звездочка или вертикальная черта используются для обозначения идентичности между двумя столбцами; другие, менее распространенные символы включают двоеточие для консервативных замен и точку для полуконсервативных замен. Многие программы визуализации последовательностей также используют цвет для отображения информации о свойствах отдельных элементов последовательности; в последовательностях ДНК и РНК это соответствует присвоению каждому нуклеотиду своего собственного цвета. В выравниваниях белков, таких как показанное на изображении выше, цвет часто используется для указания свойств аминокислот, чтобы помочь оценить степень консервации данной аминокислотной замены. Для множественных последовательностей последняя строка в каждом столбце часто представляет собой консенсусную последовательность, определенную на основе выравнивания; консенсусная последовательность также часто представляется в графическом формате в виде логотипа последовательности, где размер каждой буквы нуклеотида или аминокислоты соответствует степени ее консервации. Выравнивания последовательностей могут храниться в различных текстовых форматах файлов, многие из которых изначально разрабатывались в связи с конкретной программой или реализацией выравнивания. Большинство веб-инструментов поддерживают ограниченное количество входных и выходных форматов, таких как формат FASTA и формат GenBank, а выходные данные нелегко редактировать. Доступно несколько программ преобразования, предоставляющих графические и/или интерфейсы командной строки, такие как READSEQ и EMBOSS. Существуют также несколько программных пакетов, обеспечивающих эту функциональность преобразования, такие как BioPython, BioRuby и BioPerl. Файлы SAM/BAM используют строковый формат CIGAR (Compact Idiosyncratic Gapped Alignment Report) для представления выравнивания последовательности относительно референсной, кодируя последовательность событий (например, соответствие/несоответствие, вставки, удаления).

Глобальные и локальные согласования

Глобальные выравнивания, которые пытаются выровнять каждый остаток в каждой последовательности, наиболее полезны, когда последовательности в наборе запросов похожи и примерно одинаковы по размеру. (Это не означает, что глобальные выравнивания не могут начинаться и/или заканчиваться гэпами.) Общим методом глобального выравнивания является алгоритм Нидлмана — Вунша, основанный на динамическом программировании. Локальные выравнивания более полезны для сильно различающихся последовательностей, которые предположительно содержат области сходства или схожие мотивы последовательностей в более широком контексте. Алгоритм Смита — Ватермана — это общий метод локального выравнивания, основанный на той же схеме динамического программирования, но с дополнительными возможностями начала и окончания в любом месте. Полуглобальное выравнивание также полезно, когда одна последовательность короткая (например, последовательность гена), а другая — очень длинная (например, последовательность хромосомы). В этом случае короткая последовательность должна быть выровнена глобально (полностью), а для длинной последовательности требуется только локальное (частичное) выравнивание. Быстрое увеличение объема генетических данных ставит под сомнение скорость современных алгоритмов выравнивания последовательностей ДНК. Необходимость в эффективном и точном методе обнаружения вариантов ДНК требует инновационных подходов к параллельной обработке в реальном времени. Оптические вычисления предлагаются как перспективная альтернатива текущим электрическим реализациям, однако их применимость еще предстоит оценить.

Методы точечной матрицы

Подход с использованием матрицы точек, который неявно генерирует семейство выравниваний для отдельных участков последовательности, является качественным и концептуально простым, хотя анализ в крупном масштабе требует значительных затрат времени. В отсутствие шума можно легко визуально идентифицировать определенные особенности последовательности – такие как вставки, делеции, повторы или инвертированные повторы – на графике точечной матрицы. Для построения графика точечной матрицы две последовательности записываются вдоль верхней строки и крайнего левого столбца двумерной матрицы, и точка ставится в любой позиции, где символы в соответствующих столбцах совпадают – это типичный график рекуррентности. Некоторые реализации изменяют размер или интенсивность точки в зависимости от степени сходства двух символов, чтобы учитывать консервативные замены. Графики точечных матриц для очень близкородственных последовательностей будут выглядеть как одна линия вдоль главной диагонали матрицы. Проблемы, связанные с использованием графиков точечных матриц как метода визуализации информации, включают: шум, недостаточную четкость, неинтуитивность, трудности с извлечением сводной статистики по совпадениям и позициям совпадений в двух последовательностях. Также имеется значительное количество неиспользуемого пространства, где данные о совпадениях по сути дублируются вдоль диагонали, и большая часть площади графика занята либо пустым пространством, либо шумом, и, наконец, графики точечных матриц ограничены двумя последовательностями. Ни одно из этих ограничений не применимо к диаграммам выравнивания Miropeats, но они имеют свои собственные недостатки. Графики точечных матриц также можно использовать для оценки повторяемости в одной последовательности. Последовательность можно нанести на график относительно самой себя, и области, имеющие значительное сходство, будут отображаться в виде линий, отходящих от главной диагонали. Этот эффект наблюдается, когда белок состоит из нескольких похожих структурных доменов.

Динамическое программирование

Техника динамического программирования может быть применена для получения глобальных выравниваний с помощью алгоритма Нидлмана — Вунша и локальных выравниваний с помощью алгоритма Смита — Уотермана. В типичном использовании при выравнивании белков используется матрица подстановок для присвоения баллов совпадениям или несовпадениям аминокислот, а также штраф за гэп (вставку/удаление) при сопоставлении аминокислоты в одной последовательности с гэпом в другой. При выравнивании ДНК и РНК может использоваться матрица оценок, но на практике часто просто присваиваются положительный балл за совпадение, отрицательный балл за несовпадение и отрицательный штраф за гэп. (В стандартном динамическом программировании оценка каждой позиции аминокислоты не зависит от идентичности её соседей, и поэтому эффекты штабелирования оснований не учитываются. Однако такие эффекты можно учесть, модифицируя алгоритм.) Распространённым расширением стандартных линейных затрат на гэпы является использование двух различных штрафов за гэп: для открытия гэпа и для его удлинения. Обычно штраф за открытие гэпа значительно выше, чем за его удлинение, например, 10 за открытие гэпа и 2 за его удлинение. Таким образом, количество гэпов в выравнивании обычно уменьшается, и остатки и гэпы остаются сгруппированными, что обычно имеет больше биологического смысла. Алгоритм Гото реализует аффинные затраты на гэпы, используя три матрицы. Динамическое программирование может быть полезно при выравнивании нуклеотидных последовательностей и белковых последовательностей, задача, осложнённая необходимостью учитывать мутации со сдвигом рамки считывания (обычно вставки или удаления). Метод поиска рамки считывания генерирует серию глобальных или локальных парных выравниваний между запросной нуклеотидной последовательностью и набором поисковых белковых последовательностей или наоборот. Его способность оценивать сдвиги рамки считывания, смещённые на произвольное число нуклеотидов, делает метод полезным для последовательностей, содержащих большое количество инделей, которые очень сложно выровнять с помощью более эффективных эвристических методов. На практике метод требует значительных вычислительных ресурсов или системы, архитектура которой специализирована для динамического программирования. Пакеты программ BLAST и EMBOSS предоставляют базовые инструменты для создания транслированных выравниваний (хотя некоторые из этих подходов используют побочные эффекты возможностей поиска последовательностей в этих инструментах). Более общие методы доступны в программном обеспечении с открытым исходным кодом, таком как GeneWise. Метод динамического программирования гарантированно находит оптимальное выравнивание при заданной функции оценки; однако определение хорошей функции оценки часто является эмпирической, а не теоретической задачей. Хотя динамическое программирование можно расширить на более чем две последовательности, оно становится неприемлемо медленным для большого количества последовательностей или чрезвычайно длинных последовательностей.

Методы слов

Методы слов, также известные как методы k-туплов, – это эвристические методы, которые не гарантируют нахождение оптимального решения выравнивания, но значительно более эффективны, чем динамическое программирование. Эти методы особенно полезны при масштабном поиске в базах данных, когда предполагается, что большая часть последовательностей-кандидатов практически не будет иметь значимого соответствия с запросной последовательностью. Методы слов наиболее известны благодаря своей реализации в инструментах поиска по базам данных FASTA и семействе программ BLAST. Тем не менее, полезность этих выравниваний в биоинформатике привела к разработке различных методов, подходящих для выравнивания трех и более последовательностей.

Динамическое программирование

Техника динамического программирования теоретически применима к любому числу последовательностей; однако, из-за высокой вычислительной сложности как по времени, так и по памяти, в своей простейшей форме она редко используется для более чем трех или четырех последовательностей. Этот метод требует построения n-мерного аналога матрицы последовательностей, сформированной из двух последовательностей, где n – количество последовательностей в запросе. Сначала стандартное динамическое программирование применяется ко всем парам последовательностей запроса, а затем "пространство выравнивания" заполняется путем рассмотрения возможных соответствий или пропусков в промежуточных позициях, что в конечном итоге приводит к построению выравнивания, по сути, между каждой парой попарных выравниваний последовательностей. Несмотря на высокую вычислительную сложность, гарантия получения глобально оптимального решения полезна в тех случаях, когда требуется точное выравнивание лишь небольшого числа последовательностей. Один из способов снижения вычислительных затрат динамического программирования, основанный на целевой функции "сумма по парам", реализован в программном пакете MSA.

Прогрессивные методы

Прогрессивные, иерархические или древовидные методы генерируют множественное выравнивание последовательностей, сначала выравнивая наиболее похожие последовательности, а затем последовательно добавляя менее родственные последовательности или группы к выравниванию, пока весь набор запросов не будет включен в решение. Начальное дерево, описывающее родство последовательностей, основано на попарных сравнениях, которые могут включать эвристические методы попарного выравнивания, подобные FASTA. Результаты прогрессивного выравнивания зависят от выбора "наиболее родственных" последовательностей и, следовательно, могут быть чувствительны к неточностям в начальных попарных выравниваниях. Большинство прогрессивных методов множественного выравнивания последовательностей дополнительно взвешивают последовательности в наборе запросов в соответствии с их родством, что снижает вероятность неудачного выбора начальных последовательностей и, таким образом, повышает точность выравнивания. Многие варианты прогрессивной реализации Clustal используются для множественного выравнивания последовательностей, построения филогенетических деревьев и в качестве входных данных для предсказания структуры белка. Более медленный, но более точный вариант прогрессивного метода известен как T-Coffee.

Итеративные методы

Итеративные методы стремятся уменьшить сильную зависимость от точности начальных попарных выравниваний, являющуюся слабым местом прогрессивных методов. Итеративные методы оптимизируют целевую функцию на основе выбранного метода оценки выравнивания, начиная с начального глобального выравнивания и последующего повторного выравнивания подмножеств последовательностей. Повторно выровненные подмножества затем выравниваются между собой для получения множественного выравнивания последовательностей следующей итерации. Различные способы выбора подгрупп последовательностей и целевых функций рассматриваются в [далее следует ссылка/указание на источник].

Определение мотивов

Поиск мотивов, также известный как профильный анализ, строит глобальные множественные выравнивания последовательностей, стремясь выровнять короткие консервативные последовательные мотивы среди последовательностей в наборе запросов. Обычно это делается путем первоначального построения общего глобального множественного выравнивания, после чего высококонсервативные области изолируются и используются для создания набора профильных матриц. Профильная матрица для каждой консервативной области организована подобно матрице оценок, но частоты каждого аминокислотного или нуклеотидного остатка в каждой позиции определяются распределением символов в консервативной области, а не более общим эмпирическим распределением. Затем профильные матрицы используются для поиска в других последовательностях вхождений мотивов, которые они характеризуют. В случаях, когда исходный набор данных содержал небольшое количество последовательностей или только тесно связанные последовательности, добавляются псевдосчета для нормализации распределения символов, представленного в мотиве.

Методы, вдохновленные информатикой

Различные алгоритмы общей оптимизации, обычно используемые в информатике, также применялись к задаче выравнивания множественных последовательностей. Скрытые марковские модели использовались для вычисления вероятностных оценок для семейства возможных вариантов выравнивания множественных последовательностей для заданного набора запросов; хотя ранние методы, основанные на HMM, демонстрировали невысокую эффективность, более поздние разработки показали их особую результативность в обнаружении отдалённо родственных последовательностей, поскольку они менее чувствительны к шуму, возникающему из-за консервативных или полуконсервативных замен. Генетические алгоритмы и имитация отжига также применялись для оптимизации оценок выравнивания множественных последовательностей, основываясь на функции оценки, такой как метод суммирования по парам. Более подробную информацию и программное обеспечение можно найти в основной статье «Выравнивание множественных последовательностей». Преобразование Бэрроуза — Уилера успешно используется для быстрого выравнивания коротких фрагментов в популярных инструментах, таких как Bowtie и BWA. См. FM-индекс.

Структурное выравнивание

Структурные выравнивания, обычно специфичные для белковых и иногда РНК-последовательностей, используют информацию о вторичной и третичной структуре белка или РНК-молекулы для облегчения выравнивания последовательностей. Эти методы могут применяться к двум или более последовательностям и обычно создают локальные выравнивания; однако, поскольку они зависят от наличия структурной информации, они могут использоваться только для последовательностей, чьи соответствующие структуры известны (обычно полученные с помощью рентгеновской кристаллографии или ЯМР-спектроскопии). Поскольку структура белка и РНК эволюционно более консервативна, чем последовательность, структурные выравнивания могут быть более надежными для очень далёко родственных последовательностей, которые настолько сильно разошлись, что сравнение последовательностей не позволяет надёжно обнаружить их сходство. Структурные выравнивания используются в качестве "золотого стандарта" при оценке выравниваний для предсказания структуры белка на основе гомологии, поскольку они явно выравнивают области белковой последовательности, структурно похожие друг на друга, а не полагаются исключительно на информацию о последовательности. Однако, очевидно, структурные выравнивания нельзя использовать в предсказании структуры, поскольку по крайней мере одна последовательность в наборе запросов является целевой, структура которой неизвестна. Показано, что при наличии структурного выравнивания между целевой и шаблонной последовательностью можно создавать высокоточные модели целевой белковой последовательности; основным препятствием в предсказании структуры на основе гомологии является получение структурно точных выравниваний, основываясь только на информации о последовательности. Они могут генерировать парные или множественные выравнивания и определять структурных соседей последовательности запроса в Банке данных белков (PDB). Они использовались для создания базы данных структурных выравниваний FSSP (классификация укладки на основе структурного выравнивания белков или семейств структурно похожих белков). Веб-сервер DALI доступен по адресу DALI, а FSSP находится в базе данных Dali.

ССАП

SSAP (Sequential Structure Alignment Program) — это метод структурного выравнивания, основанный на динамическом программировании, который использует векторы "атом-атом" в структурном пространстве в качестве точек сравнения. С момента своего первоначального описания он был расширен для выполнения как множественного, так и парного выравнивания и использовался при создании иерархической классификации белковых доменов в базе данных CATH (Class, Architecture, Topology, Homology). База данных CATH доступна по адресу CATH Protein Structure Classification.

Комбинаторное расширение

Комбинаторный метод расширения структурного выравнивания генерирует парное структурное выравнивание, используя локальную геометрию для выравнивания коротких фрагментов двух анализируемых белков, а затем собирает эти фрагменты в более крупное выравнивание. Локальные выравнивания, называемые "парами выровненных фрагментов", генерируются на основе таких показателей, как среднеквадратичное расстояние жесткого тела, расстояния между аминокислотными остатками, локальная вторичная структура и характеристики окружающей среды, такие как гидрофобность соседних остатков, и используются для построения матрицы сходства, представляющей все возможные структурные выравнивания в рамках заданных пороговых значений. Затем путь от одного состояния структуры белка к другому прослеживается через эту матрицу путем последовательного расширения выравнивания на один фрагмент. Оптимальный путь определяет выравнивание, полученное методом комбинаторного расширения. Веб-сервер, реализующий данный метод и предоставляющий базу данных парных выравниваний структур из базы данных белков, доступен на сайте Combinatorial Extension.

Филогенетический анализ

Филогенетика и выравнивание последовательностей тесно связаны между собой из-за общей необходимости оценки родства последовательностей. Филогенетика широко использует выравнивание последовательностей при построении и интерпретации филогенетических деревьев, которые применяются для классификации эволюционных взаимоотношений между гомологичными генами, представленными в геномах дивергирующих видов. Степень различий между последовательностями в наборе данных качественно связана с их эволюционным расстоянием друг от друга. В общих чертах, высокая идентичность последовательностей указывает на то, что рассматриваемые последовательности имеют относительно недавнего общего предка, в то время как низкая идентичность предполагает более древнее расхождение. Это приближение, основанное на гипотезе "молекулярных часов", согласно которой приблизительно постоянная скорость эволюционных изменений может быть использована для экстраполяции времени, прошедшего с момента первого расхождения двух генов (то есть времени коалесценции), предполагает, что эффекты мутаций и отбора постоянны в линиях последовательностей. Следовательно, оно не учитывает возможные различия между организмами или видами в скорости репарации ДНК или возможную функциональную консервацию специфических регионов в последовательности. (В случае нуклеотидных последовательностей, гипотеза молекулярных часов в своей наиболее простой форме также не учитывает разницу в частоте встречаемости между безмолвными мутациями, которые не изменяют значение кодона, и другими мутациями, приводящими к включению другой аминокислоты в белок). Более статистически точные методы позволяют эволюционной скорости варьироваться на каждой ветви филогенетического дерева, что обеспечивает более точные оценки времени коалесценции генов. Методы прогрессивного множественного выравнивания неизбежно строят филогенетическое дерево, поскольку включают последовательности в растущее выравнивание в порядке их родства. Другие методы, собирающие множественные выравнивания последовательностей и филогенетические деревья, сначала оценивают и сортируют деревья, а затем вычисляют множественное выравнивание последовательностей на основе дерева с наивысшим баллом. Обычно используемые методы построения филогенетических деревьев в основном являются эвристическими, поскольку задача выбора оптимального дерева, как и задача выбора оптимального множественного выравнивания последовательностей, является NP-трудной.

Оценка значимости

Выравнивание последовательностей полезно в биоинформатике для выявления сходства последовательностей, построения филогенетических деревьев и разработки гомологичных моделей белковых структур. Однако биологическая значимость выравнивания последовательностей не всегда очевидна. Обычно предполагается, что выравнивания отражают степень эволюционных изменений между последовательностями, произошедшими от общего предка; однако формально возможно, что конвергентная эволюция может привести к кажущемуся сходству между белками, которые эволюционно не связаны, но выполняют сходные функции и имеют похожие структуры. При поиске в базах данных, например с помощью BLAST, статистические методы позволяют оценить вероятность случайного возникновения конкретного выравнивания между последовательностями или их участками, учитывая размер и состав искомой базы данных. Эти значения могут существенно различаться в зависимости от области поиска. В частности, вероятность обнаружения данного выравнивания случайно возрастает, если база данных состоит только из последовательностей того же организма, что и запрос. Повторяющиеся последовательности в базе данных или в запросе также могут искажать как результаты поиска, так и оценку статистической значимости; BLAST автоматически фильтрует такие повторяющиеся последовательности в запросе, чтобы избежать ложных совпадений, являющихся статистическими артефактами. В литературе доступны методы оценки статистической значимости для выравнивания последовательностей с гэпами.

Оценка доверия

Статистическая значимость указывает на вероятность получения выравнивания заданного качества случайным образом, но не отражает, насколько лучше данное выравнивание по сравнению с другими возможными выравниваниями тех же последовательностей. Показатели надежности выравнивания отражают степень существенного сходства наилучших выравниваний для данной пары последовательностей. В литературе доступны методы оценки надежности выравнивания для выравниваний с гэпами.

Функции оценки

Выбор функции оценки, отражающей биологические или статистические наблюдения об известных последовательностях, важен для получения качественных выравниваний. Белковые последовательности часто выравниваются с использованием матриц подстановки, отражающих вероятности замены одного символа на другой. Серия матриц, называемых PAM-матрицами (матрицы точечно принятых мутаций, впервые определенные Маргарет Дейхофф и иногда называемые "матрицами Дейхофф"), явно кодируют эволюционные приближения относительно скорости и вероятности конкретных мутаций аминокислот. Другая распространенная серия оценочных матриц, известная как BLOSUM (Blocks Substitution Matrix), кодирует эмпирически полученные вероятности подстановки. Варианты обоих типов матриц используются для обнаружения последовательностей с различной степенью расхождения, что позволяет пользователям BLAST или FASTA ограничивать поиск более близкими соответствиями или расширять его для обнаружения более далеких последовательностей. Штрафы за пробелы учитывают введение пробела в эволюционной модели, мутацию вставки или делеции как в нуклеотидных, так и в белковых последовательностях, поэтому значения штрафов должны быть пропорциональны ожидаемой частоте таких мутаций. Качество полученных выравниваний, таким образом, зависит от качества функции оценки. Может быть очень полезно и познавательно несколько раз выполнять одно и то же выравнивание с разными вариантами оценочной матрицы и/или значениями штрафов за пробелы и сравнивать результаты. Области, где решение неустойчиво или неоднозначно, часто можно определить, наблюдая, какие области выравнивания устойчивы к изменениям параметров выравнивания.

Другие биологические применения

Секвенированная РНК, такая как экспрессированные теги последовательности и мРНК полной длины, может быть выровнена по секвенированному геному для определения местоположения генов и получения информации об альтернативном сплайсинге и редактировании РНК. Выравнивание последовательностей также является частью сборки генома, где последовательности выравниваются для поиска перекрытий, необходимых для формирования контигов (длинных участков последовательности). Еще одна область применения – анализ однонуклеотидных полиморфизмов (SNP), где последовательности от разных индивидуумов выравниваются для выявления отдельных пар оснований, часто различающихся в популяции.

Небиологическое использование

Методы, используемые для выравнивания биологических последовательностей, также нашли применение в других областях, в частности в обработке естественного языка и в социальных науках, где алгоритм Нидлмана — Вунша обычно называют методом оптимального соответствия. Методы, генерирующие набор элементов, из которых выбираются слова в алгоритмах генерации естественного языка, заимствовали методы множественного выравнивания последовательностей из биоинформатики для создания лингвистических версий компьютерно-генерируемых математических доказательств. В области исторической и сравнительной лингвистики выравнивание последовательностей используется для частичной автоматизации сравнительного метода, традиционно применяемого лингвистами для реконструкции языков. Бизнес и маркетинговые исследования также используют методы множественного выравнивания последовательностей при анализе последовательностей покупок во времени.

Программное обеспечение

Более полный список доступного программного обеспечения, классифицированного по алгоритму и типу выравнивания, можно найти по адресу sequence alignment software, но к распространенным инструментам, используемым для общих задач выравнивания последовательностей, относятся ClustalW2 и T-Coffee для выравнивания, а также BLAST и FASTA3x для поиска в базах данных. Также доступны коммерческие инструменты, такие как DNASTAR Lasergene, Geneious и PatternHunter. Инструменты, помеченные как выполняющие выравнивание последовательностей, перечислены в реестре биоинструментов (bio.tools registry). Алгоритмы и программы выравнивания можно непосредственно сравнивать друг с другом, используя стандартизированный набор эталонных множественных выравниваний, известный как BAliBASE. Этот набор данных состоит из структурных выравниваний, которые можно рассматривать как стандарт для сравнения методов, основанных исключительно на анализе последовательностей. Относительная производительность многих распространенных методов выравнивания при решении часто встречающихся задач выравнивания была проанализирована и отдельные результаты опубликованы онлайн на BAliBASE. Полный список оценок BAliBASE для многих (в настоящее время 12) различных инструментов выравнивания можно вычислить в рабочей среде для работы с белками STRAP.