Введение

Сходные последовательности ДНК, РНК или белков в геномах или среди видов.

В эволюционной биологии консервативные последовательности – это идентичные или сходные последовательности в нуклеиновых кислотах (ДНК и РНК) или белках, встречающиеся у разных видов (ортологичные последовательности), внутри генома (паралогичные последовательности) или между донорными и реципиентными таксонами (ксенологические последовательности). Консервация указывает на то, что последовательность поддерживалась естественным отбором. Высококонсервативная последовательность – это последовательность, которая оставалась относительно неизменной на протяжении длительного эволюционного времени, и, следовательно, в геологическом масштабе. Примеры высококонсервативных последовательностей включают РНК-компоненты рибосом, присутствующие во всех доменах жизни, последовательности гомеобокса, широко распространенные среди эукариот, и tmРНК у бактерий. Изучение консервации последовательностей связано с такими областями, как геномика, протеомика, эволюционная биология, филогенетика, биоинформатика и математика.

История

Открытие роли ДНК в наследственности и наблюдения Фредерика Сэнгера за вариациями между инсулинами животных в 1949 году подтолкнули первых молекулярных биологов к изучению таксономии с молекулярной точки зрения. Исследования 1960-х годов использовали методы гибридизации ДНК и перекрестной реактивности белков для измерения степени сходства между известными ортологичными белками, такими как гемоглобин и цитохром c. В 1965 году Эмиль Цукеркандль и Линус Полинг предложили концепцию молекулярных часов, предполагая, что стабильные скорости замены аминокислот могут быть использованы для оценки времени, прошедшего с момента дивергенции двух организмов. Хотя первоначальные филогении хорошо соответствовали данным палеонтологии, наблюдения о том, что некоторые гены, по-видимому, эволюционируют с разной скоростью, привели к разработке теорий молекулярной эволюции.

Механизмы

На протяжении многих поколений последовательности нуклеиновых кислот в геноме эволюционной линии могут постепенно изменяться со временем из-за случайных мутаций и делеций. Последовательности также могут рекомбинировать или удаляться в результате хромосомных перестроек. Консервированные последовательности – это последовательности, которые сохраняются в геноме, несмотря на эти факторы, и имеют более низкую скорость мутаций, чем фоновая скорость мутаций. Консервация может происходить как в кодирующих, так и в некодирующих последовательностях нуклеиновых кислот. Считается, что высококонсервированные последовательности ДНК обладают функциональной значимостью, хотя роль многих высококонсервированных некодирующих последовательностей ДНК изучена недостаточно. Степень консервации последовательности может зависеть от различных селективных сил, её устойчивости к мутациям, размера популяции и генетического дрейфа. Многие функциональные последовательности также имеют модульную структуру, содержащую области, которые могут подвергаться независимому селективному давлению, например, белковые домены.

Кодировка

В кодирующих последовательностях нуклеиновая и аминокислотная последовательности могут сохраняться в различной степени, поскольку вырожденность генетического кода означает, что синонимические мутации в кодирующей последовательности не влияют на аминокислотную последовательность белкового продукта. Аминокислотные последовательности могут сохраняться для поддержания структуры или функции белка или домена. Консервированные белки подвергаются меньшему числу замен аминокислот или чаще заменяют аминокислоты на аналогичные по биохимическим свойствам. Внутри последовательности аминокислоты, важные для правильного сворачивания, структурной стабильности или формирования связывающего центра, могут быть более строго сохранены. Нуклеиновая последовательность гена, кодирующего белок, также может сохраняться под действием других отборочных сил. Склонность к использованию кодонов у некоторых организмов может ограничивать типы синонимических мутаций в последовательности. Нуклеиновые последовательности, вызывающие образование вторичной структуры в мРНК кодирующего гена, могут подвергаться отрицательному отбору, поскольку некоторые структуры могут негативно влиять на трансляцию, или сохраняться, если мРНК также выполняет функцию некодирующей РНК.

Не кодируется

Некодирующие последовательности, важные для регуляции генов, такие как сайты связывания или распознавания рибосом и транскрипционных факторов, могут сохраняться в геноме. Например, промотор консервированного гена или оперона также может быть сохранен. Как и в случае с белками, нуклеиновые кислоты, важные для структуры и функции некодирующих РНК (нкРНК), также могут сохраняться. Однако степень сохранения последовательности в нкРНК обычно ниже, чем в кодирующих белком последовательностях, и чаще сохраняются парные основания, определяющие структуру или функцию.

Идентификация

Сохраненные последовательности обычно идентифицируются биоинформатическими методами, основанными на выравнивании последовательностей. Достижения в высокопроизводительном секвенировании ДНК и протеомном анализе (белковой масс-спектрометрии) существенно расширили доступность последовательностей белков и полных геномов для сравнения с начала 2000-х годов.

Однородное поиск

Сохраненные последовательности могут быть идентифицированы с помощью гомологического поиска, используя такие инструменты, как BLAST, HMMER, OrthologR и Infernal. Инструменты гомологического поиска могут принимать на вход отдельную нуклеотидную или аминокислотную последовательность, либо использовать статистические модели, построенные на основе множественных выравниваний последовательностей известных родственных последовательностей. Статистические модели, такие как профильные HMM и модели ковариации РНК, которые также учитывают структурную информацию, могут быть полезны при поиске более отдалённо родственных последовательностей. Входные последовательности затем выравниваются с базой данных последовательностей родственных организмов или других видов. Полученные выравнивания оцениваются на основе количества совпадающих аминокислот или нуклеотидов, а также количества вставленных пробелов или делеций, возникших в процессе выравнивания. Допустимые консервативные замены могут быть определены с использованием матриц подстановки, таких как PAM и BLOSUM. Выравнивания с высоким баллом считаются полученными из гомологичных последовательностей. О консервации последовательности можно судить по обнаружению высокопохожих гомологов в широком филогенетическом диапазоне.

Выравнивание множественной последовательности

[[Файл:LexA грамположительные бактерии последовательность логотипа.png|400px|thumb|right|Последовательный логотип для мотива связывания LexA у грамположительных бактерий. Поскольку аденозин в позиции 5 высоко консервативен, он отображается больше, чем другие символы. Последовательные логотипы также могут показывать консервацию последовательности, представляя пропорции символов в каждой точке выравнивания высотой.

Выравнивание генома

thumb|500px|right|Это изображение из браузера ECR демонстрирует результат выравнивания геномов различных позвоночных с геномом человека в области консервативного гена OTX2. Сверху: аннотации гена OTX2, показывающие экзоны и интроны. Для каждого генома отображено процентное сходство последовательностей (%) по отношению к геному человека. Дорожки представляют геномы данио-рерио (рыбы-зебры), собаки, курицы, африканской коготной лягушки, опоссума, мыши, резус-макаки и шимпанзе. Пики указывают на области высокой степени сходства последовательностей во всех геномах, что свидетельствует о высокой консервативности этой последовательности. Выравнивание целых геномов (WGA) также может использоваться для идентификации высококонсервативных областей между видами. В настоящее время точность и масштабируемость инструментов WGA ограничены из-за вычислительной сложности, связанной с перестановками, повторными областями и большим размером многих геномов эукариот. Однако WGA для 30 и более близкородственных бактерий (прокариот) становятся все более выполнимыми.

Сверхсохраняемые элементы

Ультраконсервативные элементы, или UCE, – это последовательности, демонстрирующие высокую степень сходства или идентичности у представителей различных таксономических групп. Они были впервые обнаружены у позвоночных, а впоследствии выявлены и у представителей существенно отличающихся таксонов. Несмотря на то, что происхождение и функции UCE изучены недостаточно, они используются для исследования древних расхождений в эволюции амниот, насекомых, а также между царствами животных и растений.

Универсально сохранившиеся гены

Наиболее высококонсервативные гены – это гены, которые обнаруживаются во всех организмах. Они в основном состоят из некодирующих РНК и белков, необходимых для транскрипции и трансляции, которые, как считается, сохранились со времён последнего универсального общего предка всего живого. Генами или семействами генов, которые были установлены как универсально консервативные, являются факторы элонгации, связывающие ГТФ, метионин-аминопептидаза 2, серин-гидроксиметилтрансфераза и АТФ-транспортеры. Компоненты аппарата транскрипции, такие как РНК-полимераза и геликазы, и аппарата трансляции, такие как рибосомальные РНК, тРНК и рибосомальные белки, также универсально консервативны.

Филогенетика и таксономия

Наборы консервативных последовательностей часто используются для построения филогенетических деревьев, поскольку можно предположить, что организмы с похожими последовательностями тесно связаны между собой. Выбор последовательностей может варьироваться в зависимости от таксономического масштаба исследования. Например, наиболее высококонсервативные гены, такие как 16S рРНК и другие рибосомные последовательности, полезны для реконструкции глубоких филогенетических связей и идентификации бактериальных фил в метагеномных исследованиях. Последовательности, которые консервативны внутри клады, но подвергаются некоторым мутациям, такие как гены поддержания жизнедеятельности, могут использоваться для изучения родственных связей между видами. Внутренний транскрибированный спейсер (ITS) – область, необходимая для разделения консервативных генов рРНК, но подвергающаяся быстрой эволюции, – обычно используется для классификации грибов и штаммов быстро эволюционирующих бактерий.

Медицинские исследования

Поскольку высококонсервативные последовательности часто выполняют важные биологические функции, они могут служить отправной точкой для выявления причин генетических заболеваний. Многие врожденные нарушения метаболизма и лизосомные болезни накопления являются результатом изменений в отдельных консервативных генах, приводящих к отсутствию или дефектам ферментов, которые лежат в основе симптомов этих заболеваний. Генетические заболевания можно предсказывать, идентифицируя последовательности, консервативные для человека и лабораторных организмов, таких как мыши или дрозофилы, и изучая последствия нокаута этих генов. Полногеномные ассоциативные исследования также могут использоваться для выявления вариаций в консервативных последовательностях, связанных с риском развития заболеваний или состоянием здоровья. Для болезни Альцгеймера обнаружено более двух десятков новых потенциальных локусов предрасположенности.

Функциональная аннотация

Определение консервативных последовательностей может быть использовано для выявления и предсказания функциональных последовательностей, таких как гены. Консервативные последовательности с известной функцией, например, белковые домены, также могут быть использованы для предсказания функции последовательности. Базы данных консервативных белковых доменов, такие как Pfam и база данных консервативных доменов (Conserved Domain Database), могут использоваться для аннотации функциональных доменов в предсказанных генах, кодирующих белки.