Введение

Шаблон последовательности нуклеотидов или аминокислот

В биологии, мотив последовательности – это широко распространенный шаблон последовательности нуклеотидов или аминокислот, который обычно считается связанным с биологической функцией макромолекулы. Например, мотив N-гликозилирования можно определить как Asn, за которым следует любая аминокислота, кроме Pro, за которым следует либо Ser, либо Thr, за которым следует любая аминокислота, кроме Pro.

Обзор

Когда последовательность мотивов встречается в экзоне гена, она может кодировать "структурный мотив" белка, то есть стереотипный элемент его общей структуры. Однако мотивы не обязательно должны быть связаны с выраженной вторичной структурой. "Некодирующие" последовательности не транслируются в белки, и нуклеиновые кислоты, содержащие такие мотивы, не обязаны отклоняться от типичной формы (например, двойная спираль ДНК "B-формы"). За пределами генных экзонов существуют регуляторные последовательности мотивов и мотивы в "мусорной" ДНК, такие как спутниковая ДНК. Некоторые из них, как полагают, влияют на конформацию нуклеиновых кислот (например, самосплайсинг РНК), но это происходит не всегда. Например, многие белки, связывающиеся с ДНК и обладающие сродством к специфическим участкам связывания, связывают ДНК только в форме двойной спирали. Они способны распознавать мотивы, взаимодействуя с большой или малой бороздкой двойной спирали. К коротким кодирующим мотивам, которые, по-видимому, лишены вторичной структуры, относятся те, которые маркируют белки для доставки в определенные части клетки или для фосфорилирования. Исследователи ищут и находят мотивы в последовательностях или базах данных последовательностей, используя компьютерные методы анализа последовательностей, такие как BLAST. Эти методы относятся к области биоинформатики. См. также консенсусная последовательность.

Открытие мотивов De novo

Существуют программные средства, которые, анализируя несколько входных последовательностей, пытаются выявить один или несколько возможных мотивов. Одним из примеров является алгоритм Multiple EM for Motif Elicitation (MEME), который генерирует статистические данные для каждого кандидата. Существует более 100 публикаций, посвященных алгоритмам поиска мотивов; Weirauch и др. оценили многие из этих алгоритмов в ходе сравнительного анализа 2013 года. Поиск внедренных мотивов – это еще один метод поиска мотивов, основанный на комбинаторном подходе.

Открытие филогенетических мотивов

Мотивы также были обнаружены с помощью филогенетического подхода и изучения гомологичных генов у разных видов. Например, путём выравнивания аминокислотных последовательностей, кодируемых геном GCM (glial cells missing) у человека, мыши и D. melanogaster, Акияма и другие в 1996 году обнаружили паттерн, который они назвали мотивом GCM. Он охватывает около 150 аминокислотных остатков и начинается следующим образом:

WDIND*. *P * D. F.*W***.**. IYS** A. *H*S*WAMRNTNNHN

Здесь каждая буква обозначает отдельную аминокислоту или пробел, а каждый * указывает на один из членов близкородственного семейства аминокислот. Авторы показали, что мотив обладает способностью связываться с ДНК. Аналогичный подход широко используется в современных базах данных доменов белков, таких как Pfam: эксперты-кураторы отбирают пул последовательностей, известных как гомологичные, и используют компьютерные программы для их выравнивания и создания профиля мотива (Pfam использует HMM, которые могут быть использованы для идентификации других связанных белков). Филогенетический подход также может быть использован для улучшения алгоритма MEME de novo, примером чего является PhyloGibbs.

Открытие пары мотивов De novo

В 2017 году MotifHyades был разработан как инструмент для поиска мотивов, который можно непосредственно применять к парным последовательностям.