Введение

Идентификация и изучение геномных последовательностей

В биоинформатике анализ последовательностей – это процесс применения широкого спектра аналитических методов к последовательности ДНК, РНК или пептида для понимания её характеристик, функции, структуры или эволюции. Он может быть выполнен на всем геноме, транскриптоме или протеоме организма, а также может включать только отдельные сегменты или области, такие как тандемные повторы и транспозоны. Используемые методы включают выравнивание последовательностей, поиск в биологических базах данных и другие. С момента разработки методов высокопроизводительного секвенирования генов и белков скорость добавления новых последовательностей в базы данных значительно возросла. Сама по себе такая коллекция последовательностей не углубляет понимание биологии организмов. Однако сравнение этих новых последовательностей с теми, чьи функции известны, является ключевым способом понимания биологии организма, из которого получена новая последовательность. Таким образом, анализ последовательностей может быть использован для определения функции кодирующих и некодирующих областей в биологической последовательности, обычно путем сравнения последовательностей и изучения их сходств и различий. В настоящее время существует множество инструментов и техник, обеспечивающих сравнение последовательностей (выравнивание последовательностей) и анализ результатов выравнивания для понимания их биологического значения. Анализ последовательностей в молекулярной биологии включает в себя широкий спектр процессов:

Сравнение последовательностей для выявления сходства, часто для определения, связаны ли они (гомологичны).
Идентификация внутренних характеристик последовательности, таких как активные центры, сайты посттрансляционных модификаций, структура генов, рамки считывания, распределение интронов и экзонов, а также регуляторные элементы.
Выявление различий и вариаций в последовательностях, таких как точечные мутации и однонуклеотидный полиморфизм (SNP), для получения генетических маркеров. Выявление эволюции и генетического разнообразия последовательностей и организмов.
Определение молекулярной структуры на основе одной лишь последовательности.

История

С тех пор как в 1951 году Фред Сэнгер определил первые последовательности белка инсулина, биологи пытаются использовать эти знания для понимания функций молекул. Открытия, сделанные им и его коллегами, способствовали успешному секвенированию первого генома на основе ДНК. Метод, использованный в этом исследовании, известный как "метод Сэнгера" или секвенирование по Сэнгеру, стал важной вехой в секвенировании длинных молекул, таких как ДНК. В конечном итоге этот метод был применен в проекте "Геном человека". По словам Майкла Левитта, анализ последовательностей зародился в период с 1969 по 1977 год. В 1969 году анализ последовательностей транспортных РНК был использован для выведения взаимодействий между остатками на основе коррелирующих изменений в нуклеотидных последовательностях, что позволило создать модель вторичной структуры тРНК. В 1970 году Саул Б. Нидлман и Кристиан Д. Вунш опубликовали первый компьютерный алгоритм для выравнивания двух последовательностей. За это время значительно улучшились методы получения нуклеотидных последовательностей, что привело к публикации первого полного генома бактериофага в 1977 году. Считается, что Роберт Холли и его команда из Корнелльского университета первыми секвенировали молекулу РНК.

Обзор анализа нуклеотидной последовательности (ДНК и РНК)

Анализ последовательностей нуклеотидов выявляет функциональные элементы, такие как сайты связывания белков, обнаруживает генетические вариации, например, однонуклеотидные полиморфизмы (SNP), изучает паттерны экспрессии генов и позволяет понять генетические основы признаков. Это помогает разобраться в механизмах, лежащих в основе процессов, таких как репликация и транскрипция. Ниже представлен перечень некоторых задач, связанных с этим.

Контроль качества и предварительная обработка

Контроль качества оценивает качество считываний, полученных с помощью технологии секвенирования (например, Illumina). Это первый этап в анализе последовательностей, позволяющий избежать ошибочных выводов из-за данных низкого качества. Инструменты, используемые на этом этапе, зависят от платформы секвенирования. Например, FastQC проверяет качество коротких считываний (включая последовательности РНК), Nanoplot или PycoQC используются для длинных считываний (например, считываний Nanopore), а MultiQC объединяет результаты FastQC в формате веб-страницы. Контроль качества предоставляет информацию о длине считываний, содержании GC, наличии адаптерных последовательностей (для коротких считываний) и оценке качества, которая часто выражается в шкале PHRED. Если в считываниях присутствуют адаптеры или другие артефакты, возникшие в результате ПЦР-амплификации (особенно в коротких считываниях), они удаляются с помощью программного обеспечения, такого как Trimmomatic или Cutadapt.

Читать выравнивание

На этом этапе секвенированные чтения, качество которых было улучшено, отображаются на референсный геном с использованием инструментов выравнивания, таких как BWA для коротких последовательностей ДНК, minimap для длинных последовательностей ДНК и STAR для последовательностей РНК. Цель отображения – определить происхождение каждого чтения на основе референсной последовательности. Это также важно для обнаружения вариаций или проведения филогенетических исследований. Результат этого этапа, то есть выровненные чтения, сохраняется в совместимых форматах файлов, известных как SAM, которые содержат информацию о референсном геноме и отдельных чтениях. В качестве альтернативы предпочтительны форматы файлов BAM, поскольку они занимают значительно меньше места на диске или в хранилище. Эти файлы используются для выявления различий по сравнению с референсной последовательностью. Выбор инструмента для вызова вариантов сильно зависит от используемой технологии секвенирования, поэтому GATK часто используется при работе с короткими чтениями, в то время как для длинных последовательностей требуются инструменты, такие как DeepVariant и Sniffles. Инструменты также могут различаться в зависимости от организма (прокариот или эукариот), источника данных о последовательности (рак или метагеном) и типа интересующих вариантов (SNV или структурные варианты). Результат вызова вариантов обычно представлен в формате VCF и может быть отфильтрован с использованием частот аллелей, оценок качества или других факторов, основанных на поставленных задачах исследования, или с помощью пользовательских скриптов и конвейеров. Результатом этого этапа является аннотационный файл в формате BED или TXT. Также проводится выявление дифференциально экспрессируемых генов (DEG) между экспериментальными условиями с использованием статистических методов, таких как DESeq2. Это выполняется для сравнения уровней экспрессии генов или изоформ между различными образцами или группами образцов и для определения биологической значимости.

Анализ функционального обогащения

Анализ функционального обогащения выявляет биологические процессы, пути и функциональные изменения, связанные с дифференциально экспрессируемыми генами, полученными на предыдущем этапе. В нем используются такие инструменты, как GOSeq и Pathview. Результатом является таблица, содержащая информацию о путях и молекулярных процессах, ассоциированных с дифференциально экспрессируемыми генами, о том, какие гены подавлены или активированы, а также о повторяющихся или избыточно представленных терминах генной онтологии.

Просматриватели генома в анализе последовательности

Браузеры генома предоставляют не требующий навыков программирования, удобный для пользователя интерфейс для визуализации геномов и геномных сегментов, идентификации геномных признаков и анализа взаимосвязей между множеством геномных элементов. Три основных браузера генома — Ensembl, UCSC и Национальный центр биотехнологической информации (NCBI) — поддерживают различные процедуры анализа последовательностей, включая сборку генома, аннотирование генома и сравнительную геномику, например, изучение паттернов дифференциальной экспрессии и выявление консервативных регионов. Все браузеры поддерживают множество форматов данных для загрузки и скачивания и предоставляют ссылки на внешние инструменты и ресурсы для анализа последовательностей, что повышает их универсальность.

Сравнение профилей

В 1987 году Майкл Грибсков, Эндрю МакЛахлан и Дэвид Эйзенберг предложили метод сравнения профилей для выявления далеких сходств между белками. Вместо использования одной последовательности, профильные методы используют множественное выравнивание последовательностей для кодирования профиля, содержащего информацию об уровне консервации каждого аминокислотного остатка. Эти профили затем могут быть использованы для поиска в базах последовательностей, чтобы найти родственные последовательности. Профили также известны как матрицы оценки позиций (PSSM). В 1993 году Андерс Крог и его коллеги предложили вероятностную интерпретацию профилей с использованием скрытых марковских моделей. Эти модели стали известны как профильные HMM. В последние годы были разработаны методы, позволяющие сравнивать профили непосредственно друг с другом. Эти методы известны как методы сравнения профилей.

Сборка последовательности

Сборка последовательностей относится к реконструкции последовательности ДНК путем выравнивания и объединения небольших фрагментов ДНК. Это неотъемлемая часть современного секвенирования ДНК. Поскольку современные технологии секвенирования ДНК не предназначены для чтения длинных последовательностей, большие участки ДНК (например, геномы) часто секвенируют, выполняя следующие шаги: (1) разрезая ДНК на небольшие фрагменты, (2) считывая эти фрагменты и (3) восстанавливая исходную ДНК путем объединения информации, полученной из различных фрагментов. В последнее время одной из приоритетных задач исследований является секвенирование нескольких видов одновременно. Метагеномика – это изучение микробных сообществ, полученных непосредственно из окружающей среды. В отличие от микроорганизмов, выращенных в лабораторных условиях, природные образцы обычно содержат десятки, а иногда и тысячи видов микроорганизмов из их естественной среды обитания. Восстановление исходных геномов может оказаться весьма сложной задачей.

Прогнозирование генов

Прогнозирование генов или поиск генов относится к процессу идентификации участков геномной ДНК, кодирующих гены. Это включает в себя гены, кодирующие белки, а также гены РНК, но может также включать прогнозирование других функциональных элементов, таких как регуляторные области. Прогнозирование генов – один из первых и важнейших этапов в понимании генома вида после его секвенирования. В целом, предсказание бактериальных генов значительно проще и точнее, чем предсказание генов у эукариотических организмов, которые обычно имеют сложные структуры интронов/экзонов. Идентификация генов в длинных последовательностях остаётся проблемой, особенно когда количество генов неизвестно. Скрытые марковские модели могут быть частью решения. Машинное обучение сыграло значительную роль в предсказании последовательностей факторов транскрипции. Традиционный анализ секвенирования фокусируется на статистических параметрах самой нуклеотидной последовательности (наиболее часто используемые программы перечислены в таблице 4.1). Другой метод – поиск гомологичных последовательностей на основе других известных последовательностей генов (инструменты см. в таблице 4.3). Оба описанных метода ориентированы на последовательность. Однако, структурные особенности этих молекул, таких как ДНК и белки, также изучались и предлагаются как оказывающие эквивалентное, а возможно и большее, влияние на поведение этих молекул.

Прогноз структуры белка

Трехмерные структуры молекул имеют первостепенное значение для их функций в природе. Поскольку структурное предсказание крупных молекул на атомном уровне является в основном неразрешимой задачей, некоторые биологи разработали методы прогнозирования трехмерной структуры на уровне первичной последовательности. Это включает в себя биохимический или статистический анализ аминокислотных остатков в локальных областях и структурные выводы на основе гомологов (или других потенциально родственных белков) с известными трехмерными структурами. Существует большое количество разнообразных подходов к решению проблемы предсказания структуры. Чтобы определить наиболее эффективные методы, был организован конкурс по предсказанию структуры, известный как CASP (Critical Assessment of Structure Prediction) – Критическая оценка предсказания структуры.