Введение

В вычислительной биологии, предсказание генов или поиск генов относится к процессу идентификации участков геномной ДНК, кодирующих гены. Это включает в себя гены, кодирующие белки, а также гены РНК, но может также включать прогнозирование других функциональных элементов, таких как регуляторные области. Поиск генов – один из первых и важнейших этапов в понимании генома вида после его секвенирования. На заре развития, "поиск генов" основывался на кропотливых экспериментах на живых клетках и организмах. Статистический анализ скорости гомологичной рекомбинации нескольких различных генов мог определять их порядок на определенной хромосоме, а данные, полученные в результате множества таких экспериментов, могли быть объединены для создания генетической карты, определяющей приблизительное расположение известных генов относительно друг друга. Сегодня, благодаря полногеномному секвенированию и мощным вычислительным ресурсам, доступным научному сообществу, поиск генов был переопределен как преимущественно вычислительная задача. Определение функциональности последовательности следует отличать от определения функции гена или его продукта. Предсказание функции гена и подтверждение точности предсказания гена по-прежнему требуют экспериментов in vivo, таких как нокаут гена и другие анализы, хотя передовые исследования в области биоинформатики все чаще позволяют предсказывать функцию гена исключительно на основе его последовательности. Предсказание генов является одним из ключевых этапов аннотации генома, следующим за сборкой последовательности, фильтрацией некодирующих областей и маскированием повторов. Предсказание генов тесно связано с так называемой "задачей поиска мишени", изучающей, как белки, связывающие ДНК (факторы транскрипции), находят специфические сайты связывания в геноме. Многие аспекты предсказания структуры генов основаны на современных представлениях об основных биохимических процессах в клетке, таких как транскрипция генов, трансляция, белок-белковые взаимодействия и процессы регуляции, которые являются предметом активных исследований в различных областях омики, таких как транскриптомика, протеомика, метаболомика и, в более общем смысле, структурная и функциональная геномика.

Эмпирические методы

В эмпирических (основанных на сходстве, гомологии или доказательствах) системах поиска генов целевой геном просматривается на предмет наличия последовательностей, сходных с внешними данными в виде известных экспрессированных тегов последовательности, матричной РНК (мРНК), белковых продуктов, а также гомологичных или ортологичных последовательностей. При наличии последовательности мРНК, получение уникальной последовательности геномной ДНК, из которой она была транскрибирована, является тривиальной задачей. При наличии последовательности белка можно получить семейство возможных кодирующих последовательностей ДНК путем обратного транслирования генетического кода. После определения кандидатных последовательностей ДНК, эффективный поиск в целевом геноме соответствий – полных или частичных, точных или неточных – становится относительно простой алгоритмической задачей. Для заданной последовательности локальные алгоритмы выравнивания, такие как BLAST, FASTA и Smith-Waterman, ищут области сходства между целевой последовательностью и возможными кандидатными соответствиями. Соответствия могут быть полными или частичными, точными или неточными. Успех этого подхода ограничен содержанием и точностью базы данных последовательностей. Высокая степень сходства с известной мРНК или белковым продуктом является веским доказательством того, что область целевого генома представляет собой ген, кодирующий белок. Однако для систематического применения этого подхода требуется масштабное секвенирование мРНК и белковых продуктов. Это не только дорогостоящий процесс, но и в сложных организмах лишь подмножество всех генов в геноме организма экспрессируется в любой момент времени, что означает, что внешние данные для многих генов недоступны в любой единичной клеточной культуре. Таким образом, для сбора внешних данных для большинства или всех генов сложного организма требуется изучение сотен или тысяч типов клеток, что создает дополнительные трудности. Например, некоторые человеческие гены могут экспрессироваться только в период развития эмбриона или плода, что может быть сложно изучать по этическим соображениям. Несмотря на эти трудности, обширные базы данных транскриптов и последовательностей белков были созданы для человека, а также для других важных модельных организмов в биологии, таких как мыши и дрожжи. Например, база данных RefSeq содержит транскрипты и последовательности белков многих различных видов, а система Ensembl всесторонне сопоставляет эти данные с геномами человека и нескольких других организмов. Однако, вероятно, эти базы данных неполны и содержат небольшое, но значительное количество ошибочных данных. Новые высокопроизводительные технологии секвенирования транскриптома, такие как RNA-Seq и ChIP-секвенирование, открывают возможности для включения дополнительных внешних данных в прогнозирование и валидацию генов, а также позволяют создать более информативную и точную альтернативу предыдущим методам измерения экспрессии генов, таким как экспрессированные теги последовательности или ДНК-микромассивы. Основные проблемы, связанные с прогнозированием генов, включают обработку ошибок секвенирования в исходных данных ДНК, зависимость от качества сборки последовательности, обработку коротких прочтений, сдвиги рамки считывания, перекрывающиеся гены и неполные гены. При поиске гомологии последовательностей генов у прокариот необходимо учитывать горизонтальный перенос генов. Дополнительным важным фактором, недостаточно используемым в современных инструментах обнаружения генов, является существование кластеров генов – оперонов (которые являются функциональными единицами ДНК, содержащими кластер генов под контролем одного промотора) как у прокариот, так и у эукариот. Большинство популярных детекторов генов рассматривают каждый ген изолированно, независимо от других, что не соответствует биологической реальности.

Нейронные сети

Искусственные нейронные сети – это вычислительные модели, превосходно справляющиеся с машинным обучением и распознаванием образов. Нейронные сети необходимо обучать на примерах данных, прежде чем они смогут обобщать информацию для экспериментальных данных и проверять свою работу на эталонных данных. Нейронные сети способны находить приближенные решения задач, которые сложно решить алгоритмически, при наличии достаточного объема обучающих данных. При применении к предсказанию генов нейронные сети могут использоваться совместно с другими ab initio методами для предсказания или идентификации биологических элементов, таких как сайты сплайсинга. Один из подходов заключается в использовании скользящего окна, которое последовательно перемещается по данным с перекрытием. Результат в каждой позиции – это оценка, основанная на том, считает ли сеть, что в окне находится сайт донора сплайсинга или сайт акцептора сплайсинга. Окна большего размера обеспечивают более высокую точность, но требуют больших вычислительных ресурсов. Нейронная сеть является примером сенсора сигнала, поскольку ее задача – идентифицировать функциональный участок в геноме.

Комбинированные подходы

Такие программы, как Maker, объединяют экстраполяционные и de novo подходы, сопоставляя данные по белкам и EST с геномом для валидации предсказаний de novo. Augustus, который может быть использован в составе конвейера Maker, также способен учитывать подсказки в виде выравниваний EST или профилей белков для повышения точности предсказания генов.

Сравнительные подходы к геномике

Поскольку секвенируются полные геномы многих различных видов, перспективным направлением в современных исследованиях по поиску генов является подход сравнительной геномики. Он основан на принципе, что силы естественного отбора приводят к более медленной скорости мутаций в генах и других функциональных элементах по сравнению с остальной частью генома, поскольку мутации в функциональных элементах с большей вероятностью оказывают негативное воздействие на организм, чем мутации в других областях. Таким образом, гены можно выявлять, сравнивая геномы родственных видов, чтобы обнаружить это эволюционное давление, направленное на сохранение. Этот подход был впервые применен к геномам мыши и человека с использованием программ, таких как SLAM, SGP и TWINSCAN/N SCAN и CONTRAST.

Многочисленные информаторы

TWINSCAN исследовал только синтeнию генов человека и мыши для поиска ортологичных генов. Программы, такие как N SCAN и CONTRAST, позволяли включать выравнивания из нескольких организмов, или, в случае N SCAN, выравнивание с одним альтернативным организмом по отношению к целевому. Использование нескольких источников информации может значительно повысить точность. Предсказание псевдогенов использует существующие методы оценки сходства последовательностей и ab initio методы, а также добавляет дополнительную фильтрацию и методы для выявления характеристик псевдогенов. Методы оценки сходства последовательностей могут быть адаптированы для предсказания псевдогенов с использованием дополнительной фильтрации для поиска потенциальных псевдогенов. Это может включать обнаружение инактивации, которое выявляет нонсенс-мутации или мутации со сдвигом рамки считывания, приводящие к усечению или разрушению в противном случае функциональной кодирующей последовательности. Кроме того, трансляция ДНК в последовательности белков может быть более эффективной, чем просто прямое сравнение гомологии ДНК.

Прогнозирование метагеномных генов

Метагеномика – это изучение генетического материала, полученного из окружающей среды, что приводит к получению информации о последовательностях из совокупности организмов. Прогнозирование генов полезно для сравнительной метагеномики. Инструменты метагеномики также относятся к основным категориям, использующим подходы на основе сходства последовательностей (MEGAN4) и методы *ab initio* (GLIMMER MG). Glimmer MG является расширением GLIMMER, который в основном опирается на подход *ab initio* для поиска генов и использует обучающие наборы данных родственных организмов. Стратегия прогнозирования дополняется классификацией и кластеризацией наборов данных генов перед применением методов прогнозирования генов *ab initio*. Данные кластеризуются по видам. Этот метод классификации использует методы метагеномной филогенетической классификации. Примером программного обеспечения для этого является Phymm, использующий интерполированные модели Маркова, и PhymmBL, который интегрирует BLAST в процедуры классификации. MEGAN4 использует подход на основе сходства последовательностей, выполняя локальное выравнивание с базами данных известных последовательностей, но также пытается классифицировать, используя дополнительную информацию о функциональных ролях, биологических путях и ферментах. Как и при прогнозировании генов отдельных организмов, подходы на основе сходства последовательностей ограничены размером базы данных. FragGeneScan и MetaGeneAnnotator – популярные программы прогнозирования генов, основанные на модели Hidden Markov. Эти инструменты учитывают ошибки секвенирования, частичные гены и работают с короткими прочтениями. Еще одним быстрым и точным инструментом для прогнозирования генов в метагеномах является MetaGeneMark. Этот инструмент используется Объединенным институтом генома Министерства энергетики США (DOE Joint Genome Institute) для аннотирования IMG/M – крупнейшей на сегодняшний день коллекции метагеномов.