Введение

Отрасль биологии

Вычислительная биология – это использование анализа данных, математического моделирования и вычислительных симуляций для понимания биологических систем и взаимосвязей. К 1982 году исследователи обменивались информацией посредством перфокарт. К концу 1980-х годов объём данных рос экспоненциально, что потребовало новых вычислительных методов для быстрой интерпретации релевантной информации. К 2003 году проект секвенировал около 85% генома человека, достигнув своих первоначальных целей. Однако работа продолжалась, и к 2021 году был достигнут уровень "полного генома", при этом лишь 0,3% оставшихся оснований были покрыты потенциальными проблемами. Отсутствующая Y-хромосома была добавлена в январе 2022 года. С конца 1990-х годов вычислительная биология стала важной частью биологии, что привело к появлению многочисленных поддисциплин. Сегодня Международное общество вычислительной биологии признаёт 21 различную "группу по особым интересам", каждая из которых представляет собой часть более широкой области. Помимо помощи в секвенировании генома человека, вычислительная биология способствовала созданию точных моделей человеческого мозга, построению карт трёхмерной структуры геномов и моделированию биологических систем. Группа диффеоморфизмов используется для изучения различных координатных систем посредством координатных преобразований, генерируемых лагранжевыми и эйлеровыми скоростями потока из одной анатомической конфигурации в другую. Она связана со статистикой формы и морфометрией, но отличается тем, что диффеоморфизмы используются для отображения координатных систем, изучение которых известно как диффеоморфометрия.

Данные и моделирование

Математическая биология – это использование математических моделей живых организмов для изучения систем, определяющих структуру, развитие и поведение в биологических системах. Это подразумевает более теоретический подход к решению проблем, в отличие от эмпирически ориентированной экспериментальной биологии. Математическая биология опирается на дискретную математику, топологию (также полезную для вычислительного моделирования), байесовскую статистику, линейную алгебру и булеву алгебру, а также на вычислительное биомоделирование, которое включает создание компьютерных моделей и визуальных симуляций биологических систем. Это позволяет исследователям предсказывать реакцию таких систем на различные условия, что полезно для определения способности системы "поддерживать свое состояние и функции при внешних и внутренних возмущениях". Хотя современные методы в основном сосредоточены на небольших биологических системах, исследователи работают над подходами, позволяющими анализировать и моделировать более крупные сети. Большинство исследователей полагают, что это будет необходимо для разработки современных медицинских подходов к созданию новых лекарств и генной терапии. Подобным образом, до недавнего времени теоретическая экология в основном использовала аналитические модели, не связанные со статистическими моделями, применяемыми эмпирическими экологами. Однако вычислительные методы способствовали развитию экологической теории посредством моделирования экологических систем, а также расширили применение методов вычислительной статистики в экологическом анализе.

Генемика

Компьютерная геномика – это изучение геномов клеток и организмов. Проект «Геном человека» – один из примеров вычислительной геномики. Этот проект направлен на секвенирование всего человеческого генома и преобразование его в набор данных. После полной реализации это позволит врачам анализировать геном отдельного пациента, открывая возможности для персонализированной медицины и назначения лечения на основе индивидуальных генетических особенностей. Исследователи стремятся секвенировать геномы животных, растений, бактерий и всех других форм жизни. Одним из основных способов сравнения геномов является гомология последовательностей. Гомология – это изучение биологических структур и нуклеотидных последовательностей у разных организмов, имеющих общего предка. Исследования показывают, что таким образом можно идентифицировать от 80 до 90% генов в недавно секвенированных прокариотических геномах. Недостаточно изученной областью в вычислительной геномике остается анализ межгенных областей, которые составляют около 97% генома человека. 3D-геномика – это раздел вычислительной биологии, который фокусируется на организации и взаимодействии генов внутри эукариотической клетки. Один из методов сбора 3D-геномных данных – это Genome Architecture Mapping (GAM). GAM измеряет трехмерные расстояния между хроматином и ДНК в геноме, комбинируя криосекционирование – процесс получения тонких срезов ядра для изучения ДНК – с лазерной микродиссекцией. Ядерный профиль – это непосредственно такой срез или полоска, извлеченная из ядра. Каждый ядерный профиль содержит геномные окна, представляющие собой определенные последовательности нуклеотидов – основных строительных блоков ДНК. GAM позволяет получить карту геномной сети, отражающую сложные множественные хроматиновые контакты по всей клетке.

Нейробиологии

Вычислительная нейробиология – это изучение функций мозга с точки зрения информационно-процессирующих свойств нервной системы. Являясь частью нейробиологии, она направлена на создание моделей мозга для изучения конкретных аспектов неврологической системы. Модели мозга включают в себя:
Реалистичные модели мозга: Эти модели стремятся воспроизвести каждый аспект мозга, включая максимально возможную детализацию на клеточном уровне. Реалистичные модели предоставляют наибольший объем информации о мозге, но при этом имеют наибольшую погрешность. Чем больше переменных в модели мозга, тем выше вероятность возникновения ошибок. Эти модели не учитывают элементы клеточной структуры, которые неизвестны науке. Реалистичные модели мозга требуют наибольших вычислительных ресурсов и наиболее затратны в реализации. Упрощенные модели мозга: Эти модели ограничивают область применения модели, чтобы оценить конкретное физическое свойство неврологической системы. Это позволяет решать сложные вычислительные задачи и снижает потенциальную погрешность, присущую реалистичным моделям мозга.

Фармакология

Компьютерная фармакология – это "изучение влияния геномных данных для выявления связей между конкретными генотипами и заболеваниями, а затем – скрининг данных о лекарственных препаратах". Фармацевтическая промышленность нуждается в смене методик анализа данных о лекарствах. Ранее фармакологи могли использовать Microsoft Excel для сопоставления химических и геномных данных, связанных с эффективностью лекарств. Однако отрасль столкнулась с так называемым "Excel-барьером", обусловленным ограниченным числом ячеек в таблицах. Это привело к необходимости развития компьютерной фармакологии. Ученые и исследователи разрабатывают вычислительные методы для анализа этих огромных массивов данных, что позволяет эффективно сравнивать ключевые параметры и создавать более эффективные лекарственные препараты. Аналитики прогнозируют, что в случае истечения срока действия патентов на основные лекарства, компьютерная биология станет необходимой для замены существующих препаратов на рынке. Аспирантов, обучающихся в области компьютерной биологии, стимулируют выбирать карьеру в промышленности, а не продолжать обучение в постдокторантуре. Это связано с растущей потребностью крупных фармацевтических компаний в квалифицированных специалистах для анализа больших данных, необходимых при разработке новых лекарств.

Техника

Компьютерные биологи используют широкий спектр программного обеспечения и алгоритмов для проведения исследований.

Аналитика графов

Анализ графов, или сетевой анализ, — это изучение графов, представляющих связи между различными объектами. Графы могут моделировать различные типы биологических сетей, такие как сети взаимодействия белков, регуляторные сети, метаболические и биохимические сети и многое другое. Существует множество способов анализа этих сетей, один из которых — изучение центральности в графах. Определение центральности в графе позволяет ранжировать узлы по их значимости или центральности в сети, что полезно для выявления наиболее важных узлов. Это может быть очень полезно в биологии. Например, если у нас есть данные об активности генов за определенный период времени, мы можем использовать степень центральности, чтобы определить, какие гены наиболее активны в сети или с какими генами происходит наибольшее количество взаимодействий. Это помогает понять, какую роль играют определенные гены в сети. Существует множество методов расчета центральности в графах, каждый из которых предоставляет различные сведения о центральности. Определение центральности в биологии может применяться в различных областях, таких как регуляция генов, взаимодействие белков и метаболические сети.

Обучение под наблюдением

Обучение с учителем — это тип алгоритма, который обучается на размеченных данных и учится присваивать метки новым, неразмеченным данным. В биологии обучение с учителем может быть полезно, когда у нас есть данные, для которых известна категория, и мы хотим отнести к этим категориям больше данных. Распространенным алгоритмом обучения с учителем является случайный лес, который использует множество деревьев решений для обучения модели классификации набора данных. В основе случайного леса лежит дерево решений — структура, предназначенная для классификации или маркировки набора данных на основе известных признаков этих данных. Практическим биологическим примером может служить анализ генетических данных человека для прогнозирования предрасположенности к определенному заболеванию или раку. На каждом внутреннем узле алгоритм проверяет набор данных по одному признаку (например, конкретному гену) и затем разветвляется влево или вправо в зависимости от результата. Затем на каждом листовом узле дерево решений присваивает классовую метку набору данных. Таким образом, на практике алгоритм проходит по определенному пути от корня к листу, основанному на входных данных, через дерево решений, что приводит к классификации этих данных. Обычно деревья решений оперируют с целевыми переменными, принимающими дискретные значения, например, «да/нет», в этом случае они называются деревьями классификации, но если целевая переменная непрерывна, то они называются деревьями регрессии. Для построения дерева решений его необходимо сначала обучить на тренировочном наборе данных, чтобы определить, какие признаки являются наилучшими предикторами целевой переменной.

Программное обеспечение с открытым исходным кодом

Программное обеспечение с открытым исходным кодом предоставляет платформу для вычислительной биологии, где каждый может получить доступ к разработанному в ходе исследований программному обеспечению и использовать его. PLOS называет четыре основные причины использования программного обеспечения с открытым исходным кодом:
Воспроизводимость: Это позволяет исследователям использовать точно те же методы, которые применялись для вычисления взаимосвязей между биологическими данными. Ускоренная разработка: разработчикам и исследователям не приходится заново создавать существующий код для решения небольших задач. Вместо этого они могут использовать готовые программы, чтобы сэкономить время при разработке и внедрении более крупных проектов. Повышенное качество: участие нескольких исследователей, изучающих одну и ту же проблему, обеспечивает дополнительную гарантию отсутствия ошибок в коде. Долгосрочная доступность: программы с открытым исходным кодом не привязаны к каким-либо компаниям или патентам, что позволяет размещать их на различных веб-сайтах и обеспечивать их доступность в будущем.

Исследования

Существует несколько крупных конференций, посвященных вычислительной биологии. Среди заметных примеров – Intelligent Systems for Molecular Biology, Европейская конференция по вычислительной биологии и Research in Computational Molecular Biology. Также существует множество журналов, специализирующихся на вычислительной биологии. К числу известных относятся Journal of Computational Biology и PLOS Computational Biology – рецензируемый журнал открытого доступа, публикующий множество значимых исследовательских проектов в области вычислительной биологии. В нем публикуются обзоры программного обеспечения, учебные пособия по программному обеспечению с открытым исходным кодом и информация о предстоящих конференциях по вычислительной биологии.

Связанные области

Вычислительная биология, биоинформатика и математическая биология – это междисциплинарные подходы к изучению живых систем, опирающиеся на количественные дисциплины, такие как математика и информатика. NIH определяет вычислительную/математическую биологию как использование вычислительных/математических методов для решения теоретических и экспериментальных задач в биологии, а биоинформатику – как применение информационных наук для анализа сложных данных в области биологии.