Введение
Структурная биоинформатика – это раздел биоинформатики, посвященный анализу и предсказанию трехмерной структуры биологических макромолекул, таких как белки, РНК и ДНК. Она изучает закономерности, касающиеся макромолекулярных 3D-структур, включая сравнение общих архитектур и локальных мотивов, принципы молекулярного сворачивания, эволюцию, взаимодействия при связывании и взаимосвязь структуры и функции, используя как экспериментально определенные структуры, так и вычислительные модели. Термин "структурный" имеет такое же значение, как и в структурной биологии, и структурную биоинформатику можно рассматривать как часть вычислительной структурной биологии. Главная задача структурной биоинформатики – разработка новых методов анализа и обработки данных о биологических макромолекулах для решения биологических задач и получения новых знаний.
Structural bioinformatics is the branch of bioinformatics that is related to the analysis and prediction of the three dimensional structure of biological macromolecules such as proteins, RNA, and DNA. It deals with generalizations about macromolecular 3D structures such as comparisons of overall folds and local motifs, principles of molecular folding, evolution, binding interactions, and structure/function relationships, working both from experimentally solved structures and from computational models. The term structural has the same meaning as in structural biology, and structural bioinformatics can be seen as a part of computational structural biology. The main objective of structural bioinformatics is the creation of new methods of analysing and manipulating biological macromolecular data in order to solve problems in biology and generate new knowledge.
Структура белка
Структура белка напрямую связана с его функцией. Наличие определенных химических групп в определенных положениях позволяет белкам выступать в роли ферментов, катализируя множество химических реакций. В общем случае, структуры белков классифицируются на четыре уровня: первичный (последовательности), вторичный (локальная конформация полипептидной цепи), третичный (трехмерная структура белкового сворачивания) и четвертичный (ассоциация нескольких полипептидных структур). Структурная биоинформатика в основном изучает взаимодействия между структурами, принимая во внимание их пространственные координаты. Таким образом, первичную структуру целесообразнее анализировать в традиционных областях биоинформатики. Однако последовательность накладывает ограничения, которые позволяют формировать консервативные локальные конформации полипептидной цепи, такие как альфа-спираль, бета-листы и петли (вторичная структура). Также, слабые взаимодействия (например, водородные связи) стабилизируют сворачивание белка. Взаимодействия могут быть внутримолекулярными, то есть возникающими между частями одного и того же белкового мономера (третичная структура), или межмолекулярными, то есть возникающими между различными структурами (четвертичная структура). Наконец, топологическая организация взаимодействий, как сильных, так и слабых, и переплетения изучается в области структурной биоинформатики с использованием таких подходов, как топология цепей.
Визуализация структуры
Визуализация структуры белка является важной задачей для структурной биоинформатики. Она позволяет пользователям наблюдать статические или динамические представления молекул, а также выявлять взаимодействия, которые можно использовать для понимания молекулярных механизмов. Наиболее распространенные типы визуализации:
Картун (Схематичное изображение): этот тип визуализации белка выделяет различия во вторичной структуре. Как правило, α-спираль изображается в виде винта, β-цепи – в виде стрелок, а петли – в виде линий. Линии: каждый аминокислотный остаток представляется тонкими линиями, что обеспечивает низкую стоимость графической отрисовки. Поверхность: в этой визуализации отображается внешняя форма молекулы. Палочки: каждая ковалентная связь между атомами аминокислот изображается в виде палочки. Этот тип визуализации чаще всего используется для отображения взаимодействий между аминокислотами.
Структура ДНК
Классическая структура дуплексов ДНК была первоначально описана Уотсоном и Криком (с учетом вклада Розалинд Франклин). Молекула ДНК состоит из трех компонентов: фосфатной группы, пентозы и азотистого основания (аденина, тимина, цитозина или гуанина). Структура двойной спирали ДНК стабилизируется водородными связями, образующимися между комплементарными парами оснований: аденин с тимином (A-T) и цитозин с гуанином (C-G). Многие исследования в области структурной биоинформатики были посвящены изучению взаимодействий между ДНК и малыми молекулами, что стало целью ряда исследований по разработке лекарственных препаратов.
Взаимодействия
Взаимодействия – это контакты, устанавливаемые между частями молекул на различных уровнях. Они обеспечивают стабилизацию белковых структур и выполняют широкий спектр функций. В биохимии взаимодействия характеризуются близостью групп атомов или областей молекул, оказывающих влияние друг на друга, таких как электростатические силы, водородные связи и гидрофобное взаимодействие. Белки способны вступать в различные типы взаимодействий, включая белок-белковые взаимодействия (PPI), белок-пептидные взаимодействия, белок-лигандные взаимодействия (PLI) и белок-ДНК взаимодействия.
Расчет контактов
Расчет контактов является важной задачей в структурной биоинформатике, поскольку он необходим для корректного предсказания структуры и сворачивания белка, термодинамической стабильности, взаимодействий белок-белок и белок-лиганд, анализа докинга и молекулярной динамики и так далее. Традиционно, вычислительные методы использовали пороговое расстояние между атомами (также называемое отсечкой) для выявления возможных взаимодействий. Это выявление выполняется на основе евклидова расстояния и углов между атомами определенных типов. Однако большинство методов, основанных на простом евклидовом расстоянии, не способны обнаруживать перекрытые контакты. Поэтому, в последние годы, методы, не использующие отсечку, такие как триангуляция Делоне, приобрели популярность. Кроме того, для улучшения определения контактов использовалась комбинация различных критериев, например, физико-химических свойств, расстояния, геометрии и углов. PDBx/mmCIF (макромолекулярный кристаллографический информационный файл) – это стандартный текстовый формат для представления кристаллографической информации. С 2014 года формат PDB был заменен форматом PDBx/mmCIF (.cif) в качестве стандартного формата распространения архива PDB. В то время как формат PDB содержит набор записей, идентифицируемых ключевым словом до шести символов, формат PDBx/mmCIF использует структуру, основанную на парах «ключ-значение», где ключ – это имя, идентифицирующее определенную характеристику, а значение – переменная информация.
Другие структурные базы данных
В дополнение к Банку данных белков (PDB) существует несколько баз данных структур белков и других макромолекул. Примеры включают:
MMDB: экспериментально определенные трехмерные структуры биомолекул, полученные из Банка данных белков (PDB). База данных нуклеиновых кислот (NDB): экспериментально определенная информация о нуклеиновых кислотах (ДНК, РНК). Структурная классификация белков (SCOP): всестороннее описание структурных и эволюционных взаимосвязей между белками с известной структурой. TOPOFIT DB: выравнивания структур белков, основанные на методе TOPOFIT. Сервер электронной плотности (EDS): карты электронной плотности и статистика, характеризующая соответствие кристаллических структур и их карт. CASP: Общемировой эксперимент по предсказанию структуры белка, проводимый в рамках CASP. Сервер PISCES для создания нередундантных списков белков: генерирует списки PDB на основе идентичности последовательностей и критериев структурного качества. База знаний по структурной биологии: инструменты для поддержки разработки исследований в области белков. ProtCID: База данных общих интерфейсов белков – база данных схожих белок-белковых интерфейсов в кристаллических структурах гомологичных белков. AlphaFold: База данных структур белков AlphaFold.
Структурное выравнивание
Структурное выравнивание – это метод сравнения трехмерных структур на основе их формы и конформации. Он может быть использован для определения эволюционного родства между набором белков, даже при низкой схожести последовательностей. Структурное выравнивание подразумевает наложение одной трехмерной структуры на другую, с вращением и трансляцией атомов в соответствующих позициях (обычно с использованием атомов Cα или даже тяжелых атомов главной цепи – C, N, O и Cα). Качество выравнивания обычно оценивается на основе среднеквадратичного отклонения (RMSD) атомных позиций, то есть среднего расстояния между атомами после наложения:
где δi – расстояние между атомом i и либо соответствующим атомом в другой структуре, либо средней координатой N эквивалентных атомов. Обычно значение RMSD измеряется в ангстремах (Å), что эквивалентно 10−10 м. Чем ближе значение RMSD к нулю, тем более похожи структуры.
Структурные сигнатуры на основе графов
Структурные подписи, также называемые отпечатками пальцев, являются представлениями паттернов макромолекул, которые можно использовать для выявления сходств и различий. Сравнение большого набора белков с использованием RMSD остаётся сложной задачей из-за высокой вычислительной стоимости структурного выравнивания. Структурные подписи, основанные на паттернах расстояний между парами атомов, использовались для определения идентифицирующих векторов белков и выявления нетривиальной информации. Более того, линейная алгебра и машинное обучение могут применяться для кластеризации структурных подписей белков, обнаружения взаимодействий белок-лиганд, предсказания ΔΔG и предложения мутаций на основе евклидова расстояния.
Прогноз структуры
Атомные структуры молекул можно определить несколькими методами, такими как рентгеноструктурный анализ (XRC), ЯМР-спектроскопия и 3D-электронная микроскопия; однако эти методы могут быть дорогостоящими, и определение некоторых структур, например, мембранных белков, может оказаться затруднительным. Поэтому необходимо использовать вычислительные методы для определения трехмерных структур макромолекул. Методы предсказания структуры классифицируются на сравнительное моделирование и моделирование de novo.
Сравнительное моделирование
Сравнительное моделирование, также известное как гомологическое моделирование, – это методология построения трехмерных структур на основе аминокислотной последовательности целевого белка и шаблона с известной структурой. В научной литературе показано, что эволюционно родственные белки, как правило, сохраняют трехмерную структуру. Однако последовательности белков с далекой степенью родства и идентичностью ниже 20% могут иметь различные типы укладки.
Моделирование De Novo
В структурной биоинформатике моделирование de novo, также известное как ab initio моделирование, относится к методам получения трехмерных структур на основе последовательностей без использования информации о гомологичных структурах, известных ранее. Несмотря на новые алгоритмы и методы, предложенные за последние годы, предсказание структуры белка de novo по-прежнему считается одной из нерешенных ключевых задач современной науки.
Валидация структуры
После построения модели структуры необходим дополнительный этап валидации структуры, поскольку многие сравнительные и 'de novo' алгоритмы и инструменты моделирования используют эвристические методы для сборки трехмерной структуры, что может приводить к многочисленным ошибкам. Некоторые стратегии валидации включают в себя вычисление энергетических оценок и их сравнение с экспериментально определенными структурами. Например, оценка DOPE – это энергетическая оценка, используемая инструментом MODELLER для определения наилучшей модели. Другая стратегия валидации – вычисление торсионных углов φ и ψ для всех аминокислотных остатков и построение диаграммы Рамачандрана. Боковые цепи аминокислот и характер взаимодействий в пептидной цепи ограничивают эти два угла, что позволяет визуализировать допустимые конформации на основе диаграммы Рамачандрана. Большое количество аминокислот, расположенных в недопустимых областях диаграммы, указывает на низкое качество моделирования.
Инструменты прогнозирования
Список часто используемых программных средств для предсказания структуры белка, включая сравнительное моделирование, метод проthreading (или поточного моделирования), предсказание структуры белка de novo и предсказание вторичной структуры, доступен в списке программного обеспечения для предсказания структуры белка.
Молекулярный стыковка
Молекулярный докинг (также называемый просто докингом) — это метод, используемый для предсказания координат ориентации молекулы (лиганда) при связывании с другой молекулой (рецептором или мишенью). Связывание может осуществляться преимущественно посредством нековалентных взаимодействий, хотя также возможно изучение ковалентно связанного связывания. Молекулярный докинг направлен на предсказание возможных конформаций (способов связывания) лиганда при взаимодействии с определенными областями рецептора. Инструменты докинга используют силовые поля для оценки баллов, позволяющих ранжировать наиболее благоприятные конформации, обеспечивающие лучшее взаимодействие между двумя молекулами. Как правило, протоколы докинга используются для предсказания взаимодействий между малыми молекулами и белками. Однако докинг также может применяться для выявления ассоциаций и способов связывания между белками, пептидами, молекулами ДНК или РНК, углеводами и другими макромолекулами.
Виртуальный скрининг
Виртуальный скрининг (ВС) — это вычислительный подход, используемый для быстрого отбора больших библиотек соединений в процессе поиска лекарственных средств. Как правило, виртуальный скрининг использует алгоритмы молекулярного докинга для ранжирования малых молекул по их сродству к целевому рецептору. В последнее время разработано несколько инструментов для оценки эффективности виртуального скрининга в процессе открытия новых лекарств. Однако такие проблемы, как неполнота информации, неточное понимание молекулярных свойств, важных для лекарственных средств, слабые функции оценки или недостаточно эффективные стратегии докинга, затрудняют процесс докинга. Поэтому в литературе виртуальный скрининг пока не рассматривается как полностью зрелая технология.
Молекулярная динамика
Молекулярная динамика (МД) — это вычислительный метод, используемый для моделирования взаимодействий между молекулами и их атомами на протяжении заданного периода времени. Этот метод позволяет наблюдать за поведением молекул и их взаимодействиями, рассматривая систему как единое целое. Для расчета поведения систем и, следовательно, определения траекторий, в МД может применяться уравнение движения Ньютона, а также методы молекулярной механики для оценки сил, действующих между частицами (потенциалы межмолекулярного взаимодействия).
Инструменты
+Список инструментов структурной биоинформатики
Программное обеспечение
Описание
I TASSER Прогнозирование трехмерной модели структуры молекул белка из аминокислотных последовательностей.
MOE Молекулярная операционная среда (MOE) – это обширная платформа, включающая структурное моделирование белков, семейств белков и антител.
SBL Библиотека структурной биоинформатики: приложения для конечных пользователей и передовые алгоритмы.
BALLView Молекулярное моделирование и визуализация.
STING Визуализация и анализ.
PyMOL Визуализатор и моделирование.
VMD Визуализатор, молекулярная динамика.
Gromacs Сворачивание белка, молекулярная динамика, усовершенствование молекулярной модели, генерация силового поля молекулярной модели.
LAMMPS Сворачивание белка, молекулярная динамика, усовершенствование молекулярной модели, квантово-механические макромолекулярные взаимодействия.
GAMESS Молекулярное силовое поле, уточнение зарядов, квантово-молекулярная динамика белка, моделирование молекулярных химических реакций (электронный перенос).
KiNG Открытый Java-просмотрщик кинемужей.
STRIDE Определение вторичной структуры по координатам.
DSSP Алгоритм присвоения вторичной структуры аминокислотам белка.
MolProbity Веб-сервер для валидации структуры.
PROCHECK Веб-сервис для валидации структуры.
CheShift Онлайн-приложение для валидации структуры белка.
3D mol. js Молекулярный просмотрщик для веб-приложений, разработанный на Javascript.
PROPKA Быстрое прогнозирование значений pKa белка на основе эмпирических соотношений структура/функция.
CARA Computer Aided Resonance Assignment (компьютерная помощь в назначении резонансов).
Docking Server Молекулярный веб-сервер для докинга.
StarBiochem Java-просмотрщик белков, с возможностью прямого поиска в базе данных белков.
SPADE Среда разработки приложений структурной протеомики.
PocketSuite Веб-портал для различных веб-серверов для анализа на уровне связывающего сайта. PocketSuite разделен на: PocketDepth (предсказание связывающего сайта), PocketMatch (сравнение связывающих сайтов), PocketAlign (выравнивание связывающих сайтов) и PocketAnnotate (аннотация связывающего сайта).
MSL Открытая C++ библиотека для молекулярного моделирования, предназначенная для реализации методов структурного анализа, прогнозирования и дизайна.
PSSpred Прогнозирование вторичной структуры белка.
Proteus Веб-инструмент для предложения пар мутаций.
SDMA Сервер для прогнозирования влияния мутаций на стабильность белка.
PocketMatch (Binding site comparison), PocketAlign (Binding site alignment), and PocketAnnotate (Binding site annotation). MSLAn open source C++ molecular modeling software library for the implementation of structural analysis, prediction and design methodsPSSpredProtein secondary structure predictionProteusWebtool for suggesting mutation pairsSDMA server for predicting effects of mutations on protein stability