Введение
Метод прогнозирования структуры белка
В молекулярной биологии протеиновое нить (также известное как распознавание структуры) — это метод моделирования белков, используемый для моделирования белков, имеющих ту же структуру, что и белки с известными структурами, но не имеющих гомологичных белков с известной структурой. Он отличается от метода гомологического моделирования, поскольку протеиновое нить применяется к белкам, для которых гомологичные структуры не представлены в базе данных белков (PDB), в то время как гомологическое моделирование используется для белков, для которых такие структуры имеются. Протеиновое нить основано на использовании статистических данных о взаимосвязи между структурами, хранящимися в PDB, и аминокислотной последовательностью белка, структуру которого необходимо предсказать. Прогнозирование осуществляется путем "нанизывания" (то есть размещения, выравнивания) каждой аминокислоты целевой последовательности на позицию в структуре-шаблоне и оценки степени соответствия целевой последовательности шаблону. После выбора наилучшего шаблона строится структурная модель последовательности на основе выравнивания с выбранным шаблоном. В основе протеинового нитя лежат два основных наблюдения: количество различных структур в природе относительно невелико (около 1300); и 90% новых структур, представленных в PDB за последние три года, имеют структурные особенности, сходные с уже имеющимися в PDB.
Классификация структуры белка
База данных структурной классификации белков (SCOP) предоставляет детальное и всестороннее описание структурных и эволюционных взаимосвязей известных структур. Белки классифицируются для отражения как структурного, так и эволюционного родства. В иерархии существует множество уровней, но основными являются семья, суперсемейство и укладка:
Family (clear evolutionary relationship): Proteins clustered together into families are clearly evolutionarily related. Generally, this means that pairwise residue identities between the proteins are 30% and greater. However, in some cases similar functions and structures provide definitive evidence of common descent in the absence of high sequence identity; for example, many globins form a family though some members have sequence identities of only 15%. Superfamily (probable common evolutionary origin): Proteins that have low sequence identities, but whose structural and functional features suggest that a common evolutionary origin is probable, are placed together in superfamilies. For example, actin, the ATPase domain of the heat shock protein, and hexokinase together form a superfamily. Fold (major structural similarity): Proteins are defined as having a common fold if they have the same major secondary structures in the same arrangement and with the same topological connections. Different proteins with the same fold often have peripheral elements of secondary structure and turn regions that differ in size and conformation. In some cases, these differing peripheral regions may comprise half the structure. Proteins placed together in the same fold category may not have a common evolutionary origin: the structural similarities could arise just from the physics and chemistry of proteins favoring certain packing arrangements and chain topologies.
Семья (явное эволюционное родство): белки, объединенные в семьи, имеют четкую эволюционную связь. Обычно это означает, что парная идентичность аминокислотных остатков между белками составляет 30% и выше. Однако в некоторых случаях сходные функции и структуры предоставляют убедительные доказательства общего происхождения даже при низкой идентичности последовательностей; например, многие глобины образуют семью, хотя у некоторых членов идентичность последовательностей составляет всего 15%.
Family (clear evolutionary relationship): Proteins clustered together into families are clearly evolutionarily related. Generally, this means that pairwise residue identities between the proteins are 30% and greater. However, in some cases similar functions and structures provide definitive evidence of common descent in the absence of high sequence identity; for example, many globins form a family though some members have sequence identities of only 15%. Superfamily (probable common evolutionary origin): Proteins that have low sequence identities, but whose structural and functional features suggest that a common evolutionary origin is probable, are placed together in superfamilies. For example, actin, the ATPase domain of the heat shock protein, and hexokinase together form a superfamily. Fold (major structural similarity): Proteins are defined as having a common fold if they have the same major secondary structures in the same arrangement and with the same topological connections. Different proteins with the same fold often have peripheral elements of secondary structure and turn regions that differ in size and conformation. In some cases, these differing peripheral regions may comprise half the structure. Proteins placed together in the same fold category may not have a common evolutionary origin: the structural similarities could arise just from the physics and chemistry of proteins favoring certain packing arrangements and chain topologies.
Суперсемейство (вероятное общее эволюционное происхождение): белки с низкой идентичностью последовательностей, но обладающие структурными и функциональными особенностями, указывающими на вероятное общее эволюционное происхождение, объединяются в суперсемейства. Например, актин, АТФазный домен белка теплового шока и гексокиназа вместе образуют суперсемейство.
Family (clear evolutionary relationship): Proteins clustered together into families are clearly evolutionarily related. Generally, this means that pairwise residue identities between the proteins are 30% and greater. However, in some cases similar functions and structures provide definitive evidence of common descent in the absence of high sequence identity; for example, many globins form a family though some members have sequence identities of only 15%. Superfamily (probable common evolutionary origin): Proteins that have low sequence identities, but whose structural and functional features suggest that a common evolutionary origin is probable, are placed together in superfamilies. For example, actin, the ATPase domain of the heat shock protein, and hexokinase together form a superfamily. Fold (major structural similarity): Proteins are defined as having a common fold if they have the same major secondary structures in the same arrangement and with the same topological connections. Different proteins with the same fold often have peripheral elements of secondary structure and turn regions that differ in size and conformation. In some cases, these differing peripheral regions may comprise half the structure. Proteins placed together in the same fold category may not have a common evolutionary origin: the structural similarities could arise just from the physics and chemistry of proteins favoring certain packing arrangements and chain topologies.
Укладка (основное структурное сходство): белки определяются как имеющие общую укладку, если они содержат одни и те же основные вторичные структуры в одинаковом расположении и с теми же топологическими связями. Различные белки с одинаковой укладкой часто имеют периферические элементы вторичной структуры и области поворотов, различающиеся по размеру и конформации. В некоторых случаях эти различные периферические области могут составлять половину структуры. Белки, отнесенные к одной и той же категории укладки, могут не иметь общего эволюционного происхождения: структурное сходство может возникать просто из-за физики и химии белков, благоприятствующих определенным способам упаковки и топологии цепей.
Family (clear evolutionary relationship): Proteins clustered together into families are clearly evolutionarily related. Generally, this means that pairwise residue identities between the proteins are 30% and greater. However, in some cases similar functions and structures provide definitive evidence of common descent in the absence of high sequence identity; for example, many globins form a family though some members have sequence identities of only 15%. Superfamily (probable common evolutionary origin): Proteins that have low sequence identities, but whose structural and functional features suggest that a common evolutionary origin is probable, are placed together in superfamilies. For example, actin, the ATPase domain of the heat shock protein, and hexokinase together form a superfamily. Fold (major structural similarity): Proteins are defined as having a common fold if they have the same major secondary structures in the same arrangement and with the same topological connections. Different proteins with the same fold often have peripheral elements of secondary structure and turn regions that differ in size and conformation. In some cases, these differing peripheral regions may comprise half the structure. Proteins placed together in the same fold category may not have a common evolutionary origin: the structural similarities could arise just from the physics and chemistry of proteins favoring certain packing arrangements and chain topologies.
Сравнение с гомологическим моделированием
Моделирование гомологии и протеиновое сворачивание – оба метода, основанные на шаблонах, и чёткой границы между ними с точки зрения техник предсказания нет. Однако белковые структуры их целей различны. Моделирование гомологии применяется для целей, имеющих гомологичные белки с известной структурой (обычно, как правило, из одной семьи), в то время как протеиновое сворачивание – для целей, для которых обнаружена лишь гомология на уровне укладки. Иными словами, моделирование гомологии предназначено для "более простых" целей, а протеиновое сворачивание – для "более сложных". Моделирование гомологии рассматривает шаблон в выравнивании как последовательность, используя для предсказания только гомологию последовательностей. Протеиновое сворачивание рассматривает шаблон в выравнивании как структуру, используя для предсказания как информацию о последовательности, так и информацию о структуре, извлечённую из выравнивания. Когда значимая гомология не обнаружена, протеиновое сворачивание может сделать предсказание, основываясь на информации о структуре. Это также объясняет, почему протеиновое сворачивание во многих случаях может быть эффективнее моделирования гомологии. На практике, когда идентичность последовательностей в выравнивании низкая (то есть, менее 25%), моделирование гомологии может не дать значимого предсказания. В этом случае, если для данной цели обнаружена далёкая гомология, протеиновое сворачивание может сгенерировать хорошее предсказание.
Больше о нитьях
Методы распознавания складки можно разделить на два типа: методы, которые получают 1D-профиль для каждой структуры в библиотеке складки и выравнивают целевую последовательность с этими профилями; и методы, которые рассматривают полную 3D-структуру белкового шаблона. Простым примером профильного представления будет принятие каждой аминокислоты в структуре и простое обозначение её в зависимости от того, находится ли она в ядре белка или экспонирована на поверхности. Более сложные профили могут учитывать локальную вторичную структуру (например, является ли аминокислота частью альфа-спирали) или даже эволюционную информацию (насколько консервативна аминокислота). В 3D-представлении структура моделируется как набор межатомных расстояний, то есть расстояния рассчитываются между некоторыми или всеми парами атомов в структуре. Это гораздо более полное и гибкое описание структуры, но его гораздо сложнее использовать для расчета выравнивания. Подход распознавания складки на основе профиля был впервые описан Боуи, Люти и Дэвидом Эйзенбергом в 1991 году. Термин "threading" (проталкивание) был впервые предложен Дэвидом Джонсом, Уильямом Р. Тейлором и Джанет Торнтон в 1992 году и первоначально относился конкретно к использованию полного 3D-структурного атомного представления белкового шаблона при распознавании складки. Сегодня термины "threading" и "fold recognition" часто (хотя и несколько неточно) используются как взаимозаменяемые. Методы распознавания складки широко используются и эффективны, поскольку считается, что в природе существует строго ограниченное количество различных белковых складок, в основном в результате эволюции, но также из-за ограничений, налагаемых фундаментальной физикой и химией полипептидных цепей. Поэтому существует значительная вероятность (в настоящее время 70–80%), что белок, имеющий сходную складку с целевым белком, уже был исследован с помощью рентгеновской кристаллографии или спектроскопии ядерного магнитного резонанса (ЯМР) и может быть найден в PDB. В настоящее время известно около 1300 различных белковых складок, но новые складки продолжают открываться каждый год, во многом благодаря продолжающимся проектам структурной геномики. Было предложено множество различных алгоритмов для поиска правильного "проталкивания" последовательности на структуру, хотя многие из них используют динамическое программирование в той или иной форме. Для полного 3D-threading проблема определения наилучшего выравнивания очень сложна (это NP-трудная задача для некоторых моделей threading). Исследователи использовали множество методов комбинаторной оптимизации, таких как условные случайные поля, имитация отжига, метод ветвей и границ и линейное программирование, в поисках эвристических решений. Интересно сравнить методы threading с методами, которые пытаются выровнять две белковые структуры (структурное выравнивание белков), и, действительно, многие из одних и тех же алгоритмов были применены к обеим задачам.
Программное обеспечение для протеинового нарезки
HHpred – популярный сервер для поиска гомологов, использующий HHsearch, широко применяемое программное обеспечение для дистанционного обнаружения гомологии, основанное на попарном сравнении скрытых марковских моделей. RAPTOR (программное обеспечение) – программа для поиска гомологов на основе целочисленного программирования. Она была заменена новой программой RaptorX / программным обеспечением для моделирования и анализа белков, использующим вероятностные графические модели и статистический вывод для поиска гомологов на основе одного или нескольких шаблонов. RaptorX значительно превосходит RAPTOR и особенно хорошо справляется с выравниванием белков с разреженным профилем последовательностей. Сервер RaptorX доступен для всеобщего использования бесплатно. Phyre – популярный сервер для поиска гомологов, сочетающий HHsearch с методами ab initio и моделированием на основе множества шаблонов. MUSTER – стандартный алгоритм поиска гомологов, основанный на динамическом программировании и выравнивании профилов последовательностей. Он также использует несколько структурных ресурсов для улучшения выравнивания профилей последовательностей. SPARKS X – вероятностный метод сопоставления последовательности и структуры, основанный на сравнении предсказанных одномерных структурных свойств запроса с соответствующими свойствами шаблонов. BioShell – алгоритм поиска гомологов, использующий оптимизированный алгоритм динамического программирования для сравнения профилей последовательностей в сочетании с предсказанной вторичной структурой.