Введение
Тип биологического предсказания
Предсказание структуры белка – это определение трехмерной структуры белка по его аминокислотной последовательности, то есть предсказание вторичной и третичной структуры на основе первичной структуры. Предсказание структуры отличается от обратной задачи – проектирования белка. Предсказание структуры белка является одной из важнейших целей, которые преследует вычислительная биология; оно важно в медицине (например, при разработке лекарственных препаратов) и биотехнологии (например, при создании новых ферментов). Начиная с 1994 года, эффективность современных методов оценивается раз в два года в эксперименте CASP (Critical Assessment of Techniques for Protein Structure Prediction – Критическая оценка методов предсказания структуры белков). Непрерывная оценка веб-серверов для предсказания структуры белка осуществляется в рамках общедоступного проекта CAMEO3D.
Структура белка и терминология
Белки — это цепочки аминокислот, соединенных пептидными связями. Множество конформаций этой цепи возможно благодаря вращению основной цепи вокруг двух торсионных углов φ и ψ у атома Cα (см. рисунок). Эта конформационная гибкость определяет различия в трехмерной структуре белков. Пептидные связи в цепи полярны, то есть они имеют разделенные положительные и отрицательные заряды (частичные заряды) в карбонильной группе, которая может выступать в качестве акцептора водородной связи, и в NH-группе, которая может выступать в качестве донора водородной связи. Эти группы, таким образом, могут взаимодействовать в структуре белка. Белки состоят главным образом из 20 различных типов L α-аминокислот (протеиногенных аминокислот). Их можно классифицировать в соответствии с химией боковой цепи, которая также играет важную структурную роль. Глицин занимает особое положение, поскольку имеет самую маленькую боковую цепь, состоящую всего из одного атома водорода, и поэтому может повысить локальную гибкость в структуре белка. Цистеин, с другой стороны, может реагировать с другим остатком цистеина, образуя цистин и тем самым формируя поперечную связь, стабилизирующую всю структуру. Структура белка может рассматриваться как последовательность элементов вторичной структуры, таких как α-спирали и β-листы. В этих вторичных структурах образуются регулярные паттерны водородных связей между NH- и CO-группами основной цепи пространственно близких аминокислот, при этом аминокислоты имеют схожие углы φ и ψ. Образование этих вторичных структур эффективно удовлетворяет способности пептидных связей к образованию водородных связей. Вторичные структуры могут быть плотно упакованы в гидрофобном ядре белка, но также могут присутствовать на полярной поверхности белка. Каждая боковая цепь аминокислоты имеет ограниченный объем и ограниченное число возможных взаимодействий с другими соседними боковыми цепями, что необходимо учитывать при молекулярном моделировании и выравнивании.
angles. The formation of these secondary structures efficiently satisfies the hydrogen bonding capacities of the peptide bonds. The secondary structures can be tightly packed in the protein core in a hydrophobic environment, but they can also present at the polar protein surface. Each amino acid side chain has a limited volume to occupy and a limited number of possible interactions with other nearby side chains, a situation that must be taken into account in molecular modeling and alignments.
α-спираль
Альфа-спираль является наиболее распространенным типом вторичной структуры в белках. В альфа-спираль в каждом обороте входит 3,6 аминокислоты, с образованием водородной связи между каждой четвертой аминокислотой; средняя длина составляет 10 аминокислот (3 оборота) или 10 Å, но варьируется от 5 до 40 (1,5 до 11 оборотов). Выравнивание водородных связей создает дипольный момент спирали, приводящий к частичному положительному заряду на аминоконце спирали. Поскольку в этой области присутствуют свободные группы NH2, она будет взаимодействовать с отрицательно заряженными группами, такими как фосфаты. Наиболее часто альфа-спирали располагаются на поверхности белковых ядер, где они обеспечивают взаимодействие с водной средой. Внутренняя сторона спирали, как правило, содержит гидрофобные аминокислоты, а внешняя – гидрофильные. Таким образом, каждая третья или четвертая аминокислота вдоль цепи, как правило, будет гидрофобной, что достаточно легко обнаружить. В мотиве лейцинной молнии повторяющийся рисунок лейцинов на обращенных сторонах двух соседних спиралей является высокоспецифичным признаком этого мотива. Спиральный график колеса (helical wheel plot) может быть использован для визуализации этой повторяющейся закономерности. Другие альфа-спирали, находящиеся внутри белкового ядра или в клеточных мембранах, имеют более высокую и более регулярную концентрацию гидрофобных аминокислот, что является сильным предиктором таких структур. Спирали, экспонированные на поверхности, содержат меньшее количество гидрофобных аминокислот. Состав аминокислот может предсказывать альфа-спиральный регион. Регионы, богатые аланином (A), глутаминовой кислотой (E), лейцином (L) и метионином (M), и бедные пролином (P), глицином (G), тирозином (Y) и серином (S), как правило, формируют альфа-спираль. Пролин дестабилизирует или разрывает альфа-спираль, но может присутствовать в более длинных спиралях, образуя изгиб.
β-лист
β-листы формируются за счет водородных связей между в среднем 5–10 последовательными аминокислотами в одной части цепи и другими 5–10 аминокислотами, расположенными дальше по цепи. Взаимодействующие области могут быть соседними, разделенными коротким контуром, или удаленными друг от друга, с другими структурами между ними. Все цепи могут быть ориентированы в одном направлении, образуя параллельный лист, каждая вторая цепь может быть ориентирована в противоположном направлении, образуя антипараллельный лист, или цепи могут быть параллельными и антипараллельными, формируя смешанный лист. Характер водородных связей различается в параллельной и антипараллельной конфигурациях. Каждая аминокислота во внутренних участках листа образует две водородные связи с соседними аминокислотами, в то время как каждая аминокислота во внешних участках образует только одну связь с внутренним участком. При взгляде на лист под прямым углом к его участкам, более удаленные участки слегка повернуты против часовой стрелки, создавая левосторонний изгиб. Атомы Cα чередуются над и под листом, образуя складчатую структуру, а R-боковые группы аминокислот чередуются над и под складками. Углы Φ и Ψ аминокислот в листах значительно варьируются в определенной области диаграммы Рамачандрана. Предсказать расположение β-листов сложнее, чем α-спиралей. Ситуация несколько улучшается при учете изменчивости аминокислот в множественных выравниваниях последовательностей.
Круги
Некоторые части белка обладают фиксированной трехмерной структурой, но не формируют регулярных структур. Их не следует путать с разупорядоченными или денатурированными сегментами белков, или с "случайной катушкой" – развернутой полипептидной цепью, лишенной какой-либо фиксированной трехмерной структуры. Эти части часто называют "петлями", поскольку они соединяют β-листы и α-спирали. Петли обычно располагаются на поверхности белка, и поэтому мутации в их аминокислотных остатках переносятся легче. Большое количество замен, вставок и делеций в определенной области выравнивания последовательностей может указывать на наличие петли. Положение интронов в геномной ДНК может коррелировать с расположением петель в кодируемом белке. Петли также, как правило, содержат заряженные и полярные аминокислоты и часто являются частью активных центров.
Классификация белков
Белки могут быть классифицированы как по структурному, так и по последовательному сходству. Для структурной классификации сравниваются размеры и пространственное расположение вторичных структур, описанных выше, в известных трехмерных структурах. Классификация на основе сходства последовательностей исторически была первой примененной. Первоначально проводилось сравнение на основе выравнивания целых последовательностей. Позднее белки классифицировали на основе наличия консервативных аминокислотных паттернов. Существуют базы данных, классифицирующие белки по одной или нескольким из этих схем. При рассмотрении схем классификации белков важно учитывать несколько наблюдений. Во-первых, две совершенно разные последовательности белков с разным эволюционным происхождением могут сворачиваться в сходную структуру. И наоборот, последовательность древнего гена для данной структуры может значительно дивергировать у разных видов, сохраняя при этом основные структурные особенности. Выявление остаточного сходства последовательностей в таких случаях может быть сложной задачей. Во-вторых, два белка, обладающих значительной степенью сходства последовательностей друг с другом или с третьей последовательностью, имеют общее эволюционное происхождение и должны обладать некоторыми структурными особенностями. Однако дупликация генов и генетические перестройки в ходе эволюции могут приводить к появлению новых копий генов, которые затем могут эволюционировать в белки с новой функцией и структурой. Мотив (структурный контекст) – комбинация нескольких вторичных структурных элементов, образующаяся при сворачивании соседних участков полипептидной цепи в определенную трехмерную конфигурацию. Примером является мотив геликс-петля-геликс. Структурные мотивы также называют суперсекундными структурами и фолдами. Позиционно-специфическая матрица оценки (контекст последовательности, также известная как весовая или оценочная матрица) представляет собой консервативный участок в множественном выравнивании последовательностей без пробелов. Каждый столбец матрицы отражает вариацию, наблюдаемую в соответствующем столбце множественного выравнивания последовательностей. Позиционно-специфическая матрица оценки 3D (структурный контекст) представляет вариацию аминокислот, обнаруженную в выравнивании белков, относящихся к одному и тому же структурному классу. Столбцы матрицы отражают вариацию аминокислот, наблюдаемую в определенной позиции аминокислоты в выровненных структурах. Первичная структура – линейная последовательность аминокислот белка, химически представляющая собой полипептидную цепь, состоящую из аминокислот, соединенных пептидными связями. Профиль (контекст последовательности) – матрица оценки, представляющая множественное выравнивание последовательностей семейства белков. Профиль обычно получают из хорошо консервативного участка множественного выравнивания последовательностей. Профиль имеет вид матрицы, где каждый столбец представляет позицию в выравнивании, а каждая строка – одну из аминокислот. Значения матрицы указывают вероятность наличия каждой аминокислоты в соответствующей позиции выравнивания. Профиль перемещается вдоль целевой последовательности для определения областей с наивысшим баллом с помощью алгоритма динамического программирования. При сопоставлении допускаются пробелы, и в этом случае в качестве отрицательного балла учитывается штраф за пробелы, когда аминокислота не сопоставляется. Профиль последовательности также может быть представлен скрытой марковской моделью, называемой профилем HMM. Профиль (структурный контекст) – матрица оценки, представляющая, какие аминокислоты должны хорошо и какие плохо соответствовать последовательным позициям в известной структуре белка. Столбцы профиля представляют последовательные позиции в структуре, а строки профиля – 20 аминокислот. Как и в случае с профилем последовательности, структурный профиль перемещается вдоль целевой последовательности для поиска наивысшего возможного балла выравнивания с помощью алгоритма динамического программирования. Допускаются пробелы, за которые начисляется штраф. Полученный балл дает представление о том, может ли целевой белок принять такую структуру. Четвертичная структура – трехмерная конфигурация молекулы белка, состоящая из нескольких независимых полипептидных цепей. Вторичная структура – взаимодействия, возникающие между группами C, O и NH в аминокислотах полипептидной цепи, приводящие к образованию α-спиралей, β-листов, поворотов, петель и других форм, способствующих сворачиванию в трехмерную структуру. Суперсемейство – группа семейств белков одинаковой или различной длины, связанных отдаленным, но обнаруживаемым сходством последовательностей. Члены данного суперсемейства имеют общее эволюционное происхождение. Изначально Dayhoff определил критерий для суперсемейства как вероятность того, что последовательности не связаны, равную 106, на основе балла выравнивания (Dayhoff et al. 1978). Белки с небольшим количеством идентичных аминокислот в выравнивании последовательностей, но с убедительно общим числом структурных и функциональных особенностей, помещаются в одно и то же суперсемейство. На уровне трехмерной структуры белки суперсемейства будут иметь общие структурные особенности, такие как общий фолд, но также могут быть различия в количестве и расположении вторичных структур. Ресурс PIR использует термин гомеоморфные суперсемейства для обозначения суперсемейств, состоящих из последовательностей, которые можно выровнять от конца до конца, представляя собой общий домен гомологий последовательностей, область сходства, которая простирается на протяжении всего выравнивания. Этот домен также может включать меньшие домены гомологии, которые разделяются другими семействами и суперсемействами белков. Хотя данная последовательность белка может содержать домены, встречающиеся в нескольких суперсемействах, что указывает на сложную эволюционную историю, последовательности будут отнесены только к одному гомеоморфному суперсемейству на основе наличия сходства на протяжении множественного выравнивания последовательностей. Выравнивание суперсемейства также может включать области, которые не выравниваются либо внутри, либо на концах выравнивания. В отличие от этого, последовательности в одном семействе хорошо выравниваются на протяжении всего выравнивания. Суперсекундная структура – термин, имеющий аналогичное значение структурному мотиву. Третичная структура – трехмерная или глобулярная структура, образующаяся в результате упаковки или сворачивания вторичных структур полипептидной цепи. Эта высокая точность позволяет использовать прогнозы для улучшения распознавания фолдов и *ab initio* предсказания структуры белка, классификации структурных мотивов и уточнения выравниваний последовательностей. Точность современных методов предсказания вторичной структуры белка оценивается еженедельными тестами, такими как LiveBench и EVA.
Предыстория
Ранние методы прогнозирования вторичной структуры, разработанные в 1960-х и начале 1970-х годов, были сосредоточены на выявлении вероятных альфа-спиралей и основывались главным образом на моделях перехода спираль-катушка. Значительно более точные прогнозы, включающие бета-листы, появились в 1970-х годах и опирались на статистические оценки, основанные на вероятностных параметрах, полученных из известных решенных структур. Эти методы, применяемые к отдельной последовательности, обычно имеют точность не более 60-65% и часто недооценивают количество бета-листов. Эволюционную консервацию вторичных структур можно использовать, одновременно оценивая множество гомологичных последовательностей в выравнивании множественных последовательностей, путем расчета общей склонности к вторичной структуре для выровненного столбца аминокислот. В сочетании с более крупными базами данных известных белковых структур и современными методами машинного обучения, такими как нейронные сети и машины опорных векторов, эти методы могут достигать общей точности до 80% для глобулярных белков. Теоретический предел точности составляет около 90%. Оригинальные параметры Чу-Фасмана, определенные на небольшой выборке структур, решенных в середине 1970-х годов, дают плохие результаты по сравнению с современными методами, хотя параметризация была обновлена после первой публикации. Метод Чу-Фасмана обеспечивает примерно 50-60% точность при прогнозировании вторичных структур. Метод GOR учитывает не только вероятность того, что каждая аминокислота имеет определенную вторичную структуру, но и условную вероятность принятия аминокислотой каждой структуры с учетом вклада ее соседей (при этом не предполагается, что соседи имеют ту же структуру). Этот подход более чувствителен и точен, чем подход Чу и Фасмана, поскольку структурные склонности аминокислот выражены сильно лишь для небольшого числа аминокислот, таких как пролин и глицин. Слабый вклад каждого из множества соседей может в совокупности давать сильный эффект. Исходный метод GOR был примерно на 65% точен и значительно успешнее предсказывал альфа-спирали, чем бета-листы, которые он часто ошибочно определял как петли или неупорядоченные области. Развитие методов машинного обучения направлено на прогнозирование более детальных локальных свойств белков, таких как диэдрические углы основной цепи в неназначенных областях. И SVM, и нейронные сети были применены для решения этой задачи.
Другие улучшения
Сообщается, что помимо аминокислотной последовательности, формирование вторичной структуры зависит от других факторов. Например, указывается, что склонность к формированию вторичной структуры также зависит от локального окружения, доступности аминокислотных остатков для растворителя, структурного класса белка и даже от организма, из которого выделен белок. На основании этих наблюдений, некоторые исследования показали, что точность предсказания вторичной структуры может быть повышена за счет включения информации о структурном классе белка, площади поверхности, доступной для аминокислотных остатков, а также информации о количестве контактов.
Третичная структура
Практическая роль предсказания структуры белка сейчас важнее, чем когда-либо. Огромные объемы данных о последовательностях белков генерируются современными крупномасштабными проектами по секвенированию ДНК, такими как Проект генома человека. Несмотря на общепринятые усилия в области структурной геномики, количество экспериментально определенных белковых структур – как правило, полученных трудоемкими и относительно дорогостоящими методами рентгеновской кристаллографии или ЯМР-спектроскопии – значительно отстает от количества белковых последовательностей. Предсказание структуры белка остается чрезвычайно сложной и нерешенной задачей. Две основные проблемы заключаются в вычислении свободной энергии белка и поиске ее глобального минимума. Метод предсказания структуры белка должен исследовать астрономически большое пространство возможных структур. Эти проблемы можно частично обойти в "сравнительном" или гомологическом моделировании, а также в методах распознавания фолдов, где пространство поиска сужается, исходя из предположения, что рассматриваемый белок принимает структуру, близкую к экспериментально определенной структуре другого гомологичного белка. С другой стороны, методы предсказания структуры белка de novo должны явно решать эти проблемы. Прогресс и вызовы в области предсказания структуры белка были рассмотрены Чжан, или ab initio, используя только последовательность (обычно с применением машинного обучения, с учетом ковариации). Структуры отдельных доменов объединяются в процессе, называемом сборкой доменов, для формирования окончательной третичной структуры.
Методы, основанные на энергии и фрагменте
Методы моделирования белков ab initio или de novo стремятся построить трехмерные модели белков "с нуля", то есть на основе физических принципов, а не (непосредственно) на основе ранее определенных структур. Существует множество возможных процедур, которые либо пытаются имитировать сворачивание белка, либо применяют какой-либо стохастический метод для поиска возможных решений (то есть глобальную оптимизацию подходящей энергетической функции). Эти процедуры, как правило, требуют значительных вычислительных ресурсов и поэтому были реализованы только для небольших белков. Для предсказания структуры белка de novo для более крупных белков потребуются более совершенные алгоритмы и большие вычислительные мощности, предоставляемые либо мощными суперкомпьютерами (такими как Blue Gene или MDGRAPE 3), либо распределенными вычислениями (такими как Folding@home, Human Proteome Folding Project и Rosetta@Home). Несмотря на эти значительные вычислительные ограничения, потенциальные преимущества структурной геномики (получаемой как предсказаниями, так и экспериментальными методами) делают предсказание структуры ab initio активной областью исследований. По состоянию на 2009 год, белок из 50 аминокислотных остатков можно было смоделировать атом за атомом на суперкомпьютере в течение 1 миллисекунды. К 2012 году аналогичное исследование стабильных состояний стало возможным на стандартном настольном компьютере с новой видеокартой и более сложными алгоритмами. Значительно большие временные масштабы моделирования могут быть достигнуты с использованием крупнозернистого моделирования.
Эволюционная ковариация для прогнозирования 3D-контактов
Поскольку секвенирование стало более распространенным в 1990-х годах, несколько групп использовали выравнивание последовательностей белков для предсказания коррелирующих мутаций, и надеялись, что эти соэволюционировавшие остатки можно будет использовать для предсказания третичной структуры (по аналогии с дистанционными ограничениями, получаемыми экспериментальными методами, такими как ЯМР). Предполагается, что когда мутации в отдельных остатках оказываются незначительно деструктивными, могут возникать компенсаторные мутации для восстановления стабильности взаимодействий между остатками. В этой ранней работе использовались так называемые локальные методы для вычисления коррелирующих мутаций на основе последовательностей белков, однако они страдали от косвенных ложных корреляций, возникающих из-за рассмотрения каждой пары остатков независимо от всех остальных. В 2011 году был предложен другой, и на этот раз глобальный статистический подход, который показал, что предсказанных соэволюционировавших остатков достаточно для предсказания трехмерной структуры белка, при условии наличия достаточного количества последовательностей (требуется более 1000 гомологичных последовательностей). Метод EVfold не использует гомологическое моделирование, трединг или трехмерные фрагменты структуры и может быть запущен на стандартном персональном компьютере даже для белков, содержащих сотни остатков. Точность контактов, предсказанных с помощью этого и связанных с ним подходов, была продемонстрирована на множестве известных структур и контактных карт, включая предсказание структуры трансмембранных белков, структура которых экспериментально не определена.
Сравнительное моделирование белков
Сравнительное моделирование белков использует ранее определенные структуры в качестве отправных точек, или шаблонов. Это эффективно, поскольку, несмотря на огромное количество существующих белков, существует ограниченный набор третичных структурных мотивов, к которым принадлежит большинство из них. Предполагается, что в природе существует около 2000 различных белковых фолдов, хотя количество различных белков исчисляется миллионами. Сравнительное моделирование белков может быть объединено с анализом эволюционной ковариации при предсказании структуры. Эти методы также можно разделить на две группы: не удивительно, что гомологическое моделирование наиболее точно, когда целевая последовательность и шаблон имеют схожие последовательности. Метод "протягивания" белка (protein threading) сканирует аминокислотную последовательность неизвестной структуры по базе данных решенных структур. В каждом случае используется функция оценки для определения совместимости последовательности со структурой, что позволяет получить возможные трехмерные модели. Этот тип метода также известен как распознавание трехмерного фолда по одномерной последовательности (3D-1D fold recognition) из-за анализа совместимости между трехмерными структурами и линейными последовательностями белков. Этот метод также послужил основой для разработки методов обратного сворачивания, оценивающих совместимость заданной структуры с большой базой данных последовательностей, тем самым предсказывая, какие последовательности способны формировать данный фолд.
Моделирование конформаций боковой цепи
Точная упаковка боковых цепей аминокислот представляет собой отдельную проблему в предсказании структуры белка. Методы, специально предназначенные для решения проблемы предсказания геометрии боковых цепей, включают метод исключения тупиковых вариантов и методы самосогласованного среднего поля. Конформации боковых цепей с низкой энергией обычно определяются на жестком полипептидном каркасе с использованием набора дискретных конформаций боковых цепей, известных как "ротамеры". Эти методы стремятся определить набор ротамеров, который минимизирует общую энергию модели. Для этого используются ротамерные библиотеки – коллекции благоприятных конформаций для каждого типа аминокислотных остатков в белках. Ротамерные библиотеки могут содержать информацию о конформации, ее частоте и стандартных отклонениях средних двугранных углов, которые могут быть использованы при выборке. Ротамерные библиотеки получают из структурной биоинформатики или другого статистического анализа конформаций боковых цепей в известных экспериментальных структурах белков, например, путем кластеризации наблюдаемых конформаций тетраэдрических углеродов вблизи значений, близких к staggered (60°, 180°, 60°). Ротамерные библиотеки могут быть независимыми от каркаса, зависимыми от вторичной структуры или зависимыми от каркаса. Независимые от каркаса библиотеки не учитывают конформацию каркаса и рассчитываются на основе всех доступных боковых цепей определенного типа (например, первая ротамерная библиотека, разработанная Пондером и Ричардсом в Йельском университете в 1987 году). Библиотеки, зависимые от вторичной структуры, представляют различные двугранные углы и/или частоты ротамеров для α-спиралей, β-листов или неупорядоченных участков (coil). Библиотеки, зависимые от каркаса, представляют конформации и/или частоты, зависящие от локальной конформации каркаса, определяемой двугранными углами каркаса φ и ψ, независимо от вторичной структуры. Современные версии этих библиотек, используемые в большинстве программ, представлены в виде многомерных распределений вероятности или частоты, где пики соответствуют конформациям двугранных углов, рассматриваемым как отдельные ротамеры в списках. Некоторые версии основаны на тщательно отобранных данных и используются в основном для валидации структуры, в то время как другие делают акцент на относительных частотах в больших наборах данных и используются в основном для предсказания структуры, например, ротамерные библиотеки Данбрака. Методы упаковки боковых цепей наиболее полезны для анализа гидрофобного ядра белка, где боковые цепи упакованы более плотно; им сложнее учитывать более слабые ограничения и большую гибкость поверхностных остатков, которые часто занимают несколько конформаций ротамеров, а не только одну.
Четвертичная структура
В случае комплексов, состоящих из двух или более белков, для которых структуры белков известны или могут быть предсказаны с высокой точностью, можно использовать методы докинга белок-белок для предсказания структуры комплекса. Информация о влиянии мутаций в определенных позициях на сродство комплекса помогает понять структуру комплекса и направлять методы докинга.
Программное обеспечение
Существует большое количество программных средств для предсказания структуры белка. Подходы включают моделирование гомологии, протеиновое нитьение, ab initio методы, предсказание вторичной структуры, а также предсказание трансмембранных спиралей и сигнальных пептидов. В частности, глубокое обучение на основе долгой краткосрочной памяти используется для этой цели с 2007 года, когда оно было успешно применено для обнаружения гомологии белков и предсказания субклеточной локализации белков. Некоторые из успешных методов, продемонстрированных в экспериментах CASP, включают I-TASSER, HHpred и AlphaFold. В 2021 году было сообщено, что AlphaFold в настоящее время демонстрирует наилучшие результаты. Знание структуры белка часто позволяет также предсказывать его функцию. Например, коллаген сворачивается в длинную, протяженную цепь, подобную волокну, что и определяет его как волокнистый белок. В последнее время разработано несколько методов для предсказания сворачивания белков и, следовательно, их структуры, таких как I-TASSER и AlphaFold.
predict subcellular localization of proteins. Some recent successful methods based on the CASP experiments include I TASSER, HHpred and AlphaFold. In 2021, AlphaFold was reported as currently having the best performance. Knowing the structure of a protein often allows functional prediction as well. For instance, collagen is folded into a long extended fiber like chain and it makes it a fibrous protein. Recently, several techniques have been developed to predict protein folding and thus protein structure, for example, Itasser, and AlphaFold.
Методы ИИ
AlphaFold был одним из первых ИИ, предсказавших структуры белков. Он был представлен DeepMind компании Google на 13-м конкурсе CASP, который состоялся в 2018 году. Вслед за AlphaFold быстро появились RoseTTAFold, а затем OmegaFold и ESM Metagenomic Atlas. В недавнем исследовании Sommer и др. (2022) продемонстрировали применение предсказания структуры белка в аннотации генома, в частности, для идентификации функциональных изоформ белка с использованием вычислительно предсказанных структур, доступных по адресу https://www.isoform.io. Это исследование подчеркивает потенциал предсказания структуры белка как инструмента аннотации генома и представляет практический, основанный на структуре подход, который можно использовать для улучшения аннотации любого генома. Европейский институт биоинформатики совместно с DeepMind создали базу данных AlphaFold EBI, содержащую предсказанные структуры белков.
Оценка автоматических серверов прогнозирования структуры
CASP, что расшифровывается как Critical Assessment of Techniques for Protein Structure Prediction (Критическая оценка методов прогнозирования структуры белка), – это общеэксперимент, охватывающий сообщество специалистов по прогнозированию структуры белка, который проводится раз в два года с 1994 года. CASP предоставляет возможность оценить качество доступных методов, используемых человеком и неавтоматизированных (человеческая категория), а также автоматических серверов для прогнозирования структуры белка (серверная категория, представленная в CASP7). CAMEO3D Continuous Automated Model EvaluatiOn Server еженедельно оценивает автоматизированные серверы прогнозирования структуры белка, используя "слепые" прогнозы для недавно опубликованных белковых структур. CAMEO публикует результаты на своем веб-сайте.