Введение

Рациональная разработка новых белковых молекул. Рациональный дизайн белков.

Дизайн белков – это рациональная разработка новых белковых молекул для создания новой активности, поведения или функциональности, а также для углубления базового понимания функции белков. Белки могут быть спроектированы с нуля (de novo дизайн) или путем создания рассчитанных вариантов известной структуры белка и его аминокислотной последовательности (так называемый редизайн белков). Рациональные подходы к дизайну белков позволяют предсказывать аминокислотные последовательности, которые будут сворачиваться в заданные структуры. Эти предсказанные последовательности затем могут быть экспериментально проверены с помощью таких методов, как пептидный синтез, сайт-направленный мутагенез или искусственный генный синтез. Рациональный дизайн белков берет свое начало с середины 1970-х годов. Однако в последнее время появилось множество успешных примеров рациональной разработки водорастворимых и даже трансмембранных пептидов и белков, что отчасти обусловлено более глубоким пониманием различных факторов, влияющих на стабильность структуры белка, и разработкой более совершенных вычислительных методов.

Обзор и история

Цель рационального дизайна белка – предсказать аминокислотные последовательности, которые будут сворачиваться в заданную структуру белка. Хотя число возможных белковых последовательностей огромно и растет экспоненциально с увеличением длины белковой цепи, лишь часть из них способна надежно и быстро сворачиваться в одно нативное состояние. Дизайн белка включает в себя идентификацию новых последовательностей в этом подмножестве. Нативное состояние белка представляет собой минимум конформационной свободной энергии для цепи. Таким образом, дизайн белка – это поиск последовательностей, для которых выбранная структура является минимумом свободной энергии. В определенном смысле, это обратная задача по отношению к предсказанию структуры белка. В дизайне задается третичная структура, а затем идентифицируется последовательность, которая будет сворачиваться в эту структуру. Поэтому этот процесс также называют обратным сворачиванием. Дизайн белка, таким образом, является задачей оптимизации: с использованием определенных критериев оценки выбирается оптимизированная последовательность, которая будет сворачиваться в желаемую структуру. Когда первые белки были рационально спроектированы в 1970-х и 1980-х годах, их последовательности оптимизировались вручную на основе анализа других известных белков, состава последовательности, зарядов аминокислот и геометрии целевой структуры. В 2003 году лаборатория Дэвида Бейкера спроектировала полноценный белок с принципиально новой для природы конформацией. В 2010 году один из наиболее эффективных широко нейтрализующих антител был выделен из сыворотки пациента с использованием белкового зонда, разработанного с помощью компьютерного моделирования. Благодаря этим и другим успехам (например, см. примеры ниже), дизайн белка стал одним из важнейших инструментов в арсенале белковой инженерии. Существует большая надежда на то, что дизайн новых белков, как малых, так и больших, найдет применение в биомедицине и биоинженерии.

Основные модели структуры и функции белка

Программы для разработки белков используют компьютерные модели молекулярных сил, определяющих поведение белков в живых организмах. Чтобы сделать задачу решаемой, эти силы упрощаются в моделях разработки белков. Несмотря на значительные различия между программами разработки белков, все они должны решать четыре основных вопроса моделирования: какова целевая структура разрабатываемого белка, какая гибкость допустима для этой структуры, какие аминокислотные последовательности включаются в поиск, и какое силовое поле будет использоваться для оценки последовательностей и структур.

Целевая структура

Функция белка в значительной степени зависит от его структуры, и рациональный дизайн белка использует эту взаимосвязь для создания функции, проектируя белки с заданной целевой структурой или конформацией. Таким образом, по определению, в рациональном дизайне белка целевая структура или набор структур должны быть известны заранее. Это отличается от других методов протеиновой инженерии, таких как направленная эволюция, где используются различные подходы для поиска белков, достигающих определенной функции, и от предсказания структуры белка, где известна последовательность аминокислот, но структура неизвестна. Чаще всего целевая структура основывается на известной структуре другого белка. Однако создание принципиально новых конформаций, не встречающихся в природе, становится все более возможным. Питер С. Ким и его коллеги разработали тримеры и тетрамеры из неестественных спиральных структур, которые ранее не наблюдались в природе.

Пространство последовательности

В рациональном дизайне белков белки могут быть перепроектированы на основе последовательности и структуры известного белка или созданы полностью с нуля в дизайне белков de novo. При перепроектировании белка большинство аминокислотных остатков в последовательности сохраняют свои природные значения, в то время как небольшому числу из них разрешается мутировать. В дизайне de novo вся последовательность разрабатывается заново, без использования каких-либо известных последовательностей в качестве основы. Как дизайн de novo, так и перепроектирование белка позволяют устанавливать правила для пространства последовательностей, определяя, какие аминокислоты допустимы в каждой изменяемой позиции остатка. Например, состав поверхности зонда RSC3 для отбора широко нейтрализующих антител к ВИЧ был ограничен на основе эволюционных данных и баланса зарядов. Многие из первых попыток в области дизайна белков в значительной степени опирались на эмпирические правила, касающиеся пространства последовательностей. Библиотеки ротамеров, зависящие от структуры белкового скелета, напротив, описывают ротамеры, указывая вероятность их появления в зависимости от конформации белкового скелета вокруг боковой цепи. Большинство программ для дизайна белков используют одну конформацию (например, модальное значение для диэдральных углов ротамеров в пространстве) или несколько точек в области, описываемой ротамером; программа OSPREY для дизайна белков, в отличие от них, моделирует всю непрерывную область. Гибкость белкового скелета особенно важна при перепроектировании белка, поскольку мутации последовательности часто приводят к небольшим изменениям в структуре скелета. Более того, гибкость скелета может быть необходима для более сложных задач дизайна белков, таких как предсказание связывания и дизайн ферментов. Некоторые модели гибкости белкового скелета включают небольшие и непрерывные глобальные движения скелета, дискретные образцы скелета вокруг целевой укладки, движения "backrub" и гибкость петель белка. Энергетические функции, основанные на физике, такие как AMBER и CHARMM, обычно выводятся из квантово-механических симуляций и экспериментальных данных, полученных методами термодинамики, кристаллографии и спектроскопии. Эти функции обычно упрощают физические энергетические зависимости и делают их парно разложимыми, то есть общая энергия конформации белка может быть рассчитана путем суммирования парных энергий между каждой парой атомов, что делает их привлекательными для алгоритмов оптимизации. Энергетические функции, основанные на физике, обычно моделируют привлекательный отталкивающий член Леннарда-Джонса между атомами и парный кулоновский электростатический член между не связанными атомами. Статистические потенциалы, в отличие от потенциалов, основанных на физике, имеют преимущество в скорости вычислений, неявном учете сложных эффектов и меньшей чувствительности к небольшим изменениям в структуре белка. Эти функции основаны на определении энергетических значений на основе частоты встречаемости в структурной базе данных. Однако дизайн белка предъявляет требования, которые иногда могут быть ограничены силовыми полями молекулярной механики. Силовые поля молекулярной механики, которые в основном использовались в симуляциях молекулярной динамики, оптимизированы для моделирования отдельных последовательностей, но дизайн белка исследует множество конформаций многих последовательностей. Таким образом, силовые поля молекулярной механики должны быть адаптированы для дизайна белка. На практике энергетические функции дизайна белка часто включают как статистические, так и физически обоснованные члены. Например, энергетическая функция Rosetta, одна из наиболее часто используемых, включает в себя физически обоснованные энергетические члены, происходящие из энергетической функции CHARMM, и статистические энергетические члены, такие как вероятность ротамера и электростатика, основанная на знаниях. Как правило, энергетические функции сильно настраиваются в разных лабораториях и специально адаптируются для каждого конкретного дизайна. Несмотря на то, что класс задач является NP-трудным, на практике многие примеры дизайна белка могут быть решены точно или оптимизированы удовлетворительно с помощью эвристических методов.

Алгоритмы

Для решения проблемы проектирования белков разработано несколько алгоритмов. Эти алгоритмы можно разделить на два основных класса: точные алгоритмы, такие как метод исключения тупиковых ситуаций, которые не имеют гарантий по времени выполнения, но гарантируют качество решения; и эвристические алгоритмы, такие как метод Монте-Карло, которые быстрее точных алгоритмов, но не дают гарантий оптимальности результатов. Точные алгоритмы гарантируют, что процесс оптимизации выдает оптимальное решение в соответствии с моделью проектирования белка. Следовательно, если предсказания точных алгоритмов не подтверждаются экспериментально, источник ошибки можно отнести к энергетической функции, допустимой гибкости, пространству последовательностей или целевой структуре (например, если ее невозможно спроектировать). Ниже приведены некоторые алгоритмы проектирования белков. Хотя эти алгоритмы решают только самую простую формулировку задачи проектирования белка, уравнение , при изменении цели оптимизации, когда разработчики вносят улучшения и расширения в модель проектирования белка, такие как повышение структурной гибкости (например, гибкости белкового каркаса) или включение сложных энергетических членов, многие расширения в области проектирования белков, улучшающие моделирование, основаны на этих алгоритмах. Например, Rosetta Design включает в себя сложные энергетические члены и гибкость каркаса, используя метод Монте-Карло в качестве базового алгоритма оптимизации. Алгоритмы OSPREY основаны на методе исключения тупиковых ситуаций и алгоритме A* для учета непрерывных движений основного и боковых звеньев. Таким образом, эти алгоритмы дают хорошее представление о различных типах алгоритмов, доступных для проектирования белков. В 2020 году ученые сообщили о разработке процесса на основе искусственного интеллекта с использованием геномных баз данных для эволюционного проектирования новых белков. Они использовали глубокое обучение для выявления правил проектирования. В 2022 году в исследовании было представлено программное обеспечение глубокого обучения, способное проектировать белки, содержащие заранее заданные функциональные участки.

Устранение тупиков

Алгоритм устранения тупиковых ветвей (DEE) итеративно уменьшает пространство поиска, удаляя ротамеры, которые можно доказать не входящими в глобальную конформацию с наименьшей энергией (GMEC). На каждой итерации алгоритм устранения тупиковых ветвей сравнивает все возможные пары ротамеров в каждой позиции аминокислотного остатка и удаляет каждый ротамер r′i, который можно показать как всегда имеющий более высокую энергию, чем другой ротамер ri, и, следовательно, не являющийся частью GMEC.

Другие мощные расширения алгоритма устранения тупиковых ветвей включают критерий исключения пар и обобщенный критерий исключения тупиковых ветвей. Этот алгоритм также был расширен для работы с непрерывными ротамерами с гарантированными свойствами. Хотя алгоритм устранения тупиковых ветвей работает за полиномиальное время на каждой итерации, он не может гарантировать сходимость. Если после определенного числа итераций алгоритм устранения тупиковых ветвей перестает отсекать ротамеры, то либо ротамеры необходимо объединить, либо для поиска в оставшемся пространстве поиска следует использовать другой алгоритм. В таких случаях устранение тупиковых ветвей выступает в качестве предварительного фильтра для уменьшения пространства поиска, в то время как другие алгоритмы, такие как A*, метод Монте-Карло, линейное программирование или FASTER, используются для поиска в оставшемся пространстве поиска. Популярным алгоритмом поиска для разработки белков является алгоритм поиска A*.

Приближения, основанные на передаче сообщений, к дуальному линейному программированию

Решатели ILP используют алгоритмы линейного программирования (LP), такие как симплекс-метод или методы внутренней точки, для выполнения LP-релаксации на каждой ветке. Эти LP-алгоритмы были разработаны как универсальные методы оптимизации и не оптимизированы для задачи проектирования белков (Уравнение). В результате, LP-релаксация становится узким местом для решателей ILP при большом размере задачи. В последнее время были разработаны несколько альтернативных подходов, основанных на алгоритмах обмена сообщениями, специально для оптимизации LP-релаксации задачи проектирования белков. Эти алгоритмы могут аппроксимировать как двойственные, так и примитивные экземпляры целочисленного программирования, но для обеспечения гарантий оптимальности они наиболее эффективны при аппроксимации двойственной задачи проектирования белков, поскольку аппроксимация двойственной задачи гарантирует, что ни одно решение не будет упущено. Аппроксимации, основанные на обмене сообщениями, включают алгоритм взвешенного дерева максимального произведения сообщений и алгоритм линейного программирования на основе обмена сообщениями.

Монте-Карло и имитированное отжигание

Монте-Карло – один из наиболее широко используемых алгоритмов для разработки белков. В простейшем варианте алгоритм Монте-Карло случайным образом выбирает аминокислотный остаток, и в этом остатке оценивается случайно выбранный ротамер (любой аминокислоты).

Быстрее

Алгоритм FASTER использует комбинацию детерминированных и стохастических критериев для оптимизации последовательностей аминокислот. FASTER сначала использует DEE для исключения ротамеров, не входящих в оптимальное решение. Затем серия итеративных шагов оптимизирует присвоение ротамеров.

Пропаганда убеждений

В алгоритме распространения убеждений, применяемом для проектирования белков, происходит обмен сообщениями, описывающими уверенность каждого аминокислотного остатка в вероятности каждого ротамера у соседних остатков. Алгоритм обновляет сообщения на каждой итерации и повторяет процесс до достижения сходимости или до достижения заданного числа итераций. Сходимость не гарантирована при проектировании белков. Сообщение mi→ j(rj, которое остаток i отправляет каждому ротамеру rj у соседнего остатка j, определяется как:

Как алгоритм распространения убеждений с использованием произведения максимумов, так и с использованием суммы произведений были использованы для оптимизации проектирования белков.

Конструкция ферментов

Конструирование новых ферментов – это применение методов проектирования белков, обладающее огромным потенциалом в биоинженерии и биомедицине. В общем случае, проектирование структуры белка может отличаться от проектирования фермента, поскольку при создании ферментов необходимо учитывать множество состояний, вовлеченных в каталитический механизм. Однако, проектирование белка является необходимым условием для de novo конструирования ферментов, так как, по крайней мере, для создания катализаторов требуется каркас, в который можно встроить каталитический механизм. Значительный прогресс в de novo конструировании и перепроектировании ферментов был достигнут в первом десятилетии XXI века. В трех крупных исследованиях Дэвид Бейкер и его коллеги de novo сконструировали ферменты для реакции ретроальдола, реакции элиминирования Кемпа и реакции Дильса-Альдера. Кроме того, Стивен Майо и его коллеги разработали итеративный метод для создания наиболее эффективного известного фермента для реакции элиминирования Кемпа. Также, в лаборатории Брюса Дональда, вычислительное проектирование белков было использовано для изменения специфичности одного из белковых доменов нерибосомного пептидсинтаза, производящего грамицидин S, с его естественного субстрата фенилаланина на другие неродственные субстраты, включая заряженные аминокислоты; активность переконструированных ферментов была близка к активности ферментов природного типа.

Конструкция для аффинитета

Взаимодействие белков участвует в большинстве биологических процессов. Многие из наиболее трудноизлечимых заболеваний, таких как болезнь Альцгеймера, многие формы рака (например, TP53) и инфекция вирусом иммунодефицита человека (ВИЧ), связаны с взаимодействием белков. Таким образом, для лечения таких заболеваний желательно разработать белковые или белкоподобные терапевтические средства, которые связываются с одним из партнеров взаимодействия и, тем самым, нарушают вызывающее заболевание взаимодействие. Это требует разработки белковых терапевтических средств с высокой аффинностью к своему партнеру. Взаимодействие белков можно спроектировать с использованием алгоритмов дизайна белков, поскольку принципы, определяющие стабильность белка, также определяют связывание белков. Однако дизайн взаимодействия белков представляет собой задачи, которые обычно не встречаются при дизайне белков. Одной из наиболее важных задач является то, что, как правило, интерфейсы между белками более полярны, чем внутренние области белков, а связывание включает компромисс между десольватацией и образованием водородных связей. Чтобы преодолеть эту проблему, Брюс Тидор и его коллеги разработали метод повышения аффинности антител, сосредоточившись на электростатических вкладах. Они обнаружили, что для антител, спроектированных в этом исследовании, снижение энергетических затрат на десольватацию аминокислотных остатков в интерфейсе увеличило аффинность связывающей пары.

Регенерация белка

Ресурфейсинг белка заключается в изменении поверхности белка с сохранением общей структуры, ядра и граничных областей белка. Ресурфейсинг белка особенно полезен для изменения взаимодействия белка с другими белками. Одним из наиболее важных применений ресурфейсинга стало создание зонда RSC3 для отбора широко нейтрализующих антител к ВИЧ в Центре исследований вакцин Национального института здоровья (NIH). Сначала для изменения были выбраны аминокислотные остатки, находящиеся вне области контакта между белком оболочки gp120 ВИЧ и ранее обнаруженным антителом b12. Затем пространство возможных последовательностей было отобрано на основе эволюционной информации, растворимости, сходства с природным типом и других факторов. После этого программное обеспечение RosettaDesign было использовано для поиска оптимальных последовательностей в выбранном пространстве. Позднее RSC3 был использован для обнаружения широко нейтрализующего антитела VRC01 в сыворотке крови человека, длительно инфицированного ВИЧ, но не проявляющего признаков прогрессирования заболевания.

Конструкция шаровых белков

Глобулярные белки – это белки, содержащие гидрофобное ядро и гидрофильную поверхность. В отличие от волокнистых белков, которые могут принимать множество конформаций, глобулярные белки обычно имеют стабильную структуру. Определение трехмерной структуры глобулярных белков, как правило, проще с помощью рентгеновской кристаллографии и ядерного магнитного резонанса, чем для волокнистых и мембранных белков, что делает глобулярные белки более предпочтительными для разработки новых белков. Большинство успешных проектов по разработке белков были связаны с глобулярными белками. RSD 1 и Top7 были созданы de novo как глобулярные белки. В 2012 году группа Бейкера разработала, синтезировала и подтвердила структуру еще пяти белков. Эти новые белки не имеют биологической функции, но их структура предназначена для использования в качестве строительных блоков, которые можно расширить для включения функциональных активных центров. Структуры были найдены вычислительным путем с использованием новых эвристических методов, основанных на анализе соединительных петель между участками последовательности, определяющими вторичную структуру.

Конструкция мембранных белков

Несколько трансмембранных белков были успешно разработаны, а также множество других пептидов и белков, связанных с мембраной. Недавно Костас Маранас и его коллеги разработали автоматизированный инструмент для изменения размера пор внешнемembrанного порина типа F (OmpF) из E. coli до любого желаемого размера, измеряемого в долях нанометра, и собрали их в мембраны для осуществления точного разделения с точностью до ангстрема.

Другие применения

Одно из наиболее востребованных применений проектирования белков — это биосенсоры, белки, способные обнаруживать присутствие определенных соединений. Некоторые попытки создания биосенсоров включают датчики для неестественных молекул, в том числе ТНТ. Недавно Кульман и его коллеги разработали биосенсор для PAK1. В определенном смысле, проектирование белков можно рассматривать как частный случай проектирования батарей.