Введение
Прогнозирование взаимодействия белков – это область, объединяющая биоинформатику и структурную биологию в попытке выявить и каталогизировать физические взаимодействия между парами или группами белков. Понимание взаимодействия белков важно для изучения внутриклеточных сигнальных путей, моделирования структур белковых комплексов и получения представления о различных биохимических процессах. Экспериментально физические взаимодействия между парами белков можно установить с помощью различных методов, включая системы двух гибридов на основе дрожжей, анализы комплементации фрагментов белка (PCA), аффинную очистку с последующей масс-спектрометрией, белковые микромассивы, флуоресцентный резонансный перенос энергии (FRET) и микромасштабный термофорез (MST). Ведутся работы по экспериментальному определению интерактома многих видов. Экспериментально установленные взаимодействия обычно служат основой для вычислительных методов прогнозирования взаимодействий, например, с использованием гомологичных последовательностей белков у разных видов. Однако существуют также методы, которые предсказывают взаимодействия de novo, без предварительных знаний о существующих взаимодействиях.
Методы
Белки, которые взаимодействуют, с большей вероятностью со-эволюционируют, поэтому можно делать выводы о взаимодействиях между парами белков, основываясь на их филогенетических расстояниях. Также в некоторых случаях наблюдалось, что у взаимодействующих белков в других организмах существуют сросшиеся ортологи. Кроме того, структура ряда связанных белковых комплексов была определена и может быть использована для выявления аминокислотных остатков, опосредующих взаимодействие, чтобы затем находить подобные мотивы в других организмах.
Филогенетическое профилирование
[[Файл:Филогенетический метод профилирования.png|thumb|Рисунок A. Филогенетические профили четырех генов (A, B, C и D) показаны справа. '1' обозначает наличие гена в геноме, а '0' – отсутствие. Два идентичных профиля генов A и B выделены желтым цветом. Рисунок A иллюстрирует гипотетическую ситуацию, в которой белки A и B идентифицируются как функционально связанные из-за их идентичных филогенетических профилей в пяти различных геномах. Объединенный институт генома предоставляет интегрированную базу данных микробиологических геномов и микробиомов (JGI IMG), которая включает инструмент филогенетического профилирования для отдельных генов и генных кассет.
Прогнозирование пары протеинов, коэволюционировавших на основе схожих филогенетических деревьев
Было замечено, что филогенетические деревья лигандов и рецепторов часто оказываются более похожими, чем можно было бы ожидать случайно. Вероятно, это связано с тем, что они подвергались схожему селекционному давлению и коэволюционировали. Этот метод использует филогенетические деревья белковых пар для определения наличия взаимодействий. Для этого находят гомологи интересующих белков (с помощью инструмента поиска последовательностей, такого как BLAST) и выполняют множественное выравнивание последовательностей (с использованием инструментов выравнивания, таких как Clustal) для построения матриц расстояний для каждого из интересующих белков. Затем матрицы расстояний используются для построения филогенетических деревьев. Однако сравнение филогенетических деревьев затруднительно, и современные методы обходят это, просто сравнивая матрицы расстояний. Матрицы расстояний белков используются для расчета коэффициента корреляции, при котором большее значение соответствует коэволюции. Преимущество сравнения матриц расстояний вместо филогенетических деревьев заключается в том, что результаты не зависят от используемого метода построения деревьев. Недостатком является то, что матрицы расстояний не являются идеальным представлением филогенетических деревьев, и использование такого упрощения может привести к неточностям. Еще один важный фактор заключается в том, что существует фоновая схожесть между филогенетическими деревьями любых белков, даже не взаимодействующих. Если это не учитывать, это может привести к высокой частоте ложноположительных результатов. Поэтому некоторые методы строят фоновое дерево, используя последовательности 16S рРНК, которые рассматриваются как каноническое дерево жизни. Матрица расстояний, построенная на основе этого дерева жизни, затем вычитается из матриц расстояний интересующих белков. Однако, поскольку матрицы расстояний РНК и ДНК имеют разные масштабы, предположительно из-за различий в скорости мутаций РНК и ДНК, матрицу РНК необходимо перемасштабировать перед вычитанием из матриц ДНК. Используя белки молекулярных часов, можно рассчитать коэффициент масштабирования для расстояния между белками и расстояния между РНК. Этот коэффициент используется для перемасштабирования матрицы РНК. Рисунок Б (миниатюра). Фермент сукцинил-КоА-трансферазы человека представлен двумя соединенными синими и зелеными полосами в верхней части изображения. Альфа-субъединица фермента ацетат-КоА-трансферазы гомологична первой половине фермента и представлена синей полосой. Бета-субъединица фермента ацетат-КоА-трансферазы гомологична второй половине фермента и представлена зеленой полосой. Изображение адаптировано из Uetz, P. & Pohl, E. (2018) Protein–Protein and Protein–DNA Interactions. In: Wink, M. (ed.), Introduction to Molecular Biotechnology, 3rd ed. Wiley VCH, in press.
Метод Розеттского камня (генное слияние)
Метод «Розеттский камень» или слияние доменов основан на гипотезе о том, что взаимодействующие белки иногда объединяются в единый белок. Например, гены trpA и trpB у Escherichia coli кодируют две субъединицы фермента триптофан-синтазы, которые, как известно, взаимодействуют для катализа одной реакции. Соседство этих двух генов оказалось сохраненным в девяти различных бактериальных и археальных геномах.
Вывод взаимодействий из гомологичных структур
Эта группа методов использует известные структуры белковых комплексов для предсказания и структурного моделирования взаимодействий между запрошенными последовательностями белков. Процесс предсказания обычно начинается с применения метода, основанного на анализе последовательностей (например, Interolog), для поиска структур белковых комплексов, гомологичных запрошенным последовательностям. Эти известные структуры комплексов затем используются в качестве шаблонов для структурного моделирования взаимодействия между запрошенными последовательностями. Преимущество этого метода заключается не только в определении взаимодействий между белками, но и в предложении моделей их структурного взаимодействия, что может дать представление о механизме этого взаимодействия на атомном уровне. С другой стороны, возможность применения этих методов для предсказаний ограничена небольшим количеством известных структур белковых комплексов.
Методы ассоциации
Методы ассоциации ищут характерные последовательности или мотивы, которые могут помочь различить взаимодействующие и не взаимодействующие пары. Классификатор обучается путем поиска пар последовательностных сигнатур, где один белок содержит одну сигнатуру последовательности, а его взаимодействующий партнер – другую. Они специально ищут сигнатуры последовательностей, которые встречаются вместе чаще, чем можно было бы ожидать случайно. Для этого используется логарифмический коэффициент, вычисляемый по формуле log2(Pij/PiPj), где Pij – наблюдаемая частота встречаемости доменов i и j в одной паре белков; Pi и Pj – фоновые частоты доменов i и j в данных. Предсказанные взаимодействия доменов – это те, которые имеют положительные значения логарифмического коэффициента и также встречаются несколько раз в базе данных. Недостаток этого метода заключается в том, что он рассматривает каждую пару взаимодействующих доменов по отдельности и предполагает, что они взаимодействуют независимо друг от друга.
Определение структурных моделей
Этот метод строит библиотеку известных белково-белковых интерфейсов на основе данных PDB, где интерфейсы определяются как пары полипептидных фрагментов, находящихся на расстоянии, незначительно превышающем радиус Ван-дер-Ваальса участвующих атомов. Последовательности в библиотеке затем кластеризуются на основе структурного выравнивания, и избыточные последовательности удаляются. Аминокислотные остатки, демонстрирующие высокую (обычно >50%) частоту в определенной позиции, рассматриваются как горячие точки. Эта библиотека затем используется для идентификации потенциальных взаимодействий между парами мишеней, при условии, что для них известна структура (то есть они представлены в PDB).
Моделирование байесовской сети
Байесовские методы объединяют данные из самых разных источников, включая как экспериментальные результаты, так и априорные вычислительные предсказания, и используют эти данные для оценки вероятности того, что конкретное потенциальное взаимодействие белков является истинным. Эти методы полезны, поскольку экспериментальные процедуры, особенно эксперименты с использованием дрожжевых двухгибридов, крайне подвержены шумам и дают большое количество ложноположительных результатов, в то время как ранее упомянутые вычислительные методы могут предоставить лишь косвенные свидетельства возможного взаимодействия конкретной пары белков.
Анализ исключения пары доменов
Анализ исключения пар доменов выявляет специфические взаимодействия доменов, которые сложно обнаружить с помощью байесовских методов. Байесовские методы хорошо подходят для обнаружения неспецифических, беспорядочных взаимодействий, но не очень эффективны для выявления редких, специфических взаимодействий. Метод анализа исключения пар доменов рассчитывает E-оценку, которая показывает, взаимодействуют ли два домена. Она вычисляется как логарифм отношения вероятностей: вероятность взаимодействия двух белков при взаимодействии доменов к вероятности взаимодействия двух белков при отсутствии взаимодействия доменов. Вероятности, необходимые для формулы, рассчитываются с использованием процедуры максимизации ожиданий – метода оценки параметров в статистических моделях. Высокие значения E-оценки указывают на вероятное взаимодействие двух доменов, а низкие – на то, что за взаимодействие, скорее всего, отвечают другие домены, входящие в состав белковой пары. Недостатком этого метода является то, что он не учитывает ложноположительные и ложноотрицательные результаты в экспериментальных данных.
Проблема обучения под наблюдением
Проблема предсказания белок-белковых взаимодействий (ББВ) может быть сформулирована как задача обучения с учителем. В рамках этой парадигмы известные белковые взаимодействия используются для обучения функции, способной предсказывать наличие или отсутствие взаимодействия между двумя белками на основе данных о белках (например, уровней экспрессии генов в различных экспериментальных условиях, информации о локализации, филогенетических профилей и т.д.).
Связь с методами стыковки
Область предсказания взаимодействий между белками тесно связана с областью докинга белков, которая стремится использовать геометрические и стерические соображения для подгонки двух белков с известной структурой в связанный комплекс. Это полезный подход к исследованию в тех случаях, когда структуры обоих белков в паре известны и само взаимодействие подтверждено (или, по крайней мере, сильно подозревается), но поскольку для многих белков экспериментально определенные структуры отсутствуют, методы предсказания взаимодействий на основе последовательности особенно полезны в сочетании с экспериментальными исследованиями интерактома организма.