Введение
Структурное выравнивание в когнитивной науке. Выравнивание молекулярных последовательностей с использованием информации о последовательности и структуре.
Aligning molecular sequences using sequence and structural information
Структурное выравнивание стремится установить гомологию между двумя или более полимерными структурами на основе их формы и трехмерной конформации. Этот процесс обычно применяется к третичным структурам белков, но также может использоваться для крупных молекул РНК. В отличие от простой структурной суперпозиции, где известны хотя бы некоторые эквивалентные остатки в двух структурах, структурное выравнивание не требует предварительных знаний об эквивалентных позициях. Структурное выравнивание является ценным инструментом для сравнения белков с низкой степенью сходства последовательностей, когда эволюционные взаимосвязи между белками не могут быть легко обнаружены стандартными методами выравнивания последовательностей. Таким образом, структурное выравнивание может использоваться для выявления эволюционных связей между белками, имеющими очень мало общих последовательностей. Однако следует соблюдать осторожность при использовании результатов в качестве доказательства общего эволюционного происхождения из-за возможных искажающих эффектов конвергентной эволюции, в результате которой несколько неродственных аминокислотных последовательностей сходятся к общей третичной структуре. Структурные выравнивания могут сравнивать две или несколько последовательностей. Поскольку эти выравнивания опираются на информацию о трехмерных конформациях всех запрошенных последовательностей, метод может применяться только к последовательностям, для которых эти структуры известны. Обычно они определяются с помощью рентгеновской кристаллографии или спектроскопии ЯМР. Возможно выполнение структурного выравнивания на структурах, полученных методами предсказания структуры. Фактически, оценка таких предсказаний часто требует структурного выравнивания между моделью и истинной известной структурой для оценки качества модели. Выбор представления для упрощения вычислений критически важен для разработки эффективного механизма выравнивания.
Методы
Методы структурного выравнивания применяются для сравнения отдельных структур или наборов структур, а также для создания баз данных, содержащих сравнения "всех с всеми", которые оценивают степень различия между каждой парой структур, представленных в Банке данных белков (PDB). Эти базы данных используются для классификации белков по их структурной организации.
Дали
Общим и популярным методом структурного выравнивания является DALI, или метод выравнивания матрицы расстояний, который разбивает входные структуры на фрагменты гексапептидов и вычисляет матрицу расстояний, оценивая контактные паттерны между последовательными фрагментами. Возможно использование различных метрик сходства; первоначальное определение метода CE включало только структурные суперпозиции и расстояния между остатками, но впоследствии было расширено для учета локальных свойств окружения, таких как вторичная структура, экспозиция растворителю, схемы водородных связей и двугранные углы. Этот метод подходит к задаче выравнивания с отличной от большинства других целью. Вместо того, чтобы искать выравнивание, максимально накладывающее наибольшее количество остатков, он определяет подмножество структурного выравнивания, наименее вероятно возникшее случайно. Для этого он помечает выравнивание локального мотива флажками, указывающими, какие остатки одновременно удовлетворяют более строгим критериям: 1) перекрытие локальных структур, 2) регулярная вторичная структура, 3) 3D-суперпозиция, 4) одинаковый порядок в первичной последовательности. Он преобразует статистику количества остатков с высокодостоверными соответствиями и размер белка для вычисления ожидаемого значения (E-value) результата, полученного случайно. Он особенно эффективен при сопоставлении удаленных гомологов, в частности структур, сгенерированных *ab initio* предсказанием структуры, со структурными семействами, такими как SCOP, поскольку он делает акцент на извлечении статистически надежного подвыравнивания, а не на достижении максимального выравнивания последовательностей или максимальной 3D-суперпозиции. Для каждого перекрывающегося окна из 7 последовательных остатков он вычисляет набор единичных векторов направления смещения между соседними остатками Cα. Все локальные мотивы сравниваются друг с другом на основе оценки URMS. Эти значения становятся элементами оценки выравнивания пар для динамического программирования, которое создает начальное парное выравнивание остатков. Вторая фаза использует модифицированный алгоритм MaxSub: одна пара выровненных из 7 остатков в каждом белке используется для ориентации двух полноразмерных белковых структур, чтобы максимально наложить именно эти 7 атомов Cα, после чего в этой ориентации выполняется поиск любых дополнительных выровненных пар, близких в 3D-пространстве. Структуры переориентируются для наложения этого расширенного набора, и процесс повторяется до тех пор, пока больше не будет совпадающих пар в 3D. Этот процесс перезапускается для каждого 7-остаточного окна в начальном выравнивании. Результатом является максимальное количество атомов, найденных из любого из этих начальных "зародышей". Эта статистика преобразуется в откалиброванное E-value для сходства белков. Mammoth не пытается итерировать начальное выравнивание или расширять подмножество высокого качества. Следовательно, выравнивание "зародыша", которое он отображает, нельзя справедливо сравнивать с выравниваниями DALI или TM-align, поскольку оно было сформировано исключительно как эвристический прием для сокращения пространства поиска. (Его можно использовать, если требуется выравнивание, основанное исключительно на сходстве локальных структурных мотивов, не зависящее от выравнивания жестких тел на больших расстояниях). Благодаря этой же простоте он более чем в десять раз быстрее, чем DALI, CE и TM-align. Он часто используется в сочетании с этими более медленными инструментами для предварительного отбора больших баз данных, чтобы извлечь только структуры с наилучшими E-value для более полного наложения или дорогостоящих вычислений. Он особенно успешно применяется для анализа "ложных" структур, полученных при *ab initio* предсказании структуры.
ССАП
Метод SSAP (Sequential Structure Alignment Program) использует двойное динамическое программирование для получения структурного выравнивания на основе векторов атом-атом в пространстве структуры. Вместо альфа-углеродов, обычно используемых при структурном выравнивании, SSAP конструирует свои векторы из бета-углеродов для всех аминокислотных остатков, кроме глицина, что позволяет учитывать ротамерное состояние каждого остатка, а также его положение вдоль полипептидной цепи. SSAP работает, сначала строя серию векторов расстояний между остатками для каждого остатка и его ближайших некоррелированных соседей в каждой белковой структуре. Затем создается серия матриц, содержащих разности векторов между соседями для каждой пары остатков, для которых были построены векторы. Динамическое программирование, применяемое к каждой полученной матрице, определяет серию оптимальных локальных выравниваний, которые затем суммируются в "сводную" матрицу, к которой динамическое программирование применяется повторно для определения общего структурного выравнивания. Изначально SSAP создавал только парные выравнивания, но впоследствии был расширен для работы с множественными выравниваниями, в том числе при сравнении с участками связывания или базами данных структур целых белков. Серверы MultiBind и MAPPIS позволяют идентифицировать общие пространственные расположения физико-химических свойств, таких как доноры и акцепторы водородных связей, алифатические, ароматические или гидрофобные группы, в наборе сайтов связывания белков, предоставленных пользователем и определенных взаимодействиями с малыми молекулами (MultiBind), или в наборе белок-белковых интерфейсов, предоставленных пользователем (MAPPIS). Другие инструменты обеспечивают сравнение целых структур белков с набором структур, предоставленных пользователем, или с большой базой данных структур белков за разумное время (ProBiS). В отличие от подходов глобального выравнивания, подходы локального структурного выравнивания лучше подходят для обнаружения локально консервативных паттернов функциональных групп, которые часто встречаются в сайтах связывания и играют важную роль в связывании лигандов. Это инструмент для выравнивания локальной структуры, в отличие от TM-align, метода, основанного на глобальном структурном выравнивании. Хотя G Losa предсказывает положение лиганд-подобных молекул в белковых мишенях с одной полипептидной цепью точнее, чем TM-align, общий процент успешных выравниваний TM-align выше. Однако, поскольку алгоритмические улучшения и повышение производительности компьютеров устранили чисто технические недостатки старых подходов, стало ясно, что не существует единого универсального критерия для "оптимального" структурного выравнивания. Например, TM-align особенно устойчив при количественном сравнении наборов белков с существенными различиями в длине последовательности, но он лишь косвенно учитывает сохранение водородных связей или порядка вторичной структуры, что может быть более подходящим показателем для выравнивания эволюционно связанных белков. Таким образом, последние разработки были сосредоточены на оптимизации определенных характеристик, таких как скорость, количественная оценка результатов, корреляция с альтернативными эталонными стандартами или устойчивость к неточностям в структурных данных или ab initio структурных моделях. Альтернативная методология, набирающая популярность, заключается в использовании консенсуса различных методов для определения структурного сходства белков.
Структурное выравнивание РНК
Техники структурного выравнивания традиционно применялись исключительно к белкам, как к основным биологическим макромолекулам, принимающим характерные трехмерные структуры. Однако крупные молекулы РНК также формируют характерные третичные структуры, которые в основном обусловлены водородными связями между основаниями и штабелированием оснований. Функционально схожие некодирующие молекулы РНК особенно сложно выделить из геномных данных, поскольку структура сохраняется в РНК сильнее, чем последовательность, а также в белках.