Введение
Группа эволюционно родственных белков. Семья белков – это группа эволюционно родственных белков. Во многих случаях у семьи белков есть соответствующая семья генов, в которой каждый ген кодирует соответствующий белок в соотношении один к одному. Термин "семья белков" не следует путать с понятием "семья" в таксономии. Белки в пределах одной семьи происходят от общего предка и обычно обладают схожими трехмерными структурами, функциями и значительным сходством последовательностей. Сходство последовательностей (обычно аминокислотных) является одним из наиболее распространенных показателей гомологии, то есть общего эволюционного происхождения. Для оценки значимости сходства между последовательностями используются различные методы выравнивания последовательностей. Белки, не имеющие общего предка, вряд ли продемонстрируют статистически значимое сходство последовательностей, что делает выравнивание последовательностей мощным инструментом для идентификации членов семейств белков. Однако неоднозначность в определении "семьи белков" приводит к значительным различиям в оценках их числа, полученных разными исследователями.
A protein family is a group of evolutionarily related proteins. In many cases, a protein family has a corresponding gene family, in which each gene encodes a corresponding protein with a 1:1 relationship. The term "protein family" should not be confused with family as it is used in taxonomy. Proteins in a family descend from a common ancestor and typically have similar three dimensional structures, functions, and significant sequence similarity. Sequence similarity (usually amino acid sequence) is one of the most common indicators of homology, or common evolutionary ancestry. Some frameworks for evaluating the significance of similarity between sequences use sequence alignment methods. Proteins that do not share a common ancestor are unlikely to show statistically significant sequence similarity, making sequence alignment a powerful tool for identifying the members of protein families. although ambiguity in the definition of "protein family" leads different researchers to highly varying numbers.
Терминология и использование
Термин "семейство белков" широко используется и может применяться как к большим группам белков с едва уловимым сходством последовательностей, так и к узким группам белков с почти идентичными последовательностями, функциями и структурой. Для разграничения этих случаев используется иерархическая терминология. Наивысший уровень классификации занимают белковые суперсемейства, объединяющие отдалённо родственные белки, часто на основе структурного сходства. Далее следуют семейства белков, обозначающие белки с общим эволюционным происхождением, подтверждаемым значительным сходством последовательностей. Внутри семейств могут выделяться подсемейства для обозначения близкородственных белков со схожими или идентичными функциями. Например, суперсемейство, такое как клан протеаз PA, демонстрирует меньшую консервацию последовательности, чем семейство C04, входящее в его состав.
Домены и мотивы белков
Семьи белков были впервые выделены, когда большинство изученных структур белков представляли собой небольшие белки с одним доменом, такие как миоглобин, гемоглобин и цитохром c. С тех пор было обнаружено множество белков, состоящих из нескольких независимых структурных и функциональных единиц, называемых доменами. В результате эволюционного перераспределения домены в составе белка эволюционировали независимо друг от друга. Это привело к акценту на семействах белковых доменов. Существует ряд онлайн-ресурсов, предназначенных для идентификации и каталогизации этих доменов. Различные участки белка подвержены различным функциональным ограничениям. Например, активный центр фермента требует точной ориентации определенных аминокислотных остатков. Область взаимодействия белок-белок может представлять собой большую поверхность с ограничениями на гидрофобность или полярность аминокислотных остатков. Функционально ограниченные участки белков эволюционируют медленнее, чем неограниченные участки, такие как поверхностные петли, что приводит к образованию блоков консервативных последовательностей при сравнении последовательностей семейства белков (см. множественное выравнивание последовательностей). Эти блоки чаще всего называют мотивами, хотя используются и другие термины (блоки, сигнатуры, отпечатки и т.д.). Существует ряд онлайн-ресурсов, предназначенных для идентификации и каталогизации белковых мотивов.
Эволюция семейств белков
Согласно современному научному мнению, семейства белков возникают двумя путями. Во-первых, разделение исходного вида на два генетически изолированных потомственных вида позволяет гену/белку независимо накапливать вариации (мутации) в этих двух линиях. Это приводит к образованию семейства ортологичных белков, обычно с консервативными последовательностями мотивов. Во-вторых, дупликация гена может создать вторую копию гена (называемую паралогом). Поскольку исходный ген сохраняет способность выполнять свою функцию, дуплицированный ген может свободно дивергировать и приобретать новые функции (в результате случайных мутаций). Определенные семейства генов/белков, особенно у эукариот, подвергаются значительным расширениям и сокращениям в ходе эволюции, иногда в связи с дупликацией всего генома. Расширения менее вероятны, а потери – более вероятны для белков с внутренней неупорядоченностью и для белковых доменов, гидрофобные аминокислоты которых расположены дальше от оптимальной степени распределения вдоль первичной последовательности. Эти расширения и сокращения семейств белков являются одной из ключевых особенностей эволюции генома, однако их значимость и последствия в настоящее время остаются неясными.
Использование и значение семейств белков
По мере увеличения общего числа секвенированных белков и расширения интереса к анализу протеомов, прилагаются усилия по организации белков в семейства и описанию составляющих их доменов и мотивов. Надежная идентификация семейств белков критически важна для филогенетического анализа, функциональной аннотации и изучения разнообразия функций белков в пределах определенной филогенетической ветви. Инициатива по изучению функций ферментов использует семейства и суперсемейства белков в качестве основы для разработки стратегии, основанной на последовательности и структуре, для масштабного функционального назначения ферментов с неизвестной функцией. Алгоритмические методы для установления семейств белков в больших масштабах базируются на понятии сходства.