Введение
База данных семейств белков, доменов и функциональных участков
InterPro – это база данных семейств белков, доменов белков и функциональных участков, в которой идентифицируемые признаки, обнаруженные в известных белках, могут быть применены к новым последовательностям белков для их функциональной характеристики. Содержимое InterPro состоит из диагностических сигнатур и белков, которым эти сигнатуры существенно соответствуют. Сигнатуры состоят из моделей (от простых, таких как регулярные выражения, до более сложных, таких как скрытые марковские модели), описывающих белковые семейства, домены или участки. Модели строятся на основе аминокислотных последовательностей известных семейств или доменов и впоследствии используются для поиска в неизвестных последовательностях (например, полученных при секвенировании новых геномов) с целью их классификации. Каждая из баз данных, входящих в состав InterPro, специализируется в определенной области, от классификаций высокого уровня, основанных на структуре (SUPERFAMILY и CATH Gene3D), до более специфических классификаций подсемейств (PRINTS и PANTHER). InterPro стремится предоставить единую платформу для классификации белков, объединяя все сигнатуры, созданные различными базами данных-членами, в записи базы данных InterPro. Сигнатуры, представляющие эквивалентные домены, участки или семейства, объединяются в одну запись, а записи могут быть связаны между собой. К каждой записи, по возможности, прилагается дополнительная информация, такая как описание, унифицированные названия и термины генной онтологии (GO).
Данные, содержащиеся в InterPro
InterPro содержит три основных сущности: белки, сигнатуры (также называемые «методами» или «моделями») и записи. Белки в UniProtKB также являются центральными белковыми сущностями в InterPro. Информация о том, какие сигнатуры значительно соответствуют этим белкам, рассчитывается по мере публикации последовательностей UniProtKB, и эти результаты становятся общедоступными (см. ниже). Соответствие сигнатур белкам определяет, как сигнатуры объединяются в записи InterPro: сравнительное перекрытие соответствующих наборов белков и расположение соответствий сигнатур на последовательностях используются в качестве индикаторов родства. В InterPro интегрируются только сигнатуры, признанные достаточно качественными. По состоянию на версию 81.0 (выпущенную 21 августа 2020 года) записи InterPro аннотировали 73,9% аминокислотных остатков, найденных в UniProtKB, еще 9,2% аннотированы сигнатурами, ожидающими интеграции. Система классификации белков PIRSF представляет собой сеть с множеством уровней разнообразия последовательностей, от суперсемейств до подсемейств, отражающую эволюционные взаимосвязи белков и доменов полной длины. Основной классификационной единицей PIRSF является гомеоморфное семейство, члены которого одновременно гомологичны (произошли от общего предка) и гомеоморфны (обладают сходством последовательностей по всей длине и общей архитектурой доменов). PRINTS – это сборник протеиновых отпечатков. Отпечаток – это группа консервативных мотивов, используемых для характеристики семейства белков; его диагностическая сила уточняется итеративным сканированием UniProt. Обычно мотивы не перекрываются, но разделены вдоль последовательности, хотя они могут быть соединены в трехмерном пространстве. Отпечатки могут кодировать белковые фолдинги и функциональность более гибко и эффективно, чем отдельные мотивы, их полная диагностическая сила обусловлена взаимным контекстом, обеспечиваемым соседними мотивами. PROSITE – это база данных семейств и доменов белков. Она состоит из биологически значимых сайтов, паттернов и профилей, которые помогают надежно определить, к какому известному семейству белков (если таковое имеется) принадлежит новая последовательность. SMART (Simple Modular Architecture Research Tool) позволяет идентифицировать и аннотировать генетически мобильные домены и анализировать архитектуру доменов. Обнаружено более 800 семейств доменов, встречающихся в сигнальных, внеклеточных и хроматин-ассоциированных белках. Эти домены широко аннотированы в отношении филетического распределения, функционального класса, третичных структур и функционально важных остатков. SUPERFAMILY – это библиотека скрытых моделей Маркова, представляющих все белки с известной структурой. Библиотека основана на классификации белков SCOP: каждая модель соответствует домену SCOP и направлена на представление всего суперсемейства SCOP, к которому принадлежит домен. SUPERFAMILY использовалась для структурной аннотации всех полностью секвенированных геномов. SFLD – иерархическая классификация ферментов, связывающая специфические особенности структуры последовательности со специфическими химическими возможностями. TIGRFAMs – это коллекция семейств белков, включающая курируемые множественные выравнивания последовательностей, скрытые модели Маркова (HMM) и аннотации, предоставляющие инструмент для идентификации функционально связанных белков на основе гомологии последовательностей. Записи, которые являются «эквивалогами», группируют гомологичные белки, консервативные по функции.
Доступ
База данных доступна для поиска по тексту и последовательностям через веб-сервер, а также для загрузки по анонимному FTP. Как и другие базы данных EBI, она находится в общественном достоянии, поскольку её содержимое может использоваться любым лицом и для любых целей. InterPro стремится публиковать данные каждые 8 недель, обычно в течение суток после публикации UniProtKB тех же белков.
Интерфейс программирования приложений InterPro (API)
InterPro предоставляет API для программного доступа ко всем записям InterPro и связанным с ними записям в формате JSON. Существует шесть основных конечных точек API, соответствующих различным типам данных InterPro: запись, белок, структура, таксономия, протеом и набор.
InterProScan
InterProScan – это программный пакет, позволяющий пользователям сканировать последовательности на соответствие сигнатурам баз данных. Пользователи могут использовать это программное обеспечение для сканирования сигнатур с целью функциональной характеристики новых нуклеотидных или белковых последовательностей. InterProScan часто используется в геномных проектах для получения первичной характеристики интересующего генома. По состоянию на 2020 год, публичная версия InterProScan (v5.x) использует архитектуру на основе Java. В настоящее время программный пакет поддерживается только на 64-битных операционных системах Linux. InterProScan, наряду со многими другими биоинформатическими инструментами EMBL-EBI, также может быть доступен программно через RESTful и SOAP Web Services API.