Введение

UniProt — это свободно доступная база данных последовательностей белков и функциональной информации, многие записи в которой получены в результате проектов секвенирования геномов. Она содержит обширный объем информации о биологической функции белков, извлеченной из научных публикаций. Поддержка базы данных осуществляется консорциумом UniProt, в который входят несколько европейских биоинформатических организаций и фонд из Вашингтона, округ Колумбия, США.

Консорциум UniProt

Консорциум UniProt состоит из Европейского института биоинформатики (EBI), Швейцарского института биоинформатики (SIB) и Ресурса по информации о белках (PIR). EBI, расположенный на территории кампуса Wellcome Trust Genome в Хинкстоне, Великобритания, предоставляет обширный набор биоинформатических баз данных и сервисов. SIB, находящийся в Женеве, Швейцария, поддерживает серверы ExPASy (Expert Protein Analysis System), являющиеся центральным ресурсом для инструментов и баз данных протеомики. PIR, размещенный Национальным биомедицинским исследовательским фондом (NBRF) при Медицинском центре Джорджтаунского университета в Вашингтоне, округ Колумбия, США, является преемником старейшей базы данных последовательностей белков – "Атласа последовательностей и структуры белков" Маргарет Дейхофф, впервые опубликованного в 1965 году. В 2002 году EBI, SIB и PIR объединили усилия, образовав консорциум UniProt.

Истоки баз данных UniProt

Каждый член консорциума активно участвует в поддержке и аннотации баз данных белков. До недавнего времени EBI и SIB совместно создавали базы данных Swiss-Prot и TrEMBL, а PIR – базу данных по последовательностям белков (PIR PSD). Эти базы данных сосуществовали, имея различный охват последовательностей белков и приоритеты аннотации. Swiss-Prot был создан в 1986 году Амосом Байрохом во время его работы над докторской диссертацией и разработан Швейцарским институтом биоинформатики, а затем Рольфом Апвайлером в Европейском институте биоинформатики. Swiss-Prot был нацелен на предоставление надежных последовательностей белков, связанных с высоким уровнем аннотации (таким как описание функции белка, его доменная структура, посттрансляционные модификации, варианты и т.д.), минимальным уровнем избыточности и высоким уровнем интеграции с другими базами данных. Осознавая, что данные о последовательностях генерируются темпами, превышающими возможности Swiss-Prot по поддержанию актуальности, была создана TrEMBL (Translated EMBL Nucleotide Sequence Data Library) для обеспечения автоматизированной аннотации белков, не включенных в Swiss-Prot. В то же время PIR поддерживала PIR PSD и связанные с ней базы данных, включая iProClass – базу данных последовательностей белков и курируемых семейств. Члены консорциума объединили свои общие ресурсы и опыт и запустили UniProt в декабре 2003 года. По состоянию на 2023 год выпуск "2023_01" UniProtKB/Swiss-Prot содержит 569 213 записей последовательностей (включающих 205 728 242 аминокислоты, полученные из 291 046 ссылок), а выпуск "2023_01" UniProtKB/TrEMBL содержит 245 871 724 записей последовательностей (включающих 85 739 380 194 аминокислоты).

UniProtKB/Swiss-Prot (протоколы для снятия с учета)

UniProtKB/Swiss-Prot – это база данных последовательностей белков, аннотированная вручную и не содержащая избыточности. Она объединяет информацию, извлеченную из научной литературы, и результаты вычислительного анализа, оцененные биокураторами. Цель UniProtKB/Swiss-Prot – предоставить всю известную и релевантную информацию об определенном белке. Аннотации регулярно пересматриваются для соответствия современным научным данным. Ручная аннотация записи включает в себя детальный анализ последовательности белка и научной литературы. Последовательности одного и того же гена и одного и того же вида объединяются в одну запись базы данных. Различия между последовательностями выявляются, и причины этих различий документируются (например, альтернативный сплайсинг, естественная вариация, неверные сайты инициации, неверные границы экзонов, сдвиг рамки считывания, неидентифицированные конфликты). Для аннотации записей UniProtKB/Swiss-Prot используется широкий спектр инструментов анализа последовательностей. Компьютерные предсказания оцениваются вручную, и соответствующие результаты отбираются для включения в запись. Эти предсказания включают посттрансляционные модификации, трансмембранные домены и их топологию, сигнальные пептиды, идентификацию доменов и классификацию семейств белков. Релевантные публикации выявляются путем поиска в базах данных, таких как PubMed. Полный текст каждой статьи читается, информация извлекается и добавляется в запись. Аннотации, основанные на научной литературе, включают, помимо прочего: с 22 июля 2021 года они также включают структуры, предсказанные с помощью AlphaFold2.

UniParc

UniProt Archive (UniParc) – это всеобъемлющая и не содержащая избыточности база данных, включающая в себя все последовательности белков из основных общедоступных баз данных белковых последовательностей. Белки могут присутствовать в нескольких различных исходных базах данных и в нескольких копиях в пределах одной базы данных. Для устранения избыточности UniParc хранит каждую уникальную последовательность только один раз. Идентичные последовательности объединяются, независимо от того, принадлежат ли они одному и тому же виду или разным видам. Каждой последовательности присваивается стабильный и уникальный идентификатор (UPI), что позволяет идентифицировать один и тот же белок из различных исходных баз данных. UniParc содержит только последовательности белков, без какой-либо аннотации. Перекрестные ссылки на базы данных в записях UniParc позволяют получить дополнительную информацию о белке из исходных баз данных. При изменениях последовательностей в исходных базах данных, эти изменения отслеживаются UniParc, а история всех изменений архивируется.

UniRef

Референтные кластеры UniProt (UniRef) состоят из трех баз данных, содержащих кластеризованные наборы последовательностей белков из UniProtKB и отобранных записей UniParc. База данных UniRef100 объединяет идентичные последовательности и фрагменты последовательностей (из любого организма) в одну запись UniRef. Отображается последовательность репрезентативного белка, номера доступа всех объединенных записей и ссылки на соответствующие записи UniProtKB и UniParc. Последовательности UniRef100 кластеризуются с использованием алгоритма CD-HIT для построения UniRef90 и UniRef50. Каждый кластер состоит из последовательностей, имеющих не менее 90% или 50% идентичности последовательности к самой длинной последовательности, соответственно. Кластеризация последовательностей значительно уменьшает размер базы данных, обеспечивая более быстрый поиск последовательностей. UniRef доступен на FTP-сайте UniProt.

Финансирование

UniProt финансируется за счет грантов Национального института геномных исследований человека, Национальных институтов здоровья (NIH), Европейской комиссии, правительства Швейцарии через Федеральное управление образования и науки, NCI caBIG и Министерства обороны США.