SCOPe: база данных белковых структур. Классификация доменов, семейств и структур. Обновления UC Berkeley (2018). Информация для биологов и исследователей.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Биологическая база данных белков
Biological database of proteins
infobox biodatabase|title=SCOPe|pmid=24304899|description=SCOP расширенная|url=https://scop.berkeley.edu|author=Naomi K. Fox, Steven E. Brenner, and John Marc Chandonia|version=2.07 (март 2018; 276 231 домен в 87 224 структурах, классифицированных в 4919 семейств) База данных поддерживалась Алексеем Г. Мурзиным и его коллегами в Центре белковой инженерии до его закрытия в 2010 году, а затем – в Лаборатории молекулярной биологии в Кембридже, Англия. Работа над SCOP 1.75 была прекращена в 2014 году. С тех пор команда SCOPe из Калифорнийского университета в Беркли отвечает за обновление базы данных в совместимом формате, используя комбинацию автоматизированных и ручных методов. По состоянию на 2019 год, последняя версия – SCOPe 2.07 (март 2018). Новая база данных структурной классификации белков версии 2 (SCOP2) была выпущена в начале 2020 года. Новое обновление включает в себя улучшенную схему базы данных, новый API и модернизированный веб-интерфейс. Это было самое значительное обновление, сделанное кембриджской группой после SCOP 1.75, и оно основано на достижениях в схеме прототипа SCOP 2.
infobox biodatabase|title=SCOPe|pmid=24304899|description=SCOP extended|url=https://scop. berkeley. edu|author=Naomi K. Fox, Steven E. Brenner, and John Marc Chandonia|version=2.07 (March 2018; 276,231 domains in 87,224 structures classed as 4,919 families) It was maintained by Alexey G. Murzin and his colleagues in the Centre for Protein Engineering until its closure in 2010 and subsequently at the Laboratory of Molecular Biology in Cambridge, England. The work on SCOP 1.75 has been discontinued in 2014. Since then SCOPe team from UC Berkeley has been responsible for updating the database in a compatible manner, with a combination of automated and manual methods. as of 2019, the latest release is SCOPe 2.07 (March 2018). The new Structural Classification of Proteins version 2 (SCOP2) database was released at the beginning of 2020. The new update featured an improved database schema, a new API and modernised web interface. This was the most significant update by the Cambridge group since SCOP 1.75 and builds on the advances in schema from the SCOP 2 prototype.
Иерархическая организация
Источником белковых структур является Банк данных белков. Единицей классификации структуры в SCOP является белковый домен. Что авторы SCOP подразумевают под "доменом", можно понять из их утверждения, что небольшие белки и большинство белков среднего размера имеют только один домен, и из наблюдения, что человеческому гемоглобину, имеющему структуру α2β2, присваиваются два домена SCOP – один для α и один для β субъединицы. Формы доменов в SCOP называются "складками". Домены, принадлежащие к одной и той же складке, имеют одинаковые основные вторичные структуры в одном и том же расположении с одинаковыми топологическими связями. В версии SCOP 1.75 представлено 1195 складок. Приведены краткие описания каждой из них. Например, складка "подобная глобину" описывается как ядро: 6 спиралей; сложенный лист, частично раскрытый. К какой складке принадлежит домен, определяется визуально, а не с помощью программного обеспечения. Уровни SCOP версии 1.75 следующие: Класс: типы складок, например, бета-листы. Складка: различные формы доменов внутри класса. Суперсемейство: домены в складке группируются в суперсемейства, имеющие как минимум отдаленного общего предка. Семья: домены в суперсемействе группируются в семьи, имеющие более недавнего общего предка. Белковый домен: домены в семьях группируются в белковые домены, которые по сути являются одним и тем же белком. Вид: домены в "белковых доменах" группируются по видам. Домен: часть белка. Для простых белков это может быть весь белок.
The source of protein structures is the Protein Data Bank. The unit of classification of structure in SCOP is the protein domain. What the SCOP authors mean by "domain" is suggested by their statement that small proteins and most medium sized ones have just one domain, and by the observation that human hemoglobin, which has an α2β2 structure, is assigned two SCOP domains, one for the α and one for the β subunit. The shapes of domains are called "folds" in SCOP. Domains belonging to the same fold have the same major secondary structures in the same arrangement with the same topological connections. 1195 folds are given in SCOP version 1.75. Short descriptions of each fold are given. For example, the "globin like" fold is described as core: 6 helices; folded leaf, partly opened. The fold to which a domain belongs is determined by inspection, rather than by software. The levels of SCOP version 1.75 are as follows. Class: Types of folds, e. g., beta sheets. Fold: The different shapes of domains within a class. Superfamily: The domains in a fold are grouped into superfamilies, which have at least a distant common ancestor. Family: The domains in a superfamily are grouped into families, which have a more recent common ancestor. Protein domain: The domains in families are grouped into protein domains, which are essentially the same protein. Species: The domains in "protein domains" are grouped according to species. Domain: part of a protein. For simple proteins, it can be the entire protein.
Складки
Каждый класс содержит ряд различных укладóк. Этот уровень классификации указывает на сходное третичное строение, но не обязательно на эволюционное родство. Например, класс "Все α-белки" содержит более 280 различных укладóк, включая: глобин-подобные (основная часть: 6 спиралей; сложенный лист, частично раскрытый), длинную альфа-шпильку (2 спирали; антипараллельная шпилька, левый винт) и домены докерина типа I (тандемный повтор двух спиральных мотивов кальцийсвязывающего цикла, отличающиеся от EF-руки).
Each class contains a number of distinct folds. This classification level indicates similar tertiary structure, but not necessarily evolutionary relatedness. For example, the "All α proteins" class contains >280 distinct folds, including: Globin like (core: 6 helices; folded leaf, partly opened), long alpha hairpin (2 helices; antiparallel hairpin, left handed twist) and Type I dockerin domains (tandem repeat of two calcium binding loop helix motifs, distinct from the EF hand).
Сверхсемейства
Домены внутри складки далее классифицируются в суперсемьи. Это самая крупная группа белков, для которой структурное сходство достаточно для указания на эволюционное родство и, следовательно, наличие общего предка. Однако считается, что этот предок достаточно далек, поскольку различные члены суперсемейства демонстрируют низкий процент идентичности последовательностей. Например, две суперсемейства "глобиноподобной" складки: суперсемейство глобинов и суперсемейство альфа-спирального ферредоксина (содержит два Fe4S4 кластера).
Domains within a fold are further classified into superfamilies. This is a largest grouping of proteins for which structural similarity is sufficient to indicate evolutionary relatedness and therefore share a common ancestor. However, this ancestor is presumed to be distant, because the different members of a superfamily have low sequence identities. For example, the two superfamilies of the "Globin like" fold are: the Globin superfamily and alpha helical ferredoxin superfamily (contains two Fe4 S4 clusters).
Домены входа PDB
"TaxId" – это идентификатор таксономии и ссылка на браузер таксономии NCBI, предоставляющий дополнительную информацию о виде, к которому принадлежит белок. При нажатии на вид или изоформу открывается список доменов. Например, белок "Гемоглобин, альфа-цепь человека (Homo sapiens)" имеет более 190 решенных структур белка, таких как 2dn3 (в комплексе с cmo) и 2dn1 (в комплексе с гемом, mbn, окси). При нажатии на номера PDB предполагается отображение структуры молекулы, но в настоящее время ссылки не работают (ссылки работают в pre-SCOP).
A "TaxId" is the taxonomy ID number and links to the NCBI taxonomy browser, which provides more information about the species to which the protein belongs. Clicking on a species or isoform brings up a list of domains. For example, the "Hemoglobin, alpha chain from Human (Homo sapiens)" protein has >190 solved protein structures, such as 2dn3 (complexed with cmo), and 2dn1 (complexed with hem, mbn, oxy). Clicking on the PDB numbers is supposed to display the structure of the molecule, but the links are currently broken (links work in pre SCOP).
Сравнение с другими системами классификации
Классификация SCOP в большей степени зависит от ручных решений, чем полуавтоматическая классификация CATH, ее главного конкурента. Для определения того, являются ли определенные белки эволюционно связанными и, следовательно, должны быть отнесены к одному и тому же суперсемейству, или их сходство обусловлено структурными ограничениями и, следовательно, они принадлежат к одной и той же укладке, используется экспертная оценка. Другая база данных, FSSP, генерируется исключительно автоматически (включая регулярные автоматические обновления), но не предоставляет классификации, позволяя пользователю самостоятельно оценивать значимость структурных взаимосвязей на основе попарных сравнений отдельных белковых структур.
SCOP classification is more dependent on manual decisions than the semi automatic classification by CATH, its chief rival. Human expertise is used to decide whether certain proteins are evolutionary related and therefore should be assigned to the same superfamily, or their similarity is a result of structural constraints and therefore they belong to the same fold. Another database, FSSP, is purely automatically generated (including regular automatic updates) but offers no classification, allowing the user to draw their own conclusion as to the significance of structural relationships based on the pairwise comparisons of individual protein structures.
Преемники SCOP
К 2009 году первоначальная база данных SCOP вручную классифицировала 38 000 записей PDB в строго иерархическую структуру. С ускорением темпов публикации структур белков, ограниченная автоматизация классификации не успевала за ростом данных, что привело к неполному набору данных. Расширенная база данных структурной классификации белков (SCOPe) была выпущена в 2012 году с гораздо большей степенью автоматизации той же иерархической системы и полностью обратно совместима с версией SCOP 1.75. В 2014 году в SCOPe была вновь внедрена ручная курация для поддержания точности назначения структур. По состоянию на февраль 2015 года SCOPe 2.05 классифицировал 71 000 из 110 000 общих записей PDB. Прототип SCOP2 представлял собой бета-версию структурной классификации белков и системы классификации, направленной на отражение присущей эволюции структуры белков эволюционной сложности. Поэтому это не простая иерархия, а направленный ациклический граф, соединяющий суперсемейства белков, представляющих структурные и эволюционные взаимосвязи, такие как циклические перестановки, слияние доменов и деградация доменов. Следовательно, домены не разделены строгими фиксированными границами, а определяются их связями с наиболее похожими структурами. Прототип был использован для разработки базы данных SCOP версии 2. Версия SCOP 2, выпущенная в январе 2020 года, содержит 5134 семейства и 2485 суперсемейств по сравнению с 3902 семействами и 1962 суперсемействами в SCOP 1.75. Уровни классификации организуют более 41 000 нередундантных доменов, представляющих более 504 000 белковых структур. База данных эволюционной классификации белковых доменов (ECOD), выпущенная в 2014 году, является расширением SCOP версии 1.75, аналогичным SCOPe. В отличие от совместимого SCOPe, она переименовала иерархию класс-суперсемейство-семейство в группировку архитектура-X-гомология-топология-семейство (A XHTF), где последний уровень в основном определяется Pfam и дополняется кластеризацией HHsearch для неклассифицированных последовательностей. ECOD обладает наилучшим охватом PDB среди всех трех последователей: она охватывает каждую структуру PDB и обновляется раз в две недели. Прямое сопоставление с Pfam оказалось полезным для кураторов Pfam, которые используют категорию уровня гомологии для дополнения своей группировки "кланов".
By 2009, the original SCOP database manually classified 38,000 PDB entries into a strictly hierarchical structure. With the accelerating pace of protein structure publications, the limited automation of classification could not keep up, leading to a non comprehensive dataset. The Structural Classification of Proteins extended (SCOPe) database was released in 2012 with far greater automation of the same hierarchical system and is full backwards compatible with SCOP version 1.75. In 2014, manual curation was reintroduced into SCOPe to maintain accurate structure assignment. As of February 2015, SCOPe 2.05 classified 71,000 of the 110,000 total PDB entries. SCOP2 prototype was a beta version of Structural classification of proteins and classification system that aimed to more the evolutionary complexity inherent in protein structure evolution. It is therefore not a simple hierarchy, but a directed acyclic graph network connecting protein superfamilies representing structural and evolutionary relationships such as circular permutations, domain fusion and domain decay. Consequently, domains are not separated by strict fixed boundaries, but rather are defined by their relationships to the most similar other structures. The prototype was used for the development of the SCOP version 2 database. The SCOP version 2, release January 2020, contains 5134 families and 2485 superfamilies compared to 3902 families and 1962 superfamilies in SCOP 1.75. The classification levels organise more than 41 000 non redundant domains that represent more than 504 000 protein structures. The Evolutionary Classification of Protein Domains (ECOD) database released in 2014 is a similar to SCOPe expansion of SCOP version 1.75. Unlike the compatible SCOPe, it renames the class fold superfamily family hierarchy into an architecture X homology topology family (A XHTF) grouping, with the last level mostly defined by Pfam and supplemented by HHsearch clustering for uncategorized sequences. ECOD has the best PDB coverage of all three successors: it covers every PDB structure, and is updated biweekly. The direct mapping to Pfam has proven useful to Pfam curators who use the homology level category to supplement their "clan" grouping.