Введение

Биологическая база данных белков

infobox biodatabase|title=SCOPe|pmid=24304899|description=SCOP расширенная|url=https://scop.berkeley.edu|author=Naomi K. Fox, Steven E. Brenner, and John Marc Chandonia|version=2.07 (март 2018; 276 231 домен в 87 224 структурах, классифицированных в 4919 семейств) База данных поддерживалась Алексеем Г. Мурзиным и его коллегами в Центре белковой инженерии до его закрытия в 2010 году, а затем – в Лаборатории молекулярной биологии в Кембридже, Англия. Работа над SCOP 1.75 была прекращена в 2014 году. С тех пор команда SCOPe из Калифорнийского университета в Беркли отвечает за обновление базы данных в совместимом формате, используя комбинацию автоматизированных и ручных методов. По состоянию на 2019 год, последняя версия – SCOPe 2.07 (март 2018). Новая база данных структурной классификации белков версии 2 (SCOP2) была выпущена в начале 2020 года. Новое обновление включает в себя улучшенную схему базы данных, новый API и модернизированный веб-интерфейс. Это было самое значительное обновление, сделанное кембриджской группой после SCOP 1.75, и оно основано на достижениях в схеме прототипа SCOP 2.

Иерархическая организация

Источником белковых структур является Банк данных белков. Единицей классификации структуры в SCOP является белковый домен. Что авторы SCOP подразумевают под "доменом", можно понять из их утверждения, что небольшие белки и большинство белков среднего размера имеют только один домен, и из наблюдения, что человеческому гемоглобину, имеющему структуру α2β2, присваиваются два домена SCOP – один для α и один для β субъединицы. Формы доменов в SCOP называются "складками". Домены, принадлежащие к одной и той же складке, имеют одинаковые основные вторичные структуры в одном и том же расположении с одинаковыми топологическими связями. В версии SCOP 1.75 представлено 1195 складок. Приведены краткие описания каждой из них. Например, складка "подобная глобину" описывается как ядро: 6 спиралей; сложенный лист, частично раскрытый. К какой складке принадлежит домен, определяется визуально, а не с помощью программного обеспечения. Уровни SCOP версии 1.75 следующие: Класс: типы складок, например, бета-листы. Складка: различные формы доменов внутри класса. Суперсемейство: домены в складке группируются в суперсемейства, имеющие как минимум отдаленного общего предка. Семья: домены в суперсемействе группируются в семьи, имеющие более недавнего общего предка. Белковый домен: домены в семьях группируются в белковые домены, которые по сути являются одним и тем же белком. Вид: домены в "белковых доменах" группируются по видам. Домен: часть белка. Для простых белков это может быть весь белок.

Складки

Каждый класс содержит ряд различных укладóк. Этот уровень классификации указывает на сходное третичное строение, но не обязательно на эволюционное родство. Например, класс "Все α-белки" содержит более 280 различных укладóк, включая: глобин-подобные (основная часть: 6 спиралей; сложенный лист, частично раскрытый), длинную альфа-шпильку (2 спирали; антипараллельная шпилька, левый винт) и домены докерина типа I (тандемный повтор двух спиральных мотивов кальцийсвязывающего цикла, отличающиеся от EF-руки).

Сверхсемейства

Домены внутри складки далее классифицируются в суперсемьи. Это самая крупная группа белков, для которой структурное сходство достаточно для указания на эволюционное родство и, следовательно, наличие общего предка. Однако считается, что этот предок достаточно далек, поскольку различные члены суперсемейства демонстрируют низкий процент идентичности последовательностей. Например, две суперсемейства "глобиноподобной" складки: суперсемейство глобинов и суперсемейство альфа-спирального ферредоксина (содержит два Fe4S4 кластера).

Домены входа PDB

"TaxId" – это идентификатор таксономии и ссылка на браузер таксономии NCBI, предоставляющий дополнительную информацию о виде, к которому принадлежит белок. При нажатии на вид или изоформу открывается список доменов. Например, белок "Гемоглобин, альфа-цепь человека (Homo sapiens)" имеет более 190 решенных структур белка, таких как 2dn3 (в комплексе с cmo) и 2dn1 (в комплексе с гемом, mbn, окси). При нажатии на номера PDB предполагается отображение структуры молекулы, но в настоящее время ссылки не работают (ссылки работают в pre-SCOP).

Сравнение с другими системами классификации

Классификация SCOP в большей степени зависит от ручных решений, чем полуавтоматическая классификация CATH, ее главного конкурента. Для определения того, являются ли определенные белки эволюционно связанными и, следовательно, должны быть отнесены к одному и тому же суперсемейству, или их сходство обусловлено структурными ограничениями и, следовательно, они принадлежат к одной и той же укладке, используется экспертная оценка. Другая база данных, FSSP, генерируется исключительно автоматически (включая регулярные автоматические обновления), но не предоставляет классификации, позволяя пользователю самостоятельно оценивать значимость структурных взаимосвязей на основе попарных сравнений отдельных белковых структур.

Преемники SCOP

К 2009 году первоначальная база данных SCOP вручную классифицировала 38 000 записей PDB в строго иерархическую структуру. С ускорением темпов публикации структур белков, ограниченная автоматизация классификации не успевала за ростом данных, что привело к неполному набору данных. Расширенная база данных структурной классификации белков (SCOPe) была выпущена в 2012 году с гораздо большей степенью автоматизации той же иерархической системы и полностью обратно совместима с версией SCOP 1.75. В 2014 году в SCOPe была вновь внедрена ручная курация для поддержания точности назначения структур. По состоянию на февраль 2015 года SCOPe 2.05 классифицировал 71 000 из 110 000 общих записей PDB. Прототип SCOP2 представлял собой бета-версию структурной классификации белков и системы классификации, направленной на отражение присущей эволюции структуры белков эволюционной сложности. Поэтому это не простая иерархия, а направленный ациклический граф, соединяющий суперсемейства белков, представляющих структурные и эволюционные взаимосвязи, такие как циклические перестановки, слияние доменов и деградация доменов. Следовательно, домены не разделены строгими фиксированными границами, а определяются их связями с наиболее похожими структурами. Прототип был использован для разработки базы данных SCOP версии 2. Версия SCOP 2, выпущенная в январе 2020 года, содержит 5134 семейства и 2485 суперсемейств по сравнению с 3902 семействами и 1962 суперсемействами в SCOP 1.75. Уровни классификации организуют более 41 000 нередундантных доменов, представляющих более 504 000 белковых структур. База данных эволюционной классификации белковых доменов (ECOD), выпущенная в 2014 году, является расширением SCOP версии 1.75, аналогичным SCOPe. В отличие от совместимого SCOPe, она переименовала иерархию класс-суперсемейство-семейство в группировку архитектура-X-гомология-топология-семейство (A XHTF), где последний уровень в основном определяется Pfam и дополняется кластеризацией HHsearch для неклассифицированных последовательностей. ECOD обладает наилучшим охватом PDB среди всех трех последователей: она охватывает каждую структуру PDB и обновляется раз в две недели. Прямое сопоставление с Pfam оказалось полезным для кураторов Pfam, которые используют категорию уровня гомологии для дополнения своей группировки "кланов".