Введение

Центр исследований

Европейский институт биоинформатики (EMBL EBI) — это межправительственная организация (IGO), входящая в состав Европейской молекулярно-биологической лаборатории (EMBL) и специализирующаяся на исследованиях и услугах в области биоинформатики. Он расположен на территории Wellcome Genome Campus в Хинкстоне, недалеко от Кембриджа, и насчитывает более 600 сотрудников, эквивалентных полной ставке (FTE). Руководители института, такие как Рольф Апвейлер, Алекс Бейтман, Эван Бирни и Гай Кокран, советник Научного консультативного совета Национального центра геномных данных, входят в международную исследовательскую сеть Центра больших данных (BIG Data Center) при Пекинском институте геномики. Кроме того, EMBL EBI организует учебные программы, обучающие ученых основам работы с биологическими данными и продвигающие широкий спектр биоинформатических инструментов, доступных для их исследований, как разработанных в EMBL EBI, так и сторонними.

Биоинформатические услуги

Одной из задач EMBL EBI является индексация и поддержка биологических данных в ряде баз данных, включая Ensembl (содержащую данные о последовательности генома), UniProt (базу данных последовательностей и аннотаций белков) и Protein Data Bank (базу данных третичной структуры белков и нуклеиновых кислот). Предоставляется широкий спектр онлайн-сервисов и инструментов, таких как Basic Local Alignment Search Tool (BLAST) или инструмент выравнивания последовательностей Clustal Omega, для дальнейшего анализа данных.

Взрыв

BLAST – это алгоритм для сравнения первичной структуры биомакромолекул, чаще всего нуклеотидных последовательностей ДНК/РНК и аминокислотных последовательностей белков, хранящихся в биоинформатических базах данных, с запросной последовательностью. Алгоритм использует оценку доступных последовательностей по отношению к запросу с помощью матрицы оценок, такой как BLOSUM 62. Последовательности с наивысшими баллами соответствуют наиболее близким родственникам запроса с точки зрения функционального и эволюционного сходства. Для поиска в базе данных с помощью BLAST требуется, чтобы входные данные были представлены в правильном формате (например, FASTA, GenBank, PIR или EMBL). Пользователи могут также указать конкретные базы данных для поиска, выбрать используемые матрицы оценок и другие параметры перед запуском инструмента. Наилучшие результаты в BLAST упорядочены в соответствии с рассчитанным E-value (вероятность обнаружения в базе данных случайного совпадения с аналогичным или более высоким баллом).

Клустальная Омега

Clustal Omega – это инструмент для множественного выравнивания последовательностей (MSA), позволяющий найти оптимальное выравнивание от трех до 4000 входных последовательностей ДНК и белков. Алгоритм Clustal Omega использует две профильные скрытые марковские модели (HMM) для получения окончательного выравнивания последовательностей. Результат работы Clustal Omega может быть визуализирован в виде направляющего дерева (отображающего филогенетические взаимосвязи наиболее похожих последовательностей) или упорядочен по степени взаимного сходства между запрошенными последовательностями. Главное преимущество Clustal Omega перед другими инструментами MSA (Muscle, ProbCons) – его эффективность при сохранении высокой точности результатов.

Ансамбль

Ensembl – это база данных, организованная вокруг геномных данных и поддерживаемая проектом Ensembl. Проект Ensembl занимается непрерывной аннотацией геномов модельных организмов и предоставляет исследователям исчерпывающий ресурс биологической информации по каждому конкретному геному. Аннотация хранимых эталонных геномов выполняется автоматически на основе анализа последовательностей. Ensembl включает в себя общедоступную базу данных геномов, к которой можно получить доступ через веб-браузер. Взаимодействие с хранящимися данными осуществляется посредством графического интерфейса, поддерживающего отображение информации на различных уровнях детализации – от кариотипа и отдельных генов до нуклеотидных последовательностей. Изначально основное внимание уделялось геномам позвоночных животных, но с 2009 года Ensembl, в рамках сестринского проекта Ensembl Genomes, предоставляет аннотированные данные о геномах растений, грибов, беспозвоночных, бактерий и других видов. В совокупности базы данных проекта Ensembl содержат информацию о более чем 50 000 эталонных геномах.

ПДБ

PDB — это база данных трехмерных структур биологических макромолекул, таких как белки и нуклеиновые кислоты. Данные обычно получают методами рентгеновской кристаллографии или ЯМР-спектроскопии и предоставляются структурными биологами по всему миру вручную через организации-члены PDB – PDBe, RCSB, PDBj и BMRB. Доступ к базе данных возможен через веб-сайты ее участников, включая PDBe (размещенный в EMBL-EBI). Являясь членом консорциума wwPDB, PDBe способствует совместной задаче архивирования и поддержания данных о макромолекулярной структуре.

UniProt

UniProt — это онлайн-репозиторий данных о последовательности и аннотации белков, представленных в базах данных UniProt Knowledgebase (UniProt KB), UniProt Reference Clusters (UniRef) и UniProt Archive (UniParc). Изначально UniProt возник как отдельные проекты EMBL EBI, Швейцарского института биоинформатики (SIB) (совместно поддерживающих Swiss-Prot и TrEMBL) и Protein Information Resource (PIR) (содержащего базу данных последовательностей белков). Рост объемов глобальных данных о белках привел к их сотрудничеству и созданию UniProt в 2002 году. Каждая белковая запись в UniProt имеет уникальный идентификатор UniProt. Данные аннотации для каждой записи организованы в логические разделы (например, функция белка, структура, экспрессия, последовательность или соответствующие публикации), обеспечивая комплексный обзор интересующего белка. Также предоставляются ссылки на внешние базы данных и первоначальные источники данных. Помимо стандартного поиска по названию или идентификатору белка, веб-сайт UniProt содержит инструменты для поиска BLAST, выравнивания последовательностей и поиска белков, содержащих определенные пептиды.