Введение
Отдел баз данных Национальной медицинской библиотеки США
Национальный центр биотехнологической информации (NCBI) является частью Национальной медицинской библиотеки США (NLM), входящей в состав Национального института здравоохранения (NIH). Он утвержден и финансируется правительством Соединенных Штатов. NCBI расположен в городе Бетесда, штат Мэриленд, и был основан в 1988 году на основании законодательства, инициированного конгрессменом США Клодом Пеппером. NCBI содержит ряд баз данных, имеющих отношение к биотехнологии и биомедицине, и является важным ресурсом для биоинформатических инструментов и сервисов. К основным базам данных относятся GenBank для последовательностей ДНК и PubMed – библиографическая база данных по биомедицинской литературе. Среди других баз данных – база данных NCBI Epigenomics. Все эти базы данных доступны онлайн через поисковую систему Entrez. Руководителем NCBI был Дэвид Липман, широко известный и уважаемый специалист в области биоинформатики.
GenBank
NCBI несет ответственность за предоставление доступа к базе данных последовательностей ДНК GenBank с 1992 года. GenBank координирует свою работу с отдельными лабораториями и другими базами данных последовательностей, такими как Европейская лаборатория молекулярной биологии (EMBL) и Японский банк данных ДНК (DDBJ). В NCBI имеются программные инструменты, доступные через веб-браузеры или по протоколу FTP. Например, BLAST – это программа для поиска сходства последовательностей. BLAST способен выполнять сравнение последовательностей с базой данных ДНК GenBank менее чем за 15 секунд.
Книжная полка NCBI
NCBI Bookshelf – это коллекция свободно доступных, скачиваемых онлайн-версий избранных биомедицинских книг. Bookshelf охватывает широкий спектр тем, включая молекулярную биологию, биохимию, клеточную биологию, генетику, микробиологию, патологические состояния с молекулярной и клеточной точки зрения, методы исследований и вирусологию. Некоторые книги представляют собой онлайн-версии ранее опубликованных изданий, а другие, например, Coffee Break, написаны и отредактированы сотрудниками NCBI. Bookshelf дополняет репозиторий аннотаций рецензируемых публикаций Entrez PubMed, предоставляя устоявшиеся взгляды на развивающиеся области исследований и контекст, в котором можно систематизировать множество отдельных, разрозненных результатов научных работ.
Основный инструмент поиска локального выравнивания (BLAST)
BLAST — это алгоритм, используемый для вычисления сходства между биологическими последовательностями, такими как последовательности нуклеотидов ДНК и аминокислот белков. BLAST — мощный инструмент для поиска последовательностей, подобных запросной последовательности, в пределах одного организма или в разных организмах. Он осуществляет поиск запросной последовательности в базах данных и на серверах NCBI и возвращает результаты в браузер пользователя в выбранном формате. Входные последовательности для BLAST обычно представлены в формате FASTA или GenBank, а результаты могут быть предоставлены в различных форматах, таких как HTML, XML и простой текст. HTML является форматом по умолчанию для веб-страницы NCBI. Результаты поиска NCBI BLAST отображаются в графическом виде, включая все найденные совпадения, таблицу с идентификаторами последовательностей совпадений и данными об оценках, а также выравнивания для интересующей последовательности и полученных совпадений с соответствующими значениями BLAST.
Внутри
Система глобального поиска по кросс-базам данных Entrez Global Query используется в NCBI для всех основных баз данных, таких как последовательности нуклеотидов и белков, структуры белков, PubMed, таксономия, полные геномы, OMIM и ряд других. Entrez является системой индексирования и поиска, объединяющей данные из различных источников для биомедицинских исследований. NCBI выпустила первую версию Entrez в 1991 году, включавшую последовательности нуклеотидов из PDB и GenBank, последовательности белков из SWISS-PROT, транслированные GenBank, PIR, PRF, PDB, а также соответствующие аннотации и ссылки из PubMed. Entrez специально разработана для интеграции данных из множества различных источников, баз данных и форматов в единую информационную модель и систему поиска, способную эффективно извлекать релевантные ссылки, последовательности и структуры.
Ген
В NCBI реализована система Gene для характеризации и организации информации о генах. Она является ключевым узлом, объединяющим данные геномных карт, экспрессии, последовательности, функции белков, структуры и гомологии. Каждой записи гена присваивается уникальный идентификатор GeneID, который сохраняется на протяжении всех редакций. Записи генов для известных или предполагаемых генов создаются здесь и идентифицируются по их положению на карте или нуклеотидным последовательностям. Gene обладает рядом преимуществ по сравнению с предшествующей системой LocusLink, включая более тесную интеграцию с другими базами данных NCBI, более широкий таксономический охват и расширенные возможности поиска и извлечения данных, предоставляемые системой Entrez.
Белок
База данных белков содержит текстовые записи для отдельных последовательностей белков, полученные из различных источников, таких как проект NCBI Reference Sequence (RefSeq), GenBank, PDB и UniProtKB/SWISS-Prot. Записи о белках представлены в различных форматах, включая FASTA и XML, и связаны с другими ресурсами NCBI. База данных предоставляет пользователям релевантные данные, такие как гены, последовательности ДНК/РНК, биологические пути, данные об экспрессии и вариациях, а также научную литературу. Она также предоставляет предварительно определенные наборы сходных и идентичных белков для каждой последовательности, рассчитанные с помощью BLAST. Структурная база данных NCBI содержит наборы 3D-координат для экспериментально определенных структур из PDB, импортированных NCBI. База данных консервативных доменов (CDD) белка содержит профили последовательностей, характеризующие высококонсервативные домены в белковых последовательностях, а также записи из внешних источников, таких как SMART и Pfam. Существует также база данных белковых кластеров, содержащая наборы последовательностей белков, сгруппированных на основе максимальных выравниваний между отдельными последовательностями, рассчитанных с помощью BLAST.
База данных Pubchem
База данных PubChem Национального центра биотехнологической информации (NCBI) — это общедоступный ресурс для молекул и их активности в биологических тестах. Поиск в PubChem и доступ к данным осуществляется через систему поиска Entrez.