Введение

Биологические базы данных – это собрания данных биологических наук, полученные из научных экспериментов, опубликованной литературы, технологий высокопроизводительного анализа и вычислительных методов. Они содержат информацию из таких областей исследований, как геномика, протеомика, метаболомика, экспрессия генов с помощью микрочипов и филогенетика. Информация, содержащаяся в биологических базах данных, включает в себя функции генов, структуру, локализацию (клеточную и хромосомную), клинические проявления мутаций, а также сходство биологических последовательностей и структур. Биологические базы данных можно классифицировать по типу собираемых данных (см. ниже). В целом, выделяют молекулярные базы данных (для последовательностей, молекул и т.п.), функциональные базы данных (для физиологии, активности ферментов, фенотипов, экологии и т.п.), таксономические базы данных (для видов и других таксономических групп), изображения и другие медиафайлы, а также базы данных образцов (например, музейных коллекций). Базы данных являются важными инструментами, помогающими ученым анализировать и объяснять широкий спектр биологических явлений – от структуры биомолекул и их взаимодействий до метаболизма организмов в целом и понимания эволюции видов. Эти знания способствуют борьбе с заболеваниями, разработке лекарственных препаратов, прогнозированию наследственных заболеваний и выявлению фундаментальных взаимосвязей между видами в истории жизни.

Технические основы и теоретические концепции

Концепции реляционных баз данных из области информатики и концепции информационного поиска в цифровых библиотеках важны для понимания биологических баз данных. Проектирование, разработка и долгосрочное управление биологическими базами данных – ключевая область дисциплины биоинформатики. Содержимое данных включает последовательности генов, текстовые описания, атрибуты, классификации онтологий, ссылки и табличные данные. Эти данные часто описываются как полуструктурированные и могут быть представлены в виде таблиц, записей с разделителями по ключам и XML-структур.

Доступ

Большинство биологических баз данных доступны через веб-сайты, которые организуют данные таким образом, чтобы пользователи могли просматривать их онлайн. Помимо этого, сами данные обычно доступны для скачивания в различных форматах. Биологические данные представлены во множестве форматов, включая текст, последовательности, структуры белков и ссылки. Каждый из этих типов данных можно найти в определенных источниках, например: текстовые форматы предоставляются PubMed и OMIM, данные о последовательностях – GenBank (для ДНК) и UniProt (для белков), а структуры белков – PDB, SCOP и CATH.

Проблемы и вызовы

Биологические знания распределены по бесчисленным базам данных. Это иногда затрудняет обеспечение согласованности информации, например, когда для одного и того же вида используются разные названия или разные форматы данных. Как следствие, обеспечение совместимости является постоянной проблемой при обмене информацией. Например, если база данных последовательностей ДНК хранит последовательность ДНК вместе с названием вида, изменение названия этого вида может разорвать связи с другими базами данных, которые могут использовать другое название. Интегративная биоинформатика – это одно из направлений, стремящееся решить эту проблему, предоставляя унифицированный доступ. Одно из решений заключается в том, как биологические базы данных перекрестно ссылаются на другие базы данных, используя идентификаторы доступа для объединения связанных знаний (например, так, чтобы идентификатор доступа оставался неизменным, даже если название вида меняется). Избыточность – еще одна проблема, поскольку многие базы данных должны хранить одну и ту же информацию, например, базы данных по структуре белков также содержат последовательности белков, которые они охватывают, их последовательности и библиографические данные.

Базы данных образцовых организмов

Для некоторых видов существуют видоспецифические базы данных, в основном для тех, которые часто используются в исследованиях (модельных организмов). Например, EcoCyc – это база данных E. coli. Другие популярные базы данных модельных организмов включают Mouse Genome Informatics для лабораторной мыши Mus musculus, базу данных генома крысы для Rattus, ZFIN для Danio rerio (данио-рерио, или зебра-рыба), PomBase для дрожжей Schizosaccharomyces pombe, FlyBase для Drosophila, WormBase для нематод Caenorhabditis elegans и Caenorhabditis briggsae, и Xenbase для лягушек Xenopus tropicalis и Xenopus laevis.

Базы данных биоразнообразия и видов

Многочисленные базы данных стремятся задокументировать разнообразие жизни на Земле. Ярким примером является Каталог жизни, впервые созданный в 2001 году Species 2000 и Интегрированной таксономической информационной системой (ITIS). Каталог жизни – это совместный проект, направленный на документирование таксономической классификации всех в настоящее время признанных видов в мире. Каталог жизни предоставляет исследователям и лицам, определяющим политику, объединенную и согласованную базу данных для использования в качестве справочного материала. Каталог жизни содержит актуальные наборы данных из других источников, таких как база данных хвойных, ICTV MSL (для вирусов) и LepIndex (для бабочек и мотыльков). По состоянию на май 2022 года Каталог жизни использует данные из 165 баз данных. Операционные расходы Каталога жизни покрываются Глобальным информационным центром по биоразнообразию (GBIF), Иллинойским центром изучения естественной истории, Центром биоразнообразия Naturalis и Смитсоновским институтом. Некоторые биологические базы данных также документируют географическое распространение различных видов. Шуан Дай и др. создали новую многоисточниковую базу данных для документирования пространственного/географического распространения 1371 вида птиц в Китае, поскольку существующие базы данных серьезно не хватало данных о пространственном распространении многих видов. Источники для этой новой базы данных включали книги, научную литературу, данные GPS-слежения и информацию с веб-страниц. Новая база данных отображает таксономию, распространение, информацию о видах и источники данных для каждого вида. После завершения базы данных о пространственном распространении птиц было обнаружено, что 61% известных видов в Китае встречаются в регионах, за пределами ранее известных мест их обитания.

Медицинские базы данных

Медицинские базы данных являются особым случаем биомедицинского ресурса данных и могут включать в себя как библиографии, такие как PubMed, так и базы данных изображений, предназначенные для разработки диагностического программного обеспечения на основе искусственного интеллекта. Например, одна из таких баз данных изображений была разработана для содействия разработке алгоритмов мониторинга заживления ран. Было собрано более 188 многомодальных наборов изображений, полученных в ходе 79 посещений пациентов, включающих фотографии, термограммы и 3D-карты глубины. Контуры ран были отрисованы вручную и добавлены к наборам фотографий. База данных была предоставлена в открытый доступ в виде программы WoundsDB, которую можно загрузить с веб-сайта базы данных хронических ран.

Исследования в области нуклеиновых кислот

Важным ресурсом для поиска биологических баз данных является специальный ежегодный выпуск журнала Nucleic Acids Research (NAR). Выпуск, посвященный базам данных, в журнале NAR находится в свободном доступе и содержит классификацию множества общедоступных биологических баз данных. Сопутствующая база данных, известная как Online Molecular Biology Database Collection, содержит информацию о 1380 онлайн-базах данных. Существуют также другие коллекции баз данных, такие как MetaBase и Bioinformatics Links Collection.