Введение

В области биоинформатики база данных последовательностей – это тип биологической базы данных, состоящий из обширной коллекции компьютеризированных ("цифровых") последовательностей нуклеиновых кислот, аминокислотных последовательностей или других полимерных последовательностей, хранящихся на компьютере. База данных UniProt является примером базы данных аминокислотных последовательностей. По состоянию на 2013 год она содержала более 40 миллионов последовательностей и продолжает расти экспоненциально. Ранее последовательности публиковались в печатном виде, но с увеличением их количества этот способ хранения стал невозможным.

Поиск

Поиск в базе данных последовательностей включает в себя выявление сходства между геномной или белковой последовательностью и запросом, а также нахождение в базе данных последовательности, наиболее точно соответствующей целевой последовательности (на основе критериев, которые различаются в зависимости от используемого метода поиска). Количество совпадений используется для расчета оценки, определяющей степень сходства между запрошенной последовательностью и последовательностями в базе данных. Основная задача – достижение оптимального баланса между этими двумя критериями.

1950 год

Необходимость в базах данных последовательностей возникла в 1950 году, когда Фредерик Сэнгер опубликовал данные о первичной структуре инсулина. Он был удостоен второй Нобелевской премии за разработку методов секвенирования нуклеиновых кислот, и именно его сравнительный подход стимулировал других биохимиков, работающих с белками, к сбору последовательностей аминокислот, что положило начало созданию молекулярных баз данных.

В 1960 году

В 1965 году Маргарет Дейхофф и ее команда из Национального фонда биомедицинских исследований (NBRF) опубликовали "Атлас последовательностей и структуры белков". Они включили в "Атлас" все известные последовательности белков, включая и неопубликованные данные. Это можно считать первой попыткой создания молекулярной базы данных. Они использовали недавно компьютеризированную (в 1964 году) систему анализа и поиска медицинской литературы (MEDLARS) в Национальных институтах здравоохранения (NIH). Команда использовала компьютеры для хранения данных, но была вынуждена вручную вводить и вычитывать каждую последовательность, что требовало значительных затрат времени и средств.

Настоящее время

У нас сейчас имеется множество баз данных последовательностей, инструменты для их использования и удобный доступ к ним. Одной из крупнейших является GenBank, содержащая более 2 миллиардов последовательностей. Многие аннотации последовательностей основаны не на лабораторных экспериментах, а на результатах поиска сходства с ранее аннотированными последовательностями. Как только последовательность аннотирована на основе сходства с другими и сама помещена в базу данных, она также может стать основой для последующих аннотаций. Это может привести к проблеме транзитивной аннотации, поскольку между конкретной записью в базе данных и фактическими экспериментальными данными, полученными в лаборатории, может произойти несколько таких переносов аннотаций на основе сходства последовательностей. Поэтому при интерпретации данных аннотаций из баз данных последовательностей необходимо проявлять осторожность.

Методы оценки

Большинство современных алгоритмов поиска в базах данных ранжируют результаты выравнивания по значению, которое обычно определяется конкретной системой оценки. Решение этой проблемы заключается в предоставлении разнообразных систем оценки, подходящих для решения конкретной задачи.

Статистика согласования

При использовании алгоритма поиска мы часто получаем упорядоченный список, который нередко лишен биологической значимости.