Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
В области биоинформатики база данных последовательностей – это тип биологической базы данных, состоящий из обширной коллекции компьютеризированных ("цифровых") последовательностей нуклеиновых кислот, аминокислотных последовательностей или других полимерных последовательностей, хранящихся на компьютере. База данных UniProt является примером базы данных аминокислотных последовательностей. По состоянию на 2013 год она содержала более 40 миллионов последовательностей и продолжает расти экспоненциально. Ранее последовательности публиковались в печатном виде, но с увеличением их количества этот способ хранения стал невозможным.
In the field of bioinformatics, a sequence database is a type of biological database that is composed of a large collection of computerized ("digital") nucleic acid sequences, protein sequences, or other polymer sequences stored on a computer. The UniProt database is an example of a protein sequence database. As of 2013 it contained over 40 million sequences and is growing at an exponential rate. Historically, sequences were published in paper form, but as the number of sequences grew, this storage method became unsustainable.
Поиск
Поиск в базе данных последовательностей включает в себя выявление сходства между геномной или белковой последовательностью и запросом, а также нахождение в базе данных последовательности, наиболее точно соответствующей целевой последовательности (на основе критериев, которые различаются в зависимости от используемого метода поиска). Количество совпадений используется для расчета оценки, определяющей степень сходства между запрошенной последовательностью и последовательностями в базе данных. Основная задача – достижение оптимального баланса между этими двумя критериями.
Searching in a sequence database involves looking for similarities between a genomic/protein sequence and a query string and, finding the sequence in the database that "best" matches the target sequence (based on criteria which vary depending on the search method). The number of matches/hits is used to formulate a score that determines the similarity between the sequence query and the sequences in the sequence database. The main goal is to have a good balance between the two criteria.
1950 год
Необходимость в базах данных последовательностей возникла в 1950 году, когда Фредерик Сэнгер опубликовал данные о первичной структуре инсулина. Он был удостоен второй Нобелевской премии за разработку методов секвенирования нуклеиновых кислот, и именно его сравнительный подход стимулировал других биохимиков, работающих с белками, к сбору последовательностей аминокислот, что положило начало созданию молекулярных баз данных.
The need for sequence databases originated in 1950 when Fredrick Sanger reported the primary structure of insulin. He won his second Nobel Prize for creating methods for sequencing nucleic acids, and his comparative approach is what sparked other protein biochemists to begin collecting amino acid sequences. Thus marking the beginning of molecular databases.
В 1960 году
В 1965 году Маргарет Дейхофф и ее команда из Национального фонда биомедицинских исследований (NBRF) опубликовали "Атлас последовательностей и структуры белков". Они включили в "Атлас" все известные последовательности белков, включая и неопубликованные данные. Это можно считать первой попыткой создания молекулярной базы данных. Они использовали недавно компьютеризированную (в 1964 году) систему анализа и поиска медицинской литературы (MEDLARS) в Национальных институтах здравоохранения (NIH). Команда использовала компьютеры для хранения данных, но была вынуждена вручную вводить и вычитывать каждую последовательность, что требовало значительных затрат времени и средств.
In 1965 Margaret Dayhoff and her team at the National Biomedical Research Foundation (NBRF) published "The Atlas of Protein Sequence and Structure". They put all know protein sequences in the Atlas, even unpublished material. This can be seen as the first attempt to create a molecular database. They made use of the newly computerized (1964) Medical Literature Analysis and Retrieval System (MEDLARS) at the National Institutes of Health (NIH). The team used computers to store the data but had to manually type and proofread each sequence, which had a high cost in time and money.
Настоящее время
У нас сейчас имеется множество баз данных последовательностей, инструменты для их использования и удобный доступ к ним. Одной из крупнейших является GenBank, содержащая более 2 миллиардов последовательностей. Многие аннотации последовательностей основаны не на лабораторных экспериментах, а на результатах поиска сходства с ранее аннотированными последовательностями. Как только последовательность аннотирована на основе сходства с другими и сама помещена в базу данных, она также может стать основой для последующих аннотаций. Это может привести к проблеме транзитивной аннотации, поскольку между конкретной записью в базе данных и фактическими экспериментальными данными, полученными в лаборатории, может произойти несколько таких переносов аннотаций на основе сходства последовательностей. Поэтому при интерпретации данных аннотаций из баз данных последовательностей необходимо проявлять осторожность.
We now have many sequence databases, tools for using them and easy access to them. One of the largest being GenBank which contains over 2 billion sequences. Many annotations of the sequences are based not on laboratory experiments, but on the results of sequence similarity searches for previously annotated sequences. Once a sequence has been annotated based on similarity to others, and itself deposited in the database, it can also become the basis for future annotations. This can lead to a transitive annotation problem because there may be several such annotation transfers by sequence similarity between a particular database record and actual wet lab experimental information. Therefore, care must be taken when interpreting the annotation data from sequence databases.
Методы оценки
Большинство современных алгоритмов поиска в базах данных ранжируют результаты выравнивания по значению, которое обычно определяется конкретной системой оценки. Решение этой проблемы заключается в предоставлении разнообразных систем оценки, подходящих для решения конкретной задачи.
Most of the current database search algorithms rank alignment by a score, which is usually a particular scoring system. The solution towards solving this issue is found by making a variety of scoring systems available to suit to the specific problem.
Статистика согласования
При использовании алгоритма поиска мы часто получаем упорядоченный список, который нередко лишен биологической значимости.
When using a searching algorithm we often produce an ordered list which can often carry a lack of biological significance.