Биоақпараттық тізбектер базасы: құрылымы, дамуы және қолданылуы
Sequence database
Биоинформатикадағы тізбектер базасы – ДНК, белок тізбектерін сақтайтын цифрлық дерекқор. UniProt базасы 40 млн-нан астам тізбек сақтайды, іздеу мүмкіндігі бар.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Биоинформатика саласында тізбектік деректер қоры – компьютерде сақталған нуклеин қышқылының («цифрлық») тізбектерінің, ақуыз тізбектерінің немесе басқа полимерлік тізбектердің үлкен жиынтығынан тұратын биологиялық деректер қорының бір түрі. UniProt деректер қоры – ақуыз тізбектері деректер қорының мысалы. 2013 жылғы мәлімет бойынша, онда 40 миллионнан астам тізбек бар және олар экспоненциалдық қарқынмен өсуде. Бұрын тізбектер қағаз түрінде жарияланған, бірақ тізбектер саны арта түскенде, бұл сақтау әдісі қолдануға келмейтін болды.
In the field of bioinformatics, a sequence database is a type of biological database that is composed of a large collection of computerized ("digital") nucleic acid sequences, protein sequences, or other polymer sequences stored on a computer. The UniProt database is an example of a protein sequence database. As of 2013 it contained over 40 million sequences and is growing at an exponential rate. Historically, sequences were published in paper form, but as the number of sequences grew, this storage method became unsustainable.
Іздеу
Реттік деректер базасында іздеу – геномдық/белок тізбегі мен сұраныс тізбегі арасындағы ұқсастықтарды табу және деректер базасындағы мақсатты тізбекке "ең жақсы" сәйкес келетін тізбекті анықтауды қамтиды (іздеу әдісіне байланысты критерийлерге сүйене отырып). Табылған сәйкес келулер/нәтижелер саны тізбек сұранысы мен реттілік деректер базасындағы тізбектердің ұқсастығын бағалайтын ұпайды есептеу үшін пайдаланылады. Басты мақсат – екі критерийдің арасында тиімді тепе-теңдік орнату.
Searching in a sequence database involves looking for similarities between a genomic/protein sequence and a query string and, finding the sequence in the database that "best" matches the target sequence (based on criteria which vary depending on the search method). The number of matches/hits is used to formulate a score that determines the similarity between the sequence query and the sequences in the sequence database. The main goal is to have a good balance between the two criteria.
1950 жыл
1950 жылы Фредрик Сангер инсулиннің бастапқы құрылымын анықтағанда, тізбектелген дерекқорларға қажеттілік туды. Ол нуклеин қышқылдарын тізбектеу әдістерін жасағаны үшін екінші Нобель сыйлығын алды, ал оның салыстыру тәсілі басқа ақуыз биохимияшыларын аминқышқылдарының тізбектерін жинауға түрткі берді. Осылайша молекулалық дерекқорлардың пайда болуы басталды.
The need for sequence databases originated in 1950 when Fredrick Sanger reported the primary structure of insulin. He won his second Nobel Prize for creating methods for sequencing nucleic acids, and his comparative approach is what sparked other protein biochemists to begin collecting amino acid sequences. Thus marking the beginning of molecular databases.
1960 жыл
1965 жылы Маргарет Дейхофф және Ұлттық биомедициналық зерттеулер қорындағы (NBRF) оның тобы "Белоктар тізбегі мен құрылымының атласы" атты еңбегін жариялады. Олар барлық белгілі белок тізбектерін, тіпті жарияланбаған материалдарды да Атласқа енгізді. Бұл молекулалық деректер базасын жасауға жасалған алғашқы тыраныс деп есептелуі мүмкін. Олар Ұлттық денсаулық сақтау институтында (NIH) 1964 жылы жаңадан компьютерлендірілген Медициналық әдебиеттерді талдау және іздеу жүйесін (MEDLARS) пайдаланды. Топ деректерді компьютерде сақтады, бірақ әр тізбекті қолмен теріп, қатесін жоюға тура келді, бұл көп уақыт пен қаржы шығынына әкелді.
In 1965 Margaret Dayhoff and her team at the National Biomedical Research Foundation (NBRF) published "The Atlas of Protein Sequence and Structure". They put all know protein sequences in the Atlas, even unpublished material. This can be seen as the first attempt to create a molecular database. They made use of the newly computerized (1964) Medical Literature Analysis and Retrieval System (MEDLARS) at the National Institutes of Health (NIH). The team used computers to store the data but had to manually type and proofread each sequence, which had a high cost in time and money.
Қазіргі күн
Бізде қазір көптеген тізбектердің дерекқоры, оларды пайдалану құралдары және оларға оңай қол жеткізу бар. Олардың ең ірісі – GenBank, онда 2 миллиардтан астам тізбек сақталған. Тізбектерге жасалған көптеген түсіндірмелер зертханалық тәжірибелерге емес, бұрын түсіндірілген тізбектермен тізбектей ұқсастығын іздеу нәтижелеріне негізделген. Тізбек басқа тізбектерге ұқсас екені анықталып, дерекқорға енгізілгеннен кейін, ол болашақ түсіндірмелердің негізі ретінде де пайдаланылуы мүмкін. Бұл транзитивті түсіндірме мәселесіне алып келуі мүмкін, себебі белгілі бір дерекқор жазбасы мен нақты зертханалық тәжірибелік мәліметтер арасында тізбектей ұқсастық арқылы бірнеше түсіндірмелер таралуы мүмкін. Сондықтан тізбектер дерекқорынан алынған түсіндірме мәліметтерін интерпретациялау кезінде сақтық таныту қажет.
We now have many sequence databases, tools for using them and easy access to them. One of the largest being GenBank which contains over 2 billion sequences. Many annotations of the sequences are based not on laboratory experiments, but on the results of sequence similarity searches for previously annotated sequences. Once a sequence has been annotated based on similarity to others, and itself deposited in the database, it can also become the basis for future annotations. This can lead to a transitive annotation problem because there may be several such annotation transfers by sequence similarity between a particular database record and actual wet lab experimental information. Therefore, care must be taken when interpreting the annotation data from sequence databases.
Нысанды есептеу әдістері
Қазіргі деректер қорын іздеу алгоритмдерінің көпшілігі сәйкестікті балл арқылы реттейді, бұл әдетте нақты баллдау жүйесі болып табылады. Осы мәселені шешу үшін, нақты проблемаға сай келетін әртүрлі баллдау жүйелерін қолжетімді ету қажет.
Most of the current database search algorithms rank alignment by a score, which is usually a particular scoring system. The solution towards solving this issue is found by making a variety of scoring systems available to suit to the specific problem.
Үйлестіру статистикасы
Іздеу алгоритмін қолданғанда, біз көбінесе биологиялық маңызы жоқ реттелген тізім аламыз.
When using a searching algorithm we often produce an ordered list which can often carry a lack of biological significance.