Кіріспе

Биоинформатика саласында тізбектік деректер қоры – компьютерде сақталған нуклеин қышқылының («цифрлық») тізбектерінің, ақуыз тізбектерінің немесе басқа полимерлік тізбектердің үлкен жиынтығынан тұратын биологиялық деректер қорының бір түрі. UniProt деректер қоры – ақуыз тізбектері деректер қорының мысалы. 2013 жылғы мәлімет бойынша, онда 40 миллионнан астам тізбек бар және олар экспоненциалдық қарқынмен өсуде. Бұрын тізбектер қағаз түрінде жарияланған, бірақ тізбектер саны арта түскенде, бұл сақтау әдісі қолдануға келмейтін болды.

Іздеу

Реттік деректер базасында іздеу – геномдық/белок тізбегі мен сұраныс тізбегі арасындағы ұқсастықтарды табу және деректер базасындағы мақсатты тізбекке "ең жақсы" сәйкес келетін тізбекті анықтауды қамтиды (іздеу әдісіне байланысты критерийлерге сүйене отырып). Табылған сәйкес келулер/нәтижелер саны тізбек сұранысы мен реттілік деректер базасындағы тізбектердің ұқсастығын бағалайтын ұпайды есептеу үшін пайдаланылады. Басты мақсат – екі критерийдің арасында тиімді тепе-теңдік орнату.

1950 жыл

1950 жылы Фредрик Сангер инсулиннің бастапқы құрылымын анықтағанда, тізбектелген дерекқорларға қажеттілік туды. Ол нуклеин қышқылдарын тізбектеу әдістерін жасағаны үшін екінші Нобель сыйлығын алды, ал оның салыстыру тәсілі басқа ақуыз биохимияшыларын аминқышқылдарының тізбектерін жинауға түрткі берді. Осылайша молекулалық дерекқорлардың пайда болуы басталды.

1960 жыл

1965 жылы Маргарет Дейхофф және Ұлттық биомедициналық зерттеулер қорындағы (NBRF) оның тобы "Белоктар тізбегі мен құрылымының атласы" атты еңбегін жариялады. Олар барлық белгілі белок тізбектерін, тіпті жарияланбаған материалдарды да Атласқа енгізді. Бұл молекулалық деректер базасын жасауға жасалған алғашқы тыраныс деп есептелуі мүмкін. Олар Ұлттық денсаулық сақтау институтында (NIH) 1964 жылы жаңадан компьютерлендірілген Медициналық әдебиеттерді талдау және іздеу жүйесін (MEDLARS) пайдаланды. Топ деректерді компьютерде сақтады, бірақ әр тізбекті қолмен теріп, қатесін жоюға тура келді, бұл көп уақыт пен қаржы шығынына әкелді.

Қазіргі күн

Бізде қазір көптеген тізбектердің дерекқоры, оларды пайдалану құралдары және оларға оңай қол жеткізу бар. Олардың ең ірісі – GenBank, онда 2 миллиардтан астам тізбек сақталған. Тізбектерге жасалған көптеген түсіндірмелер зертханалық тәжірибелерге емес, бұрын түсіндірілген тізбектермен тізбектей ұқсастығын іздеу нәтижелеріне негізделген. Тізбек басқа тізбектерге ұқсас екені анықталып, дерекқорға енгізілгеннен кейін, ол болашақ түсіндірмелердің негізі ретінде де пайдаланылуы мүмкін. Бұл транзитивті түсіндірме мәселесіне алып келуі мүмкін, себебі белгілі бір дерекқор жазбасы мен нақты зертханалық тәжірибелік мәліметтер арасында тізбектей ұқсастық арқылы бірнеше түсіндірмелер таралуы мүмкін. Сондықтан тізбектер дерекқорынан алынған түсіндірме мәліметтерін интерпретациялау кезінде сақтық таныту қажет.

Нысанды есептеу әдістері

Қазіргі деректер қорын іздеу алгоритмдерінің көпшілігі сәйкестікті балл арқылы реттейді, бұл әдетте нақты баллдау жүйесі болып табылады. Осы мәселені шешу үшін, нақты проблемаға сай келетін әртүрлі баллдау жүйелерін қолжетімді ету қажет.

Үйлестіру статистикасы

Іздеу алгоритмін қолданғанда, біз көбінесе биологиялық маңызы жоқ реттелген тізім аламыз.