Кіріспе
Биоинформатикада молекулалық тізбектердегі сайыс келетін орындарды анықтау процесі. Биоинформатикада тізбектерді үйлестіру – ДНК, РНК немесе белок тізбектерін салыстыру арқылы олардың ұқсас аймақтарын табудың бір жолы. Бұл ұқсастық тізбектер арасындағы функционалдық, құрылымдық немесе эволюциялық байланыстардың нәтижесі болуы мүмкін. Нуклеотидтер немесе аминқышқылдары тізбегі әдетте матрицадағы қатарлар түрінде көрсетіледі. Бірдей немесе ұқсас символдарды тікелей бағандарға келтіру үшін тізбектер арасына бос орындар енгізіледі. Тізбектерді үйлестіру биологиялық емес тізбектер үшін де қолданылады, мысалы, табиғи тілдегі жолдар арасындағы қашықтықты есептеу немесе қаржылық деректерді көрсету үшін.
In bioinformatics, a sequence alignment is a way of arranging the sequences of DNA, RNA, or protein to identify regions of similarity that may be a consequence of functional, structural, or evolutionary relationships between the sequences. Aligned sequences of nucleotide or amino acid residues are typically represented as rows within a matrix. Gaps are inserted between the residues so that identical or similar characters are aligned in successive columns. Sequence alignments are also used for non biological sequences such as calculating the distance cost between strings in a natural language, or to display financial data.
Интерпретация
Егер бірлестіктегі екі тізбектің ортақ ата-тегі болса, қарама-қайшылықтарды нүктелік мутациялар, ал олқылықтарды олар бір-бірінен бөлінгеннен бергі уақытта бір немесе екі тарапта енгізілген инделдер (яғни, қосылу немесе жою мутациялары) ретінде қарастыруға болады. Ақуыз тізбектерінің бірлестірілуінде, тізбектегі нақты бір позицияны иеленетін аминқышқылдарының ұқсастық деңгейі, сол аймақтың немесе тізбек мотивінің тараптар арасында қаншалықты сақталғанын шамамен бағалауға мүмкіндік береді. Тізбектің нақты бір аймағында алмастырулардың болмауы немесе тек өте консервативті алмастырулардың болуы (яғни, жанама тізбектері ұқсас биохимиялық қасиеттері бар аминқышқылдарының алмастырылуы) осы аймақтың құрылымдық немесе функционалдық маңызы бар екенін көрсетеді. ДНК және РНК нуклеотидтерінің негіздері аминқышқылдарына қарағанда бір-біріне көбірек ұқсас болғанымен, негіз жұптарының сақталуы ұқсас функционалдық немесе құрылымдық рөлді білдіруі мүмкін.
Түзеткіш әдістері
Өте қысқа немесе өте ұқсас тізбектерді қолмен туралауға болады. Дегенмен, ең қызықты мәселелер ұзын, өте өзгермелі немесе өте көп санды тізбектерді туралауды талап етеді, оларды тек адам күшімен туралау мүмкін емес. Оның орнына, адам білімі жоғары сапалы тізбектерді туралау үшін алгоритмдер құруда және кейде алгоритмдік тұрғыдан көрсету қиын үлгілерді бейнелеу үшін соңғы нәтижелерді түзетуде қолданылады (әсіресе нуклеотидтік тізбектер үшін). Тізбектерді туралаудың есептеу әдістері әдетте екі санатқа бөлінеді: жаһандық туралау және жергілікті туралау. Жаһандық туралауды есептеу – барлық сұраныс тізбектерінің толық ұзындығын қамтитын туралауды «күштеп» жүзеге асыратын жаһандық оңтайландырудың бір түрі. Керісінше, жергілікті туралау ұзақ тізбектердегі ұқсас аймақтарды анықтайды, олар көбінесе жалпы алғанда өте әртүрлі болады. Жергілікті туралау көбінесе артықшылыққа ие, бірақ ұқсас аймақтарды анықтаудың қосымша қиындығы болғандықтан есептеу қиын болуы мүмкін. Тізбектерді туралау мәселесіне әртүрлі есептеу алгоритмдері қолданылған. Оларға динамикалық бағдарламалау сияқты баяу, бірақ формальды түрде дұрыс әдістер жатады. Сондай-ақ, үлкен деректер базасын іздеуге арналған тиімді, эвристикалық алгоритмдер немесе ықтималдық әдістер де кіреді, олар ең жақсы сәйкестіктерді табуға кепілдік бермейді.
Өкілдіктер
Туралаулар графикалық және мәтіндік форматта кеңінен бейнеленеді. Тізбек туралауларының шамажарқылы барлық түрлерінде тізбектер қатарларға жазылады, осылайша тураланған қалдықтар тізбектеп келген бағандарда орналасады. Мәтіндік форматтарда, бірдей немесе ұқсас символдарды қамтитын тураланған бағандар сақтау символдарының жүйесімен көрсетіледі. Жоғарыдағы суретте көрсетілгендей, екі бағанның сәйкестігін көрсету үшін жұлдызша немесе тік сызық символы қолданылады; басқа, сирек қолданылатын символдарға консервативті алмастырулар үшін қос нүкте және жартылай консервативті алмастырулар үшін нүкте кіреді. Көптеген тізбек визуализациялау бағдарламалары жеке тізбек элементтерінің қасиеттері туралы ақпаратты көрсету үшін түс қолданады; ДНК және РНК тізбектерінде бұл әр нуклеотидке жеке түс тағайындаумен тең. Жоғарыдағы суретте көрсетілгендей, ақуыз туралауларында түс көбінесе берілген аминқышқылының алмасуының сақталуын бағалауға көмектесетін аминқышқылының қасиеттерін көрсету үшін қолданылады. Көптеген тізбектер үшін әр бағандағы соңғы қатар көбінесе туралау арқылы анықталған консенсус тізбегі болып табылады; консенсус тізбегі жиі графикалық форматта, әр нуклеотидтің немесе аминқышқылының әрпінің мөлшері оның сақталу дәрежесіне сәйкес келетін тізбек логотипімен бейнеленеді. Тізбек туралауларын мәтіндік файл форматтарының алуан түрінде сақтауға болады, олардың көпшілігі бастапқыда нақты туралау бағдарламасымен немесе іске асырылуымен бірге әзірленген. Көптеген веб-құралдары FASTA форматы және GenBank форматы сияқты кіріс және шығыс форматтарының шектеулі санын ұсынады және шығыс деректерін оңай өңдеуге болмайды. READSEQ және EMBOSS сияқты графикалық және/немесе командалық жол интерфейстерін ұсынатын бірнеше түрлендіру бағдарламалары бар. Сондай-ақ, бұл түрлендіру функционалдығын қамтамасыз ететін бірнеше бағдарламалау пакеттері бар, мысалы BioPython, BioRuby және BioPerl. SAM/BAM файлдары CIGAR (Compact Idiosyncratic Gapped Alignment Report) тізбек пішімін қолданады, оқиғалар тізбегін (мысалы, сәйкес/сәйкессіздік, енгізулер, жоюлар) кодтау арқылы сілтемеге тізбекті туралауды көрсету үшін.
Жаһандық және жергілікті сәйкестендірулер
Жаһандық сәйкестендірулер, әрбір реттіліктегі әрбір қалдықты сәйкестендіруге тырысатын, сұраныс жиынтығындағы реттіліктер ұқсас және шамамен бірдей өлшемде болғанда ең пайдалы. (Бұл жаһандық сәйкестендірулер бос орындардан басталып немесе аяқталуы мүмкін дегенді білдірмейді.) Жалпы жаһандық сәйкестендіру әдісі – динамикалық бағдарламалауға негізделген Нидлман-Вунш алгоритмі. Жергілікті сәйкестендірулер үлкен реттілік контекстінде ұқсастық аймақтары немесе ұқсас реттілік мотивтері бар деп күдіктелген, ұқсамайтын реттіліктер үшін көбірек пайдалы. Смит-Уотерман алгоритмі – бұл бірдей динамикалық бағдарламалау схемасына негізделген, бірақ кез келген жерде бастау және аяқтау үшін қосымша мүмкіндіктері бар жалпы жергілікті сәйкестендіру әдісі. Жарым-жаһандық сәйкестендірудің пайдалы болатын тағы бір жағдайы – бір реттілік қысқа (мысалы, гендік реттілік), ал екіншісі өте ұзын (мысалы, хромосомалық реттілік) болғанда. Мұндай жағдайда, қысқа реттілік жаһандық (толық) сәйкестендірілуі керек, ал ұзын реттілік үшін тек жергілікті (ішінара) сәйкестендіру қажет. Генетикалық деректердің жылдам өсуі қазіргі ДНҚ реттіліктерін сәйкестендіру алгоритмдерінің жылдамдығына үлкен қиындық тудырады. ДНҚ вариацияларын анықтау үшін тиімді және дәл әдіс қажеттігі, нақты уақытта параллель өңдеудің жаңа тәсілдерін талап етеді. Оптикалық есептеу тәсілдері қазіргі электрлік жүзеге асыруларға перспективті балама ретінде ұсынылған, бірақ олардың қолданылуы әлі тексеруді қажет етеді.
Нүктелік матрицалық әдістер
Жеке реттілік аймақтары үшін сәйкестендірулер отбасын тікелей тудыратын нүктелік матрица тәсілі сапалық және түсінік жағынан қарапайым болғанымен, үлкен көлемде талдау үшін көп уақытты қажет етеді. Шудың болмауы жағдайында, нүктелік матрица графигінен енгізулер, жоюлар, қайталаулар немесе инверттік қайталаулар сияқты белгілі бір реттілік ерекшеліктерін көзбен анықтау оңай болады. Нүктелік матрица графигін құру үшін екі реттілік екі өлшемді матрицаның жоғарғы қатары мен сол жақ бағанына жазылады және сәйкес бағандардағы символдар сәйкес келген кез келген нүктеге нүкте қойылады – бұл әдеттегі қайталану графигі. Кейбір нұсқалары консервативті алмастыруларды ескеру үшін екі символдың ұқсастық деңгейіне байланысты нүктенің мөлшерін немесе қарқындылығын өзгертеді. Өте жақын байланысты реттіліктердің нүктелік графиктері матрицаның басты диагоналі бойымен бір сызық түрінде көрінеді. Ақпаратты көрсету әдісі ретінде нүктелік графиктердің кемшіліктеріне шу, айқындығының жетіспеуі, түсініксіздік, сәйкестік туралы жиынтық статистиканы және екі реттіліктегі сәйкестік позицияларын алудағы қиындықтар жатады. Сонымен қатар, сәйкес деректер диагональ бойынша жиі қайталанады, ал сызбаның көп бөлігі бос орынмен немесе шумен толтырылады, сондай-ақ нүктелік графиктер екі реттілікпен ғана шектеледі. Бұл шектеулер Миропиаттың сәйкестендіру диаграммаларына қатысты емес, бірақ олардың өзіндік кемшіліктері бар. Нүктелік графиктерді бір реттіліктегі қайталауды бағалау үшін де қолдануға болады. Реттік өзіне қарсы салыстырылғанда, маңызды ұқсастықтарды бөлісетін аймақтар басты диагоналдан тыс сызықтар түрінде көрінеді. Бұл әсер ақуыз бірнеше ұқсас құрылымдық домендерден тұрғанда байқалады.
Динамикалық бағдарламалау
Динамикалық бағдарламалау әдісі Needleman-Wunsch алгоритмі арқылы жаһандық сәйкестендірулерді және Smith-Waterman алгоритмі арқылы жергілікті сәйкестендірулерді жасауға қолданылады. Әдеттегі қолданыста ақуыз сәйкестендірулері аминокислоталардың сәйкес келуіне немесе сәйкес келмеуіне балл беру үшін алмастыру матрицасын пайдаланады, ал бір тізбектегі аминокислотаны екіншісіндегі бос орынға сәйкес келтіру үшін олқылық жазасы қолданылады. ДНҚ және РНК сәйкестендірулері балл беру матрицасын қолдана алады, бірақ практикада көбінесе жай ғана оң сәйкестік балл, теріс сәйкессіздік балл және теріс саңылау жазасы беріледі. (Стандартты динамикалық бағдарламалауда әр аминқышқыл позициясының бағасы оның көршілеріне тәуелсіз болғандықтан, негіздердің үйіліп қою әсерлері ескерілмейді. Дегенмен, алгоритмді өзгерту арқылы мұндай әсерлерді есепке алуға болады.) Стандартты сызықтық саңылау құнына кеңейтім ретінде, саңылау ашу және саңылау ұзарту үшін екі түрлі саңылау жазасын қолдану жиі кездеседі. Әдетте, саңылау ашу жазасы саңылау ұзарту жазасынан әлдеқайда үлкен болады, мысалы, саңылау ашу үшін 10, ал саңылау ұзарту үшін 2. Осылайша, сәйкестендірудегі саңылаулар саны көбінесе азаяды және қалдықтар мен саңылаулар біріктіріліп сақталады, бұл көбінесе биологиялық тұрғыдан дұрыс. Gotoh алгоритмі үш матрицаны пайдалану арқылы аффиндік саңылау құнын іске асырады. Динамикалық бағдарламалау нуклеотидтік тізбектерді ақуыз тізбектерімен сәйкестендіруде пайдалы болуы мүмкін, бұл міндет фреймшифт мутацияларын (әдетте, енгізілімдер немесе жойылулар) ескеру қажеттілігімен қиындатылады. Фреймді іздеу әдісі сұраныс нуклеотидтік тізбегі мен ақуыз тізбектерінің іздеу жиынтығы арасында жаһандық немесе жергілікті жұптық сәйкестендірулер сериясын жасайды немесе керісінше. Кез келген нуклеотид санымен ығысқан фреймшифттерді бағалау мүмкіндігі әдісті көптеген инделдері бар тізбектер үшін пайдалы етеді, оларды тиімді эвристикалық әдістермен сәйкестендіру өте қиын болуы мүмкін. Іс жүзінде, бұл әдіс үлкен есептеу қуатын немесе динамикалық бағдарламалауға арналған архитектурасы бар жүйені қажет етеді. BLAST және EMBOSS жиынтықтары аударылған сәйкестендірулерді жасау үшін негізгі құралдарды ұсынады (бірақ бұл тәсілдердің кейбіреулері құралдардың тізбектерді іздеу мүмкіндіктерінің жанама әсерлерін пайдаланады). GeneWise сияқты ашық бастапқы кодты бағдарламалық жасақтамадан көбірек жалпылама әдістер қол жетімді. Динамикалық бағдарламалау әдісі белгілі бір бағалау функциясын ескере отырып, оңтайлы сәйкестендіруді табуға кепілдік береді; алайда, жақсы бағалау функциясын анықтау көбінесе эмпирикалық, теориялық емес мәселе болып табылады. Динамикалық бағдарламалау екі тізбектен көп тізбектерге де қолданылуы мүмкін болса да, ол көптеген немесе өте ұзын тізбектер үшін тым баяу.
Word әдістері
Word әдістері, сондай-ақ k-түптік әдістер деп те аталады, олар ең оңтайлы сәйкестендіру шешімін табуға кепілдік бермейтін, бірақ динамикалық бағдарламалаудан әлдеқайда тиімді эвристикалық әдістер болып табылады. Бұл әдістер, әсіресе, үлкен көлемді деректер базасын іздеу кезінде пайдалы, онда көптеген үміткер тізбектердің сұраныс тізбегімен маңызды сәйкестігі болмайды деп есептеледі. Word әдістері FASTA және BLAST отбасы құрамына кіретін деректер базасын іздеу құралдарында қолданылуымен кеңінен танымал. Дегенмен, биоинформатикада осы сәйкестендірулердің пайдалы болуы үш немесе одан да көп тізбекті сәйкестендіруге қолайлы әртүрлі әдістердің жасалуына әкелді.
Динамикалық бағдарламалау
Динамикалық бағдарламалау әдісі теориялық тұрғыдан кез келген тізбектерге қолданылады; алайда, оның уақыт және жад ресурстарын көп қажет етуіне байланысты, ең қарапайым түрінде үш немесе төрт тізбектен артық тізбектерге сирек қолданылады. Бұл әдіс екі тізбектен құрылған тізбек матрицасының n-өлшемді аналогын құруды талап етеді, мұнда n – сұраныстағы тізбектер саны. Алдымен стандартты динамикалық бағдарламалау сұраныс тізбектерінің барлық жұптарына қолданылады, содан кейін аралық позициялардағы мүмкін болатын сәйкестіктерді немесе үзілістерді ескере отырып, "бағытталу кеңістігі" толтырылады, нәтижесінде әрбір екі тізбек жұбы үшін сәйкестік құрылады. Бұл әдіс есептеулерге көп шығын келтірсе де, оның жаһандық оңтайлы шешімді кепілдігі, тек бірнеше тізбекті дәл бағыттау қажет болған жағдайларда пайдалы. "Жұптардың қосындысы" мақсатты функциясына негізделген динамикалық бағдарламалаудың есептеу талаптарын азайтудың бір әдісі MSA бағдарламалық пакетінде іске асырылған.
Прогрессивті әдістер
Прогрессивті, иерархиялық немесе ағаш тәсілдері көптік тізбектерді туралауды ең ұқсас тізбектерді бірінші кезекте туралап, содан кейін сұраныс жиынтығының барлығы шешімге енгенше, наразылық білдіретін тізбектерді немесе топтарды біртіндеп қосу арқылы жасайды. Тізбектердің байланысын сипаттайтын бастапқы ағаш, FASTA-ға ұқсас эвристикалық жұптық туралау тәсілдерін қамтуы мүмкін жұптық салыстыруларға негізделген. Прогрессивті туралау нәтижелері "ең жақын" тізбектерді таңдауға байланысты, сондықтан бастапқы жұптық туралаудағы қателіктерге сезімтал болуы мүмкін. Көптеген прогрессивті көптік тізбектерді туралау тәсілдері сұраныс жиынтығындағы тізбектерді олардың байланысына қарай қосымша салмақтайды, бұл бастапқы тізбектерді дұрыс таңдамау мүмкіндігін азайтады және осылайша туралаудың дәлдігін арттырады. Clustal прогрессивті іске асырудың көптеген түрлері көптік тізбектерді туралау, филогенетикалық ағаштарды құру және ақуыз құрылымын болжау үшін кіріс ретінде қолданылады. Прогрессивті тәсілдің баяу, бірақ дәл нұсқасы T Coffee деп аталады.
Итерациялық әдістер
Итеративтік әдістер прогрессивті әдістердің әлсіз тұсы болып табылатын бастапқы жұптық сәйкестендірулердің дәлдігіне жоғары тәуелділікті азайтуға бағытталған. Итеративтік әдістер таңдалған сәйкестендіруді бағалау әдісіне сүйене отырып, бастапқы жаһандық сәйкестендіруді белгілеп, содан кейін реттілік кіші топтарын қайта сәйкестендіру арқылы объективті функцияны оңтайландырады. Қайта сәйкестендірілген кіші топтар келесі итерацияның көп реттілік сәйкестендіруін жасау үшін сәйкестендіріледі. Тізбек кіші топтарын таңдаудың және объективті функцияны қолданудың әртүрлі жолдары қарастырылады.
Дәлелді анықтау
Мотивтерді табу, сонымен қатар профильдік талдау деп аталады, сұраныс жиынтығындағы тізбектер арасындағы қысқа сақталған тізбек мотивтерін анықтауға бағытталған жаһандық көптік тізбек сәйкестендірулерді құрайды. Бұл әдетте алдымен жалпы жаһандық көптік тізбек сәйкестігін құру арқылы іске асырылады, содан кейін жоғары сақталған аймақтарды бөліп алып, профильдік матрицалар жиынтығын жасау үшін пайдаланады. Әрбір сақталған аймаққа арналған профильдік матрица ұпайлық матрица сияқты құрылады, бірақ әрбір аминоқышқыл немесе нуклеотидтің әрбір позициядағы жиілігі жалпы эмпирикалық үлестірілімнен емес, сақталған аймақтың символдар үлестірілімінен шығарылады. Профильдік матрицалар кейін басқа тізбектерде олар сипаттайтын мотивтің кездесуін іздеу үшін қолданылады. Егер бастапқы деректер жиынтығында аз ғана тізбектер болса немесе тек өте ұқсас тізбектер ғана болса, мотивте көрсетілген символдардың үлестірілімін қалыпқа келтіру үшін псевдосандар қосылады.
Компьютерлік ғылымнан бастама алған әдістер
Компьютерлік ғылымда жиі қолданылатын әр түрлі жалпы оңтайландыру алгоритмдері көп тізбекті сәйкестендіру мәселесіне де қолданылды. Жасырын Марков модельдері берілген сұраныс жиынтығы үшін мүмкін көп тізбекті сәйкестендірулер отбасының ықтималдық бағаларын есептеу үшін пайдаланылды; HMM негізделген ерте әдістер көңілі толқымайтын нәтижелер берсе де, кейінгі қолданыстар оларды алыс туысқан тізбектерді анықтау үшін ерекше тиімді деп тапты, себебі олар консервативті немесе жартылай консервативті алмастырулардың салдарынан туындаған қателерге аз сезімтал. Генетикалық алгоритмдер және симуляцияланған қайнау да жұптардың қосындысы әдісі сияқты бағалау функциясымен өлшенген көп тізбекті сәйкестендіру бағаларын оңтайландыру үшін қолданылды. Толық мәліметтер мен бағдарламалық қамтамасы туралы ақпаратты негізгі мақаладан табуға болады. Burrows–Wheeler түрлендіруі Bowtie және BWA сияқты танымал құралдарда қысқа оқуларды жылдам сәйкестендіру үшін сәтті қолданылды. FM индексін қараңыз.
Құрылымдық сәйкестендіру
Құрылымдық сәйкестендірулер, әдетте белоктарға және кейде РНК тізбектеріне тән, тізбекті сәйкестендіруге көмектесу үшін белок немесе РНК молекуласының екінші және үшінші құрылымы туралы ақпаратты пайдаланады. Бұл әдістер екі немесе одан көп тізбек үшін қолданылуы мүмкін және көбінесе жергілікті сәйкестіктерді тудырады; алайда, олар құрылымдық ақпараттың болуына байланысты болғандықтан, тек құрылымы белгілі тізбектер үшін ғана қолданылуы мүмкін (әдетте рентгендік кристаллография немесе ЯМР спектроскопиясы арқылы). Белок және РНК құрылымы тізбекке қарағанда эволюциялық тұрғыдан жақсы сақталғандықтан, құрылымдық сәйкестендірулер өте алыс туысқан және кең ауқымда ыдыраған тізбектер арасында, олардың ұқсастығын тізбектерді салыстыру арқылы сенімді анықтау мүмкін емес болғанда, сенімдірек болуы мүмкін. Құрылымдық сәйкестендірулер гомологияға негізделген белок құрылымын болжауда сәйкестендірулерді бағалаудағы «алтын стандарт» ретінде қолданылады, өйткені олар тек тізбектік ақпаратқа сүйенбей, құрылымдық жағынан ұқсас белок тізбектерінің аймақтарын нақты сәйкестендіреді. Дегенмен, құрылымдық сәйкестендірулерді құрылымды болжауда қолдануға болмайды, себебі сұрау жиынтығындағы кем дегенде бір тізбек модельдеуге арналған мақсат болып табылады, оның құрылымы белгісіз. Мақсатты және үлгілік тізбек арасындағы құрылымдық сәйкестік болған жағдайда, мақсатты белок тізбегінің өте дәл модельдерін жасауға болатыны көрсетілді; гомологияға негізделген құрылымды болжаудағы басты қиындық – тек тізбектік ақпарат негізінде құрылымдық тұрғыдан дұрыс сәйкестендірулерді жасау болып табылады. Ол жұптық немесе көптік сәйкестендірулерді жасауға және Ақуыздық деректер банкіндегі (PDB) сұрау тізбегінің құрылымдық жақын туыстарын анықтауға мүмкіндік береді. Ол FSSP құрылымдық сәйкестендіру дерекқорын құру үшін пайдаланылды (Құрылымдық сәйкестендіруге негізделген бүктелу жіктеуіші немесе құрылымдық жағынан ұқсас белоктар отбасысы). DALI веб-серверіне DALI мекенжайы бойынша қол жеткізуге болады, ал FSSP – Dali деректер базасында орналасқан.
SSAP
SSAP (тізбектік құрылымды сәйкестендіру бағдарламасы) – бұл құрылымдық сәйкестендірудің динамикалық бағдарламалауға негіделген әдісі, ол салыстыру нүктелері ретінде құрылым кеңістігіндегі атомнан атомға векторларды пайдаланады. Бастапқы сипаттамасынан бері ол бірнеше және жұптық сәйкестендірулерді қамту үшін кеңейтілді және CATH (Класс, Архитектура, Топология, Гомология) иерархиялық ақуыз қатпарларының жіктелуін құруда қолданылды. CATH дерекқорына CATH ақуыз құрылымының жіктелуі сайтынан қол жеткізуге болады.
Комбинациялық кеңейту
Құрылымдық сәйкестендірудің комбинаторлық кеңейту әдісі екі ақуызды талдау кезінде жергілікті геометрияны қолдана отырып, олардың қысқа фрагменттерін сәйкестендіріп, содан кейін осы фрагменттерді үлкен сәйкестендіруге біріктіру арқылы жұптық құрылымдық сәйкестендіруді жасайды. Қатты дене түбірінің орташа квадраттық қашықтығы, қалдықтар арасындағы қашықтық, жергілікті екіншілік құрылым және қалдық көршілерінің гидрофобтылығы сияқты қоршаған ортаның ерекшеліктеріне негізделген "сәйкестендірілген фрагмент жұптары" деп аталатын жергілікті сәйкестендірулер жасалады және бұл сәйкестендірулер алдын ала белгіленген шектік мәндер бойынша барлық мүмкін құрылымдық сәйкестендірулерді көрсететін ұқсастық матрицасын құру үшін қолданылады. Содан кейін, матрица арқылы бір мезгілде бір фрагментпен өсетін сәйкестендіруді кеңейту арқылы бір ақуыз құрылымының күйінен екіншісіне өту жолы іздестіріледі. Мұндай ең оңтайлы жол комбинаторлық кеңейту сәйкестендіруін анықтайды. Әдісті жүзеге асыратын және Белок деректер банкіндегі құрылымдардың жұптық сәйкестендірулерінің дерекқорын ұсынатын веб-сервер Комбинаторлық кеңейту веб-сайтында орналасқан.
Филогенетикалық талдау
Филогенетика және тізбектерді сәйкестендіру өте жақын салалар, себебі олардың екеуі де тізбектердің байланысын бағалау қажеттілігімен біріктірілген. Филогенетика саласы филогенетикалық ағаштарды құру және түсіндіру үшін тізбектерді сәйкестендіруді кеңінен пайдаланады, бұл ағаштар әртүрлі түрлердің геномдарындағы гомологты гендердің эволюциялық байланыстарын жіктеуге қолданылады. Сұраныс жиынтығындағы тізбектердің өзгешелігі олардың бір-бірінен эволюциялық қашықтығымен сапалық түрде байланысты. Шамамен айтқанда, жоғары тізбек сәйкестігі зертенеін тізбектердің салыстырмалы түрде жас ортақ ата-тегі бар екенін көрсетеді, ал төмен сәйкестік – эволюциялық айырмашылықтың көнерек екенін көрсетеді. Бұл жуықтау, «молекулалық сағат» гипотезасын көрсетеді, яғни эволюциялық өзгерістің шамамен тұрақты жылдамдығы екі ген алғаш рет айырылғаннан бері өткен уақытты (яғни, коалесценция уақытын) болжау үшін қолданылуы мүмкін. Бұл мутация мен таңдаудың әсері тізбектердің ұрпақтарында тұрақты деп есептейді. Сондықтан ол организмдер немесе түрлер арасында ДНК жөндеу жылдамдықтарының немесе тізбектегі белгілі бір аймақтардың функционалдық сақталуының болу мүмкіндігін ескермейді. (Нуклеотидтік тізбектердің жағдайында, молекулалық сағат гипотезасы ең қарапайым түрінде берілген кодонның мағынасын өзгертпейтін үнсіз мутациялар мен белокқа басқа аминқышқылы қосылатын мутациялар арасындағы қабылдау жылдамдықтарының айырмашылығын да ескермейді). Көбірек статистикалық дәл әдістер филогенетикалық ағаштың әр тармағындағы эволюциялық жылдамдықтың өзгеруіне мүмкіндік береді, осылайша гендердің коалесценция уақытын жақсырақ бағалауға мүмкіндік тудырады. Прогрессивті көптік сәйкестендіру әдістері қажеттілік бойынша филогенетикалық ағаш құрайды, себебі олар тізбектерді өсу сәйкестендіруіне туыстық байланыс ретімен қосады. Басқа әдістер, көптік тізбек сәйкестендірулерін және филогенетикалық ағаштарды құрастырады, алдымен ағаштарды бағалап, сұрыптап, ең жоғары балл алған ағаштан көптік тізбек сәйкестендіруін есептейді. Филогенетикалық ағаш құрылысының көп қолданылатын әдістері негізінен эвристикалық болып табылады, себебі ең жақсы ағашты таңдау мәселесі, ең жақсы көптік тізбек сәйкестендіруін таңдау мәселесі сияқты, NP қиын.
Маңыздылықты бағалау
Тізбектік сәйкестендірулер биоинформатикада тізбектік ұқсастықты анықтау, филогенетикалық ағаштар құру және белок құрылымдарының гомологиялық модельдерін жасау үшін пайдалы. Дегенмен, тізбектік сәйкестендірулердің биологиялық маңыздылығы әрқашан айқын болмайды. Сәйкестендірулер көбінесе ортақ ата-тектен тараған тізбектер арасындағы эволюциялық өзгерістердің дәрежесін көрсетеді деп есептеледі; алайда, формальды түрде конвергентті эволюция орын алып, эволюциялық байланысы жоқ, бірақ ұқсас функцияларды орындайтын және ұқсас құрылымдарға ие белоктар арасында көзге көрінетін ұқсастықты тудыруы мүмкін. BLAST сияқты дерекқорларды іздеу кезінде, статистикалық әдістер іздеу жүргізіліп жатқан дерекқордың мөлшері мен құрамына байланысты тізбектердің немесе тізбек аймақтарының арасындағы белгілі бір сәйкестіктің кездейсоқ пайда болу ықтималдығын анықтай алады. Бұл мәндер іздеу кеңістігіне қарай айтарлықтай өзгеріп, егер дерекқор сұраныш тізбегінің бір ғана организмнен алынған тізбектерінен ғана тұрса, берілген сәйкестікті кездейсоқ табу ықтималдығы артады. Дерекқордағы немесе сұраныштағы қайталама тізбектер іздеу нәтижелерін және статистикалық маңыздылықты бағалауды бұрмалауы мүмкін; BLAST мұндай қайталама тізбектерді сұраныштан автоматты түрде сүзіп, статистикалық артефакттар болып табылатын көзге көрінетін сәйкестіктерді болдырмауға тырысады. Бос орынды тізбектік сәйкестендірулердің статистикалық маңыздылығын бағалау әдістері әдебиетте келтірілген.
Сенімділікті бағалау
Статистикалық маңыздылық белгілі бір сападағы сәйкестіктің кездейсоқ түрде пайда болу ықтималдығын көрсетеді, бірақ берілген сәйкестіктің сол тізбектердің баламалы сәйкестіктерінен қаншалықты артық екенін көрсетпейді. Сәйкестіктің сенімділігін өлшеу шаралары, берілген тізбектер жұбы үшін ең жақсы нәтиже берген сәйкестіктердің қаншалықты айқын ұқсас екенін көрсетеді. Бөлігі бар тізбектерді сәйкестіру үшін сенімділікті бағалау әдістері әдебиетте келтірілген.
Нысанды функция
Біологілық немесе статистикалық байқауларды көрсететін балл функциясын таңдау жақсы сәйкестендірулерді жасау үшін маңызды. Белок тізбектері көбінесе берілген таңбалардың алмасу ықтималдығын көрсететін алмастыру матрицаларын пайдалана отырып сәйкестендіріледі. PAM матрицалары (Point Accepted Mutation матрицалары, бастапқыда Маргарет Дейхофф анықтаған және кейде "Дейхофф матрицалары" деп аталатын) белгілі бір аминқышқылының мутацияларының жылдамдығы мен ықтималдығына қатысты эволюциялық жуықтамаларды нақты кодтайды. BLOSUM (Blocks Substitution Matrix) деп белгілі басқа дамыған балл матрицалары эмпирикалық түрде алынған алмастыру ықтималдығын кодтайды. Матрицаның екі түрінің де нұсқалары әртүрлі деңгейдегі айырмашылықтары бар тізбектерді анықтау үшін қолданылады, осылайша BLAST немесе FASTA пайдаланушылары іздеуді жақын туысқан сәйкестіктерге шектеуге немесе көбірек айырмашылықтары бар тізбектерді анықтау үшін кеңейтуге мүмкіндік алады. Аралықтарға арналған айыппұлдар эволюциялық модельдегі аралықтың енгізілуін, нуклеотидтік және белок тізбектеріндегі енгізу немесе жою мутацияларын ескереді, сондықтан айыппұлдар мұндай мутациялардың күтілетін деңгейіне пропорционалды болуы керек. Сондықтан, алынған сәйкестендірулердің сапасы балл функциясының сапасына байланысты. Әртүрлі балл матрицаларымен және/немесе аралық айыппұлдардың мәндерімен бірдей сәйкестендіруді бірнеше рет сынап көру және нәтижелерді салыстыру өте пайдалы және нұсқаулық болуы мүмкін. Сәйкестендіру параметрлерінің өзгеруіне төзімді сәйкестендірудің қай аймақтары екенін байқау арқылы әлсіз немесе бірегей емес шешімдері бар аймақтарды көбінесе анықтауға болады.
Басқа биологиялық қолданыстар
Тізбектелген РНК, мысалы, экспрессияланған тізбекті тегтер және толық ұзындығы бар мРНК, гендердің орналасқан жерін анықтау және баламалы тізілімдеу (splicing) және РНК өңдеу туралы ақпарат алу үшін тізбектелген геноммен салыстырылуы мүмкін. Тізбектерді салыстыру геномды құрастырудың да бір бөлігі болып табылады, онда тізбектердің үлестігін анықтау үшін олар салыстырылады, соның нәтижесінде контигтер (тізбектердің ұзын бөліктері) құрылады. SNP талдауының тағы бір мақсаты – әртүрлі адамдардың тізбектерін салыстыру арқылы популяцияда жиі кездесетін бір негіздік жұптардың айырмашылықтарын табу.
Биологиялық емес пайдалану
Биологиялық реттіліктерді салыстыруға қолданылатын әдістер басқа салаларда да қолданыс тапты, ең бастысы – табиғи тілді өңдеу және әлеуметтік ғылымдар салаларында. Мұнда Идлман-Вунш алгоритмі көбінесе «Оңтайлы сәйкестендіру» деп аталады. Табиғи тілді жасау алгоритмдерінде сөздерді таңдау үшін қолданылатын элементтер жиынтығын құру техникалары, биоинформатикадан бірнеше реттіліктерді салыстыру әдістерін қарыздап, компьютер жасаған математикалық дәлелдемелердің тілдік нұсқаларын жасады. Тарихи және салыстырмалы лингвистика саласында реттіліктерді салыстыру лингвистер дәстүрлі түрде тілдерді қайта құру үшін қолданатын салыстырмалы әдісті ішінара автоматтандыру үшін пайдаланылды. Бизнес және маркетингтік зерттеулер де уақыт өте келе сатып алулар тізбегін талдау үшін бірнеше реттіліктерді салыстыру әдістерін қолданды.
Бағдарламалық жасақтама
Алгоритмдер мен сәйкестендіру түрлері бойынша жіктелген қолжетімді бағдарламалық қамтамасыздардың толық тізімі тізбекті сәйкестендіру бағдарламалық қамтамасыздарында қолжетімді, бірақ жалпы тізбекті сәйкестендіру міндеттері үшін қолданылатын негізгі бағдарламалық құралдарға ClustalW2 және T-Coffee сәйкестендіру үшін, ал BLAST және FASTA3x деректер базасын іздеу үшін жатады. Сонымен қатар, DNASTAR Lasergene, Geneious және PatternHunter сияқты коммерциялық құралдар да бар. Тізбекті сәйкестендіруді орындайтындай белгіленген құралдар биоқұралдар тізілімінде тізімделген. Сәйкестендіру алгоритмдері мен бағдарламалық қамтамасыздарды бір-бірімен тікелей салыстыру үшін BAliBASE деп аталатын стандартталған эталондық көптік тізбек сәйкестендірулер жиынтығы қолданылады. Деректер жиынтығы құрылымдық сәйкестендірулерден тұрады, оларды тек тізбекке негізделген әдістерді салыстыру стандарты ретінде қарастыруға болады. Көптеген таралған сәйкестендіру әдістерінің жиі кездесетін сәйкестендіру мәселелері бойынша салыстырмалы тиімділігі кестеленген, ал таңдалған нәтижелер BAliBASE-де онлайн жарияланған. Көптеген (қазіргі уақытта 12) әртүрлі сәйкестендіру құралдары үшін BAliBASE ұпайларының толық тізімін STRAP ақуыздық жұмыс станциясында есептеуге болады.