Кіріспе

Gap penalty – екі немесе одан көп тізбектердің үйлесімділігін бағалау әдісі. Тізбектерді үйлестіргенде, тізбектерге үзілістер енгізу, үзіліссіз үйлестіруге қарағанда алгоритмге көбірек элементтерді сәйкестендіруге мүмкіндік береді. Дегенмен, үйлесімділіктегі үзілістерді барынша азайту пайдалы үйлесімділік құру үшін маңызды. Тым көп үзілістер үйлесімділікті мәнсіз етеді. Gap penalty үзілістердің саны мен ұзындығына қарай үйлесімділік бағаларын түзетуге қолданылады. Gap penalty-дің бес негізгі түрі бар: тұрақты, сызықтық, аффиндік, дөңес және профильге негізделген.

Қолданбалар

Генетикалық тізбектерді салыстыру Биоинформатикада, саңылаулар генетикалық мутацияларды есепке алу үшін қолданылады, бұл мутациялар тізбекке қосылу немесе жойылу арқылы пайда болады, олар кейде инделдер деп аталады. Қосылулар немесе жойылулар жеке мутациялар, мейоз кезіндегі теңгерімсіз кроссовер, қате жұптасу және хромосомалық транслокация нәтижесінде туындауы мүмкін. Салыстырудағы саңылау ұғымы көптеген биологиялық қолданыстарда маңызды, өйткені қосылулар немесе жойылулар бүкіл кіші тізбекті құрайды және көбінесе бір мутациялық оқиғадан туындайды. Сонымен қатар, бір мутациялық оқиға әртүрлі өлшемдегі саңылауларды жасауы мүмкін. Сондықтан, екі ДНК тізбегін салыстырғанда, саңылауларды жиынтық түрде бағалау қажет. Тізбектегі бірнеше саңылауды үлкен бір саңылау ретінде қарастыру мутацияларға жоғары баға беруді азайтады. Мысалы, екі ақуыз тізбегі салыстырмалы түрде ұқсас болуы мүмкін, бірақ белгілі бір аралықтарда бір ақуыздың екіншісінен өзгеше кіші бөлімшесі болуы мүмкін. Осы әртүрлі кіші тізбектерді саңылаулар ретінде көрсету, тізбектегі ұзақ тізбекті индел операциялары болса да, осы жағдайларды «жақсы сәйкестіктер» ретінде қарастыруға мүмкіндік береді. Сондықтан, жақсы саңылау жазалау моделін пайдалану салыстыруларда төмен ұпайлардан сақтануға және нақты сәйкестікті табу мүмкіндігін арттыруға көмектеседі.

Жарым-жартылай сәйкестендіру

Үлкен тізбекте нақты сәйкестікті табу үшін жартылай жаһандық туралау қолданылады. Мысалы, ДНК тізбегінде промоторларды іздеу осыған жатады. Жаһандық туралаудан айырмашылығы, ол бір немесе екі тізбекте де соңғы бос орындарды қамтымайды. Егер 1-ші тізбекте соңғы бос орындарға жаза берілсе, ал 2-ші тізбекте жаза берілмесе, онда 2-ші тізбектің 1-ші тізбек ішінде орналасқан туралауы пайда болады.

Жергілікті сәйкестендіру

Жергілікті реттілік сәйкестендіру бір реттіліктің тікелей бөлігін екінші реттіліктің тікелей бөлігімен салыстырады. Смит-Уотерман алгоритмі сәйкестіктерге және қайшылықтарға ұпай беруге негізделген. Сәйкестіктер сәйкестендірудің жалпы ұпайын арттырса, қайшылықтар ұпайды азайтады. Жақсы сәйкестендіру оң ұпайға ие, ал нашар сәйкестендіру теріс ұпайға ие болады. Жергілікті алгоритм оң ұпай жинаған сәйкестендірулерді қарастырып, олардың арасынан ең жоғары ұпайлысын табады. Алгоритм – динамикалық бағдарламалау алгоритмі. Ақуыздарды салыстырғанда, әр мүмкін қалдық жұбына ұпай тағайындайтын ұқсастық матрицасы қолданылады. Ұқсас қалдықтар үшін оң, ал ұқсас емес қалдықтар үшін теріс ұпай болуы керек. Бос орындар әдетте сызықтық жазалау функциясы арқылы жазаланады, ол бос орынды ашу үшін бастапқы жазаны және бос орынның ұзындығын арттыратын қосымша жазаны белгілейді.

Бір-біріне жақын

Ең көп қолданылатын қашықтық айыбы – аффиндік қашықтық айыбы. Аффиндік қашықтық айыбы тұрақты және сызықтық қашықтық айыбы компоненттерін біріктіреді, мынадай формаға ие болады. Бұл жаңа терминдерді енгізеді: А – қашықтықты ашу айыбы, В – қашықтықты ұзарту айыбы және L – қашықтықтың ұзындығы. Қашықтықты ашу – кез келген ұзындықтағы қашықтықты ашуға қажетті шығын, ал қашықтықты ұзарту – қолданыстағы қашықтықтың ұзындығын 1-ге ұзартуға қажетті шығын. Көбінесе А және В мәндерінің қандай болуы керек екені белгісіз, себебі ол мақсатқа қарай өзгереді. Жалпы, егер жақын туысқан сәйкестіктерді табу мақсаты болса (мысалы, геном тізбектеу кезінде векторлық тізбекті жою), қашықтықты азайту үшін үлкен қашықтық айыбы қолданылуы керек. Ал, егер алыс сәйкестіктерді табуға қызығушылық болса, қашықтық айыбы төмендетілуі керек. Логарифмдік қашықтық мынадай формаға ие және зерттеулер көрсеткендей, индел өлшемдерінің таралуы қуат заңына бағынады. Аффиндік қашықтықты пайдаланудың тағы бір мәселесі – қысқа қашықтығы бар тізбектерге басымдық беру. Ұзақ қашықтықтарды қалау үшін логарифмдік қашықтық айыбы аффиндік қашықтықты өзгерту үшін ойлап табылды. Профиль-профильге сәйкестендірулер PSI BLAST іздеулері арқылы жасалған көптік тізбек сәйкестендірулерінен алынған статистикалық индел жиілік профильдеріне негізделген. Сондықтан, кез келген сәйкестендіру жағдайында қашықтықтың орналасуы эмпирикалық жолмен анықталуы тиіс. Сонымен қатар, жұптық сәйкестендірудегі қашықтық айыбы, мысалы аффиндік қашықтық айыбы, көбінесе енгізілген немесе жойылған фрагменттегі немесе үзілген шеттердегі аминқышқылдарының типіне қарамастан жүзеге асырылады, бірақ қашықтық аймақтарында нақты қалдық түрлеріне басымдық берілетініне қатысты дәлелдер бар. Соңында, тізбектерді сәйкестендіру – сәйкес құрылымдарды сәйкестендіруді білдіреді, бірақ ақуыздағы қашықтықтың құрылымдық ерекшеліктері мен олардың сәйкес тізбектері арасындағы байланыс толық емес. Осы себепті, қашықтық айыбына құрылымдық ақпаратты енгізу қиын. Кейбір алгоритмдер қашықтықты орналастыру үшін болжамды немесе нақты құрылымдық ақпаратты пайдаланады. Алайда, тек аз ғана тізбектерде белгілі құрылымдар бар, ал сәйкестендіру мәселелерінің көпшілігі белгісіз екінші және үшінші құрылымдар тізбектерін қамтиды.