Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Gap penalty – екі немесе одан көп тізбектердің үйлесімділігін бағалау әдісі. Тізбектерді үйлестіргенде, тізбектерге үзілістер енгізу, үзіліссіз үйлестіруге қарағанда алгоритмге көбірек элементтерді сәйкестендіруге мүмкіндік береді. Дегенмен, үйлесімділіктегі үзілістерді барынша азайту пайдалы үйлесімділік құру үшін маңызды. Тым көп үзілістер үйлесімділікті мәнсіз етеді. Gap penalty үзілістердің саны мен ұзындығына қарай үйлесімділік бағаларын түзетуге қолданылады. Gap penalty-дің бес негізгі түрі бар: тұрақты, сызықтық, аффиндік, дөңес және профильге негізделген.
A Gap penalty is a method of scoring alignments of two or more sequences. When aligning sequences, introducing gaps in the sequences can allow an alignment algorithm to match more terms than a gap less alignment can. However, minimizing gaps in an alignment is important to create a useful alignment. Too many gaps can cause an alignment to become meaningless. Gap penalties are used to adjust alignment scores based on the number and length of gaps. The five main types of gap penalties are constant, linear, affine, convex, and profile based.
Қолданбалар
Генетикалық тізбектерді салыстыру Биоинформатикада, саңылаулар генетикалық мутацияларды есепке алу үшін қолданылады, бұл мутациялар тізбекке қосылу немесе жойылу арқылы пайда болады, олар кейде инделдер деп аталады. Қосылулар немесе жойылулар жеке мутациялар, мейоз кезіндегі теңгерімсіз кроссовер, қате жұптасу және хромосомалық транслокация нәтижесінде туындауы мүмкін. Салыстырудағы саңылау ұғымы көптеген биологиялық қолданыстарда маңызды, өйткені қосылулар немесе жойылулар бүкіл кіші тізбекті құрайды және көбінесе бір мутациялық оқиғадан туындайды. Сонымен қатар, бір мутациялық оқиға әртүрлі өлшемдегі саңылауларды жасауы мүмкін. Сондықтан, екі ДНК тізбегін салыстырғанда, саңылауларды жиынтық түрде бағалау қажет. Тізбектегі бірнеше саңылауды үлкен бір саңылау ретінде қарастыру мутацияларға жоғары баға беруді азайтады. Мысалы, екі ақуыз тізбегі салыстырмалы түрде ұқсас болуы мүмкін, бірақ белгілі бір аралықтарда бір ақуыздың екіншісінен өзгеше кіші бөлімшесі болуы мүмкін. Осы әртүрлі кіші тізбектерді саңылаулар ретінде көрсету, тізбектегі ұзақ тізбекті индел операциялары болса да, осы жағдайларды «жақсы сәйкестіктер» ретінде қарастыруға мүмкіндік береді. Сондықтан, жақсы саңылау жазалау моделін пайдалану салыстыруларда төмен ұпайлардан сақтануға және нақты сәйкестікті табу мүмкіндігін арттыруға көмектеседі.
Genetic sequence alignment In bioinformatics, gaps are used to account for genetic mutations occurring from insertions or deletions in the sequence, sometimes referred to as indels. Insertions or deletions can occur due to single mutations, unbalanced crossover in meiosis, slipped strand mispairing, and chromosomal translocation. The notion of a gap in an alignment is important in many biological applications, since the insertions or deletions comprise an entire sub sequence and often occur from a single mutational event. Furthermore, single mutational events can create gaps of different sizes. Therefore, when scoring, the gaps need to be scored as a whole when aligning two sequences of DNA. Considering multiple gaps in a sequence as a larger single gap will reduce the assignment of a high cost to the mutations. For instance, two protein sequences may be relatively similar but differ at certain intervals as one protein may have a different subunit compared to the other. Representing these differing sub sequences as gaps will allow us to treat these cases as “good matches” even though there are long consecutive runs with indel operations in the sequence. Therefore, using a good gap penalty model will avoid low scores in alignments and improve the chances of finding a true alignment.
Жарым-жартылай сәйкестендіру
Үлкен тізбекте нақты сәйкестікті табу үшін жартылай жаһандық туралау қолданылады. Мысалы, ДНК тізбегінде промоторларды іздеу осыған жатады. Жаһандық туралаудан айырмашылығы, ол бір немесе екі тізбекте де соңғы бос орындарды қамтымайды. Егер 1-ші тізбекте соңғы бос орындарға жаза берілсе, ал 2-ші тізбекте жаза берілмесе, онда 2-ші тізбектің 1-ші тізбек ішінде орналасқан туралауы пайда болады.
The use of semi global alignment exists to find a particular match within a large sequence. An example includes seeking promoters within a DNA sequence. Unlike global alignment, it compromises of no end gaps in one or both sequences. If the end gaps are penalized in one sequence 1 but not in sequence 2, it produces an alignment that contains sequence 2 within sequence 1.
Жергілікті сәйкестендіру
Жергілікті реттілік сәйкестендіру бір реттіліктің тікелей бөлігін екінші реттіліктің тікелей бөлігімен салыстырады. Смит-Уотерман алгоритмі сәйкестіктерге және қайшылықтарға ұпай беруге негізделген. Сәйкестіктер сәйкестендірудің жалпы ұпайын арттырса, қайшылықтар ұпайды азайтады. Жақсы сәйкестендіру оң ұпайға ие, ал нашар сәйкестендіру теріс ұпайға ие болады. Жергілікті алгоритм оң ұпай жинаған сәйкестендірулерді қарастырып, олардың арасынан ең жоғары ұпайлысын табады. Алгоритм – динамикалық бағдарламалау алгоритмі. Ақуыздарды салыстырғанда, әр мүмкін қалдық жұбына ұпай тағайындайтын ұқсастық матрицасы қолданылады. Ұқсас қалдықтар үшін оң, ал ұқсас емес қалдықтар үшін теріс ұпай болуы керек. Бос орындар әдетте сызықтық жазалау функциясы арқылы жазаланады, ол бос орынды ашу үшін бастапқы жазаны және бос орынның ұзындығын арттыратын қосымша жазаны белгілейді.
A local sequence alignment matches a contiguous sub section of one sequence with a contiguous sub section of another. The Smith Waterman algorithm is motivated by giving scores for matches and mismatches. Matches increase the overall score of an alignment whereas mismatches decrease the score. A good alignment then has a positive score and a poor alignment has a negative score. The local algorithm finds an alignment with the highest score by considering only alignments that score positives and picking the best one from those. The algorithm is a dynamic programming algorithm. When comparing proteins, one uses a similarity matrix which assigns a score to each possible residue pair. The score should be positive for similar residues and negative for dissimilar residue pairs. Gaps are usually penalized using a linear gap function that assigns an initial penalty for a gap opening, and an additional penalty for gap extensions, increasing the gap length.
Бір-біріне жақын
Ең көп қолданылатын қашықтық айыбы – аффиндік қашықтық айыбы. Аффиндік қашықтық айыбы тұрақты және сызықтық қашықтық айыбы компоненттерін біріктіреді, мынадай формаға ие болады. Бұл жаңа терминдерді енгізеді: А – қашықтықты ашу айыбы, В – қашықтықты ұзарту айыбы және L – қашықтықтың ұзындығы. Қашықтықты ашу – кез келген ұзындықтағы қашықтықты ашуға қажетті шығын, ал қашықтықты ұзарту – қолданыстағы қашықтықтың ұзындығын 1-ге ұзартуға қажетті шығын. Көбінесе А және В мәндерінің қандай болуы керек екені белгісіз, себебі ол мақсатқа қарай өзгереді. Жалпы, егер жақын туысқан сәйкестіктерді табу мақсаты болса (мысалы, геном тізбектеу кезінде векторлық тізбекті жою), қашықтықты азайту үшін үлкен қашықтық айыбы қолданылуы керек. Ал, егер алыс сәйкестіктерді табуға қызығушылық болса, қашықтық айыбы төмендетілуі керек. Логарифмдік қашықтық мынадай формаға ие және зерттеулер көрсеткендей, индел өлшемдерінің таралуы қуат заңына бағынады. Аффиндік қашықтықты пайдаланудың тағы бір мәселесі – қысқа қашықтығы бар тізбектерге басымдық беру. Ұзақ қашықтықтарды қалау үшін логарифмдік қашықтық айыбы аффиндік қашықтықты өзгерту үшін ойлап табылды. Профиль-профильге сәйкестендірулер PSI BLAST іздеулері арқылы жасалған көптік тізбек сәйкестендірулерінен алынған статистикалық индел жиілік профильдеріне негізделген. Сондықтан, кез келген сәйкестендіру жағдайында қашықтықтың орналасуы эмпирикалық жолмен анықталуы тиіс. Сонымен қатар, жұптық сәйкестендірудегі қашықтық айыбы, мысалы аффиндік қашықтық айыбы, көбінесе енгізілген немесе жойылған фрагменттегі немесе үзілген шеттердегі аминқышқылдарының типіне қарамастан жүзеге асырылады, бірақ қашықтық аймақтарында нақты қалдық түрлеріне басымдық берілетініне қатысты дәлелдер бар. Соңында, тізбектерді сәйкестендіру – сәйкес құрылымдарды сәйкестендіруді білдіреді, бірақ ақуыздағы қашықтықтың құрылымдық ерекшеліктері мен олардың сәйкес тізбектері арасындағы байланыс толық емес. Осы себепті, қашықтық айыбына құрылымдық ақпаратты енгізу қиын. Кейбір алгоритмдер қашықтықты орналастыру үшін болжамды немесе нақты құрылымдық ақпаратты пайдаланады. Алайда, тек аз ғана тізбектерде белгілі құрылымдар бар, ал сәйкестендіру мәселелерінің көпшілігі белгісіз екінші және үшінші құрылымдар тізбектерін қамтиды.
The most widely used gap penalty function is the affine gap penalty. The affine gap penalty combines the components in both the constant and linear gap penalty, taking the form This introduces new terms, A is known as the gap opening penalty, B the gap extension penalty and L the length of the gap. Gap opening refers to the cost required to open a gap of any length, and gap extension the cost to extend the length of an existing gap by 1. Often it is unclear as to what the values A and B should be as it differs according to purpose. In general, if the interest is to find closely related matches (e. g. removal of vector sequence during genome sequencing), a higher gap penalty should be used to reduce gap openings. On the other hand, gap penalty should be lowered when interested in finding a more distant match. The logarithmic gap takes the form and was proposed as studies had shown the distribution of indel sizes obey a power law. Another proposed issue with the use of affine gaps is the favoritism of aligning sequences with shorter gaps. Logarithmic gap penalty was invented to modify the affine gap so that long gaps are desirable. Profile profile alignments are based on the statistical indel frequency profiles from multiple sequence alignments generated by PSI BLAST searches. Consequently, for any alignment situation gap placement must be empirically determined. Also, pairwise alignment gap penalties, such as the affine gap penalty, are often implemented independent of the amino acid types in the inserted or deleted fragment or at the broken ends, despite evidence that specific residue types are preferred in gap regions. Finally, alignment of sequences implies alignment of the corresponding structures, but the relationships between structural features of gaps in proteins and their corresponding sequences are only imperfectly known. Because of this incorporating structural information into gap penalties is difficult to do. Some algorithms use predicted or actual structural information to bias the placement of gaps. However, only a minority of sequences have known structures, and most alignment problems involve sequences of unknown secondary and tertiary structure.