Кіріспе
FASTA бағдарламалық пакеті
FASTA – Дэвид Ж. Липман мен Уильям Р. Пирсон 1985 жылы алғаш сипаттаған ДНК және белок тізбектерін салыстыруға арналған бағдарламалық пакет. Оның ең маңызды жетістігі – қазір биоинформатикада кеңінен қолданылатын FASTA форматы.
Тарих
FASTA бағдарламасының бастапқы нұсқасы ақуыз тізбектерінің ұқсастығын іздеуге арналған еді. 1980 жылдары генетикалық ақпараттың үрделді түрде өсуіне және компьютерлердің жылдамдығы мен жадының шектеулі болуына байланысты, сұраныс тізбегін толық деректер базасына сәйкестендіретін эвристикалық әдістер енгізілді. 1987 жылы жарияланған FASTA ДНК:ДНК іздеу, ақуыз:ДНК іздеуді аудару мүмкіндіктерін қосты, сондай-ақ статистикалық маңыздылықты бағалау үшін күрделі шатастыру бағдарламасын ұсынды. Бұл жинақта ақуыз және ДНК тізбектерін сәйкестендіруге мүмкіндік беретін бірнеше бағдарлама бар. Бүгінгі таңда, компьютер қуатының артуы Смит-Уотерман алгоритмін пайдаланып деректер базасындағы жергілікті сәйкестікті анықтауға мүмкіндік береді. FASTA "Fast A" деп айтылады және "FAST All" дегенді білдіреді, себебі ол кез келген символдар жинағымен жұмыс істейді, бұл бастапқы "FAST P" (ақуыз) және "FAST N" (нуклеотид) сәйкестендіру құралдарының кеңейтілген нұсқасы.
Қолданылуы
Қазіргі FASTA пакетіне ақуыз:ақуыз, ДНҚ:ДНҚ, ақуыз:көшірілген ДНҚ (қозғалыспен), және реттелген немесе реттелмеген пептидтерді іздеуге арналған бағдарламалар кіреді. FASTA пакетінің жаңа нұсқалары нуклеотидтік және ақуыздық тізбектерді салыстырғанда, фреймдік қателерді (алты фреймдік аударма іздеулері жақсы шеше алмайтын) дұрыс басқаратын арнайы көшірме іздеу алгоритмдерін қамтиды. Жылдам эвристикалық іздеу әдістерінен өзге, FASTA пакеті SSEARCH-ты, Smith-Waterman алгоритмінің оптималды іске асырылуын ұсынады. Бұл пакеттің негізгі мақсаты – дәл ұқсастық статистикасын есептеу, соның арқасында биологтар сәйкестіктің кездейсоқ орын алғанын немесе оны гомологияны анықтау үшін пайдалануға болатынын бағалай алады. FASTA пакетін Вирджиния университетінен және Еуропалық биоақпарат институтынан алуға болады. Бұл бағдарламалық қамтамасыздағы кіріс ретінде қолданылатын FASTA файл форматы қазір басқа тізбектерді іздеу құралдары (мысалы, BLAST) және тізбектерді сәйкестендіру бағдарламалары (Clustal, T Coffee және т.б.) кеңінен қолданады.
Іздеу әдісі
FASTA берілген нуклеотид немесе аминқышқыл тізбектерін қабылдайды және ұқсас дерекқор тізбектерінің сәйкестігін табу үшін жергілікті тізбектерді салыстыруды пайдалана отырып, сәйкес келетін тізбектер дерекқорын іздейді. FASTA бағдарламасы көбінесе эвристикалық әдіске сүйенеді, бұл оның орындалу жылдамдығына әсер етеді. Ол бастапқыда сөздердің сәйкестігін, белгілі бір ұзындықтағы сөздердің сәйкес келуін бақылайды және Smith–Waterman сияқты алгоритмді пайдалана отырып, көбірек уақыт алатын оңтайландырылған іздеуді жүргізуден бұрын ықтимал сәйкестіктерді белгілейді. Kmer параметрімен берілген сөздің мөлшері бағдарламаның сезімталдығы мен жылдамдығын анықтайды. Kmer мәнін арттыру табылған арқаулық сәйкестіктердің санын азайтады. Сөздердің сәйкестігінен қайтарылған бағдарлама жақын жердегі сәйкестіктердің кластерін қамтитын сегменттерді іздейді. Содан кейін ол осы сегменттерді ықтимал сәйкестікті тексеру үшін зерттейді. fastn және fastp арасында қолданылатын тізбектердің түріне қатысты кейбір айырмашылықтар бар, бірақ екеуі де тізбектердің ұқсастығының нәтижелерін сипаттау және пішімдеу үшін төрт қадамды қолданады және үш баллды есептейді. Олар: әрбір тізбек салыстырудағы ең жоғары тығыздық аймақтарын анықтау. Kmer 1 немесе 2-ге тең деп есептеу. Бұл қадамда екі тізбек арасындағы барлық немесе сәйкестіктердің тобы іздеу кестесін пайдалану арқылы табылады. Kmer мәні сәйкестік деп жариялау үшін қанша рет тізбектелген сәйкестіктер қажет екенін анықтайды. Демек, kmer мәні неғұрлым аз болса, іздеу неғұрлым сезімтал болады. Kmer=2 белок тізбектері үшін және kmer=4 немесе 6 нуклеотид тізбектері үшін жиі қолданылады. Қысқа олигонуклеотидтер әдетте kmer=1 арқылы жүзеге асырылады. Бағдарлама екі тізбектегі барлық ұқсас жергілікті аймақтарды табады, олар нүктелік сызбада белгілі бір ұзындықтағы диагональ ретінде бейнеленеді, kmer сәйкестіктерін санап, аралық сәйкессіздіктер үшін жазалайды. Осылайша, диагональдағы ең жоғары тығыздық сәйкестіктерді қамтитын жергілікті аймақтар арқаулық әсерлерден оқшауланады. Белок тізбектері үшін BLOSUM50 мәндері kmer сәйкестіктерін бағалау үшін қолданылады. Бұл жоғары ұқсастық баллдары бар сәйкестіктердің топтары төмен ұқсастық баллдары бар сәйкестікке қарағанда жергілікті диагональдық баллға көбірек үлес қосатындығын қамтамасыз етеді. Нуклеотидтік тізбектер бірдейлік матрицасын бірдей мақсатта пайдаланады. Барлық диагональдардан таңдалған ең жақсы 10 жергілікті аймақ сақталады. Бағалау матрицаларын пайдалана отырып, алынған аймақтарды қайта қарау. аймақтың шеттерін кесу, ең жоғары балл жинаған аймақтарды ғана қамту. 10 аймақты қайта қарау. Бұл жолы kmer мәнінен қысқа сәйкестіктерді жіберу үшін қайта бағалау кезінде тиісті бағалау матрицасын пайдаланыңыз. Сонымен қатар, қайта бағалау кезінде ұқсастық баллдарына үлес қосатын консервативті алмастырулар алынады. Белок тізбектері BLOSUM50 матрицасын қолданғанмен, белгілі бір алмастыру үшін қажетті базалық өзгерістердің ең аз санына, тек сәйкестіктерге немесе PAM сияқты ұқсастықтың баламалы өлшемдеріне негізделген бағалау матрицаларын да қолдануға болады. Осылайша қайта қарастырылған диагональдық аймақтардың әрқайсысы үшін ең жоғары балл алған субөңір анықталады. 1-қадамда табылған бастапқы баллдар кітапхана тізбектерін реттеу үшін қолданылады. Ең жоғары балл init1 балл деп аталады. Егер CUTOFF мәнінен жоғары балл алған бірнеше бастапқы аймақтар табылса, кесуден өткен бастапқы аймақтарды аралықтары бар шамамен сәйкестендіру үшін біріктіруге болатынын тексеріңіз. Әрбір аралық үшін 20 балл жазалайтын қосылған аймақтардың қосындысы болатын ұқсастық баллды есептеңіз. Бұл бастапқы ұқсастық балл (initn) кітапхана тізбектерін реттеу үшін қолданылады. 2-қадамда табылған ең жақсы бастапқы аймақтың баллдары (init1) көрсетіледі. Мұнда бағдарлама бастапқы аймақтардың оңтайлы сәйкестігін ең жоғары баллмен үйлесімді аймақтардың комбинациясы ретінде есептейді. Бастапқы аймақтардың оңтайлы сәйкестігін динамикалық бағдарламалау алгоритмін қолдану арқылы жылдам есептеуге болады. Нәтижесінде алынған initn балл кітапхана тізбектерін реттеу үшін қолданылады. Бұл біріктіру процесі сезімталдықты арттырады, бірақ іріктеуді азайтады. Сондықтан, осы қадамның қайда орындалатынын бақылау үшін мұқият есептелген кесу мәні қолданылады, бұл кітапханадағы байланыссыз тізбектерден күтілетін орташа баллдан шамамен бір стандартты ауытқу. Kmer 2 бар 200 қалдық сұраныс тізбегі 28 мәнін пайдаланады. Сұраныс тізбегі мен дерекқор (кітапхана) тізбегінің сәйкестігі үшін оңтайлы баллды есептеу үшін жолақты Smith–Waterman алгоритмін қолданыңыз. Бұл қадам 2-қадамның init1 аймағына ортасталған 32 қалдықтан тұратын жолақты Smith–Waterman алгоритмін пайдалану арқылы әрбір сәйкестік үшін оңтайландырылған баллды (opt) жасау үшін қолданылады. Барлық тізбектер ізделгеннен кейін бағдарлама әрбір дерекқор тізбегінің бастапқы баллдарын гистограммада көрсетеді және "opt" баллдың статистикалық маңыздылығын есептейді. Белок тізбектері үшін соңғы сәйкестік толық Smith–Waterman сәйкестігін пайдалану арқылы жасалады. ДНК тізбектері үшін жолақты сәйкестік ұсынылады. FASTA тізбектерді салыстыру алдында күрделі аймақтарды жоюға болады, төмен күрделі аймақтарды кішкентай әріптермен кодтау арқылы және S опциясын пайдалану арқылы. Алайда, BLAST бағдарламасы бұрыс құрастыру статистикасын түзету үшін көбірек опцияларды ұсынады. Сондықтан, FASTA тарату жинағына PRSS бағдарламасы қосылған. PRSS дерекқордағы сәйкес келетін тізбектерді бір әріптік деңгейде немесе пайдаланушы анықтай алатын ұзындықтағы қысқа сегменттерді шатастырады. Шатастырылған тізбектер қайтадан салыстырылады және егер балл күтілгеннен жоғары болса, бұл төмен күрделі аймақтардың әлі де сұранысқа сәйкес келетіндігін көрсетеді. Шатастырылған тізбектердің баллдарының мөлшері бойынша PRSS бастапқы тізбектердің баллдарының маңыздылығын болжай алады. Шатастырылған тізбектердің баллдары неғұрлым жоғары болса, бастапқы дерекқор мен сұраныс тізбектері арасында табылған сәйкестіктердің маңыздылығы соғұрлым төмен болады. FASTA бағдарламалары белок немесе ДНК тізбектері арасындағы жергілікті немесе жаһандық ұқсастық аймақтарын табады, белок немесе ДНК дерекқорларын іздеу арқылы немесе тізбек ішіндегі жергілікті дубликаттарды анықтау арқылы. Басқа бағдарламалар сәйкестіктің статистикалық маңыздылығы туралы ақпаратты ұсынады. BLAST сияқты, FASTA тізбектер арасындағы функционалды және эволюциялық қатынастарды болжауға және ген отбасының мүшелерін анықтауға көмектеседі.
Identify regions of highest density in each sequence comparison. Taking a k mer to equal 1 or 2. In this step all or a group of the identities between two sequences are found using a look up table. The k mer value determines how many consecutive identities are required for a match to be declared. Thus the lesser the k mer value: the more sensitive the search. k mer=2 is frequently taken by users for protein sequences and kmer=4 or 6 for nucleotide sequences. Short oligonucleotides are usually run with k mer= 1. The program then finds all similar local regions, represented as diagonals of a certain length in a dot plot, between the two sequences by counting k mer matches and penalizing for intervening mismatches. This way, local regions of highest density matches in a diagonal are isolated from background hits. For protein sequences BLOSUM50 values are used for scoring k mer matches. This ensures that groups of identities with high similarity scores contribute more to the local diagonal score than to identities with low similarity scores. Nucleotide sequences use the identity matrix for the same purpose. The best 10 local regions selected from all the diagonals put together are then saved. Rescan the regions taken using the scoring matrices. trimming the ends of the region to include only those contributing to the highest score. Rescan the 10 regions taken. This time use the relevant scoring matrix while rescoring to allow runs of identities shorter than the k mer value. Also while rescoring conservative replacements that contribute to the similarity score are taken. Though protein sequences use the BLOSUM50 matrix, scoring matrices based on the minimum number of base changes required for a specific replacement, on identities alone, or on an alternative measure of similarity such as PAM, can also be used with the program. For each of the diagonal regions rescanned this way, a subregion with the maximum score is identified. The initial scores found in step1 are used to rank the library sequences. The highest score is referred to as init1 score. In an alignment if several initial regions with scores greater than a CUTOFF value are found, check whether the trimmed initial regions can be joined to form an approximate alignment with gaps. Calculate a similarity score that is the sum of the joined regions penalising for each gap 20 points. This initial similarity score (initn) is used to rank the library sequences. The score of the single best initial region found in step 2 is reported (init1). Here the program calculates an optimal alignment of initial regions as a combination of compatible regions with maximal score. This optimal alignment of initial regions can be rapidly calculated using a dynamic programming algorithm. The resulting score initn is used to rank the library sequences. This joining process increases sensitivity but decreases selectivity. A carefully calculated cut off value is thus used to control where this step is implemented, a value that is approximately one standard deviation above the average score expected from unrelated sequences in the library. A 200 residue query sequence with k mer 2 uses a value 28. Use a banded Smith–Waterman algorithm to calculate an optimal score for alignment. This step uses a banded Smith–Waterman algorithm to create an optimised score (opt) for each alignment of query sequence to a database(library) sequence. It takes a band of 32 residues centered on the init1 region of step2 for calculating the optimal alignment. After all sequences are searched the program plots the initial scores of each database sequence in a histogram, and calculates the statistical significance of the "opt" score. For protein sequences, the final alignment is produced using a full Smith–Waterman alignment. For DNA sequences, a banded alignment is provided. FASTA can remove complexity regions before aligning the sequences by encoding low complexity regions in lower case and using the S option. However, the BLAST program offers more options for correcting for biased composition statistics. Therefore, the program PRSS is added in the FASTA distribution package. PRSS shuffles the matching sequences in the database either on the one letter level or it shuffles short segments which length the user can determine. The shuffled sequences are now aligned again and if the score is still higher than expected this is caused by the low complexity regions being mixed up still mapping to the query. By the amount of the score the shuffled sequences still attain PRSS now can predict the significance of the score of the original sequences. The higher the score of the shuffled sequences the less significant the matches found between original database and query sequence. The FASTA programs find regions of local or global similarity between Protein or DNA sequences, either by searching Protein or DNA databases, or by identifying local duplications within a sequence. Other programs provide information on the statistical significance of an alignment. Like BLAST, FASTA can be used to infer functional and evolutionary relationships between sequences as well as help identify members of gene families.