Кіріспе

FASTA бағдарламалық пакеті

FASTA – Дэвид Ж. Липман мен Уильям Р. Пирсон 1985 жылы алғаш сипаттаған ДНК және белок тізбектерін салыстыруға арналған бағдарламалық пакет. Оның ең маңызды жетістігі – қазір биоинформатикада кеңінен қолданылатын FASTA форматы.

Тарих

FASTA бағдарламасының бастапқы нұсқасы ақуыз тізбектерінің ұқсастығын іздеуге арналған еді. 1980 жылдары генетикалық ақпараттың үрделді түрде өсуіне және компьютерлердің жылдамдығы мен жадының шектеулі болуына байланысты, сұраныс тізбегін толық деректер базасына сәйкестендіретін эвристикалық әдістер енгізілді. 1987 жылы жарияланған FASTA ДНК:ДНК іздеу, ақуыз:ДНК іздеуді аудару мүмкіндіктерін қосты, сондай-ақ статистикалық маңыздылықты бағалау үшін күрделі шатастыру бағдарламасын ұсынды. Бұл жинақта ақуыз және ДНК тізбектерін сәйкестендіруге мүмкіндік беретін бірнеше бағдарлама бар. Бүгінгі таңда, компьютер қуатының артуы Смит-Уотерман алгоритмін пайдаланып деректер базасындағы жергілікті сәйкестікті анықтауға мүмкіндік береді. FASTA "Fast A" деп айтылады және "FAST All" дегенді білдіреді, себебі ол кез келген символдар жинағымен жұмыс істейді, бұл бастапқы "FAST P" (ақуыз) және "FAST N" (нуклеотид) сәйкестендіру құралдарының кеңейтілген нұсқасы.

Қолданылуы

Қазіргі FASTA пакетіне ақуыз:ақуыз, ДНҚ:ДНҚ, ақуыз:көшірілген ДНҚ (қозғалыспен), және реттелген немесе реттелмеген пептидтерді іздеуге арналған бағдарламалар кіреді. FASTA пакетінің жаңа нұсқалары нуклеотидтік және ақуыздық тізбектерді салыстырғанда, фреймдік қателерді (алты фреймдік аударма іздеулері жақсы шеше алмайтын) дұрыс басқаратын арнайы көшірме іздеу алгоритмдерін қамтиды. Жылдам эвристикалық іздеу әдістерінен өзге, FASTA пакеті SSEARCH-ты, Smith-Waterman алгоритмінің оптималды іске асырылуын ұсынады. Бұл пакеттің негізгі мақсаты – дәл ұқсастық статистикасын есептеу, соның арқасында биологтар сәйкестіктің кездейсоқ орын алғанын немесе оны гомологияны анықтау үшін пайдалануға болатынын бағалай алады. FASTA пакетін Вирджиния университетінен және Еуропалық биоақпарат институтынан алуға болады. Бұл бағдарламалық қамтамасыздағы кіріс ретінде қолданылатын FASTA файл форматы қазір басқа тізбектерді іздеу құралдары (мысалы, BLAST) және тізбектерді сәйкестендіру бағдарламалары (Clustal, T Coffee және т.б.) кеңінен қолданады.

Іздеу әдісі

FASTA берілген нуклеотид немесе аминқышқыл тізбектерін қабылдайды және ұқсас дерекқор тізбектерінің сәйкестігін табу үшін жергілікті тізбектерді салыстыруды пайдалана отырып, сәйкес келетін тізбектер дерекқорын іздейді. FASTA бағдарламасы көбінесе эвристикалық әдіске сүйенеді, бұл оның орындалу жылдамдығына әсер етеді. Ол бастапқыда сөздердің сәйкестігін, белгілі бір ұзындықтағы сөздердің сәйкес келуін бақылайды және Smith–Waterman сияқты алгоритмді пайдалана отырып, көбірек уақыт алатын оңтайландырылған іздеуді жүргізуден бұрын ықтимал сәйкестіктерді белгілейді. Kmer параметрімен берілген сөздің мөлшері бағдарламаның сезімталдығы мен жылдамдығын анықтайды. Kmer мәнін арттыру табылған арқаулық сәйкестіктердің санын азайтады. Сөздердің сәйкестігінен қайтарылған бағдарлама жақын жердегі сәйкестіктердің кластерін қамтитын сегменттерді іздейді. Содан кейін ол осы сегменттерді ықтимал сәйкестікті тексеру үшін зерттейді. fastn және fastp арасында қолданылатын тізбектердің түріне қатысты кейбір айырмашылықтар бар, бірақ екеуі де тізбектердің ұқсастығының нәтижелерін сипаттау және пішімдеу үшін төрт қадамды қолданады және үш баллды есептейді. Олар: әрбір тізбек салыстырудағы ең жоғары тығыздық аймақтарын анықтау. Kmer 1 немесе 2-ге тең деп есептеу. Бұл қадамда екі тізбек арасындағы барлық немесе сәйкестіктердің тобы іздеу кестесін пайдалану арқылы табылады. Kmer мәні сәйкестік деп жариялау үшін қанша рет тізбектелген сәйкестіктер қажет екенін анықтайды. Демек, kmer мәні неғұрлым аз болса, іздеу неғұрлым сезімтал болады. Kmer=2 белок тізбектері үшін және kmer=4 немесе 6 нуклеотид тізбектері үшін жиі қолданылады. Қысқа олигонуклеотидтер әдетте kmer=1 арқылы жүзеге асырылады. Бағдарлама екі тізбектегі барлық ұқсас жергілікті аймақтарды табады, олар нүктелік сызбада белгілі бір ұзындықтағы диагональ ретінде бейнеленеді, kmer сәйкестіктерін санап, аралық сәйкессіздіктер үшін жазалайды. Осылайша, диагональдағы ең жоғары тығыздық сәйкестіктерді қамтитын жергілікті аймақтар арқаулық әсерлерден оқшауланады. Белок тізбектері үшін BLOSUM50 мәндері kmer сәйкестіктерін бағалау үшін қолданылады. Бұл жоғары ұқсастық баллдары бар сәйкестіктердің топтары төмен ұқсастық баллдары бар сәйкестікке қарағанда жергілікті диагональдық баллға көбірек үлес қосатындығын қамтамасыз етеді. Нуклеотидтік тізбектер бірдейлік матрицасын бірдей мақсатта пайдаланады. Барлық диагональдардан таңдалған ең жақсы 10 жергілікті аймақ сақталады. Бағалау матрицаларын пайдалана отырып, алынған аймақтарды қайта қарау. аймақтың шеттерін кесу, ең жоғары балл жинаған аймақтарды ғана қамту. 10 аймақты қайта қарау. Бұл жолы kmer мәнінен қысқа сәйкестіктерді жіберу үшін қайта бағалау кезінде тиісті бағалау матрицасын пайдаланыңыз. Сонымен қатар, қайта бағалау кезінде ұқсастық баллдарына үлес қосатын консервативті алмастырулар алынады. Белок тізбектері BLOSUM50 матрицасын қолданғанмен, белгілі бір алмастыру үшін қажетті базалық өзгерістердің ең аз санына, тек сәйкестіктерге немесе PAM сияқты ұқсастықтың баламалы өлшемдеріне негізделген бағалау матрицаларын да қолдануға болады. Осылайша қайта қарастырылған диагональдық аймақтардың әрқайсысы үшін ең жоғары балл алған субөңір анықталады. 1-қадамда табылған бастапқы баллдар кітапхана тізбектерін реттеу үшін қолданылады. Ең жоғары балл init1 балл деп аталады. Егер CUTOFF мәнінен жоғары балл алған бірнеше бастапқы аймақтар табылса, кесуден өткен бастапқы аймақтарды аралықтары бар шамамен сәйкестендіру үшін біріктіруге болатынын тексеріңіз. Әрбір аралық үшін 20 балл жазалайтын қосылған аймақтардың қосындысы болатын ұқсастық баллды есептеңіз. Бұл бастапқы ұқсастық балл (initn) кітапхана тізбектерін реттеу үшін қолданылады. 2-қадамда табылған ең жақсы бастапқы аймақтың баллдары (init1) көрсетіледі. Мұнда бағдарлама бастапқы аймақтардың оңтайлы сәйкестігін ең жоғары баллмен үйлесімді аймақтардың комбинациясы ретінде есептейді. Бастапқы аймақтардың оңтайлы сәйкестігін динамикалық бағдарламалау алгоритмін қолдану арқылы жылдам есептеуге болады. Нәтижесінде алынған initn балл кітапхана тізбектерін реттеу үшін қолданылады. Бұл біріктіру процесі сезімталдықты арттырады, бірақ іріктеуді азайтады. Сондықтан, осы қадамның қайда орындалатынын бақылау үшін мұқият есептелген кесу мәні қолданылады, бұл кітапханадағы байланыссыз тізбектерден күтілетін орташа баллдан шамамен бір стандартты ауытқу. Kmer 2 бар 200 қалдық сұраныс тізбегі 28 мәнін пайдаланады. Сұраныс тізбегі мен дерекқор (кітапхана) тізбегінің сәйкестігі үшін оңтайлы баллды есептеу үшін жолақты Smith–Waterman алгоритмін қолданыңыз. Бұл қадам 2-қадамның init1 аймағына ортасталған 32 қалдықтан тұратын жолақты Smith–Waterman алгоритмін пайдалану арқылы әрбір сәйкестік үшін оңтайландырылған баллды (opt) жасау үшін қолданылады. Барлық тізбектер ізделгеннен кейін бағдарлама әрбір дерекқор тізбегінің бастапқы баллдарын гистограммада көрсетеді және "opt" баллдың статистикалық маңыздылығын есептейді. Белок тізбектері үшін соңғы сәйкестік толық Smith–Waterman сәйкестігін пайдалану арқылы жасалады. ДНК тізбектері үшін жолақты сәйкестік ұсынылады. FASTA тізбектерді салыстыру алдында күрделі аймақтарды жоюға болады, төмен күрделі аймақтарды кішкентай әріптермен кодтау арқылы және S опциясын пайдалану арқылы. Алайда, BLAST бағдарламасы бұрыс құрастыру статистикасын түзету үшін көбірек опцияларды ұсынады. Сондықтан, FASTA тарату жинағына PRSS бағдарламасы қосылған. PRSS дерекқордағы сәйкес келетін тізбектерді бір әріптік деңгейде немесе пайдаланушы анықтай алатын ұзындықтағы қысқа сегменттерді шатастырады. Шатастырылған тізбектер қайтадан салыстырылады және егер балл күтілгеннен жоғары болса, бұл төмен күрделі аймақтардың әлі де сұранысқа сәйкес келетіндігін көрсетеді. Шатастырылған тізбектердің баллдарының мөлшері бойынша PRSS бастапқы тізбектердің баллдарының маңыздылығын болжай алады. Шатастырылған тізбектердің баллдары неғұрлым жоғары болса, бастапқы дерекқор мен сұраныс тізбектері арасында табылған сәйкестіктердің маңыздылығы соғұрлым төмен болады. FASTA бағдарламалары белок немесе ДНК тізбектері арасындағы жергілікті немесе жаһандық ұқсастық аймақтарын табады, белок немесе ДНК дерекқорларын іздеу арқылы немесе тізбек ішіндегі жергілікті дубликаттарды анықтау арқылы. Басқа бағдарламалар сәйкестіктің статистикалық маңыздылығы туралы ақпаратты ұсынады. BLAST сияқты, FASTA тізбектер арасындағы функционалды және эволюциялық қатынастарды болжауға және ген отбасының мүшелерін анықтауға көмектеседі.