Кіріспе

Компьютерлік биологияда гендік болжау немесе генді табу – гендерді кодтайтын геномдық ДНҚ аймақтарын анықтау процесін білдіреді. Бұл ақуызды кодтайтын гендерді де, РНҚ гендерін де қамтиды, сонымен қатар реттеуші аймақтар сияқты басқа да функционалдық элементтерді болжауды да қамти алады. Генді табу – түрдің геномын тізбектеп алғаннан кейін оны түсінудегі алғашқы және ең маңызды қадамдардың бірі. Бастапқыда "генді табу" тірі жасушалар мен организмдердегі шамалы тәжірибелерге негізделген. Бірнеше геннің гомологтық рекомбинация деңгейін статистикалық талдау олардың белгілі бір хромосомадағы орналасуын анықтауға мүмкіндік берді, ал мұндай тәжірибелерден алынған ақпаратты біріктіріп, белгілі гендердің бір-біріне қатысты шамамен орналасқан жерін көрсететін генетикалық карта жасауға болады. Бүгінде ғылыми қоғамдастықтың толық геномдық тізбегі мен қуатты есептеу ресурстары бар, сондықтан генді табу көбінесе есептеу мәселесі ретінде қарастырылады. Тізбектің функционалды екенін анықтау, геннің немесе оның өнімінің қызметін анықтаудан өзгеше. Геннің қызметін болжау және гендік болжаудың дұрыстығын растау үшін гендік нокаут және басқа да талдаулар арқылы in vivo эксперименттерді жүргізу қажет, бірақ биоинформатикалық зерттеулердің шекаралары геннің қызметін оның тізбегіне сүйене отырып болжауға мүмкіндік береді. Гендік болжау – геномдық аннотацияның маңызды қадамдарының бірі, ол тізбекті құрастырудан, кодтамайтын аймақтарды сүзуден және қайталама маскалаудан кейін жүзеге асырылады. Гендік болжау, ДНҚ-ға байланысатын ақуыздардың (транскрипция факторларының) геномдағы нақты байланысу орындарын қалай іздейтінін зерттейтін "мақсатты іздеу мәселесімен" тығыз байланысты. Құрылымдық гендерді болжаудың көптеген аспектілері жасушадағы гендердің транскрипциясы, трансляциясы, белок-белок өзара әрекеттесуі және реттеу процестері сияқты негізгі биохимиялық процестердің қазіргі түсінігіне негізделген, олар транскриптомика, протеомика, метаболомика және жалпы құрылымдық және функционалдық геномика сияқты түрлі омикалық салалардағы белсенді зерттеулердің нысаны болып табылады.

Эмпирикалық әдістер

Эмпирикалық (ұқсастық, гомология немесе дәлелге негізделген) ген табу жүйелерінде мақсатты геном белгілі экспрессияланған тізбекті тегтер, хабаршы РНК (мРНК), ақуыз өнімдері және гомологиялық немесе ортологиялық тізбектер түріндегі сыртқы дәлелдерге ұқсас тізбектерді іздейді. мРНК тізбегі берілгенде, одан транскрипцияланған бірегей геномдық ДНК тізбегін алу оңай. Ақуыз тізбегі берілгенде, генетикалық кодты кері аудару арқылы ықтимал кодтаушы ДНК тізбектерінің отбасын алуға болады. Ұсынылған ДНК тізбектері анықталғаннан кейін, мақсатты геномды толық немесе ішінара, дәл немесе дәл емес сәйкестіктер үшін тиімді іздеу салыстырмалы түрде қарапайым алгоритмдік мәселе болып табылады. BLAST, FASTA және Smith Waterman сияқты жергілікті сәйкестендіру алгоритмдері мақсатты тізбек пен ықтимал кандидаттар арасындағы ұқсастық аймақтарын іздейді. Сәйкестіктер толық немесе ішінара, нақты немесе нақты емес болуы мүмкін. Бұл тәсілдің сәттілігі тізбек дерекқорының мазмұны мен дәлдігімен шектеледі. Белгілі мРНК немесе ақуыз өнімдерімен жоғары дәрежеде ұқсастық – мақсатты геномның аймағы ақуызды кодтайтын ген екендігінің күшті дәлелі. Дегенмен, бұл тәсілді жүйелі түрде қолдану үшін мРНК және ақуыз өнімдерінің кең ауқымды тізбесін анықтау қажет. Бұл тек қымбат ғана емес, сонымен қатар күрделі организмдерде организмнің геномдағы барлық гендердің тек бір бөлігі ғана белгілі бір уақытта экспрессияланады, яғни көптеген гендер үшін сыртқы дәлелдер бір жасушалық мәдениетте оңай қол жетімді емес. Осылайша, күрделі организмдегі гендердің көпшілігіне немесе барлығына сыртқы дәлелдерді жинау үшін жүздеген немесе мыңдаған жасуша түрлерін зерттеу қажет, бұл одан әрі қиындықтар тудырады. Мысалы, кейбір адам гендері тек эмбрион немесе ұрық даму кезінде ғана экспрессияланады, бұл этикалық себептермен зерттеуді қиындатуы мүмкін. Осы қиындықтарға қарамастан, адам және басқа да маңызды модельді организмдер үшін, мысықтар мен ашытқылар үшін кең ауқымды транскрипт және ақуыз тізбегі дерекқоры жасалды. Мысалы, RefSeq дерекқоры көптеген түрлердің транскрипттері мен ақуыздар тізбектерін қамтиды, ал Ensembl жүйесі осы дәлелдерді адам және басқа бірнеше геномдарға толық карталайды. Дегенмен, осы дерекқорлар толық емес және шағын, бірақ маңызды қате деректерді қамтуы мүмкін. РНК-секвенирлеу және ChIP-секвенирлеу сияқты жаңа жоғары өнімді транскриптомдық секвенирлеу технологиялары гендік болжау мен растауға қосымша сыртқы дәлелдерді енгізуге мүмкіндік береді және экспрессияланған тізбектік тегтер немесе ДНҚ микромассивтері сияқты гендік экспрессияны өлшеудің бұрынғы әдістеріне қарағанда құрылымдық жағынан бай және дәл балама ұсынады. Гендік болжаудағы негізгі қиындықтар шикі ДНҚ деректерінің секвенирлеу қателерімен жұмыс істеу, тізбек құрастыру сапасына тәуелділік, қысқа оқуларды өңдеу, фрейм-шифтілік мутацияларды, бір-біріне үстіртен жатқан гендерді және толық емес гендерді басқаруды қамтиды. Прокариоттарда ген тізбегі гомологиясын іздегенде, гендердің көлденең тасымалдануын ескеру маңызды. Қазіргі генді анықтау құралдарында аз қолданылатын қосымша маңызды фактор – прокариоттарда да, эукариоттарда да кездесетін гендер кластерлері – оперондар (бір промотордың бақылауындағы гендер кластерін қамтитын ДНҚ-ның функционалдық бірліктері). Көптеген танымал генді анықтағыштар әр генді басқалардан тәуелсіз қарастырады, бұл биологиялық тұрғыдан дұрыс емес.

Нейро желілері

Жасанды нейрондық желілер – машиналық оқыту және үлгілерді тануда өте жақсы нәтиже беретін есептеу модельдері. Нейрондық желілерді тәжірибелік деректерге қатысты жалпылау үшін, алдымен мысал деректермен оқыту қажет, содан кейін оларды стандартты деректерге қарсы тексеру керек. Нейрондық желілер жеткілікті оқу деректері болған жағдайда, алгоритмдік шешуге қиын мәселелерге жуықтап жауап бере алады. Гендік болжамдауға қолданғанда, нейрондық желілерді басқа ab initio әдістермен бірге биологиялық ерекшеліктерді, мысалы, сплайс сайттарын болжау немесе анықтау үшін қолдануға болады. Бір тәсіл – тізбектік деректерді үсті-үстіне жылжытатын жылжымалы терезеді пайдалану. Әрбір позициядағы нәтиже – желінің терезеде донорлық немесе акцепторлық сплайс сайты бар деп ойлауына байланысты балл. Үлкен терезелер жоғары дәлдік береді, бірақ оларға көбірек есептеу қуаты қажет. Нейрондық желі – геномдағы функционалдық сайтты анықтау мақсатын қойғандықтан, сигнал сенсорының мысалы болып табылады.

Бірлескен тәсілдер

Maker сияқты бағдарламалар сыртқы және бастапқы тәсілдерді біріктіре отырып, ақуыз және EST деректерін геномға бейімдейді, осы арқылы бастапқы болжамдарды тексеріп нақтылайды. Август, Maker жұмыс ағынының бір бөлігі ретінде қолданыла алады, сондай-ақ гендік болжамның дәлдігін арттыру үшін EST сәйкестендірулері немесе ақуыздық профильдер түріндегі ақпараттарды пайдалана алады.

Салыстырмалы геномика тәсілдері

Көптеген түрлердің толық геномдары анықталғандықтан, гендерді табу жөніндегі қазіргі зерттеулердің үміт беретін бағыты – салыстырмалы геномика әдісі болып табылады. Бұл, табиғи іріктеудің күштері гендерді және басқа да функционалдық элементтерді геномның қалған бөліктеріне қарағанда баяу мутацияға ұшыратады деген қағидаға негізделген, себебі функционалдық элементтердегі мутациялар организмге басқа жерлердегі мутациялардан гөрі теріс әсер етуі мүмкін. Осылайша, гендерді эволюциялық сақталу қысымын анықтау үшін туысқан түрлердің геномдарын салыстыру арқылы табуға болады. Бұл тәсіл алғаш рет SLAM, SGP және TWINSCAN/N SCAN және CONTRAST сияқты бағдарламаларды пайдалана отырып, егешқұйрық және адам геномдарына қолданылды.

Бірнеше хабарлаушы

TWINSCAN тек адам мен егеуқұйрық синтениясын қарастырып, гомологты гендерді іздеді. N SCAN және CONTRAST сияқты бағдарламалар бірнеше организмнен тізбелімдерді қосуға, ал N SCAN жағдайында – мақсатты организмнен бір ғана балама организмді қосуға мүмкіндік берді. Көптеген дереккөздерді пайдалану дәлдіктің айтарлықтай жоғарылауына әкелуі мүмкін. Псевдогендерді болжау үшін қолданыстағы тізбек ұқсастығы және ab initio әдістері қолданылады, сондай-ақ қосымша сүзгілер мен псевдогендердің ерекшеліктерін анықтау әдістері де пайдаланылады. Тізбек ұқсастығы әдістерін кандидат псевдогендерді табу үшін қосымша сүзгілерді қолдану арқылы псевдогендерді болжауға бейімдеуге болады. Бұл жарамсыздықты анықтауды қамтиды, ол әдетте функционалды кодтау тізбегін тоқтатып немесе жоятын мағынасыз немесе қаңқа жылжу мутацияларын іздейді. Сонымен қатар, ДНК-ны аминқышқыл тізбегіне аудару, қарапайым ДНК гомологиясынан тиімдірек болуы мүмкін.

Метагеномдық гендерді болжау

Метагеномика – қоршаған ортадан алынған генетикалық материалды зерттеу, нәтижесінде организмдер тобынан алынған реттілік туралы ақпарат пайда болады. Гендерді болжау салыстырмалы метагеномика үшін пайдалы. Метагеномика құралдары негізінен тізбектік ұқсастық тәсілдерін (MEGAN4) және ab initio әдістерін (GLIMMER MG) қолданудың негізгі санаттарына жатады. Glimmer MG – бұл GLIMMER-дің кеңейтілген нұсқасы, ол гендерді табу үшін негізінен ab initio әдісіне және туысқан организмдерден алынған оқу жиынтықтарына сүйенеді. Алдын ала болжау стратегиясы ab initio гендік болжау әдістерін қолдану алдында гендік деректер жиынтығын жіктеу және кластерлеу арқылы толықтырылады. Деректер түрлер бойынша кластерленеді. Бұл жіктеу әдісі метагеномдық филогенетикалық жіктеу техникаларын пайдаланады. Бұл мақсаттағы бағдарламалық қамтамасыздардың мысалы – Phymm, ол интерполяцияланған Марков модельдерін қолданады, және PhymmBL, ол классификациялық процедураларға BLAST-ті біріктіреді. MEGAN4 белгілі тізбектердің деректер базасына қатысты жергілікті сәйкестендіруді қолдана отырып, тізбектік ұқсастық тәсілін қолданады, сонымен қатар функционалдық рөлдер, биологиялық жолдар және ферменттер туралы қосымша ақпаратты пайдалана отырып жіктеуге тырысады. Жеке организмнің генін болжау сияқты, тізбектік ұқсастық тәсілдері деректер базасының мөлшерімен шектеледі. FragGeneScan және MetaGeneAnnotator – жасырын Марков моделіне негізделген танымал гендік болжау бағдарламалары. Бұл болжаушылар тізбектеу қателеріне, толық емеген гендерге және қысқа оқуларға бейімделеді. Метагеномдарда гендерді болжау үшін тағы бір жылдам және дәл құрал – MetaGeneMark. Бұл құрал DOE Joint Genome Institute (DOE) IMG/M, қазіргі кездегі ең ірі метагеномдық жиынтықты түсіндіру үшін қолданылады.