Кіріспе

Геномдық тізбектерді анықтау және зерттеу

Биоинформатикада тізбек талдау – ДНК, РНК немесе пептид тізбегінің ерекшеліктерін, қызметін, құрылымын немесе эволюциясын түсіну үшін қолданылатын әртүрлі талдау әдістерінің жиынтығы. Бұл талдау организмнің толық геномы, транскриптомы немесе протеомы бойынша жүргізілуі мүмкін, сондай-ақ тандемді қайталаулар және жылжымалы элементтер сияқты таңдалған сегменттерге немесе аймақтарға қатысты болуы мүмкін. Қолданылатын әдістерге тізбектерді салыстыру, биологиялық дерекқорларда іздеу және тағы да басқалары жатады. Гендер мен ақуыздар тізбектерін жоғары өнімділікпен өндіру әдістерінің дамуынан бастап, дерекқорларға жаңа тізбектерді қосу жылдамдығы күрт өсті. Мұндай тізбектер жинағы ғалымның организмдер биологиясын түсінуін өздігінен арттырмайды. Дегенмен, осы жаңа тізбектерді белгілі функциялары бар тізбектермен салыстыру – жаңа тізбек алынған организмнің биологиясын түсінудің маңызды жолы. Осылайша, тізбек талдау биологиялық тізбектегі кодтаушы және кодтамайтын аймақтарға функция тағайындау үшін, әдетте, тізбектерді салыстыру және ұқсастықтар мен айырмашылықтарды зерттеу арқылы қолданылады. Қазіргі таңда реттіліктерді салыстыру (тізбектерді сәйкестендіру) жүзеге асыратын және оның биологиясын түсіну үшін сәйкестендіру нәтижелерін талдайтын көптеген құралдар мен техникалар бар. Молекулалық биологиядағы тізбек талдау өте кең ауқымды процестерді қамтиды:

Тізбектерді ұқсастығын табу үшін салыстыру, көбінесе олардың туыстық (гомологты) байланыста екенін анықтау үшін.
Тізбектің ішкі ерекшеліктерін анықтау, мысалы, белсенді орталықтар, трансляциядан кейінгі модификация орындары, гендер құрылымы, оқу кадрлары, интрон мен экзон таралуы және реттеуші элементтер.
Генетикалық маркер алу үшін нүктелік мутациялар және бір нуклеотидтік полиморфизм (SNP) сияқты тізбектердегі айырмашылықтар мен вариацияларды анықтау. Тізбектер мен организмдердің эволюциясы мен генетикалық әртүрлілігін анықтау.
Тізбек бойынша ғана молекулалық құрылымды анықтау.

Тарих

1951 жылы Фред Сангер инсулин ақуызының алғашқы тізбектерін сипаттағаннан бері биологтар осы білімді молекулалардың функциясын түсіну үшін пайдалануға тырысып келеді. Ол және оның әріптестерінің жаңалықтары алғашқы ДНК-ға негізделген геномды сәтті ретке келтіруге үлкен үлес қосты. Бұл зерттеуде қолданылған, «Сангер әдісі» немесе Сангер тізбектелуі деп аталатын әдіс, ДНК сияқты ұзын тізбекті молекулаларды тізбектеуде маңызды қадам болды. Бұл әдіс кейіннен адам геном жобасында қолданылды. Майкл Левитттің сөзіне сәйкес, тізбек талдау 1969-1977 жылдар аралығында дүниеге келді. 1969 жылы трансферлік РНК тізбектерін талдау, нуклеотидтік тізбектердегі байланысты өзгерістер арқылы қалдықтардың өзара әрекеттесуін болжау үшін қолданылды, нәтижесінде tRNA екінші құрылымының моделі пайда болды. 1970 жылы Саул Б. Нидлмен және Кристиан Д. Вунш екі тізбекті салыстыру үшін алғашқы компьютерлік алгоритмді жариялады. Осы кезеңде нуклеотидтік тізбектерді алудағы жетістіктер үлкендей түсті, бұл 1977 жылы бактериофагтың алғашқы толық геномын жариялауға мүмкіндік берді. Роберт Холли және оның Корнелл университетіндегі командасы алғашқы РНК молекуласын тізбектеп шығарған деп есептеледі.

Нуклеотидтік тізбекті талдаудың жалпы сипаттамасы (ДНҚ және РНҚ)

Нуклеотидтік тізбектерді талдау функционалдық элементтерді, мысалы, ақуыз байланыс орындарын анықтайды, СНП сияқты генетикалық вариацияларды ашады, гендік экспрессия үлгілерін зерттейді және белгілердің генетикалық негізін түсінуге мүмкіндік береді. Ол репликация және транскрипция сияқты процестерге қатысты механизмдерді түсінуге көмектеседі. Көрсетілген кейбір тапсырмалар төменде келтірілген.

Сапаны бақылау және алдын ала өңдеу

Сапаны бақылау – жүйелеу технологиясынан (мысалы, Illumina) алынған жүйелеу оқуларының сапасын бағалауды қамтиды. Бұл, нашар сапалы деректерге байланысты қателігі бар қорытындыларға жол бермеу үшін реттілік талдауының алғашқы қадамы болып табылады. Бұл кезеңде қолданылатын құралдар жүйелеу платформасына байланысты. Мысалы, FastQC қысқа оқулардың сапасын тексереді (РНК тізбектерін қоса алғанда), Nanoplot немесе PycoQC ұзақ оқу тізбектері үшін қолданылады (мысалы, Nanopore тізбектері), ал MultiQC FastQC нәтижелерін веб-бет түрінде жинақтайды. Сапаны бақылау оқу ұзындығы, GC мазмұны, адаптер тізбектерінің болуы (қысқа оқулар үшін) және сапалық балл туралы ақпарат береді, бұл көбінесе PHRED шкаласында көрсетіледі. Егер оқуларда (әсіресе қысқа оқуларда) ПТР-көбейтуден туындаған адаптерлер немесе басқа артефакттар кездессе, олар Trimmomatic немесе Cutadapt сияқты бағдарламалық құралдарды пайдалану арқылы жойылады.

Қатарластыруды оқу

Бұл кезеңде сапасы жақсартылған секвенирлеу оқулары, қысқа ДНҚ оқулары үшін BWA, ұзақ ДНҚ оқулары үшін minimap және РНҚ оқулары үшін STAR сияқты сәйкестендіру құралдарын пайдалана отырып, анықтамалық геномға картаға түсіріледі. Карталаудың мақсаты – кез келген берілген оқудың анықтамалық тізбек негізінде шығу тегін табу. Бұл вариацияларды немесе филогенетикалық зерттеулерді анықтау үшін де маңызды. Бұл қадамның нәтижесі, яғни сәйкестендірілген оқулар, анықтамалық геном және жеке оқулар туралы ақпаратты қамтитын SAM форматындағы үйлесімді файлдарда сақталады. Алайда, BAM файл форматтары артықшылыққа ие, себебі олар дискіде немесе сақтау орнында аз орын алады. Олар анықтамалық тізбекпен салыстырғанда айырмашылықтарды анықтау үшін қолданылады. Вариантты шақыру құралын таңдау қолданылатын секвенирлеу технологиясына тікелей байланысты, сондықтан қысқа оқулармен жұмыс істегенде көбінесе GATK қолданылады, ал ұзақ оқу тізбектеріне DeepVariant және Sniffles сияқты құралдар қажет. Құралдар организмге (прокариоттар немесе эукариоттар), секвенирлеу деректерінің көзіне (қатерлі жасушалар немесе метагеномдар) және қызығушылық тудыратын вариант түріне (SNV немесе құрылымдық варианттар) қарай да өзгеше болуы мүмкін. Вариантты шақырудың нәтижесі әдетте vcf форматында болады және зерттеу сұрағына сәйкес аллель жиіліктері, сапа көрсеткіштері немесе басқа факторлар бойынша сүзгіленеді, сондай-ақ арнайы сценарийлер мен құбыржолдар қолданылуы мүмкін. Бұл қадамның нәтижесі bed немесе txt форматындағы түсіндірмелік файл болып табылады. Сонымен қатар, DESeq2 сияқты статистикалық әдістерді пайдалана отырып, эксперименттік жағдайларда әртүрлі экспрессияланатын гендер (DEG) анықталады. Бұл гендердің немесе изоформалардың әр түрлі үлгілер арасындағы немесе олардың арасындағы экспрессия деңгейлерін салыстыру және биологиялық маңыздылығын анықтау үшін жүзеге асырылады.

Функционалдық байытуды талдау

Функционалдық байыту талдауы алдыңғы қадамнан алынған дифференциалды экспрессияланатын гендермен байланысты биологиялық процестерді, жолдарды және функционалдық әсерлерді анықтайды. Ол GOSeq және Pathview сияқты құралдарды пайдаланады. Бұл дифференциалды экспрессияланатын гендермен байланысты жолдар мен молекулалық процестердің қандай екендігі, қандай гендердің төмен немесе жоғары реттелгендігі және қандай гендік онтология терминдерінің қайталануы немесе артық өкілдігі туралы ақпаратты қамтитын кесте құрайды.

Геномдық шұғылдықты талдау

Геномдық шолғыштар геномдар мен геномдық сегменттерді визуализациялауға, геномдық ерекшеліктерді анықтауға және көптеген геномдық элементтер арасындағы қатынасты талдауға мүмкіндік беретін, кодты қажет етпейтін, пайдаланушыға ыңғайлы интерфейс ұсынады. Ең басты үш геномдық шолғыш – Ensembl геномдық шолғышы, UCSC геномдық шолғышы және Ұлттық биотехнологиялық ақпарат орталығы (NCBI) геномдық құрастыру, геномды түсіндіру және салыстырмалы геномика сияқты түрлі тізбекті талдау процедураларын қолдайды, соның ішінде дифференциалдық экспрессия үлгілерін зерттеу және сақталған аймақтарды анықтау да бар. Барлық шолғыштар жүктеу және шығару үшін көптеген дерек форматтарын қолдайды, сондай-ақ тізбекті талдау үшін сыртқы құралдар мен ресурстарға сілтемелер береді, бұл олардың әмбебаптығын арттырады.

Профильді салыстыру

1987 жылы Майкл Грибсков, Эндрю Маклачлан және Дэвид Айзенберг ақуыздар арасындағы қашықтанғы ұқсастықтарды анықтау үшін профильдік салыстыру әдісін ұсынды. Бір ғана тізбек емес, профильдік әдістер әр қалдық қаншалықты сақталғаны туралы ақпаратты қамтитын профильді кодтау үшін көптеген тізбектердің сәйкестігін пайдаланады. Бұл профильдерді тізбектер жинағында байланысты тізбектерді табу үшін іздеуге болады. Профильдер позицияға қатысты бағалау матрицалары (PSSM) деп те аталады. 1993 жылы Андерс Крог және оның әріптестері жасырын Марков модельдерін қолданып, профильдердің ықтималдық түсіндірмесін ұсынды. Бұл модельдер профильдік HMM деп белгілі болды. Соңғы жылдары профильдерді бір-бірімен тікелей салыстыруға мүмкіндік беретін әдістер жасалды. Бұл әдістер профильдік профильдік салыстыру әдістері деп аталады.

Тізбелік құрастыру

Тізбек құрастыру – ДНК-ның кішкентай фрагменттерін үйлестіру және біріктіру арқылы ДНК тізбегін қайта құру процесі. Бұл қазіргі заманғы ДНК тізбектеудің маңызды бөлігі. Қазіргі ДНК тізбектеу технологиялары ұзын тізбектерді оқуға қолайлы емес болғандықтан, ірі ДНК фрагменттері (мысалы, геномдар) көбінесе (1) ДНК-ны кішкентай бөліктерге бөлу, (2) осы кішкентай фрагменттерді оқу және (3) әртүрлі фрагменттердегі ақпаратты біріктіру арқылы бастапқы ДНК-ны қайта құру жолымен тізбектеледі. Жақында, бірнеше түрді бір уақытта тізбектеу – зерттеудің маңызды міндеттерінің бірі болып табылады. Метагеномика – қоршаған ортадан тікелей алынған микробиалды қоғамдастықтарды зерттейтін ғылым. Лабораторияда өсірілген микроорганизмдерден өзгеше, табиғи үлгіде әдетте ондаған, кейде мыңдаған түрдегі микроорганизмдер кездеседі. Алғашқы геномдарды алу өте қиын болуы мүмкін.

Гендік болжау

Гендік болжау немесе гендерді табу – геномдық ДНҚ-ның гендерді кодтайтын аймақтарын анықтау процесін білдіреді. Бұл ақуызды кодтайтын гендерді де, РНК гендерін де қамтиды, сонымен қатар реттеуші аймақтар сияқты басқа да функционалдық элементтерді болжауды да қамти алады. Геном тізбегі анықталғаннан кейін, түрдің геномын түсінудегі ең алғашқы және маңызды қадамдардың бірі – гендік болжау. Жалпы алғанда, бактериялық гендерді болжау, әдетте күрделі интрон/экзон құрылымына ие эукариоттық түрлердегі гендерді болжауға қарағанда әлдеқайда қарапайым және дәл. Ұзын тізбектерде гендерді анықтау, әсіресе гендердің саны белгісіз болғанда қиындық тудырады. Жасырын Марков модельдері бұл мәселенің бір шешімі болуы мүмкін. Машиналық оқыту транскрипция факторларының тізбегін болжауда маңызды рөл атқарды. Дәстүрлі тізбектеу талдауы нуклеотидтік тізбектің статистикалық параметрлеріне назар аударды (Ең көп қолданылатын бағдарламалар 4.1 кестеде тізілген). Тағы бір әдіс – басқа белгілі ген тізбектеріне сәйкес гомологты тізбектерді анықтау (Құралдар туралы 4.3 кестеде қараңыз). Мұнда сипатталған екі әдіс тізбекке бағытталған. Дегенмен, ДНҚ және ақуыз сияқты осы молекулалардың пішін ерекшеліктері де зерттелді және олардың осы молекулалардың мінез-құлқына кемінде, тіпті одан да күшті әсер ететіні ұсынылды.

Белок құрылымын болжау

Молекулалардың 3D құрылымы табиғаттағы олардың атқаратын қызметтері үшін өте маңызды. Ірі молекулалардың атомдық деңгейдегі құрылымдық болжамы көбінесе шешілмейтін мәселе болғандықтан, кейбір биологтар 3D құрылымды бастапқы тізбек деңгейінде болжау әдістерін ұсынды. Бұл жергілікті аймақтардағы аминқышқылдарының қалдықтарын биохимиялық немесе статистикалық талдау, сондай-ақ белгілі 3D құрылымдары бар гомологтардан (немесе басқа да байланысты болуы мүмкін ақуыздардан) құрылымдық тұжырымдар жасауды қамтиды. Құрылымды болжау мәселесін шешуге бағытталған көптеген әртүрлі тәсілдер әзірленді. Қай әдістер ең тиімді екенін анықтау мақсатында CASP (Құрылымды болжаудың сыни бағалауы) деп аталатын құрылымды болжау бойынша бәйге ұйымдастырылды.