Гендік болжам – геном ДНК-сының гендерді кодтайтын аймақтарын анықтау процесі. Биологиялық есептеулерде маңызды, гендерді іздеу және геномды түсінуге көмектеседі.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Компьютерлік биологияда гендік болжау немесе генді табу – гендерді кодтайтын геномдық ДНҚ аймақтарын анықтау процесін білдіреді. Бұл ақуызды кодтайтын гендерді де, РНҚ гендерін де қамтиды, сонымен қатар реттеуші аймақтар сияқты басқа да функционалдық элементтерді болжауды да қамти алады. Генді табу – түрдің геномын тізбектеп алғаннан кейін оны түсінудегі алғашқы және ең маңызды қадамдардың бірі. Бастапқыда "генді табу" тірі жасушалар мен организмдердегі шамалы тәжірибелерге негізделген. Бірнеше геннің гомологтық рекомбинация деңгейін статистикалық талдау олардың белгілі бір хромосомадағы орналасуын анықтауға мүмкіндік берді, ал мұндай тәжірибелерден алынған ақпаратты біріктіріп, белгілі гендердің бір-біріне қатысты шамамен орналасқан жерін көрсететін генетикалық карта жасауға болады. Бүгінде ғылыми қоғамдастықтың толық геномдық тізбегі мен қуатты есептеу ресурстары бар, сондықтан генді табу көбінесе есептеу мәселесі ретінде қарастырылады. Тізбектің функционалды екенін анықтау, геннің немесе оның өнімінің қызметін анықтаудан өзгеше. Геннің қызметін болжау және гендік болжаудың дұрыстығын растау үшін гендік нокаут және басқа да талдаулар арқылы in vivo эксперименттерді жүргізу қажет, бірақ биоинформатикалық зерттеулердің шекаралары геннің қызметін оның тізбегіне сүйене отырып болжауға мүмкіндік береді. Гендік болжау – геномдық аннотацияның маңызды қадамдарының бірі, ол тізбекті құрастырудан, кодтамайтын аймақтарды сүзуден және қайталама маскалаудан кейін жүзеге асырылады. Гендік болжау, ДНҚ-ға байланысатын ақуыздардың (транскрипция факторларының) геномдағы нақты байланысу орындарын қалай іздейтінін зерттейтін "мақсатты іздеу мәселесімен" тығыз байланысты. Құрылымдық гендерді болжаудың көптеген аспектілері жасушадағы гендердің транскрипциясы, трансляциясы, белок-белок өзара әрекеттесуі және реттеу процестері сияқты негізгі биохимиялық процестердің қазіргі түсінігіне негізделген, олар транскриптомика, протеомика, метаболомика және жалпы құрылымдық және функционалдық геномика сияқты түрлі омикалық салалардағы белсенді зерттеулердің нысаны болып табылады.
In computational biology, gene prediction or gene finding refers to the process of identifying the regions of genomic DNA that encode genes. This includes protein coding genes as well as RNA genes, but may also include prediction of other functional elements such as regulatory regions. Gene finding is one of the first and most important steps in understanding the genome of a species once it has been sequenced. In its earliest days, "gene finding" was based on painstaking experimentation on living cells and organisms. Statistical analysis of the rates of homologous recombination of several different genes could determine their order on a certain chromosome, and information from many such experiments could be combined to create a genetic map specifying the rough location of known genes relative to each other. Today, with comprehensive genome sequence and powerful computational resources at the disposal of the research community, gene finding has been redefined as a largely computational problem. Determining that a sequence is functional should be distinguished from determining the function of the gene or its product. Predicting the function of a gene and confirming that the gene prediction is accurate still demands in vivo experimentation through gene knockout and other assays, although frontiers of bioinformatics research are making it increasingly possible to predict the function of a gene based on its sequence alone. Gene prediction is one of the key steps in genome annotation, following sequence assembly, the filtering of non coding regions and repeat masking. Gene prediction is closely related to the so called 'target search problem' investigating how DNA binding proteins (transcription factors) locate specific binding sites within the genome. Many aspects of structural gene prediction are based on current understanding of underlying biochemical processes in the cell such as gene transcription, translation, protein–protein interactions and regulation processes, which are subject of active research in the various omics fields such as transcriptomics, proteomics, metabolomics, and more generally structural and functional genomics.
Эмпирикалық әдістер
Эмпирикалық (ұқсастық, гомология немесе дәлелге негізделген) ген табу жүйелерінде мақсатты геном белгілі экспрессияланған тізбекті тегтер, хабаршы РНК (мРНК), ақуыз өнімдері және гомологиялық немесе ортологиялық тізбектер түріндегі сыртқы дәлелдерге ұқсас тізбектерді іздейді. мРНК тізбегі берілгенде, одан транскрипцияланған бірегей геномдық ДНК тізбегін алу оңай. Ақуыз тізбегі берілгенде, генетикалық кодты кері аудару арқылы ықтимал кодтаушы ДНК тізбектерінің отбасын алуға болады. Ұсынылған ДНК тізбектері анықталғаннан кейін, мақсатты геномды толық немесе ішінара, дәл немесе дәл емес сәйкестіктер үшін тиімді іздеу салыстырмалы түрде қарапайым алгоритмдік мәселе болып табылады. BLAST, FASTA және Smith Waterman сияқты жергілікті сәйкестендіру алгоритмдері мақсатты тізбек пен ықтимал кандидаттар арасындағы ұқсастық аймақтарын іздейді. Сәйкестіктер толық немесе ішінара, нақты немесе нақты емес болуы мүмкін. Бұл тәсілдің сәттілігі тізбек дерекқорының мазмұны мен дәлдігімен шектеледі. Белгілі мРНК немесе ақуыз өнімдерімен жоғары дәрежеде ұқсастық – мақсатты геномның аймағы ақуызды кодтайтын ген екендігінің күшті дәлелі. Дегенмен, бұл тәсілді жүйелі түрде қолдану үшін мРНК және ақуыз өнімдерінің кең ауқымды тізбесін анықтау қажет. Бұл тек қымбат ғана емес, сонымен қатар күрделі организмдерде организмнің геномдағы барлық гендердің тек бір бөлігі ғана белгілі бір уақытта экспрессияланады, яғни көптеген гендер үшін сыртқы дәлелдер бір жасушалық мәдениетте оңай қол жетімді емес. Осылайша, күрделі организмдегі гендердің көпшілігіне немесе барлығына сыртқы дәлелдерді жинау үшін жүздеген немесе мыңдаған жасуша түрлерін зерттеу қажет, бұл одан әрі қиындықтар тудырады. Мысалы, кейбір адам гендері тек эмбрион немесе ұрық даму кезінде ғана экспрессияланады, бұл этикалық себептермен зерттеуді қиындатуы мүмкін. Осы қиындықтарға қарамастан, адам және басқа да маңызды модельді организмдер үшін, мысықтар мен ашытқылар үшін кең ауқымды транскрипт және ақуыз тізбегі дерекқоры жасалды. Мысалы, RefSeq дерекқоры көптеген түрлердің транскрипттері мен ақуыздар тізбектерін қамтиды, ал Ensembl жүйесі осы дәлелдерді адам және басқа бірнеше геномдарға толық карталайды. Дегенмен, осы дерекқорлар толық емес және шағын, бірақ маңызды қате деректерді қамтуы мүмкін. РНК-секвенирлеу және ChIP-секвенирлеу сияқты жаңа жоғары өнімді транскриптомдық секвенирлеу технологиялары гендік болжау мен растауға қосымша сыртқы дәлелдерді енгізуге мүмкіндік береді және экспрессияланған тізбектік тегтер немесе ДНҚ микромассивтері сияқты гендік экспрессияны өлшеудің бұрынғы әдістеріне қарағанда құрылымдық жағынан бай және дәл балама ұсынады. Гендік болжаудағы негізгі қиындықтар шикі ДНҚ деректерінің секвенирлеу қателерімен жұмыс істеу, тізбек құрастыру сапасына тәуелділік, қысқа оқуларды өңдеу, фрейм-шифтілік мутацияларды, бір-біріне үстіртен жатқан гендерді және толық емес гендерді басқаруды қамтиды. Прокариоттарда ген тізбегі гомологиясын іздегенде, гендердің көлденең тасымалдануын ескеру маңызды. Қазіргі генді анықтау құралдарында аз қолданылатын қосымша маңызды фактор – прокариоттарда да, эукариоттарда да кездесетін гендер кластерлері – оперондар (бір промотордың бақылауындағы гендер кластерін қамтитын ДНҚ-ның функционалдық бірліктері). Көптеген танымал генді анықтағыштар әр генді басқалардан тәуелсіз қарастырады, бұл биологиялық тұрғыдан дұрыс емес.
In empirical (similarity, homology or evidence based) gene finding systems, the target genome is searched for sequences that are similar to extrinsic evidence in the form of the known expressed sequence tags, messenger RNA (mRNA), protein products, and homologous or orthologous sequences. Given an mRNA sequence, it is trivial to derive a unique genomic DNA sequence from which it had to have been transcribed. Given a protein sequence, a family of possible coding DNA sequences can be derived by reverse translation of the genetic code. Once candidate DNA sequences have been determined, it is a relatively straightforward algorithmic problem to efficiently search a target genome for matches, complete or partial, and exact or inexact. Given a sequence, local alignment algorithms such as BLAST, FASTA and Smith Waterman look for regions of similarity between the target sequence and possible candidate matches. Matches can be complete or partial, and exact or inexact. The success of this approach is limited by the contents and accuracy of the sequence database. A high degree of similarity to a known messenger RNA or protein product is strong evidence that a region of a target genome is a protein coding gene. However, to apply this approach systemically requires extensive sequencing of mRNA and protein products. Not only is this expensive, but in complex organisms, only a subset of all genes in the organism's genome are expressed at any given time, meaning that extrinsic evidence for many genes is not readily accessible in any single cell culture. Thus, to collect extrinsic evidence for most or all of the genes in a complex organism requires the study of many hundreds or thousands of cell types, which presents further difficulties. For example, some human genes may be expressed only during development as an embryo or fetus, which might be difficult to study for ethical reasons. Despite these difficulties, extensive transcript and protein sequence databases have been generated for human as well as other important model organisms in biology, such as mice and yeast. For example, the RefSeq database contains transcript and protein sequence from many different species, and the Ensembl system comprehensively maps this evidence to human and several other genomes. It is, however, likely that these databases are both incomplete and contain small but significant amounts of erroneous data. New high throughput transcriptome sequencing technologies such as RNA Seq and ChIP sequencing open opportunities for incorporating additional extrinsic evidence into gene prediction and validation, and allow structurally rich and more accurate alternative to previous methods of measuring gene expression such as expressed sequence tag or DNA microarray. Major challenges involved in gene prediction involve dealing with sequencing errors in raw DNA data, dependence on the quality of the sequence assembly, handling short reads, frameshift mutations, overlapping genes and incomplete genes. In prokaryotes it's essential to consider horizontal gene transfer when searching for gene sequence homology. An additional important factor underused in current gene detection tools is existence of gene clusters — operons (which are functioning units of DNA containing a cluster of genes under the control of a single promoter) in both prokaryotes and eukaryotes. Most popular gene detectors treat each gene in isolation, independent of others, which is not biologically accurate.
Нейро желілері
Жасанды нейрондық желілер – машиналық оқыту және үлгілерді тануда өте жақсы нәтиже беретін есептеу модельдері. Нейрондық желілерді тәжірибелік деректерге қатысты жалпылау үшін, алдымен мысал деректермен оқыту қажет, содан кейін оларды стандартты деректерге қарсы тексеру керек. Нейрондық желілер жеткілікті оқу деректері болған жағдайда, алгоритмдік шешуге қиын мәселелерге жуықтап жауап бере алады. Гендік болжамдауға қолданғанда, нейрондық желілерді басқа ab initio әдістермен бірге биологиялық ерекшеліктерді, мысалы, сплайс сайттарын болжау немесе анықтау үшін қолдануға болады. Бір тәсіл – тізбектік деректерді үсті-үстіне жылжытатын жылжымалы терезеді пайдалану. Әрбір позициядағы нәтиже – желінің терезеде донорлық немесе акцепторлық сплайс сайты бар деп ойлауына байланысты балл. Үлкен терезелер жоғары дәлдік береді, бірақ оларға көбірек есептеу қуаты қажет. Нейрондық желі – геномдағы функционалдық сайтты анықтау мақсатын қойғандықтан, сигнал сенсорының мысалы болып табылады.
Artificial neural networks are computational models that excel at machine learning and pattern recognition. Neural networks must be trained with example data before being able to generalise for experimental data, and tested against benchmark data. Neural networks are able to come up with approximate solutions to problems that are hard to solve algorithmically, provided there is sufficient training data. When applied to gene prediction, neural networks can be used alongside other ab initio methods to predict or identify biological features such as splice sites. One approach involves using a sliding window, which traverses the sequence data in an overlapping manner. The output at each position is a score based on whether the network thinks the window contains a donor splice site or an acceptor splice site. Larger windows offer more accuracy but also require more computational power. A neural network is an example of a signal sensor as its goal is to identify a functional site in the genome.
Бірлескен тәсілдер
Maker сияқты бағдарламалар сыртқы және бастапқы тәсілдерді біріктіре отырып, ақуыз және EST деректерін геномға бейімдейді, осы арқылы бастапқы болжамдарды тексеріп нақтылайды. Август, Maker жұмыс ағынының бір бөлігі ретінде қолданыла алады, сондай-ақ гендік болжамның дәлдігін арттыру үшін EST сәйкестендірулері немесе ақуыздық профильдер түріндегі ақпараттарды пайдалана алады.
Programs such as Maker combine extrinsic and ab initio approaches by mapping protein and EST data to the genome to validate ab initio predictions. Augustus, which may be used as part of the Maker pipeline, can also incorporate hints in the form of EST alignments or protein profiles to increase the accuracy of the gene prediction.
Салыстырмалы геномика тәсілдері
Көптеген түрлердің толық геномдары анықталғандықтан, гендерді табу жөніндегі қазіргі зерттеулердің үміт беретін бағыты – салыстырмалы геномика әдісі болып табылады. Бұл, табиғи іріктеудің күштері гендерді және басқа да функционалдық элементтерді геномның қалған бөліктеріне қарағанда баяу мутацияға ұшыратады деген қағидаға негізделген, себебі функционалдық элементтердегі мутациялар организмге басқа жерлердегі мутациялардан гөрі теріс әсер етуі мүмкін. Осылайша, гендерді эволюциялық сақталу қысымын анықтау үшін туысқан түрлердің геномдарын салыстыру арқылы табуға болады. Бұл тәсіл алғаш рет SLAM, SGP және TWINSCAN/N SCAN және CONTRAST сияқты бағдарламаларды пайдалана отырып, егешқұйрық және адам геномдарына қолданылды.
As the entire genomes of many different species are sequenced, a promising direction in current research on gene finding is a comparative genomics approach. This is based on the principle that the forces of natural selection cause genes and other functional elements to undergo mutation at a slower rate than the rest of the genome, since mutations in functional elements are more likely to negatively impact the organism than mutations elsewhere. Genes can thus be detected by comparing the genomes of related species to detect this evolutionary pressure for conservation. This approach was first applied to the mouse and human genomes, using programs such as SLAM, SGP and TWINSCAN/N SCAN and CONTRAST.
Бірнеше хабарлаушы
TWINSCAN тек адам мен егеуқұйрық синтениясын қарастырып, гомологты гендерді іздеді. N SCAN және CONTRAST сияқты бағдарламалар бірнеше организмнен тізбелімдерді қосуға, ал N SCAN жағдайында – мақсатты организмнен бір ғана балама организмді қосуға мүмкіндік берді. Көптеген дереккөздерді пайдалану дәлдіктің айтарлықтай жоғарылауына әкелуі мүмкін. Псевдогендерді болжау үшін қолданыстағы тізбек ұқсастығы және ab initio әдістері қолданылады, сондай-ақ қосымша сүзгілер мен псевдогендердің ерекшеліктерін анықтау әдістері де пайдаланылады. Тізбек ұқсастығы әдістерін кандидат псевдогендерді табу үшін қосымша сүзгілерді қолдану арқылы псевдогендерді болжауға бейімдеуге болады. Бұл жарамсыздықты анықтауды қамтиды, ол әдетте функционалды кодтау тізбегін тоқтатып немесе жоятын мағынасыз немесе қаңқа жылжу мутацияларын іздейді. Сонымен қатар, ДНК-ны аминқышқыл тізбегіне аудару, қарапайым ДНК гомологиясынан тиімдірек болуы мүмкін.
TWINSCAN examined only human mouse synteny to look for orthologous genes. Programs such as N SCAN and CONTRAST allowed the incorporation of alignments from multiple organisms, or in the case of N SCAN, a single alternate organism from the target. The use of multiple informants can lead to significant improvements in accuracy. Pseudogene prediction utilises existing sequence similarity and ab initio methods, whilst adding additional filtering and methods of identifying pseudogene characteristics. Sequence similarity methods can be customised for pseudogene prediction using additional filtering to find candidate pseudogenes. This could use disablement detection, which looks for nonsense or frameshift mutations that would truncate or collapse an otherwise functional coding sequence. Additionally, translating DNA into proteins sequences can be more effective than just straight DNA homology.
Метагеномдық гендерді болжау
Метагеномика – қоршаған ортадан алынған генетикалық материалды зерттеу, нәтижесінде организмдер тобынан алынған реттілік туралы ақпарат пайда болады. Гендерді болжау салыстырмалы метагеномика үшін пайдалы. Метагеномика құралдары негізінен тізбектік ұқсастық тәсілдерін (MEGAN4) және ab initio әдістерін (GLIMMER MG) қолданудың негізгі санаттарына жатады. Glimmer MG – бұл GLIMMER-дің кеңейтілген нұсқасы, ол гендерді табу үшін негізінен ab initio әдісіне және туысқан организмдерден алынған оқу жиынтықтарына сүйенеді. Алдын ала болжау стратегиясы ab initio гендік болжау әдістерін қолдану алдында гендік деректер жиынтығын жіктеу және кластерлеу арқылы толықтырылады. Деректер түрлер бойынша кластерленеді. Бұл жіктеу әдісі метагеномдық филогенетикалық жіктеу техникаларын пайдаланады. Бұл мақсаттағы бағдарламалық қамтамасыздардың мысалы – Phymm, ол интерполяцияланған Марков модельдерін қолданады, және PhymmBL, ол классификациялық процедураларға BLAST-ті біріктіреді. MEGAN4 белгілі тізбектердің деректер базасына қатысты жергілікті сәйкестендіруді қолдана отырып, тізбектік ұқсастық тәсілін қолданады, сонымен қатар функционалдық рөлдер, биологиялық жолдар және ферменттер туралы қосымша ақпаратты пайдалана отырып жіктеуге тырысады. Жеке организмнің генін болжау сияқты, тізбектік ұқсастық тәсілдері деректер базасының мөлшерімен шектеледі. FragGeneScan және MetaGeneAnnotator – жасырын Марков моделіне негізделген танымал гендік болжау бағдарламалары. Бұл болжаушылар тізбектеу қателеріне, толық емеген гендерге және қысқа оқуларға бейімделеді. Метагеномдарда гендерді болжау үшін тағы бір жылдам және дәл құрал – MetaGeneMark. Бұл құрал DOE Joint Genome Institute (DOE) IMG/M, қазіргі кездегі ең ірі метагеномдық жиынтықты түсіндіру үшін қолданылады.
Metagenomics is the study of genetic material recovered from the environment, resulting in sequence information from a pool of organisms. Predicting genes is useful for comparative metagenomics. Metagenomics tools also fall into the basic categories of using either sequence similarity approaches (MEGAN4) and ab initio techniques (GLIMMER MG). Glimmer MG is an extension to GLIMMER that relies mostly on an ab initio approach for gene finding and by using training sets from related organisms. The prediction strategy is augmented by classification and clustering gene data sets prior to applying ab initio gene prediction methods. The data is clustered by species. This classification method leverages techniques from metagenomic phylogenetic classification. An example of software for this purpose is, Phymm, which uses interpolated markov models—and PhymmBL, which integrates BLAST into the classification routines. MEGAN4 uses a sequence similarity approach, using local alignment against databases of known sequences, but also attempts to classify using additional information on functional roles, biological pathways and enzymes. As in single organism gene prediction, sequence similarity approaches are limited by the size of the database. FragGeneScan and MetaGeneAnnotator are popular gene prediction programs based on Hidden Markov model. These predictors account for sequencing errors, partial genes and work for short reads. Another fast and accurate tool for gene prediction in metagenomes is MetaGeneMark. This tool is used by the DOE Joint Genome Institute to annotate IMG/M, the largest metagenome collection to date.