Геннің кодтау аймағы – ақуызды кодтайтын ДНК/РНҚ бөлігі. Эволюция, геном картасы және гендік терапияны зерттеуге көмектеседі. Көбінесе экзонмен шатастырылады.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Геннің белокты кодтайтын тізбегінің бөлігі. Геннің кодтау аймағы, сонымен қатар кодтау тізбегі (CDS) деп аталады, – геннің ДНК немесе РНК-сының белокты кодтайтын бөлігі. Әртүрлі түрлер мен уақыт кезеңдерінде кодтау аймақтарының кодталмайтын аймақтармен салыстырғандағы ұзындығы, құрамы, реттелуі, тігілуі, құрылымы және функцияларын зерттеу, прокариоттар мен эукариоттардың гендерінің ұйымдасуы мен эволюциясы туралы маңызды ақпаратты қамтамасыз ете алады. Бұл адам геномын картаға түсіруге және гендік терапияны дамытуға көмектеседі.
Portion of gene's sequence which codes for protein
The coding region of a gene, also known as the coding sequence (CDS), is the portion of a gene's DNA or RNA that codes for a protein. Studying the length, composition, regulation, splicing, structures, and functions of coding regions compared to non coding regions over different species and time periods can provide a significant amount of important information regarding gene organization and evolution of prokaryotes and eukaryotes. This can further assist in mapping the human genome and developing gene therapy.
Анықтама
Бұл термин кейде эксонмен бір-біріне ауыстырылып қолданылса да, бұл толыққанды бірдей емес: эксон кодтау аймағынан, сондай-ақ РНК-ның 3' және 5' аударылмаған аймақтарынан құралады, демек, эксонның бір бөлігі кодтау аймақтарынан тұрады. РНК-ның 3' және 5' аударылмаған, ақуызды кодтамайтын аймақтары кодтамайтын аймақтар деп аталады және олар осы бетте талқыланбайды. Кодтау аймақтары мен экзомалар арасында жиі шатасу туындайды, және бұл терминдердің арасында нақты айырмашылық бар. Экзома геномдағы барлық экзондарды қамтыса, кодтау аймағы – ДНК немесе РНК-ның белгілі бір ақуызды кодтайтын жеке бөлігін білдіреді.
Although this term is also sometimes used interchangeably with exon, it is not the exact same thing: the exon is composed of the coding region as well as the 3' and 5' untranslated regions of the RNA, and so therefore, an exon would be partially made up of coding regions. The 3' and 5' untranslated regions of the RNA, which do not code for protein, are termed non coding regions and are not discussed on this page. There is often confusion between coding regions and exomes and there is a clear distinction between these terms. While the exome refers to all exons within a genome, the coding region refers to a singular section of the DNA or RNA which specifically codes for a certain kind of protein.
Тарих
1978 жылы Уолтер Гилберт "Неге гендер бөлшектеледі" деген мақаласын жариялады, онда геннің мозаикалық құрылымы туралы идея алғаш рет зерттелді – әрбір толық нуклеин қышқылы тізбегі үздіксіз кодталмай, "тыныш" кодтамайтын аймақтармен бөлінеді. Бұл геномның ақуызды кодтайтын және кодтамайтын бөліктері арасында ерекшелену қажеттігін көрсететін алғашқы көрсеткі болды.
In 1978, Walter Gilbert published "Why Genes in Pieces" which first began to explore the idea that the gene is a mosaic—that each full nucleic acid strand is not coded continuously but is interrupted by "silent" non coding regions. This was the first indication that there needed to be a distinction between the parts of the genome that code for protein, now called coding regions, and those that do not.
Құрамы
Деректер негіздердің құрамы мен кодтау аймағының қолжетімділігі арасындағы жалпы өзара тәуелділік бар екенін көрсетеді. Кодтау аймағының кодтамау аймақтарына қарағанда жоғары GC құрамына ие болуы мүмкін деп есептеледі. Тағы бір зерттеу кодируші тізбектің ұзындығы артқан сайын GC құрамының да артатынын анықтады. Ұзын емес кодтау тізбектері салыстырмалы түрде GC-ға кедей, TAG, TAA және TGA сияқты негіздік құрамдағы трансляциялық тоқтау кодондарының төмен GC құрамымен ұқсас. GC-ға бай аймақтарда нүктелік мутацияның түрінің арақатысы сәл өзгереді: пуриндерден пиримидиндерге немесе пиримидиндерден пиримидиндерге өзгерулер болып табылатын ауысулар, пуриндерден пиримидиндерге немесе пиримидиндерден пуриндерге өзгерулер болып табылатын трансверсияларға қарағанда көп кездеседі. Ауысулар кодталған аминқышқылының өзгеруіне аз мүмкіндік береді және үнсіз мутация ретінде қалады (әсіресе егер олар кодонның үшінші нуклеотидінде болса), бұл трансляция және белок түзлу кезінде организмге әдетте пайдалы. Бұл маңызды кодтау аймақтарының (генге бай) GC құрамының жоғарырақ және қосымша және маңызсыз аймақтарға (генге кедей) қарағанда тұрақтырақ және мутацияға төзімдірек екенін көрсетеді. Дегенмен, мұның бейтарап, кездейсоқ мутация нәтижесінде немесе таңдау үлгісі арқылы пайда болғаны әлі анық емес. GC құрамы мен кодтау аймағы арасындағы қатынасты анықтау үшін қолданылатын ген терезелері сияқты әдістердің дәлдігі мен бейтараптығы да талқыланып жатыр.
The evidence suggests that there is a general interdependence between base composition patterns and coding region availability. The coding region is thought to contain a higher GC content than non coding regions. There is further research that discovered that the longer the coding strand, the higher the GC content. Short coding strands are comparatively still GC poor, similar to the low GC content of the base composition translational stop codons like TAG, TAA, and TGA. GC rich areas are also where the ratio point mutation type is altered slightly: there are more transitions, which are changes from purine to purine or pyrimidine to pyrimidine, compared to transversions, which are changes from purine to pyrimidine or pyrimidine to purine. The transitions are less likely to change the encoded amino acid and remain a silent mutation (especially if they occur in the third nucleotide of a codon) which is usually beneficial to the organism during translation and protein formation. This indicates that essential coding regions (gene rich) are higher in GC content and more stable and resistant to mutation compared to accessory and non essential regions (gene poor). However, it is still unclear whether this came about through neutral and random mutation or through a pattern of selection. There is also debate on whether the methods used, such as gene windows, to ascertain the relationship between GC content and coding region are accurate and unbiased.
Құрылымы мен қызметі
ДНК-да кодтау аймағы шаблондық жіптің 5' ұшындағы промоторлық тізбекпен және 3' ұшындағы тоқтату тізбегімен шектеледі. Транскрипция кезінде РНК полимераза (РНКП) промоторлық тізбекке байланысып, шаблондық жіп бойымен кодтау аймағына қарай жылжиды. РНКП содан кейін мРНК-ны құру үшін кодтау аймағына толықтыратын РНК нуклеотидтерін қосады, тиминнің орнына урацилді қояды. Бұл РНКП тоқтату тізбегіне жеткенше жалғасады. тРНК өздеріне байланысқан аминқышқылдарын өсіп келе жатқан полипептидтік тізбекке жеткізіп, бастапқы ДНК кодтау аймағында белгіленген белокты қалыптастырады.
In DNA, the coding region is flanked by the promoter sequence on the 5' end of the template strand and the termination sequence on the 3' end. During transcription, the RNA Polymerase (RNAP) binds to the promoter sequence and moves along the template strand to the coding region. RNAP then adds RNA nucleotides complementary to the coding region in order to form the mRNA, substituting uracil in place of thymine. This continues until the RNAP reaches the termination sequence. The tRNAs transfer their associated amino acids to the growing polypeptide chain, eventually forming the protein defined in the initial DNA coding region.
Реттеу
Кодтау аймағы ген экспрессиясын реттеу үшін өзгертілуі мүмкін. Алкилдену – кодтау аймағын реттеудің бір түрі. Транскрипцияланған генді нақты тізбекке бағыттап, үндеуге болады. Бұл тізбектегі базалар алкил тобы арқылы бұғатталып, үндеу әсерін тудырады. Ген экспрессиясын реттеу жасушадағы РНК немесе белок мөлшерін басқарады, ал осы механизмдерді реттеу ДНК тізбегіндегі ашық оқу фреймі басталар алдында табылған реттеуші тізбек арқылы жүзеге асырылады. Реттеуші тізбек белокты кодтау аймағында экспрессияның қайда және қашан болатынын анықтайды. РНК тігілуі нәтижесінде тізбектің қандай бөлігі аударылып, экспрессияланатыны анықталады, бұл процесте интронтар кесіліп, экзондар біріктіріледі. Бірақ РНК-ның сплайсосомасы қай жерден кесетінін сплайс орындарының, әсіресе 5' сплайс орынының танылуы бағыттайды, ол сплайс процесінің алғашқы қадамының субстраты болып табылады. Кодтау аймақтары экзондардың ішінде орналасқан, олар ковалентті байланысып, піскен хабаршы РНК құрайды.
The coding region can be modified in order to regulate gene expression. Alkylation is one form of regulation of the coding region. The gene that would have been transcribed can be silenced by targeting a specific sequence. The bases in this sequence would be blocked using alkyl groups, which create the silencing effect. While the regulation of gene expression manages the abundance of RNA or protein made in a cell, the regulation of these mechanisms can be controlled by a regulatory sequence found before the open reading frame begins in a strand of DNA. The regulatory sequence will then determine the location and time that expression will occur for a protein coding region. RNA splicing ultimately determines what part of the sequence becomes translated and expressed, and this process involves cutting out introns and putting together exons. Where the RNA spliceosome cuts, however, is guided by the recognition of splice sites, in particular the 5' splicing site, which is one of the substrates for the first step in splicing. The coding regions are within the exons, which become covalently joined together to form the mature messenger RNA.
Мутация
Кодтау аймағындағы мутациялар организмнің фенотипіне өте әртүрлі әсер ете алады. ДНҚ/РНК-ның осы аймағындағы кейбір мутациялар пайдалы өзгерістерге алып келуі мүмкін, ал басқалары зиянды, тіпті кейде организмнің тірі қалуына қауіпті болуы мүмкін. Керісінше, кодталмаған аймақтағы өзгерістер әрқашан фенотипте байқалатын өзгерістерге әкелмейді.
Mutations in the coding region can have very diverse effects on the phenotype of the organism. While some mutations in this region of DNA/RNA can result in advantageous changes, others can be harmful and sometimes even lethal to an organism's survival. In contrast, changes in the non coding region may not always result in detectable changes in phenotype.
Мутация түрлері
Кодтау аймақтарында кездесетін мутацияның әртүрлі түрлері бар. Олардың бірі – үнсіз мутациялар, онда нуклеотидтердің өзгеруі транскрипция және аудармадан кейін аминқышқылының өзгеруіне алып келмейді. Сондай-ақ, кодтау аймағындағы негіздердің өзгеруі ерте тоқтату кодонын тудыратын және нәтижесінде қысқарақ ақуызды құрайтын, мағынасыз мутациялар да бар. Кодтау аймағындағы бір жұп негіздің өзгеруі, аударма кезінде басқа аминқышқылын кодтайтын нүктелік мутациялар қате мағыналы мутациялар деп аталады. Басқа мутация түрлеріне ендірулер немесе жоюлар сияқты қате ауыстыру мутациялары жатады. Мұндай мутацияланған кодтау аймақтары организмдегі барлық жасушаларда кездеседі. Мутацияның басқа түрлері организм өмірі бойында пайда болады (соматикалық мутациялар) және жасушадан жасушаға тұрақты болмауы мүмкін. Сонымен қатар, мРНК кодонындағы үшінші негіздің дегенерациясын сипаттайтын «Қисайту гипотезасы» бар.
There are various forms of mutations that can occur in coding regions. One form is silent mutations, in which a change in nucleotides does not result in any change in amino acid after transcription and translation. There also exist nonsense mutations, where base alterations in the coding region code for a premature stop codon, producing a shorter final protein. Point mutations, or single base pair changes in the coding region, that code for different amino acids during translation, are called missense mutations. Other types of mutations include frameshift mutations such as insertions or deletions. Such mutated coding regions are present in all cells within the organism. Other forms of mutations are acquired (somatic mutations) during an organism's lifetime, and may not be constant cell to cell. and the 'Wobble Hypothesis' which describes the degeneracy of the third base within an mRNA codon.
Шектелген кодтау аймақтары (CCR)
Бір адамның геномы екінші адамның геномымен салыстырғанда кең ауқымды айырмашылықтарға ие екені мәлім, бірақ соңғы зерттеулер бір түрдің өкілдері арасында кейбір кодтау аймақтарының жоғары дәрежеде шектелген, яғни мутацияға төзімді екенін көрсетті. Бұл сақталған тізбектердегі түрлер аралық шектеу тұжырымына ұқсас. Зерттеушілер мұндай жоғары шектелген тізбектерді шектелген кодтау аймақтары (CCR) деп атады және олардың жоғары тазарту селекциясына қатысқандығын анықтады. Орташа есеп бойынша, әр 7 кодтау негізіне шамамен 1 ақуызды өзгертетін мутация келеді, бірақ кейбір CCR-лерде 100-ден астам негіз тізбегінде ақуызды өзгертетін мутациялар байқалмайды, тіпті синонимді мутациялар да жоқ. Геномдар арасындағы мұндай шектеулер сирек кездесетін даму ауруларының немесе тіпті эмбрионалдық өлімге әкелуі мүмкін себептер туралы ақпарат бере алады. Клиникалық тұрғыдан расталған варианттар және CCR-дегі de novo мутациялары бұрын нәрестелік эпилептикалық энцефалопатия, дамудың тежелуі және жүрек аурулары сияқты аурулармен байланысты болған. ДНК тізбегіндегі ашық оқу кадрларын анықтау оңай болғанымен, кодтау тізбектерін анықтау қиын, себебі жасуша барлық ашық оқу кадрларының тек бір бөлігін ғана ақуыздарға аударады. Қазіргі уақытта CDS болжамы жасушалардан mRNA-ның іріктеуі мен тізбектеуін пайдаланады, бірақ белгілі бір mRNA-ның қай бөліктері ақуызға аударылатынын анықтау мәселесі әлі де шешілмеген. CDS болжамы – ген болжамының бір бөлігі, соңғысы ақуызды ғана емес, РНК гендері және реттеуші тізбектер сияқты басқа да функционалдық элементтерді кодтайтын ДНК тізбектерін болжауды қамтиды. Прокариоттар мен эукариоттарда гендердің үстіне жабысуы ДНК және РНК вирустарында геномның мөлшерін азайту арқылы эволюциялық артықшылықты қамтамасыз етеді, сонымен бірге қолда бар кодтау аймақтарынан әртүрлі ақуыздарды өндіру мүмкіндігін сақтайды. ДНК және РНК үшін жұптық сәйкестендіру вирустардағы қысқа ашық оқу кадрларын қоса алғанда, бір-біріне жабысқан кодтау аймақтарын анықтауға мүмкіндік береді, бірақ потенциалды жабысқан кодтау тізбегін салыстыру үшін белгілі кодтау тізбегі қажет. Бір геномдық тізбекті пайдаланудың баламалы әдісі салыстыру үшін бірнеше геномдық тізбекті қажет етпейді, бірақ сезімтал болу үшін кем дегенде 50 нуклеотидтің үстіне жабысуын қажет етеді.
While it is well known that the genome of one individual can have extensive differences when compared to the genome of another, recent research has found that some coding regions are highly constrained, or resistant to mutation, between individuals of the same species. This is similar to the concept of interspecies constraint in conserved sequences. Researchers termed these highly constrained sequences constrained coding regions (CCRs), and have also discovered that such regions may be involved in high purifying selection. On average, there is approximately 1 protein altering mutation every 7 coding bases, but some CCRs can have over 100 bases in sequence with no observed protein altering mutations, some without even synonymous mutations. These patterns of constraint between genomes may provide clues to the sources of rare developmental diseases or potentially even embryonic lethality. Clinically validated variants and de novo mutations in CCRs have been previously linked to disorders such as infantile epileptic encephalopathy, developmental delay and severe heart disease.]] While identification of open reading frames within a DNA sequence is straightforward, identifying coding sequences is not, because the cell translates only a subset of all open reading frames to proteins. Currently CDS prediction uses sampling and sequencing of mRNA from cells, although there is still the problem of determining which parts of a given mRNA are actually translated to protein. CDS prediction is a subset of gene prediction, the latter also including prediction of DNA sequences that code not only for protein but also for other functional elements such as RNA genes and regulatory sequences. In both prokaryotes and eukaryotes, gene overlapping occurs relatively often in both DNA and RNA viruses as an evolutionary advantage to reduce genome size while retaining the ability to produce various proteins from the available coding regions. For both DNA and RNA, pairwise alignments can detect overlapping coding regions, including short open reading frames in viruses, but would require a known coding strand to compare the potential overlapping coding strand with. An alternative method using single genome sequences would not require multiple genome sequences to execute comparisons but would require at least 50 nucleotides overlapping in order to be sensitive.