Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Құрылымдық геномика белгілі бір геноммен кодталған әрбір белоктың үш өлшемді құрылымын сипаттауға бағытталған. Бұл геномға негізделген тәсіл, эксперименттік және модельдеу әдістерін біріктіре отырып, құрылымды анықтаудың жоғары өнімді әдісін қамтамасыз етеді. Құрылымдық геномика мен дәстүрлі құрылымдық болжаудың арасындағы негізгі айырмашылық – құрылымдық геномика геноммен кодталған барлық белоктардың құрылымын анықтауға тырысады, ал дәстүрлі болжау белгілі бір белокқа назар аударады. Толық геномдық тізбектердің болуы құрылымды болжауды эксперименттік және модельдеу әдістерін қолдану арқылы жылдамдатуға мүмкіндік береді, әсіресе көптеген тізбектелген геномдар мен бұрын шешілген белок құрылымдарының болуы ғалымдарға бұрын шешілген гомологтардың құрылымдары негізінде белок құрылымын модельдеуге мүмкіндік береді. Белок құрылымы белок функциясымен тығыз байланысты болғандықтан, құрылымдық геномика белок функциясы туралы білімді дамытуға ықпал етеді. Белок функцияларын анықтаудан басқа, құрылымдық геномика жаңа белок қатпарларын және жаңа дәрілерді іздеу үшін потенциалды мақсаттарды анықтауға көмектеседі. Құрылымдық геномика құрылымды анықтау үшін көптеген тәсілдерді қамтиды, соның ішінде геномдық тізбектерді пайдаланатын эксперименттік әдістерді, немесе белгілі құрылымы бар белоктың тізбегіне немесе құрылымдық гомологиясына негізделген модельдеу әдістерін, немесе белгілі құрылымға гомологиясы жоқ белок үшін химиялық және физикалық принциптерге негізделген әдістерді қолданады. Дәстүрлі құрылымдық биологиядан өзгеше, құрылымдық геномика арқылы анықталған белок құрылымы көбінесе (бірақ әрқашан емес) белок функциясы туралы ештеңе белгілі болмас бұрын жүзеге асырылады. Бұл құрылымдық биоинформатикада жаңа міндеттер тудырады, яғни үш өлшемді құрылымынан белок функциясын анықтау қажеттігі туындайды. Құрылымдық геномика белок құрылымдарын жоғары өнімді анықтауға баса назар аударады. Бұл арнайы құрылған құрылымдық геномика орталықтарында жүзеге асырылады. Көптеген құрылымдық биологтар жеке белоктардың немесе белок топтарының құрылымын зерттейтін болса, құрылымдық геномика мамандары геномдық масштабта белок құрылымдарын зерттейді. Бұл үлкен масштабта клондау, экспрессия және тазартуды білдіреді. Бұл тәсілдің басты артықшылығы – масштабтық экономия. Алайда, кейбір нәтижелердің ғылыми құндылығы кейде күмәнді болады. 2006 жылғы қаңтарда жарық көрген "Science" журналындағы мақала құрылымдық геномика саласын талдайды. Құрылымдық геномиканың бір артықшылығы, мысалы, Ақуыздық құрылым бастамасы, ғылыми қоғамдастыққа жаңа құрылымдарға, сондай-ақ клондар мен ақуыздар сияқты реагенттерге дереу қол жеткізуге мүмкіндік береді. Кемшілігі – осы құрылымдардың көпшілігі белгісіз функциясы бар белоктар болып табылады және оларға сәйкес жарияланымдар жоқ. Бұл осы құрылымдық ақпаратты ғылыми қоғамдастыққа жеткізудің жаңа тәсілдерін қажет етеді. Бірлескен құрылымдық геномика орталығының (JCSG) биоинформатикалық ядросы жақында жоғары өнімді құрылымдық геномика орталықтарынан түсетін белок құрылымдарын аннотациялау үшін вики-негізделген тәсілді, атап айтқанда Ашық белок құрылымдық аннотация желісін (TOPSAN) әзірледі.
Structural genomics seeks to describe the 3 dimensional structure of every protein encoded by a given genome. This genome based approach allows for a high throughput method of structure determination by a combination of experimental and modeling approaches. The principal difference between structural genomics and traditional structural prediction is that structural genomics attempts to determine the structure of every protein encoded by the genome, rather than focusing on one particular protein. With full genome sequences available, structure prediction can be done more quickly through a combination of experimental and modeling approaches, especially because the availability of large number of sequenced genomes and previously solved protein structures allows scientists to model protein structure on the structures of previously solved homologs. Because protein structure is closely linked with protein function, the structural genomics has the potential to inform knowledge of protein function. In addition to elucidating protein functions, structural genomics can be used to identify novel protein folds and potential targets for drug discovery. Structural genomics involves taking a large number of approaches to structure determination, including experimental methods using genomic sequences or modeling based approaches based on sequence or structural homology to a protein of known structure or based on chemical and physical principles for a protein with no homology to any known structure. As opposed to traditional structural biology, the determination of a protein structure through a structural genomics effort often (but not always) comes before anything is known regarding the protein function. This raises new challenges in structural bioinformatics, i. e. determining protein function from its 3D structure. Structural genomics emphasizes high throughput determination of protein structures. This is performed in dedicated centers of structural genomics. While most structural biologists pursue structures of individual proteins or protein groups, specialists in structural genomics pursue structures of proteins on a genome wide scale. This implies large scale cloning, expression and purification. One main advantage of this approach is economy of scale. On the other hand, the scientific value of some resultant structures is at times questioned. A Science article from January 2006 analyzes the structural genomics field. One advantage of structural genomics, such as the Protein Structure Initiative, is that the scientific community gets immediate access to new structures, as well as to reagents such as clones and protein. A disadvantage is that many of these structures are of proteins of unknown function and do not have corresponding publications. This requires new ways of communicating this structural information to the broader research community. The Bioinformatics core of the Joint center for structural genomics (JCSG) has recently developed a wiki based approach namely Open protein structure annotation network (TOPSAN) for annotating protein structures emerging from high throughput structural genomics centers.
Мақсаттар
Құрылымдық геномиканың бір мақсаты – жаңа протеин қалыптарын анықтау. Протеин құрылымын анықтаудың эксперименталдық әдістері жақсы экспресс болатын және/немесе кристалданатын протеиндерді қажет етеді, бұл осы эксперименталдық деректер арқылы түсіндірілетін протеин қалыптарының түрлеріне қатысты белгілі бір баяулықты тудыруы мүмкін. Ab initio модельдеу сияқты геномикалық, модельдеуге негізделген тәсілдер эксперименталдық тәсілдерге қарағанда жаңа протеин қалыптарын жақсырақ анықтай алады, себебі олар эксперименталды шектеулермен шектелмейді. Протеиннің функциясы 3D құрылымына байланысты, ал бұл 3D құрылымдар тізбектерге қарағанда жоғары сақталады. Осылайша, құрылымдық геномиканың жоғары өнімді құрылымды анықтау әдістері протеин функцияларын түсінуге үлкен үлес қосуы мүмкін. Бұл сондай-ақ жаңа дәрілерді табу және протеин инженериясы үшін де маңызды. Әрі қарай, құрылымдық деректер базасына қосылған әрбір протеин, базада басқа белгісіз протеиндердің гомологтық тізбектерінің болу ықтималдығын арттырады. Протеин құрылымын зерттеу бастамасы (PSI) – Ұлттық денсаулық сақтау институттары мен түрлі академиялық және өнеркәсіптік серіктестердің қаржылық қолдауымен жүзеге асырылатын, құрылымдық геномика тәсілін пайдаланып протеин құрылымы туралы білімді арттыруға және құрылымды анықтау әдістемесін жақсартуға бағытталған көп қырлы күш-жігер.
One goal of structural genomics is to identify novel protein folds. Experimental methods of protein structure determination require proteins that express and/or crystallize well, which may inherently bias the kinds of proteins folds that this experimental data elucidate. A genomic, modeling based approach such as ab initio modeling may be better able to identify novel protein folds than the experimental approaches because they are not limited by experimental constraints. Protein function depends on 3 D structure and these 3 D structures are more highly conserved than sequences. Thus, the high throughput structure determination methods of structural genomics have the potential to inform our understanding of protein functions. This also has potential implications for drug discovery and protein engineering. Furthermore, every protein that is added to the structural database increases the likelihood that the database will include homologous sequences of other unknown proteins. The Protein Structure Initiative (PSI) is a multifaceted effort funded by the National Institutes of Health with various academic and industrial partners that aims to increase knowledge of protein structure using a structural genomics approach and to improve structure determination methodology.
Әдістер
Структурлық геномика протеиндердің құрылымын анықтау үшін бірнеше тәсілмен толық геномдық тізбектерді пайдаланады. Көрсеткіш протеиннің гендік тізбегі белгілі тізбекпен салыстырылып, белгілі белоктың құрылымынан құрылымдық ақпаратты алуға болады. Структурлық геномика басқа құрылымдық деректерге сүйене отырып, жаңа белок бүктелімдерін болжау үшін қолданылуы мүмкін. Сондай-ақ, структурлық геномика белгісіз белок пен шешілген белок құрылымы арасындағы гомологияға негізделген модельдеу әдісін де қолдануы мүмкін.
Structural genomics takes advantage of completed genome sequences in several ways in order to determine protein structures. The gene sequence of the target protein can also be compared to a known sequence and structural information can then be inferred from the known protein's structure. Structural genomics can be used to predict novel protein folds based on other structural data. Structural genomics can also take modeling based approach that relies on homology between the unknown protein and a solved protein structure.
de novo әдістері
Толық геномдық тізбектер әрбір ашық оқу фреймін (ORF) – геннің хабаршы РНК және белок тізбесін қамтитын бөлігін – клондырып, белок ретінде өрнектеуге мүмкіндік береді. Бұл белоктар тазартылып, кристалданады, содан кейін олардың құрылымын анықтаудың екі түрінің біріне: рентгендік кристаллографияға және ядролық магниттік резонансқа (ЯМР) талданады. Толық геномдық тізбек барлық ORF-ты күшейтуге, бактерияға клондырып, оларды өрнектеуге қажетті барлық праймерлерді жобалауға мүмкіндік береді. Осы дәстүрлі әдісті бүкіл геномдық көзқараспен қолдану арқылы геноммен кодталған барлық белоктарды бірден өрнектеуге болады. Бұл тәсіл геноммен кодталған әрбір белоктың құрылымын анықтауға мүмкіндік береді.
Completed genome sequences allow every open reading frame (ORF), the part of a gene that is likely to contain the sequence for the messenger RNA and protein, to be cloned and expressed as protein. These proteins are then purified and crystallized, and then subjected to one of two types of structure determination: X ray crystallography and nuclear magnetic resonance (NMR). The whole genome sequence allows for the design of every primer required in order to amplify all of the ORFs, clone them into bacteria, and then express them. By using a whole genome approach to this traditional method of protein structure determination, all of the proteins encoded by the genome can be expressed at once. This approach allows for the structural determination of every protein that is encoded by the genome.
бастапқы модельдеу
Бұл тәсіл ақуыз тізбегінің деректерін және кодталған аминқышқылдарының химиялық және физикалық өзара әрекеттесуін пайдаланып, бұрын шешілмеген ақуыз құрылымдарымен гомологиясы жоқ ақуыздардың үш өлшемді құрылымдарын болжауға мүмкіндік береді. Ab initio модельдеудің ең табысты әдістерінің бірі – Rosetta бағдарламасы, ол ақуызды қысқа сегменттерге бөліп, қысқа полипептид тізбегін ең төмен энергиялы жергілікті конформацияға орналастырады. Rosetta коммерциялық және коммерциялық емес мақсаттар үшін Robetta бағдарламасы арқылы қолжетімді.
This approach uses protein sequence data and the chemical and physical interactions of the encoded amino acids to predict the 3 D structures of proteins with no homology to solved protein structures. One highly successful method for ab initio modeling is the Rosetta program, which divides the protein into short segments and arranges short polypeptide chain into a low energy local conformation. Rosetta is available for commercial use and for non commercial use through its public program, Robetta.
Тізбеге негізделген модельдеу
Бұл модельдеу әдісі белгісіз белоктың гендік тізбесін, белгілі құрылымы бар белоктардың тізбектерімен салыстырады. Тізбектердің ұқсастық деңгейіне байланысты, белгілі белоктың құрылымы белгісіз белоктың құрылымын анықтау үшін модель ретінде қолданылуы мүмкін. Жоғары дәлдіктегі модельдеу үшін, белгісіз белок пен анықталған құрылым арасында кемінде 50% аминқышқыл тізбек сәйкестігі болуы керек. 30-50% тізбек сәйкестігі орташа дәлдіктегі модельді береді, ал 30%-дан төмен тізбек сәйкестігі төмен дәлдіктегі модельді береді. Барлық құрылымдық мотивтерді кемінде бір рет көрсету және кез келген белгісіз белоктың құрылымын модельдеу арқылы дәл анықтау үшін кемінде 16 000 ақуыз құрылымын анықтау қажет деп болжануда. Дегенмен, бұл әдістің бір кемшілігі – құрылым тізбектен көбірек сақталады, сондықтан тізбекке негізделген модельдеу ақуыз құрылымдарын болжаудың ең дәл тәсілі болмауы мүмкін.
This modeling technique compares the gene sequence of an unknown protein with sequences of proteins with known structures. Depending on the degree of similarity between the sequences, the structure of the known protein can be used as a model for solving the structure of the unknown protein. Highly accurate modeling is considered to require at least 50% amino acid sequence identity between the unknown protein and the solved structure. 30 50% sequence identity gives a model of intermediate accuracy, and sequence identity below 30% gives low accuracy models. It has been predicted that at least 16,000 protein structures will need to be determined in order for all structural motifs to be represented at least once and thus allowing the structure of any unknown protein to be solved accurately through modeling. One disadvantage of this method, however, is that structure is more conserved than sequence and thus sequence based modeling may not be the most accurate way to predict protein structures.
Қылқалам
Қабаттасқан ұқсастықтарға емес, тізбектердің сәйкестігіне негізделген құрылымдық модельдеу, тақырыптарды іздеуге мүмкіндік береді. Бұл әдіс алыс туысқан ақуыздарды анықтауға көмектеседі және молекулалық функцияларды болжауға қолданылады.
Threading bases structural modeling on fold similarities rather than sequence identity. This method may help identify distantly related proteins and can be used to infer molecular functions.
Құрылымдық геномиканың мысалдары
Қазіргі уақытта берілген протеомдағы әрбір белоктың құрылымын анықтауға қатысты бірнеше жұмыс жүргізілуде.
There are currently a number of on going efforts to solve the structures for every protein in a given proteome.
Термотога мортима протеомы
Біріккен құрылымдық геномика орталығының (ББГЖ), Протеин құрылымдары бастамасының (PSI) қазіргі мақсаттарының бірі – термофильді бактерия Thermotoga maritima-ның барлық ақуыздарының құрылымын анықтау. T. maritima 1877 геннен тұратын салыстырмалы түрде шағын геномға және термофильді бактериялардың өндіретін ақуыздарын кристалдастыру оңайырақ болады деген гипотез негізінде құрылымдық геномика мақсаты ретінде таңдалды. Lesley және авторлар T. maritima-ның барлық ашық оқу кадрларын (ORF) экспрессиялау үшін Escherichia coli қолданды. Содан кейін бұл ақуыздар кристалданып, сәтті кристалданылған ақуыздардың құрылымы рентгендік кристаллография арқылы анықталды. Басқа құрылымдардың қатарында, бұл құрылымдық геномикалық тәсіл TM0449 ақуызының құрылымын анықтауға мүмкіндік берді, ол жаңа түйінделгендік көрсетеді, себебі ол ешбір белгілі ақуызбен құрылымдық гомологияны бөліспейді.
One current goal of the Joint Center for Structural Genomics (JCSG), a part of the Protein Structure Initiative (PSI) is to solve the structures for all the proteins in Thermotoga maritima, a thermophillic bacterium. T. maritima was selected as a structural genomics target based on its relatively small genome consisting of 1,877 genes and the hypothesis that the proteins expressed by a thermophilic bacterium would be easier to crystallize. Lesley et al used Escherichia coli to express all the open reading frames (ORFs) of T. martima. These proteins were then crystallized and structures were determined for successfully crystallized proteins using X ray crystallography. Among other structures, this structural genomics approach allowed for the determination of the structure of the TM0449 protein, which was found to exhibit a novel fold as it did not share structural homology with any known protein.
Микобактерия туберкулезінің протеомы
Туберкулездің құрылымдық геномикасы консорциумының мақсаты – туберкулезді қоздыратын бактерия – Mycobacterium tuberculosis-тің әлеуетті дәрілік нысаналарының құрылымын анықтау. Туберкулезге қарсы жаңа дәрілік емдеуді әзірлеу, әсіресе, көп дәріге төзімді туберкулездің өрбуіне байланысты, өте маңызды. М. туберкулезінің толық секвенцияланған геномы ғалымдарға осы белоктардың көптерін тазалау және рентгендік кристаллография арқылы құрылымын анықтау үшін экспрессиялық векторларға клондауға мүмкіндік берді. Зерттеулер құрылымын анықтауға болатын бірнеше нысаналы белоктарды анықтады, оның ішінде патогенезге қатысқан клеткадан тыс белоктар, темірді реттейтін белоктар, қазіргі дәрілік нысаналар және жаңа бүктелулері болжамдалған белоктар. Қазірге дейін М. туберкулезінің кодтаған 708 белгісінің құрылымы анықталды.
The goal of the TB Structural Genomics Consortium is to determine the structures of potential drug targets in Mycobacterium tuberculosis, the bacterium that causes tuberculosis. The development of novel drug therapies against tuberculosis are particularly important given the growing problem of multi drug resistant tuberculosis. The fully sequenced genome of M. tuberculosis has allowed scientists to clone many of these protein targets into expression vectors for purification and structure determination by X ray crystallography. Studies have identified a number of target proteins for structure determination, including extracellular proteins that may be involved in pathogenesis, iron regulatory proteins, current drug targets, and proteins predicted to have novel folds. So far, structures have been determined for 708 of the proteins encoded by M. tuberculosis.