Кіріспе
Белок құрылымын болжау әдісі
Молекулалық биологияда белоктарды жіктеу, сонымен қатар бүгілуді тану деп аталады, бұл белгілі құрылымдары бар белоктармен бірдей бүгілген, бірақ белгілі құрылымдағы гомологты белоктары жоқ белоктарды модельдеуге қолданылатын белоктарды модельдеу әдісі. Ол құрылымды болжаудың гомологиялық модельдеу әдісінен ерекшеленеді, себебі белоктарды жіктеу (белок тізу) олардың гомологты белок құрылымдары Ақуыздық деректер банкіне (PDB) енгізілмеген жағдайларда қолданылады, ал гомологиялық модельдеу мұндай құрылымдары бар белоктар үшін қолданылады. Тізу PDB-ге енгізілген құрылымдар мен модельдеуге тырысылып жатқан белоктың аминқышқылдық тізбегі арасындағы статистикалық байланысты пайдалану арқылы жұмыс істейді. Болжам жасау "тізу" арқылы жүзеге асырылады (яғни, мақсатты тізбектегі әрбір аминқышқылды шаблон құрылымындағы тиісті орынға орналастыру, сәйкестендіру), содан кейін мақсаттың шаблонға қаншалықты жақсы сәйкес келетіні бағаланады. Ең жақсы сәйкес келетін шаблон таңдалғаннан кейін, тізбектің құрылымдық моделі таңдалған шаблонмен сәйкестік негізінде құрастырылады. Белоктарды тізу екі негізгі байқауға негізделген: табиғаттағы әртүрлі бүгілулердің саны салыстырмалы түрде аз (шамамен 1300); және соңғы үш жылда PDB-ге ұсынылған жаңа құрылымдардың 90%-ында PDB-дегілерге ұқсас құрылымдық бүгілулер кездеседі.
Белок құрылысының жіктелуі
Белоктардың құрылымдық жіктелуі (SCOP) дерекқоры белгілі құрылымдардың құрылымдық және эволюциялық байланыстарын егжей-тегжейлі және толық сипаттайды. Белоктар құрылымдық және эволюциялық туыстықты көрсету үшін жіктеледі. Иерархияда көптеген деңгейлер бар, бірақ негізгі деңгейлер – отбасы, суперотбасы және бүктеме:
Family (clear evolutionary relationship): Proteins clustered together into families are clearly evolutionarily related. Generally, this means that pairwise residue identities between the proteins are 30% and greater. However, in some cases similar functions and structures provide definitive evidence of common descent in the absence of high sequence identity; for example, many globins form a family though some members have sequence identities of only 15%. Superfamily (probable common evolutionary origin): Proteins that have low sequence identities, but whose structural and functional features suggest that a common evolutionary origin is probable, are placed together in superfamilies. For example, actin, the ATPase domain of the heat shock protein, and hexokinase together form a superfamily. Fold (major structural similarity): Proteins are defined as having a common fold if they have the same major secondary structures in the same arrangement and with the same topological connections. Different proteins with the same fold often have peripheral elements of secondary structure and turn regions that differ in size and conformation. In some cases, these differing peripheral regions may comprise half the structure. Proteins placed together in the same fold category may not have a common evolutionary origin: the structural similarities could arise just from the physics and chemistry of proteins favoring certain packing arrangements and chain topologies.
Отбасы (нақты эволюциялық байланыс): Отбасыға топталған белоктар нақты эволюциялық жағынан байланысты. Әдетте, бұл белоктар арасындағы жұптық қалдықтардың сәйкестігі 30% және одан жоғары екенін білдіреді. Алайда, кейбір жағдайларда жоғары реттілік сәйкестігі болмаса да, ұқсас функциялар мен құрылымдар ортақ тектің нақты дәлелін береді; мысалы, көптеген глобиндер отбасын құрайды, бірақ олардың кейбір мүшелерінің реттілік сәйкестігі 15%-қа ғана жетеді.
Family (clear evolutionary relationship): Proteins clustered together into families are clearly evolutionarily related. Generally, this means that pairwise residue identities between the proteins are 30% and greater. However, in some cases similar functions and structures provide definitive evidence of common descent in the absence of high sequence identity; for example, many globins form a family though some members have sequence identities of only 15%. Superfamily (probable common evolutionary origin): Proteins that have low sequence identities, but whose structural and functional features suggest that a common evolutionary origin is probable, are placed together in superfamilies. For example, actin, the ATPase domain of the heat shock protein, and hexokinase together form a superfamily. Fold (major structural similarity): Proteins are defined as having a common fold if they have the same major secondary structures in the same arrangement and with the same topological connections. Different proteins with the same fold often have peripheral elements of secondary structure and turn regions that differ in size and conformation. In some cases, these differing peripheral regions may comprise half the structure. Proteins placed together in the same fold category may not have a common evolutionary origin: the structural similarities could arise just from the physics and chemistry of proteins favoring certain packing arrangements and chain topologies.
Суперотбасы (ықтимал ортақ эволюциялық тегі): Төмен реттілік сәйкестігі бар, бірақ құрылымдық және функционалдық ерекшеліктері ортақ эволюциялық тегі болуы мүмкін екенін көрсететін белоктар суперотбасы ретінде топтастырылады. Мысалы, актин, жылулық шок белгісінің АТФаза домені және гексокиназа бірге суперотбасын құрайды.
Family (clear evolutionary relationship): Proteins clustered together into families are clearly evolutionarily related. Generally, this means that pairwise residue identities between the proteins are 30% and greater. However, in some cases similar functions and structures provide definitive evidence of common descent in the absence of high sequence identity; for example, many globins form a family though some members have sequence identities of only 15%. Superfamily (probable common evolutionary origin): Proteins that have low sequence identities, but whose structural and functional features suggest that a common evolutionary origin is probable, are placed together in superfamilies. For example, actin, the ATPase domain of the heat shock protein, and hexokinase together form a superfamily. Fold (major structural similarity): Proteins are defined as having a common fold if they have the same major secondary structures in the same arrangement and with the same topological connections. Different proteins with the same fold often have peripheral elements of secondary structure and turn regions that differ in size and conformation. In some cases, these differing peripheral regions may comprise half the structure. Proteins placed together in the same fold category may not have a common evolutionary origin: the structural similarities could arise just from the physics and chemistry of proteins favoring certain packing arrangements and chain topologies.
Бүктеме (негізгі құрылымдық ұқсастық): Егер белоктардың бірдей негізгі екінші құрылымдары және бірдей топологиялық байланыстары болса, олар бірдей бүктемеге ие деп анықталады. Бір бүктемедегі әртүрлі белоктардың екінші құрылымның шеткі элементтері және өлшемі мен пішіні бойынша әртүрлі айналатын аймақтары болуы мүмкін. Кейбір жағдайларда, бұл шеткі аймақтар құрылымның жартысын құрауы мүмкін. Бір бүктеме санатына біріктірілген белоктардың ортақ эволюциялық тегі болмауы мүмкін: құрылымдық ұқсастықтар белоктардың физикасы мен химиясының белгілі бір қаптамалық құрылымдар мен тізбек топологияларын қалай ұнататынынан туындауы мүмкін.
Family (clear evolutionary relationship): Proteins clustered together into families are clearly evolutionarily related. Generally, this means that pairwise residue identities between the proteins are 30% and greater. However, in some cases similar functions and structures provide definitive evidence of common descent in the absence of high sequence identity; for example, many globins form a family though some members have sequence identities of only 15%. Superfamily (probable common evolutionary origin): Proteins that have low sequence identities, but whose structural and functional features suggest that a common evolutionary origin is probable, are placed together in superfamilies. For example, actin, the ATPase domain of the heat shock protein, and hexokinase together form a superfamily. Fold (major structural similarity): Proteins are defined as having a common fold if they have the same major secondary structures in the same arrangement and with the same topological connections. Different proteins with the same fold often have peripheral elements of secondary structure and turn regions that differ in size and conformation. In some cases, these differing peripheral regions may comprise half the structure. Proteins placed together in the same fold category may not have a common evolutionary origin: the structural similarities could arise just from the physics and chemistry of proteins favoring certain packing arrangements and chain topologies.
Гомологиялық модельдеумен салыстыру
Гомологиялық модельдеу және белоктарды жіктеу – екеуі де үлгіге негізделген әдістер, және олардың арасында болжау техникалары тұрғысынан қатаң шекара жоқ. Бірақ олардың белок құрылымдары әртүрлі. Гомологиялық модельдеу белгілі құрылымы бар гомологты ақуыздары бар (әдетте бір отбасының) нысаналар үшін қолданылады, ал белоктарды жіктеу тек қана құрылымдық деңгейде гомологиясы бар нысаналар үшін қолданылады. Басқаша айтқанда, гомологиялық модельдеу "оңай" нысаналар үшін, ал белоктарды жіктеу "қиын" нысаналар үшін арналған. Гомологиялық модельдеу сәйкестіктегі үлгіні тізбек ретінде қарастырады, ал болжау үшін тек тізбектік гомология қолданылады. Белоктарды жіктеу сәйкестіктегі үлгіні құрылым ретінде қарастырады, және сәйкестіктен алынған тізбек және құрылым туралы ақпаратты болжау үшін пайдаланады. Егер маңызды гомология табылмаса, белоктарды жіктеу құрылым туралы ақпаратқа негізделген болжам жасай алады. Сондай-ақ, осы себепті белоктарды жіктеу көп жағдайда гомологиялық модельдеуден тиімді болуы мүмкін. Іс жүзінде, егер тізбектік сәйкестіктегі тізбектердің сәйкестігі төмен болса (яғни <25%), гомологиялық модельдеу маңызды болжам жасамайды. Бұл жағдайда, егер нысана үшін алыс гомология табылып, белоктарды жіктеу жақсы болжам жасауы мүмкін.
Тақырыбы туралы көбірек
Қиылысты тану әдістерін екі негізгі түрге бөлуге болады: біріншісі – жиынтық кітапханасындағы әрбір құрылым үшін 1D профильді құрып, мақсатты тізбекті осы профильдермен салыстыру; екіншісі – ақуыз үлгісінің толық 3D құрылымын қарастыру. Профильдік бейнелеудің қарапайым мысалы – құрылымдағы әрбір аминқышқылын, оның ақуыздың ядросына көмілгеніне немесе бетіне шығыңқы екеніне қарай белгілеу. Күрделірек профильдер жергілікті екіншілік құрылымды (мысалы, аминқышқыл альфа спиральдың бөлігі ме) және тіпті эволюциялық ақпаратты (аминқышқылдың қаншалықты сақталғанын) ескере алады. 3D бейнелеуде құрылым атомдар аралық қашықтықтар жиынтығы ретінде моделенеді, яғни қашықтықтар құрылымдағы кейбір немесе барлық атом жұптары арасында есептеледі. Бұл құрылымды сипаттаудың әлдеқайда толыққанды және икемді тәсілі, бірақ сәйкестікті есептеуде қолдану қиынға түседі. Профильге негізделген қиылысты тану әдісін алғаш рет 1991 жылы Боуи, Люти және Дэвид Айзенберг сипаттады. «Жік салу» (threading) терминін алғаш рет 1992 жылы Дэвид Джонс, Уильям Р. Тейлор және Джанет Торнтон қолданды, және бастапқыда ол қиылысты тануда ақуыз үлгісінің толық 3D атомдық құрылымын пайдалануды білдірді. Бүгінгі таңда «жік салу» және «қиылысты тану» терминдері жиі (бірақ толыққанды дұрыс емес) бір-бірін алмастырып қолданылады. Қиылысты тану әдістері кеңінен қолданылады және тиімді, себебі табиғатта ақуыздың қатпарларының саны шектеулі деп есептеледі, бұл көбінесе эволюцияның нәтижесінде, сондай-ақ полипептидтік тізбектердің физикалық және химиялық қасиеттерінің шектеулеріне байланысты. Сондықтан, мақсатты ақуызға ұқсас қатпары бар ақуыздың рентгендік кристаллография немесе ядролық магниттік резонанс (ЯМР) спектроскопиясы арқылы зерттелгендігі және PDB базасында табылғандығының ықтималдығы жоғары (қазіргі уақытта 70-80%). Қазіргі уақытта 1300-ге жуық әртүрлі ақуыз қатпарлары белгілі, бірақ жыл сайын жаңа қатпарлар ашылуда, бұл үлкен үлес structural genomics жобаларына тиесілі. Тізбектің құрылымға дұрыс жіктелуін табу үшін көптеген әртүрлі алгоритмдер ұсынылған, олардың көпшілігі қандай да бір түрінде динамикалық бағдарламалауды қолданады. Толық 3D жік салу үшін ең жақсы сәйкестікті анықтау мәселесі өте қиын (кейбір модельдер үшін бұл NP-қиын мәселе). Зерттеушілер шартты кездейсоқ өрістер, симуляциялық оттеу, тармақталу және шектеу, сызықтық бағдарламалау сияқты көптеген комбинаторлық оңтайландыру әдістерін қолданды, эвристикалық шешімдерге жету үшін ізденіс жүргізіп жатыр. Жік салу әдістерін екі ақуыз құрылымын салыстыруға тырысатын әдістермен (ақуыз құрылымдық сәйкестендіру) салыстыру қызықты, және шындығында екі мәселеге де бірдей алгоритмдер қолданылған.
Белоктарды жіктеу бағдарламалық жасақтамасы
HHpred – жасырын Марков модельдерін жұптап салыстыруға негізделген қашықтықтан гомологияны анықтауға арналған, кеңінен қолданылатын HHsearch бағдарламалық жасақтамасын іске қосатын танымал желілік сервер. RAPTOR (бағдарламалық қамтамасыз ету) – бүтін санды бағдарламалау негізіндегі ақуыз жіктеу бағдарламалық қамтамасыз ету. Оның орнына RaptorX / ақуыз модельдеу және талдау бағдарламалық қамтамасыз етуі келді, ол жеке шаблонды және көп шаблонды жіктеу үшін ықтималдық графикалық модельдерді және статистикалық қорытындыларды қолданады. RaptorX, RAPTOR-дан айтарлықтай жақсы нәтижелер береді және әсіресе сирек тізбектік профилі бар ақуыздарды туралауда өте тиімді. RaptorX сервері тегін қолдануға болады. Phyre – HHsearch-ті ab initio және көп шаблонды модельдеумен біріктіретін танымал желілік сервер. MUSTER – динамикалық бағдарламалау және тізбек профильдік туралауға негізделген стандартты жіктеу алгоритмі. Сондай-ақ, ол тізбек профильдік туралауға көмектесетін бірнеше құрылымдық ресурстарды біріктіреді. SPARKS X – сұраныстың болжамды бір өлшемді құрылымдық қасиеттері мен шаблонның сәйкес туа біткен қасиеттері арасындағы тізбекті құрылымға сәйкестікті табуға арналған ықтималдыққа негізделген әдіс. BioShell – оптимизацияланған профильдік динамикалық бағдарламалау алгоритмін және болжамды екінші құрылымды біріктіретін жіктеу алгоритмі.