Кіріспе

Биологиялық болжау түрі

Белок құрылымын болжау – белоктың аминоқышқылдық тізбегінен оның үш өлшемді құрылымын анықтау, яғни бастапқы құрылымынан екінші және үшінші құрылымдарын болжау. Құрылымды болжау, белокты жобалаудың кері мәселесінен өзгеше. Белок құрылымын болжау – есептеу биологиясының ең маңызды мақсаттарының бірі; ол медицинада (мысалы, дәрі-дәрмектерді әзірлеуде) және биотехнологияда (мысалы, жаңа ферменттерді жобалауда) маңызды рөл атқарады. 1994 жылдан бастап, қазіргі әдістердің нәтижелері CASP (Белок құрылымын болжау техникаларын сыни бағалау) эксперименті арқылы екі жылда бір рет бағаланады. CAMEO3D қоғамдық жобасы белок құрылымын болжауға арналған веб-серверлерді үздіксіз бағалауды жүзеге асырады.

Белоктың құрылымы мен терминологиясы

Белоктар – пептидтік байланыстар арқылы біріктірілген аминқышқылдарының тізбегі. Бұл тізбектің көптеген конформациялары Cα атомындағы φ және ψ бұрыштық бұрыштарының айналуына байланысты мүмкін (суретті қараңыз). Бұл конформациялық икемділік ақуыздардың үш өлшемді құрылымындағы айырмашылықтарға жауап береді. Тізбектегі пептидтік байланыстар полярлы, яғни олар карбонил тобында оң және теріс зарядтарды (ішімдік зарядтарды) бөліп алады, бұл сутекті байланысты қабылдағыш ретінде әрекет етуге мүмкіндік береді, ал NH тобы – сутекті байланысты донор ретінде. Сондықтан бұл топтар ақуыз құрылымында өзара әрекеттесе алады. Белоктер негізінен 20 түрлі L α аминқышқылынан (протеиногенді аминқышқылдары) тұрады. Бұларды бүйірлік тізбектің химиялық қасиеттеріне сәйкес жіктеуге болады, ол маңызды құрылымдық рөл атқарады. Глицин ерекше орынға ие, себебі оның ең кішкентай бүйірлік тізбегі бар, тек бір сутек атомынан тұрады, сондықтан ол ақуыз құрылымының жергілікті икемділігін арттыра алады. Ал цистеин басқа цистеин қалдықтарымен реакцияласып, цистин құрауы мүмкін, осылайша бүкіл құрылымды тұрақтандыратын көпіршіктерді (қайыстырушы байланыстарды) жасайды. Ақуыз құрылымын α спиральдері мен β парақтары сияқты екіншілік құрылым элементтерінің тізбектері ретінде қарастыруға болады. Осы екіншілік құрылымдарда, жақын орналасқан аминқышқылдардың негізгі тізбектегі NH және CO топтары арасында H байланыстарының реттелген үлгілері қалыптасады, ал аминқышқылдардың φ және ψ бұрыштары ұқсас болады. Бұл екіншілік құрылымдардың пайда болуы пептидтік байланыстардың сутекті байланыс жасау қабілетін тиімді қанағаттандырады. Екіншілік құрылымдар гидрофобты ортада ақуыз ядросында тығыз жиналуы мүмкін, бірақ олар ақуыздың полярлық бетінде де кездесуі мүмкін. Әрбір аминқышқылдың бүйірлік тізбегі белгілі бір көлемді алып, жақын маңдағы басқа бүйірлік тізбектермен өзара әрекеттесуге шектеулі мүмкіндіктерге ие, бұл жағдай молекулалық модельдеу және сәйкестендіру кезінде ескерілуі тиіс.

α-спираль

А спиралі – ақуыздардағы екінші құрылымның ең көп таралған түрі. А спиралінде әрбір айналымда 3,6 аминқышқылы болады, әр төртінші қалдық арасында H байланысы қалыптасады; орташа ұзындығы 10 аминқышқылы (3 айналым) немесе 10 Å құрайды, бірақ 5-тен 40-қа дейін (1,5-тен 11 айналымға дейін) өзгереді. H байланыстарының орналасуы спираль үшін диполь моментін тудырады, нәтижесінде спиральдің амин ұшында жартылай оң заряд пайда болады. Бұл аймақта бос NH2 топтары болғандықтан, ол фосфаттар сияқты теріс зарядталған топтармен өзара әрекеттеседі. А спиральдерінің ең көп кездесетін орны – ақуыз ядросының беті, онда олар сулы ортамен байланыс жасайды. Спиральдің ішкі бетіне гидрофобты аминқышқылдары, ал сыртқы бетіне гидрофильді аминқышқылдары орналасады. Сондықтан, тізбектегі әр төртінші аминқышқылының бірі гидрофобты болуға бейім, бұл үлгіні оңай анықтауға болады. Лейцин циппері мотивінде екі жақын спиральдің қарама-қарсы жақтарындағы лейциндердің қайталама үлгісі мотивтің болуын жоғары дәлдікпен болжайды. Бұл қайталама үлгіні көрсету үшін спираль тәрізді график қолданылуы мүмкін. Ақуыз ядросына енген немесе жасушалық мембраналарда орналасқан басқа α спиральдер гидрофобты аминқышқылдарының жоғары және біркелкі таралуын көрсетеді, бұл мұндай құрылымдардың болуын күтілуге аспайды. Сыртқы бетте орналасқан спиральдерде гидрофобты аминқышқылдарының үлесі төмендеу болады. Аминқышқылдарының құрамы α спиральді аймақты болжауға көмектеседі. Аланин (A), глутамин қышқылы (E), лейцин (L) және метионин (M) аминқышқылдарына бай және пролин (P), глицин (G), тирозин (Y) және серин (S) аминқышқылдарына кедей аймақтар α спиралін қалыптастыруға бейім. Пролин α спиралін тұрақсыздандырады немесе бұзады, бірақ ұзын спиральдерде кездесіп, иілім түзе алады.

β-қағаз

β-қаптамалар тізбектің бір бөлігіндегі шамамен 5–10 тізбектес аминқышқылдары арасындағы H байланыстары арқылы, тізбектің басқа бөлігіндегі тағы 5–10 аминқышқылдарымен қалыптасады. Өзара әрекеттесетін аймақтар жақын орналасқан болуы мүмкін, олардың арасында қысқа тіекше орналасқан, немесе алыс орналасқан, араларында басқа құрылымдар бар. Барлық тізбек бір бағытта жүріп параллель қаптаманы құрауы мүмкін, немесе әрбір екінші тізбек кері химиялық бағытта жүріп антипараллель қаптаманы құрауы мүмкін, ал тізбектер параллель және антипараллель болып аралас қаптаманы құрауы да мүмкін. Параллель және антипараллель конфигурациялардағы H байланысының схемасы әртүрлі. Қабаттың ішкі тізбектеріндегі әрбір аминқышқыл көрші аминқышқылдармен екі H байланысын жасайды, ал сыртқы тізбектегі әрбір аминқышқыл ішкі тізбекпен бір ғана байланыс жасайды. Тізбектерге перпендикуляр қарағанда, алыс тізбектер сәл сағат тіліне қарсы бұрылып сол жақ бұрылысын құрайды. Cα атомдары қабатталған құрылымда қабаттың үстінде және астында кезектеседі, ал аминқышқылдардың R топтары қабаттардың үстінде және астында кезектеседі. Рамачандран диаграммасының бір аймағында аминқышқылдардың Φ және Ψ бұрыштары айтарлықтай өзгереді. β-қаптамалардың орналасуын α-спиральдарға қарағанда болжау қиынырақ. Аминқышқылдарының көптік тізбектердегі өзгерісін ескергенде жағдай шамалы жақсарады.

Бұрандалар

Белгінің кейбір бөліктері үш өлшемді құрылымға ие, бірақ ешқандай реттелген құрылымдарды қалыптастырмайды. Оларды протеиндердің ретсіз немесе жазылмаған сегменттерімен, немесе кездейсоқ ораммен – ешқандай бекітілген үш өлшемді құрылымы жоқ жазылмаған полипептидтік тізбекпен шатастырмау керек. Бұл бөліктер жиі "ілмектер" деп аталады, себебі олар β-парақтар мен α-спиральдарды байланыстырады. Ілмектер әдетте ақуыздың бетінде орналасқан, сондықтан олардың қалдықтарының мутацияларына оңай төтеп беруге болады. Бірқатар тізбектемелердің белгілі бір аймағында алмастырулардың, енгізулердің және жоюлардың көп болуы, мүмкін, ілмектердің болуын көрсетеді. Геномдық ДНҚ-дағы интронның орны, кодталған ақуыздағы ілмектердің орналасуымен сәйкес келуі мүмкін. Ілмектерде зарядталған және полярлы аминқышқылдары жиі кездеседі және олар белсенді орталықтардың құрауышы болып табылады.

Белоктарды жіктеу

Ақуыздар құрылымдық және реттілік ұқсастығы бойынша жіктелуі мүмкін. Құрылымдық жіктеу үшін жоғарыда сипатталған екінші құрылымдардың мөлшері мен кеңістіктегі орналасуы белгілі үш өлшемді құрылымдармен салыстырылады. Реттік ұқсастық негізіндегі жіктеу тарихта алғаш қолданылды. Бастапқыда толық реттіліктердің салыстырылуы негізінде ұқсастық анықталды. Кейін ақуыздар сақталған аминқышқылдарының үлгілерінің болуына сүйене отырып жіктелді. Ақуыздарды осы схемалардың бірі немесе бірнешесі бойынша жіктейтін деректер базалары бар. Ақуыз жіктеу схемаларын қарастырғанда бірнеше мәселені ескеру маңызды. Біріншіден, әртүрлі эволюциялық тегі бар екі әртүрлі ақуыз бірдей құрылымға ие болуы мүмкін. Керісінше, белгілі бір құрылым үшін ежелгі геннің реттілігі әртүрлі түрлерде айтарлықтай өзгеруі мүмкін, бірақ бірдей негізгі құрылымдық ерекшеліктерді сақтайды. Мұндай жағдайларда қалған реттілік ұқсастығын анықтау өте қиын болуы мүмкін. Екіншіден, бір-бірімен немесе үшінші реттілікпен маңызды дәрежеде ұқсас екі ақуыз бірдей эволюциялық тектен шыққан және олардың құрылымдық ерекшеліктері де ұқсас болуы керек. Дегенмен, эволюция кезінде геннің көшірілуі және генетикалық өзгерістер жаңа гендердің көшірмелерін тудыруы мүмкін, олар жаңа функциялар мен құрылымдарға ие ақуыздарға айналуы мүмкін. Мотив (құрылымдық контекст) – полипептидтік тізбектің жанындағы бөліктерінің бүгілуінен пайда болатын бірнеше екінші құрылымдық элементтердің комбинациясы, нәтижесінде нақты үш өлшемді конфигурация пайда болады. Мысалы, спираль-цикл мотиві. Құрылымдық мотивтер суперсекундылық құрылымдар және бүгілімдер деп те аталады. Позицияға қатысты бағалау матрицасы (реттік контекст, салмақ немесе бағалау матрицасы деп те аталады) – бірнеше реттіліктердің сәйкестендірілуінде бос орындарсыз сақталған аймақты көрсетеді. Әрбір матрица бағаны бірнеше реттіліктердің сәйкестендірілуінің бір бағанындағы өзгерісті көрсетеді. Позицияға қатысты бағалау матрицасы – 3D (құрылымдық контекст) бір құрылымдық кластың ақуыздарының сәйкестендірілуінде кездесетін аминқышқылының өзгерісін көрсетеді. Матрица бағандары сәйкестендірілген құрылымдардағы бір аминқышқылы позициясында табылған аминқышқылының өзгерісін көрсетеді. Біріншілік құрылым – ақуыздың сызықтық аминқышқылы реттілігі, химиялық тұрғыдан пептидтік байланыстармен байланысқан аминқышқылдарынан тұратын полипептидтік тізбек. Профиль (реттік контекст) – ақуыз отбасының бірнеше реттілік сәйкестендірілуін көрсететін бағалау матрицасы. Профиль әдетте бірнеше реттілік сәйкестендірілуде жақсы сақталған аймақтан алынады. Профиль матрица түрінде болады, әрбір бағаны сәйкестендірудегі бір позицияны, ал әр қатар бір аминқышқылын көрсетеді. Матрица мәндері сәйкестендірудегі тиісті позициядағы әрбір аминқышқылының ықтималдығын көрсетеді. Профильді динамикалық бағдарламалау алгоритмімен ең жақсы бағалайтын аймақтарды табу үшін мақсатты реттілік бойымен жылжытады. Сәйкестендіру кезінде бос орындарға рұқсат етіледі және аминқышқылы сәйкес келмеген жағдайда бос орынға айыппұл салынады. Реттік профильді жасырылған Марков моделімен де көрсетуге болады, ол профильдік HMM деп аталады. Профиль (құрылымдық контекст) – белгілі бір ақуыз құрылымындағы реттілік позицияларда қандай аминқышқылдары жақсы және нашар орналасатынын көрсететін бағалау матрицасы. Профиль бағандары құрылымдағы реттілік позицияларды, ал профиль қатарлары 20 аминқышқылын көрсетеді. Реттік профильдегідей, құрылымдық профильді динамикалық бағдарламалау алгоритмімен ең жоғары сәйкестендіру бағасын табу үшін мақсатты реттілік бойымен жылжытады. Ауысулар енгізілуі мүмкін және айыппұл салынады. Нәтижесінде алынған балл мақсатты ақуыздың осындай құрылымға ие болатынына нұсқа береді. Төртіншілік құрылым – бірнеше тәуелсіз полипептидтік тізбектерді қамтитын ақуыз молекуласының үш өлшемді конфигурациясы. Екіншілік құрылым – полипептидтік тізбектегі аминқышқылдарындағы C, O және NH топтары арасындағы өзара әрекеттесулер, нәтижесінде α-спиральдар, β-парақтар, бұрылыстар, циклдар және басқа да формалар пайда болады, бұл үш өлшемді құрылымға бүгілуді жеңілдетеді. Суперотбасы – бірдей немесе әртүрлі ұзындығы бар, бірақ алыстағы, бірақ анықталатын реттілік ұқсастығымен байланысқан ақуыз отбасыларының тобы. Белгілі бір суперотбасының мүшелері ортақ эволюциялық тектің иесі. Бастапқыда Дэйхофф суперотбасы статусының шегін реттіліктердің байланыссыз болу ықтималдығы 106 деп белгіледі, бұл сәйкестендіру бағасы негізінде есептелді (Dayhoff et al. 1978). Реттік сәйкестендіруде аз сәйкестік болған, бірақ құрылымдық және функционалдық ерекшеліктерінің сенімді саны ортақ болған ақуыздар бірдей суперотбасыға жатқызылады. Үш өлшемді құрылым деңгейінде суперотбасы ақуыздары ортақ құрылымдық ерекшеліктерді, мысалы, ортақ бүгілімді бөліседі, бірақ екінші құрылымдардың саны мен орналасуында да айырмашылықтар болуы мүмкін. PIR ресурсы суперотбасыларға қатысты гомеоморфты суперотбасылар терминін қолданады, олар сәйкестендірудің соңынан соңына дейін жүзеге асырылатын реттіліктерден құралған, яғни жалпы реттілік гомологиялық доменін бөлісетін суперотбасылар, сәйкестендірудің бойында созылатын ұқсастық аймағы. Бұл домен басқа ақуыз отбасыларымен және суперотбасыларымен бөлісетін кішірек гомологиялық домендерді де қамтуы мүмкін. Ақуыз реттілігі бірнеше суперотбасыларда табылған домендерді қамтуы мүмкін, осылайша күрделі эволюциялық тарихты көрсетеді, бірақ реттіліктер бірнеше реттілік сәйкестендіруінің бойындағы ұқсастықтың болуына негізделген тек бір гомеоморфты суперотбасыға жатқызылады. Суперотбасы сәйкестендіруі сәйкестендірудің ішінде немесе соңында сәйкес келмейтін аймақтарды да қамтуы мүмкін. Керісінше, бір отбасыдағы реттіліктер сәйкестендірудің бойында жақсы сәйкес келеді. Суперсекундылық құрылым – құрылымдық мотивке ұқсас мағынаға ие термин. Үшіншілік құрылым – полипептидтік тізбектің екінші құрылымдарының жиналуынан немесе бүгілуінен пайда болатын үш өлшемді немесе глобулярлық құрылым. Бұл жоғары дәлдік, бүгілімді тануды және ab initio ақуыз құрылымын болжауды жақсарту, құрылымдық мотивтерді жіктеу және реттілік сәйкестендіруін жақсарту үшін болжамдарды пайдалануға мүмкіндік береді. Ақуыздың екінші құрылымын болжаудың қазіргі әдістерінің дәлдігі LiveBench және EVA сияқты апталық бенчмарктерде бағаланады.

Өмірбаян

Екінші құрылымды болжаудың алғашқы әдістері 1960 және 1970 жылдары енгізілді, олар негізінен альфа-спиральдарды анықтауға бағытталған және спираль-катушка өту модельдеріне негізделген. 1970 жылдары бета-парақтарды қамтитын айқын дәлдіктегі болжамдар енгізілді, олар белгілі шешілген құрылымдардан алынған ықтималдық параметрлеріне негізделген статистикалық бағалауларды пайдаланды. Бұл әдістер бір тізбекке қолданылғанда, әдетте 60-65% шамасындағы дәлдікке жетеді және көбінесе бета-парақтарды жеткіліксіз болжайды. Екінші құрылымдардың эволюциялық сақталуын көптеген гомологты тізбектерді бір мезгілде бағалау арқылы, сондай-ақ тізбектелген аминокислота бағанасының жалпы екінші құрылымдық бейімділігін есептеу арқылы пайдалануға болады. Белгілі белок құрылымдарының үлкен дерекқорларымен және нейрондық желілер мен қолдау векторлық машиналар сияқты қазіргі заманғы машиналық оқыту әдістерімен бірлесе отырып, бұл әдістер шар тәрізді белоктарда 80% дейін жалпы дәлдікке жете алады. Теориялық жоғары шекті дәлдік шамамен 90% құрайды. 1970 жылдардың ортасында шешілген құрылымдардың шағын үлгісінен анықталған бастапқы Чжоу-Фасман параметрлері, қазіргі заманғы әдістермен салыстырғанда нашар нәтижелер береді, бірақ параметрлер алғаш жарияланғаннан бері жаңартылды. Чжоу-Фасман әдісі екінші құрылымдарды болжауда шамамен 50-60% дәлдікке ие. GOR әдісі әрбір аминокислотаның белгілі бір екінші құрылымға ие болу ықтималдығын ғана емес, сонымен қатар оның көршілерінің үлесін ескере отырып, аминокислотаның әрбір құрылымды қабылдауының шартты ықтималдығын да ескереді (көршілердің сол құрылымға ие екенін қабылдамайды). Бұл тәсіл Чжоу мен Фасманның әдісіне қарағанда сезімтал және дәл, өйткені аминокислоталардың құрылымдық бейімділігі тек пролин және глицин сияқты аминокислоталардың шағын тобы үшін ғана күшті. Көптеген көршілердің әлсіз үлесі жалпы әсерге әкелуі мүмкін. Бастапқы GOR әдісі шамамен 65% дәлдікке ие болды және бета-парақтарға қарағанда альфа-спиральдарды болжауда айқын сәттілікке жетті, олар көбінесе бұрандалар немесе ұйымдаспаған аймақтар ретінде қате болжанатын. Машиналық оқыту әдістерінің кеңейтілуі белгіленбеген аймақтардағы тіректің диэдрлік бұрыштары сияқты белоктердің ұсақ түйірлі жергілікті қасиеттерін болжауға тырысады. Бұл мәселеге SVM және нейрондық желілер қолданылды.

Басқа да жақсартулар

Белоктың аминқышқылдық тізбегінен басқа, екіншілік құрылымның қалыптасуы басқа да факторларға байланысты екені хабарланды. Мысалы, екіншілік құрылымға бейімділік жергілікті ортаға, қалдықтардың еріткішпен қолжетімділігіне, белоктың құрылымдық класына және тіпті белок алынған организмге де байланысты екені көрсетілген. Осындай байқауларға негізделген кейбір зерттеулер, белоктың құрылымдық класы, қалдықтардың қолжетімді бетінің ауданы және контактілік сан туралы ақпаратты қосу арқылы екіншілік құрылымды болжауды жақсартуға болады екенін көрсетті.

Үшінші деңгейлі құрылым

Белок құрылымын болжаудың практикалық маңызы қазір бұрынғыдан да артып отыр. Адам геномдық жобасы сияқты, қазіргі заманғы ірі масштабты ДНК тізбектеу жұмыстарының нәтижесінде, белок тізбектерінің үлкен көлемдегі деректері жасалуда. Құрылымдық геномика саласындағы қауымдастық күш-жігеріне қарамастан, эксперименттік жолмен анықталған белок құрылымдарының шығысы – әдетте, уақытты көп алатын және салыстырмалы түрде қымбат рентгендік кристаллография немесе ЯМР спектроскопиясы арқылы – белок тізбектерінің шығысынан қалып қоюда. Белок құрылымын болжау әлі де өте қиын және шешілмеген мәселе болып табылады. Екі негізгі мәселе – белоктың бос энергиясын есептеу және осы энергияның глобальдық минимумдарын табу. Белок құрылымын болжау әдісі астрономиялық мөлшердегі мүмкін белок құрылымдары кеңістігін зерттеуі керек. Бұл мәселелерді "салыстырмалы" немесе гомологиялық модельдеу және бүктелуді тану әдістерінде ішінара айналып өтуге болады, онда іздеу кеңістігі зерттеліп отырған белоктың басқа гомологты белоктың эксперименттік анықталған құрылымына жақын құрылымды қабылдайды деген болжаммен қысқартылады. Де ново белок құрылымын болжау әдістері болса, осы мәселелерді нақты шешуі тиіс. Белок құрылымын болжаудағы прогресс пен қиындықтарды Жан зерттеді. Немесе тек тізбекпен (әдетте, машиналық оқыту арқылы, ковариацияның көмегімен). Жеке домендердің құрылымдары домендік құрастыру деп аталатын процесте соңғы үшіншілік құрылымды құру үшін біріктіріледі.

Энергия және фрагменттер негізінде әдістер

Ab initio немесе de novo протеин моделеу әдістері үш өлшемді протеин модельдерін "бастапқыдан" құруға тырысады, яғни бұрын шешілген құрылымдарға емес (тікелей) физикалық принциптерге негізделген. Протеин қалыбына келтіруді имитациялауға тырысатын немесе мүмкін болатын шешімдерді іздеу үшін кейбір стохастикалық әдіс қолданатын көптеген процедуралар бар (яғни, қолайлы энергия функциясының жаһандық оптимизациясы). Бұл процедуралар көп есептеу ресурстарын қажет етеді, сондықтан олар тек кішкентай протеиндер үшін ғана жүзеге асырылды. Үлкен протеиндердің құрылымын de novo болжау үшін күшті суперкомпьютерлер (мысалы, Blue Gene немесе MDGRAPE 3) немесе үлестірілген есептеулер (мысалы, Folding@home, Human Proteome Folding Project және Rosetta@Home) сияқты жақсырақ алгоритмдер мен үлкен есептеу ресурстары қажет. Бұл есептеулерге кедергілер өте зор болғанымен, құрылымдық геномиканың әлеуетті пайдасы (болжамдық немесе эксперименттік әдістермен) ab initio құрылымды болжауды белсенді зерттеу саласына айналдырады. 2009 жылы суперкомпьютерде 50 қалдықтан тұратын протеин атомдық деңгейде 1 миллисекунд бойында модельделуі мүмкін болды. 2012 жылдан бастап, жаңа графикалық карта және күрделі алгоритмдері бар стандартты компьютерде салыстырмалы тұрақты күйді үлгілеуге болады. Дәл модельдеу арқылы симуляция уақытын ұзартуға болады.

3D байланыстарды болжау үшін эволюциялық ковариация

1990 жылдары секвенирлеу кеңінен таралғандықтан, бірнеше топтар ақуыз тізбектерінің сәйкестігін пайдаланып, байланысты мутацияларды болжауға тырысты және осы коэволюцияланған қалдықтарды үшіншілік құрылымды болжау үшін пайдалануға үміттенді (NMR сияқты тәжірибелік әдістерден алынған қашықтық шектеулеріне ұқсастықпен). Егер жеке қалдық мутациялары аз дәрежеде зиянды болса, қалдықтар арасындағы өзара әрекеттесуді қайта жандандыру үшін компенсаторлық мутациялар пайда болуы мүмкін. Бұл алғашқы жұмыстар ақуыз тізбектерінен байланысты мутацияларды есептеу үшін "жергілікті әдістер" деп аталатын әдістерді қолданды, бірақ әрбір қалдық жұбын басқа жұптардан тәуелсіз қарау нәтижесінде туындайтын жанама, жалған корреляциялардан зардап шекті. 2011 жылы, мүлдем жаңа, жаһандық статистикалық тәсіл, болжалған коэволюцияланған қалдықтардың жеткілікті мөлшерде тізбектер болған жағдайда (>1000 гомологты тізбек қажет) ақуыздың 3D құрылымын болжауға жеткілікті екенін көрсетті. EVfold әдісі гомологиялық модельдеуді, тізбектеуді немесе 3D құрылым фрагменттерін пайдаланбайды және оны жүздеген қалдықтары бар ақуыздар үшін де стандартты жеке компьютерде іске қосуға болады. Осы және ұқсас тәсілдерді қолдану арқылы болжанатын контактілердің дәлдігі көптеген белгілі құрылымдар мен контактілік карталарда, соның ішінде эксперименттік жолмен шешілмеген трансмембраналық ақуыздарды болжау арқылы расталды.

Салыстырмалы ақуыздық модельдеу

Салыстырмалы ақуыздық модельдеу бұрын шешілген құрылымдарды бастапқы нүктелер немесе үлгілер ретінде пайдаланады. Бұл тиімді, себебі нақты ақуыздардың саны өте көп болғанымен, көптеген ақуыздарға тән үшіншілік құрылымдық мотивтердің шектеулі жиынтығы бар. Табиғатта бар болғаны шамамен 2000 түрлі ақуыздық бүктеу бар деген болжам бар, бірақ миллиондаған түрлі ақуыздар кездеседі. Салыстырмалы ақуыздық модельдеу құрылымды болжауда эволюциялық ковариациямен үйлестірілуі мүмкін. Бұл әдістерді екі топқа бөлуге болады: Күдіксіз, гомологиялық модельдеу мақсатты және үлгілік ақуыздардың реттіліктері ұқсас болғанда ең дәл нәтижелер береді. Ақуыздық жіптеу (threading) белгісіз құрылымның аминокислоталық тізбесін шешілген құрылымдардың деректер базасымен салыстырып қарастырады. Әрбір жағдайда реттіліктің құрылыммен сәйкестігін бағалау үшін бағалау функциясы қолданылады, осылайша мүмкін үш өлшемді модельдер алынады. Бұл әдіс сондай-ақ үш өлшемді құрылымдар мен сызықтық ақуыз тізбектері арасындағы сәйкестікті талдауға негіделген 3D-1D бүктеуді тану ретінде де белгілі. Бұл әдіс берілген құрылымның үлкен тізбектер базасымен сәйкестігін бағалау арқылы кері бүктеу іздеуін жүзеге асыратын әдістерді де тудырды, осылайша қандай тізбектердің белгілі бір бүктеуді жасауға қабілетті екенін болжауға мүмкіндік береді.

Бүйірлік тізбектің пішіндерін модельдеу

Аминқышқылдарының бүйірлік тізбектерін дәл орналастыру ақуыз құрылымын болжауда жеке проблеманы құрайды. Бүйірлік тізбек геометриясын болжау мәселесін шешетін әдістерге соқпаққа тірелуді жою және өзіне сәйкес келетін орташа өріс әдістері жатады. Төмен энергиялы бүйірлік тізбек конформациялары әдетте қатаң полипептид тірегінде анықталады және "ротамерлер" деп аталатын дискретті бүйірлік тізбек конформациялары жиынтығы қолданылады. Бұл әдістер модельдің жалпы энергиясын ең төмендететін ротамерлер жиынтығын табуға тырысады. Бұл әдістерде ротамерлік кітапханалар пайдаланылады, олар ақуыздағы әрбір қалдық түрі үшін қолайлы конформациялар жинағы болып табылады. Ротамерлік кітапханаларда конформация, оның жиілігі және орташа диэдрлік бұрыштардың стандартты ауытқулары туралы ақпарат болуы мүмкін, олар үлгі алу кезінде қолданылады. Ротамерлік кітапханалар белгілі эксперименттік құрылымдардағы бүйірлік тізбек конформацияларының құрылымдық биоинформатикасы немесе басқа статистикалық талдауынан алынады, мысалы, тетраэдрлі көміртектердің байқалған конформацияларын шашыраңқы (60°, 180°, 60°) мәндеріне жақын топтастыру арқылы. Ротамерлік кітапханалар тірекке тәуелсіз, екіншілік құрылымға тәуелді немесе тірекке тәуелді болуы мүмкін. Тірекке тәуелсіз ротамерлік кітапханалар тірек конформациясына сілтеме жасамайды және белгілі бір типтегі барлық қолжетімді бүйірлік тізбектерден есептеледі (мысалы, ротамерлік кітапхананың алғашқы мысалы, 1987 жылы Йельде Пондер және Ричардс жасаған). Екіншілік құрылымға тәуелді кітапханалар спиральді, қабатты немесе орамды екіншілік құрылымдар үшін әртүрлі диэдрлік бұрыштарды және/немесе ротамер жиіліктерін ұсынады. Тірекке тәуелді ротамерлік кітапханалар екіншілік құрылымға қарамастан, тіректің диэдрлік бұрыштарымен анықталатын жергілікті тірек конформациясына тәуелді конформацияларды және/немесе жиіліктерді ұсынады. Көптеген бағдарламалық құралдарда қолданылатын осы кітапханалардың қазіргі нұсқалары ықтималдық немесе жиілік үлестірімдері түрінде ұсынылады, мұндағы шыңдар тізімдердегі жеке ротамерлер ретінде қарастырылатын диэдрлік бұрыш конформацияларына сәйкес келеді. Кейбір нұсқалар өте мұқият жинақталған деректерге негізделген және негізінен құрылымды тексеру үшін қолданылады, ал басқалары әлдеқайда үлкен деректер жиынтықтарындағы салыстырмалы жиіліктерге баса назар аударады және негізінен құрылымды болжау үшін қолданылатын форма, мысалы, Данбрак ротамерлік кітапханалары. Бүйірлік тізбекті орналастыру әдістері ақуыздың гидрофобтық ядросын талдау үшін өте пайдалы, онда бүйірлік тізбектер тығыз орналасқан; олар беттік қалдықтардың бос шектеулерін және жоғары икемділігін шешуде қиындықтарға тап болады, олар көбінесе бір ғана емес, бірнеше ротамерлік конформацияларды алады.

Төртіншілік құрылым

Екі немесе одан көп ақуыздық кешендердің жағдайында, егер ақуыздардың құрылымы белгілі болса немесе жоғары дәлдікпен болжау мүмкіндігі болса, кешеннің құрылымын болжау үшін ақуыз-ақуыз байланысу әдістерін қолдануға болады. Нақты орналасқан мутациялардың кешеннің байланысу қабілетіне тигізетін әсері туралы мәліметтер кешеннің құрылымын түсінуге және байланысу әдістерін дұрыс бағыттауға көмектеседі.

Бағдарламалық жасақтама

Белок құрылымын болжауға арналған көптеген бағдарламалық құралдар бар. Осы әдістерге гомологиялық модельдеу, белоктарды жіктеу, ab initio әдістері, екіншілік құрылымды болжау, трансмембраналық спиральдар мен сигналдық пептидтерді болжау кіреді. Атап айтқанда, ұзақ мерзімді және қысқа мерзімді жадқа негізделген терең оқыту 2007 жылдан бері осы мақсатта қолданылып келеді, ол белок гомологиясын анықтау және белоктардың субклеткалық орналасуын болжау үшін сәтті пайдаланылды. CASP эксперименттеріне негізделген соңғы сәтті әдістердің қатарында I-TASSER, HHpred және AlphaFold бар. 2021 жылы AlphaFold қазіргі таңдағы ең жақсы нәтижелерді көрсетіп тұр деген хабарлама тарады. Белок құрылымын білу жиі оның функциясын болжауға да мүмкіндік береді. Мысалы, коллаген ұзын созылған талшық тәрізді бүктеліп, оны талшықты белок етеді. Соңғы уақыттарда белокты бүктеуді және осылайша белок құрылымын болжау үшін бірнеше техникалар әзірленді, мысалы, I-TASSER және AlphaFold.

ЖА әдістері

AlphaFold ақуыз құрылымын болжауға қолданылған алғашқы жасанды интеллекттердің бірі болды. Ол Google-дің DeepMind компаниясы 2018 жылы өткен 13-ші CASP бәйгесінде ұсынды. AlphaFold-ты RoseTTAFold, содан кейін OmegaFold және ESM Metagenomic Atlas іздестіріп келді. Жақындағы зерттеуде Sommer және авторлар (2022) геномды түсіндіруде ақуыз құрылымын болжаудың қолданылуын көрсетті, атап айтқанда, есептеу арқылы болжалган құрылымдарды пайдаланып функционалдық ақуыз изоформаларын анықтауды, ол https://www.isoform.io мекенжайында қолжетімді. Бұл зерттеу геномды түсіндіру құралы ретінде ақуыз құрылымын болжаудың перспективасын көрсетеді және кез келген геномды түсіндіруді жақсартуға пайдаланылатын практикалық, құрылымға бағытталған тәсілді ұсынады. Еуропалық биоинформатика институты DeepMind компаниясымен бірлесіп болжалган ақуыз құрылымдары үшін AlphaFold EBI дерекқорын құрды.

Автоматты құрылымды болжау серверлерін бағалау

CASP – бұл Ақуыз құрылымын болжау техникаларын сыни бағалау, 1994 жылдан бері екі жылда бір рет өткізілетін, ақуыз құрылымын болжау бойынша қоғамдық эксперимент. CASP адамның автоматтандырылмаған әдістемесінің (адамдар санаты) және ақуыз құрылымын болжауға арналған автоматты серверлердің (CASP7-де енгізілген сервер санаты) сапасын бағалау мүмкіндігін ұсынады. CAMEO3D үздіксіз автоматты модельді бағалау сервері, жаңадан жарияланған ақуыз құрылымдары үшін «көре алмау» принципімен жасалған болжамдарды пайдалана отырып, апта сайын ақуыз құрылымын болжаудың автоматты серверлерін бағалайды. CAMEO нәтижелерді өз сайтында жариялайды.