Кіріспе
Белоктардың тізбегі және функционалдық ақпараттар базасы. UniProt – белоктардың тізбегі мен функционалдық ақпараттардың тегін қолжетімді базасы, көптеген жазбалары геномдық тізбектеу жобаларынан алынған. Онда зерттеу әдебиетінен алынған ақуыздардың биологиялық функциясы туралы мол ақпарат бар. Оны бірнеше еуропалық биоинформатикалық ұйымдар мен АҚШ-тың Вашингтон қаласындағы қорынан тұратын UniProt консорциумы күзетеді.
UniProt is a freely accessible database of protein sequence and functional information, many entries being derived from genome sequencing projects. It contains a large amount of information about the biological function of proteins derived from the research literature. It is maintained by the UniProt consortium, which consists of several European bioinformatics organisations and a foundation from Washington, DC, USA.
UniProt консорциумы
UniProt консорциумына Еуропалық биоинформатика институты (EBI), Швейцария биоинформатика институты (SIB) және ақуыздық ақпараттық ресурс (PIR) кіреді. EBI, Ұлыбританияның Хинкстондағы Wellcome Trust Genome Campus-та орналасқан, биоинформатика деректер базалары мен қызметтерінің ірі ресурсына ие. Швейцарияның Женева қаласында орналасқан SIB, протеомика құралдары мен деректер базасының орталық ресурсы болып табылатын ExPASy (Эксперттік ақуызды талдау жүйесі) серверлерін қолдайды. АҚШ-тың Вашингтон қаласындағы Джорджтаун университетінің медициналық орталығында Ұлттық биомедициналық зерттеулер қоры (NBRF) орналасқан PIR, ең көне ақуыз тізбегі туралы деректер базасының мұрагері – Маргарет Дейхоффтың 1965 жылы алғаш жарық көрген «Ақуыз тізбегі мен құрылымының атласы». 2002 жылы EBI, SIB және PIR UniProt консорциумы ретінде бірікті.
UniProt деректер базасының негізі
Консорциумның әрбір мүшесі ақуыздық деректер базасын күтіп ұстау және аннотациялауға белсенді қатысады. Бұрын EBI және SIB бірлесіп Swiss-Prot және TrEMBL деректер базаларын жасаса, PIR – Ақуыз тізбегі туралы деректер базасын (PIR PSD) жасады. Бұл деректер базалары әртүрлі ақуыз тізбектерін қамту және аннотациялау басымдықтарымен қатар өмір сүрді. Swiss-Prot 1986 жылы Амос Байрохтың докторлық диссертациясы кезінде құрылып, Швейцарияның биоинформатика институтымен әзірленді, ал кейіннен Еуропалық биоинформатика институтында Рольф Апвейлер оны жетілдірді. Swiss-Prot ақуыз функциясының сипаттамасы, домендік құрылымы, трансляциядан кейінгі модификациялар, варианттар сияқты жоғары деңгейдегі аннотациямен байланысты сенімді ақуыз тізбектерін ұсынуды мақсат етті, сондай-ақ артықшылықтың минималды деңгейі мен басқа деректер базаларымен жоғары интеграцияны қамтамасыз етті. Тізбектік деректер Swiss-Prot-тың өңдеу қабілетінен асып түсетінін ескере отырып, Swiss-Prot-қа енбеген ақуыздарға автоматтандырылған аннотация беру үшін TrEMBL (Translated EMBL Nucleotide Sequence Data Library) құрылды. Ал PIR PIR PSD және iProClass сияқты байланысты деректер базаларын, ақуыз тізбектері мен кураторлық отбасылар туралы ақпараттарды күтіп ұстады. Консорциум мүшелері өзінің үсті-үстіне келген ресурстары мен тәжірибесін біріктіріп, 2003 жылдың желтоқсанында UniProt-ты іске қосты. 2023 жылғы мәліметтер бойынша, UniProtKB/Swiss-Prot-тың "2023 01" нұсқасы 569 213 тізбектік жазбаны (291 046 сілтемеден алынған 205 728 242 аминқышқылынан тұрады), ал UniProtKB/TrEMBL-дің "2023 01" нұсқасы 245 871 724 тізбектік жазбаны (85 739 380 194 аминқышқылынан тұрады) қамтиды.
UniProtKB/Swiss-Prot
UniProtKB/Swiss-Prot – қолмен түсіндірілген, қайталамасыз ақуыз тізбегінің дерекқоры. Ол ғылыми әдебиеттен алынған мәліметтерді және биокуратор бағалаған есептеулік талдауды біріктіреді. UniProtKB/Swiss-Prot-тың мақсаты – белгілі бір ақуыз туралы барлық белгілі қатысты ақпаратты ұсыну. Түсіндірмелер қазіргі ғылыми жаңалықтарға сәйкес келу үшін үнемі қайта қаралады. Жазбаны қолмен түсіндіру ақуыз тізбегін және ғылыми әдебиетті егжей-тегжейлі талдауды қамтиды. Бір геннен және бір түрден алынған тізбектер бір дерекқор жазбасына біріктіріледі. Тізбектер арасындағы айырмашылықтар анықталады және олардың себебі көрсетіледі (мысалы, баламалы тігілу, табиғи өзгергіштік, қате басталу орындары, қате экзон шекаралары, сүйірлеу, белгісіз қайшылықтар). UniProtKB/Swiss-Prot жазбаларын түсіндіруде тізбек талдау құралдарының кең ауқымы қолданылады. Компьютерлік болжамдар қолмен бағаланып, жазбаға қосу үшін тиісті нәтижелер таңдалады. Бұл болжамдарға пост-аудармалы модификациялар, трансмембраналық домендер мен топология, сигналдық пептидтер, домендік идентификация және ақуыз отбасының жіктелуі кіреді. Қатысты жарияланымдар PubMed сияқты дерекқорларды іздеу арқылы анықталады. Әр мақаланың толық мәтіні оқылып, ақпарат алынып, жазбаға қосылады. Ғылыми әдебиеттен туындайтын түсіндірмелер, бірақ олармен шектелмейді: 2021 жылдың 22 шілдесінен бастап ол AlphaFold2 арқылы болжанған құрылымдарды да қамтиды.
UniParc
UniProt Archive (UniParc) – негізгі, қалыңдыққа қолжетімді ақуыз тізбектерінің дерекқорларынан алынған барлық ақуыз тізбектерін қамтитын, толық және қайталамасыз деректер қоры. Ақуыздар бірнеше әртүрлі бастапқы дерекқорларда және тіпті бір дерекқордың ішінде бірнеше рет кездесуі мүмкін. Қайталанатындықтың алдын алу үшін UniParc әрбір бірегей тізбекті тек бір рет сақтайды. Бірдей тізбектер, олар бір түрден немесе әртүрлі түрлерден болса да, біріктіріледі. Әрбір тізбекке тұрақты және бірегей идентификатор (UPI) тағайындалады, бұл әртүрлі бастапқы дерекқорлардан алынған бірдей ақуызды анықтауға мүмкіндік береді. UniParc тек ақуыз тізбектерін ғана қамтиды, ешқандай түсіндірмелер жоқ. UniParc жазбаларындағы дерекқорларға сілтемелер ақуыз туралы толық ақпаратты бастапқы дерекқорлардан алуға мүмкіндік береді. Бастапқы дерекқорлардағы тізбектер өзгерген кезде, бұл өзгерістер UniParc жүйесімен қадағаланады және барлық өзгерістердің тарихы мұрағатталады.
UniRef
UniProt анықтамалық кластерлері (UniRef) – UniProtKB-дан алынған белок тізбектерінің кластерленген жиынтықтары мен таңдалған UniParc жазбаларынан тұратын үш дерекқор. UniRef100 дерекқоры бірдей тізбектерді және тізбек фрагменттерін (кез келген организмнен) бір ғана UniRef жазбасына біріктіреді. Өкілдік белоктың тізбегі, барлық біріктірілген жазбалардың идентификаторлары және сәйкес UniProtKB және UniParc жазбаларына сілтемелер көрсетіледі. UniRef100 тізбектері UniRef90 және UniRef50 құру үшін CD-HIT алгоритмін қолданып кластерленеді. Әрбір кластер ең ұзын тізбекке қатысты кемінде 90% немесе 50% тізбек сәйкестігіне ие тізбектерден тұрады. Тізбектерді кластерлеу дерекқордың көлемін айтарлықтай азайтады, осы арқылы жылдам тізбек іздеуге мүмкіндік береді. UniRef UniProt FTP сайтынан қолжетімді.
Қаржыландыру
UniProt Ұлттық адам геномдық зерттеулер институты, Ұлттық денсаулық сақтау институты (NIH), Еуропалық комиссия, Швейцария Федералды үкіметінің Білім және ғылым федералды кеңсесі, NCI caBIG және АҚШ Қорғаныс министрлігінен алынған гранттар есебінен қаржыландырылады.