Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Ақуыз отбасылары, домендері және функционалдық орындарының дерекқоры
Database of protein families, domains and functional sites
InterPro – бұл ақуыз отбасыларының, ақуыз домендерінің және функционалдық орындарының дерекқоры, онда белгілі ақуыздарда табылған анықталатын ерекшеліктер жаңа ақуыз тізбектерін функционалдық сипаттау үшін қолданылуы мүмкін. InterPro құрамына диагностикалық қолтаңбалар және олармен маңызды сәйкестікке ие ақуыздар кіреді. Қолтаңбалар ақуыз отбасыларын, домендерін немесе орындарын сипаттайтын модельдерден (жай типтер, мысалы, реттегіш өрнектер немесе күрделі типтер, мысалы, жасырын Марков модельдері) тұрады. Модельдер белгілі отбасылардың немесе домендердің аминқышқылдық тізбектерінен құрастырылады және олар кейіннен белгісіз тізбектерді (мысалы, жаңа геномдық секвендеуден алынғандарды) жіктеу үшін іздеуге қолданылады. InterPro-ның әрбір мүше дерекқоры өте жоғары деңгейдегі, құрылымға негізделген жіктелімдерден (SUPERFAMILY және CATH Gene3D) бастап, өте нақты под-отбасылық жіктелімдерге (PRINTS және PANTHER) дейін әртүрлі салаға үлес қосады. InterPro-ның мақсаты – ақуыз жіктемесі үшін бір терезелі қызмет ұсыну, онда әртүрлі мүше дерекқоры жасаған барлық қолтаңбалар InterPro дерекқорындағы жазбаларға орналастырылады. Эквивалентті домендерді, орындары немесе отбасыларды көрсететін қолтаңбалар бір жазбаға енгізіледі және жазбалар бір-бірімен байланысты болуы мүмкін. Мүмкіндігінше, сипаттама, біркелкі атаулар және гендік онтология (GO) терминдері сияқты қосымша ақпарат әрбір жазбамен байланыстырылады.
InterPro is a database of protein families, protein domains and functional sites in which identifiable features found in known proteins can be applied to new protein sequences in order to functionally characterise them. The contents of InterPro consist of diagnostic signatures and the proteins that they significantly match. The signatures consist of models (simple types, such as regular expressions or more complex ones, such as Hidden Markov models) which describe protein families, domains or sites. Models are built from the amino acid sequences of known families or domains and they are subsequently used to search unknown sequences (such as those arising from novel genome sequencing) in order to classify them. Each of the member databases of InterPro contributes towards a different niche, from very high level, structure based classifications (SUPERFAMILY and CATH Gene3D) through to quite specific sub family classifications (PRINTS and PANTHER). InterPro's intention is to provide a one stop shop for protein classification, where all the signatures produced by the different member databases are placed into entries within the InterPro database. Signatures which represent equivalent domains, sites or families are put into the same entry and entries can also be related to one another. Additional information such as a description, consistent names and Gene Ontology (GO) terms are associated with each entry, where possible.
InterPro-да қамтылған деректер
InterPro үш негізгі құрамдас бөлікten тұрады: ақуыздар, қолтаңбалар (әдістер немесе үлгілер деп те аталады) және жазбалар. UniProtKB-дегі ақуыздар InterPro-дағы негізгі ақуыздық құрамдас бөліктері болып табылады. Осы ақуыздарға қай қолтаңбалардың маңызды сәйкес келетіні туралы ақпарат UniProtKB тізбектері жарияланғанда есептеледі және бұл нәтижелер жұртшылыққа қолжетімді болады (төменде қараңыз). Қолтаңбалардың ақуыздарға сәйкестігі InterPro жазбаларына қолтаңбалардың қалай біріктірілетінін анықтайды: сәйкес ақуыздық жиынтықтардың салыстырмалы жабысуы және қолтаңбалардың сәйкестіктерінің тізбектердегі орналасуы туыстық белгісі ретінде қолданылады. InterPro-ға тек жеткілікті сапалы деп танылған қолтаңбалар ғана қосылады. 81.0 нұсқасынан бастап (2020 жылдың 21 тамызында жарияланған) InterPro жазбалары UniProtKB-де табылған қалдықтардың 73,9%-ын, ал интеграция күтіліп тұрған қолтаңбалар арқылы тағы 9,2%-ын түсіндіреді. PIRSF ақуыз жіктеу жүйесі – бұл толық ұзындығы бар ақуыздар мен домендердің эволюциялық қатынасын көрсететін суперотбасылардан суботбасыларға дейінгі көп деңгейлі тізбектік әртүрлілікке ие желі. PIRSF-тің негізгі жіктеу бірлігі – гомеоморфтық отбасы, оның мүшелері гомологты (жалпы ата-бабадан пайда болған) және гомеоморфты (толық ұзындығы тізбектік ұқсастығы мен ортақ домендік архитектураны бөліседі). PRINTS – ақуыздық іздердің жинағы. Іздер – ақуыз отбасын сипаттау үшін қолданылатын сақталған мотивтер тобы; оның диагностикалық күші UniProt-тің итеративтік сканерлеуі арқылы жақсартылады. Әдетте мотивтер бір-бірімен жапспайды, бірақ тізбекте бөлінеді, бірақ олар 3D кеңістікте жалғасқан болуы мүмкін. Іздер ақуыздың бүктелуін және функционалдығын жеке мотивтерге қарағанда икемдірек және күштірек кодтай алады, олардың толық диагностикалық күші мотив көршілерінің өзара контекстінен туындайды. PROSITE – ақуыз отбасылары мен домендерінің деректер қоры. Ол жаңа тізбектің қай белгілі ақуыз отбасына (бар болса) жататынын сенімді түрде анықтауға көмектесетін биологиялық маңызды орындардан, үлгілерден және профильдерден тұрады. SMART – қарапайым модульдік архитектураны зерттеу құралы, генетикалық мобильді домендерді анықтауға және түсіндіруге, сондай-ақ домендік архитектураларды талдауға мүмкіндік береді. Сигнал беруге, жасушадан тыс және хроматинмен байланысты ақуыздарда 800-ден астам домендік отбасылар анықталады. Бұл домендер филогенетикалық таралуларға, функционалдық сыныптарға, үшіншілік құрылымдарға және функционалдық маңызды қалдықтарға қатысты кеңінен түсіндіріледі. SUPERFAMILY – белгілі құрылымы бар барлық ақуыздарды бейнелейтін жасырын Марков модельдерінің кітапханасы. Кітапхана ақуыздардың SCOP жіктеліміне негізделген: әрбір модель SCOP доменіне сәйкес келеді және доменге жататын SCOP суперотбасының толық өкілін көрсетуді мақсат етеді. SUPERFAMILY барлық толық тізбектелген геномдарға құрылымдық тапсырмаларды жүргізу үшін пайдаланылды. SFLD – ферменттердің нақты химиялық қабілеттеріне байланысты нақты тізбектік құрылым ерекшеліктерін көрсететін иерархиялық жіктеу. TIGRFAMs – көптеген тізбектік сәйкестендірулерді, жасырын Марков модельдерін (HMM) және түсіндірмелерді қамтитын ақуыз отбасыларының жиынтығы, бұл тізбектік гомологияға негізделген функционалдық байланысты ақуыздарды анықтау құралы болып табылады. «Эквивалогтар» деп аталатын жазбалар функциясына қатысты сақталған гомологты ақуыздарды біріктіреді.
InterPro contains three main entities: proteins, signatures (also referred to as "methods" or "models") and entries. The proteins in UniProtKB are also the central protein entities in InterPro. Information regarding which signatures significantly match these proteins are calculated as the sequences are released by UniProtKB and these results are made available to the public (see below). The matches of signatures to proteins are what determine how signatures are integrated together into InterPro entries: comparative overlap of matched protein sets and the location of the signatures' matches on the sequences are used as indicators of relatedness. Only signatures deemed to be of sufficient quality are integrated into InterPro. As of version 81.0 (released 21 August 2020) InterPro entries annotated 73.9% of residues found in UniProtKB with another 9.2% annotated by signatures that are pending integration. PIRSF Protein classification system is a network with multiple levels of sequence diversity from superfamilies to subfamilies that reflects the evolutionary relationship of full length proteins and domains. The primary PIRSF classification unit is the homeomorphic family, whose members are both homologous (evolved from a common ancestor) and homeomorphic (sharing full length sequence similarity and a common domain architecture). PRINTS PRINTS is a compendium of protein fingerprints. A fingerprint is a group of conserved motifs used to characterise a protein family; its diagnostic power is refined by iterative scanning of UniProt. Usually the motifs do not overlap, but are separated along a sequence, though they may be contiguous in 3D space. Fingerprints can encode protein folds and functionalities more flexibly and powerfully than can single motifs, their full diagnostic potency deriving from the mutual context afforded by motif neighbours. PROSITE PROSITE is a database of protein families and domains. It consists of biologically significant sites, patterns and profiles that help to reliably identify to which known protein family (if any) a new sequence belongs. SMART Simple Modular Architecture Research Tool Allows the identification and annotation of genetically mobile domains and the analysis of domain architectures. More than 800 domain families found in signaling, extracellular and chromatin associated proteins are detectable. These domains are extensively annotated with respect to phyletic distributions, functional class, tertiary structures and functionally important residues. SUPERFAMILY SUPERFAMILY is a library of profile hidden Markov models that represent all proteins of known structure. The library is based on the SCOP classification of proteins: each model corresponds to a SCOP domain and aims to represent the entire SCOP superfamily that the domain belongs to. SUPERFAMILY has been used to carry out structural assignments to all completely sequenced genomes. SFLD A hierarchical classification of enzymes that relates specific sequence structure features to specific chemical capabilities. TIGRFAMs TIGRFAMs is a collection of protein families, featuring curated multiple sequence alignments, hidden Markov models (HMMs) and annotation, which provides a tool for identifying functionally related proteins based on sequence homology. Those entries which are "equivalogs" group homologous proteins which are conserved with respect to function.
Қол жеткізу
Деректер базасы веб-сервер арқылы мәтіндік және тізбектелген іздеулер үшін, сондай-ақ анонимді FTP арқылы жүктеуге қолжетімді. Басқа EBI деректер базалары сияқты, бұл деректер базасының мазмұны "кез келген адамға және кез келген мақсатта" пайдалануға болады, сондықтан ол жалпыға қолжетімді. InterPro деректерді 8 апта сайын, әдетте, бір күн ішінде UniProtKB сол ақуыздарды жариялаған күнінен кейін көпшілікке ұсынуды жоспарлап отыр.
The database is available for text and sequence based searches via a webserver, and for download via anonymous FTP. Like other EBI databases, it is in the public domain, since its content can be used "by any individual and for any purpose". InterPro aims to release data to the public every 8 weeks, typically within a day of the UniProtKB release of the same proteins.
InterPro қолданбалы бағдарламалау интерфейсі (API)
InterPro барлық InterPro жазбаларына және олармен байланысты жазбаларға бағдарламалық түрде қол жеткізу үшін Json форматында API қамтамасыз етеді. API-де InterPro деректерінің әртүрлі түрлеріне сәйкес алты негізгі түйін бар: жазба, белок, құрылым, таксономия, протеом және жиын.
InterPro provides an API for programmatic access to all InterPro entries and their related entries in Json format. There are six main endpoints for the API corresponding to the different InterPro data types: entry, protein, structure, taxonomy, proteome and set.
InterProScan
InterProScan – пайдаланушыларға мүшелік деректер қорының қолтаңбалары бойынша тізбектерді сканерлеуге мүмкіндік беретін бағдарламалық пакет. Пайдаланушылар осы қолтаңбаны анықтау бағдарламалық пакетін жаңа нуклеотидтік немесе белок тізбектерін функционалдық тұрғыдан сипаттау үшін пайдалана алады. InterProScan геномдық жобаларда қызығушылық тудыратын геномды алғашқы рет сипаттау үшін жиі қолданылады. 2020 жылдан бастап InterProScan-ның қоғамға ашық нұсқасы (v5.x) Java негізіндегі архитектураны қолданады. Бағдарламалық пакет қазіргі таңда тек 64 биттік Linux операциялық жүйесінде қолдау көрсетіледі. InterProScan, көптеген басқа EMBL EBI биоинформатикалық құралдарымен бірге, RESTful және SOAP Web Services API арқылы бағдарламалық жолмен қолжетімді.
InterProScan is a software package that allows users to scan sequences against member database signatures. Users can use this signature scanning software to functionally characterize novel nucleotide or protein sequences. InterProScan is frequently used in genome projects in order to obtain a "first pass" characterisation of the genome of interest. as of 2020, the public version of InterProScan (v5. x) uses a Java based architecture. The software package is currently only supported on a 64 bit Linux operating system. InterProScan, along with many other EMBL EBI bioinformatics tools, can also be accessed programmatically using RESTful and SOAP Web Services APIs.