ДНҚ және белок тізбектері үшін FASTA форматы: кең таралған, қарапайым формат. .fasta, .fna, .faa кеңейтімдері, қолдануы, және қысылу әдістері туралы ақпарат.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
ДНҚ немесе белок тізбектері үшін файл форматы. FASTA форматының қарапайымдылығы мәтіндік өңдеу құралдары мен бағдарламалау тілдерін пайдаланып тізбектерді өңдеуге және талдауға мүмкіндік береді.
File format for DNA or protein sequences
The simplicity of FASTA format makes it easy to manipulate and parse sequences using text processing tools and scripting languages.
Файл атауының жұрнағы
FASTA пішіміндегі тізбектерді қамтитын мәтіндік файл үшін стандартты файл атауының кеңейтімі жоқ. Төмендегі кесте әр кеңейтім мен оның тиісті мағынасын көрсетеді. Кеңейтім Мағынасы Ескермелерfasta, fas, fa жалпы FASTA Кез келген FASTA файлыfna FASTA нуклеин қышқылы Нуклеин қышқылдарын көрсету үшін қолданыладыffn FASTA ген аймақтарының нуклеотиді Геном үшін кодтаушы аймақтарды қамтидыfaa FASTA аминқышқылы Аминқышқыл тізбектерін қамтидыmpfa FASTA аминқышқылы Көптеген ақуыз тізбектерін қамтидыfrn FASTA кодтамайтын РНК Геном үшін кодтамайтын РНК аймақтарын қамтиды, мысалы, tRNA, rRNA.
There is no standard filename extension for a text file containing FASTA formatted sequences. The table below shows each extension and its respective meaning. Extension Meaning Notesfasta, fas, fa generic FASTA Any generic FASTA filefnaFASTA nucleic acidUsed generically to specify nucleic acidsffnFASTA nucleotide of gene regionsContains coding regions for a genomefaaFASTA amino acidContains amino acid sequencesmpfaFASTA amino acidsContains multiple protein sequencesfrnFASTA non coding RNAContains non coding RNA regions for a genome, e. g. tRNA, rRNA
Сығу
FASTA файлдарын сығыстыру үшін идентификаторлар мен тізбектер сияқты екі ақпарат арнасын өңдейтін арнайы компрессор қажет. Сығу нәтижелерін жақсарту үшін бұл екі ағынға бөлінеді, мұнда сығу тәуелсіздік принципі бойынша жасалады. Мысалы, MFCompress алгоритмі контекстік модельдеу және арифметикалық кодтауды қолдана отырып, осы файлдарды жоғалтпай сығыстырады. Genozip геномдық файлдарды сығыстыруға арналған бағдарламалық пакет болып табылады және кеңейтілген контекстке негізделген модельді пайдаланады. FASTA файлдарын сығыстыру алгоритмдерінің нәтижелерін Хосеини және авторлар тобы 2016 жылы, ал Крюков және авторлар тобы 2020 жылы жариялаған.
The compression of FASTA files requires a specific compressor to handle both channels of information: identifiers and sequence. For improved compression results, these are mainly divided into two streams where the compression is made assuming independence. For example, the algorithm MFCompress performs lossless compression of these files using context modelling and arithmetic encoding. Genozip, a software package for compressing genomic files, uses an extensible context based model. Benchmarks of FASTA file compression algorithms have been reported by Hosseini et al. in 2016, and Kryukov et al. in 2020.
Шифрлау
FASTA файлдарын шифрлеу Cryfa және Genozip сияқты әртүрлі құралдармен жүзеге асырылуы мүмкін. Cryfa AES шифрлеуін пайдаланады және деректерді сығуға да мүмкіндік береді. Сол сияқты, Genozip FASTA файлдарын AES 256 арқылы сығу кезінде шифрлей алады. A2M/A3M – FASTA форматынан туындаған, тізбектерді салыстыру үшін қолданылатын форматтар отбасы. A2M/A3M тізбектерінде кіші әріптер енгізілгендерді білдіреді, ал олар басқа тізбектерде нүкте ("") символымен көрсетіледі. Ақпаратты жоғалтпай, ықшамдық үшін нүктелерді жоюға болады. Тізбектерді салыстыруда қолданылатын әдеттегі FASTA файлдарындағыдай, бос орын ("") бір позицияны білдіреді. A3M, A2M-ге ұқсас, бірақ қосымша ереже бойынша, енгізілген бос орындарды да жоюға болады.
The encryption of FASTA files can be performed with various tools, including Cryfa and Genozip. Cryfa uses AES encryption and also enables data compression. Similarly, Genozip can encrypt FASTA files with AES 256 during compression. A2M/A3M are a family of FASTA derived formats used for sequence alignments. In A2M/A3M sequences, lowercase characters are taken to mean insertions, which are then indicated in the other sequences as the dot ("") character. The dots can be discarded for compactness without loss of information. As with typical FASTA files used in alignments, the gap ("") is taken to mean exactly one position. A3M is similar to A2M, with the added rule that gaps aligned to insertions can too be discarded.
FASTA файлдарымен жұмыс істеу
FASTA файлдарын өңдеу үшін көптеген пайдаланушыға қолайлы скрипттер қоғам тарапынан қолжетімді. FaBox немесе Galaxy серверлеріндегі FASTX Toolkit сияқты онлайн құралдар жиынтығы да бар. Оларды FASTA файлдарының үлкен көлемдерінен тізбек тақырыптарын/идентификаторларын бөліп алу, оларды қайта атау, қысқарту немесе ізделіп отырған идентификаторлар тізіміне сүйене отырып, қызығушылық тудыратын тізбектерді алу үшін пайдалануға болады (басқа қолжетімді мүмкіндіктермен қатар). FigTree қараушысында қызығушылық тудыратын тізбектерді түсті көрсету және/немесе түсіндіру негізінде көп FASTA файлдарын сұрыптау үшін ағаш негізделген тәсіл (TREE2FASTA) де бар. Сонымен қатар, Bioconductor Biostrings пакетін R бағдарламасында FASTA файлдарын оқу және өңдеу үшін қолдануға болады.
A plethora of user friendly scripts are available from the community to perform FASTA file manipulations. Online toolboxes, such as FaBox or the FASTX Toolkit within Galaxy servers, are also available. These can be used to segregate sequence headers/identifiers, rename them, shorten them, or extract sequences of interest from large FASTA files based on a list of wanted identifiers (among other available functions). A tree based approach to sorting multi FASTA files (TREE2FASTA) also exists based on the coloring and/or annotation of sequences of interest in the FigTree viewer. Additionally, the Bioconductor Biostrings package can be used to read and manipulate FASTA files in R.
Әртүрлі филогенетикалық бағдарламалармен пайдалану үшін көп FASTA файлдарын әртүрлі форматтарға (мысалы, NEXUS, PHYLIP) жылдам түрлендіруге арналған бірнеше онлайн формат түрлендіргіштер бар, мысалы, phylogeny.fr сайтындағы түрлендіргіш.
Several online format converters exist to rapidly reformat multi FASTA files to different formats (e. g. NEXUS, PHYLIP) for use with different phylogenetic programs, such as the converter available on phylogeny. fr.