Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Формат файла для последовательностей ДНК или белков. Простота формата FASTA облегчает манипулирование и разбор последовательностей с использованием инструментов обработки текста и языков программирования.
File format for DNA or protein sequences
The simplicity of FASTA format makes it easy to manipulate and parse sequences using text processing tools and scripting languages.
Расширение имени файла
Для текстового файла, содержащего последовательности в формате FASTA, не существует стандартного расширения имени файла. В таблице ниже показаны каждое расширение и его соответствующее значение.
There is no standard filename extension for a text file containing FASTA formatted sequences. The table below shows each extension and its respective meaning. Extension Meaning Notesfasta, fas, fa generic FASTA Any generic FASTA filefnaFASTA nucleic acidUsed generically to specify nucleic acidsffnFASTA nucleotide of gene regionsContains coding regions for a genomefaaFASTA amino acidContains amino acid sequencesmpfaFASTA amino acidsContains multiple protein sequencesfrnFASTA non coding RNAContains non coding RNA regions for a genome, e. g. tRNA, rRNA
| Расширение | Значение | Примечания |
|---|---|---|
| fasta, fas, fa | generic FASTA | Любой файл в формате FASTA |
| fna | FASTA нуклеиновая кислота | Используется для обозначения нуклеиновых кислот |
| ffn | FASTA нуклеотид генных областей | Содержит кодирующие области генома |
| faa | FASTA аминокислоты | Содержит последовательности аминокислот |
| mpfa | FASTA аминокислоты | Содержит множественные последовательности белков |
| frn | FASTA некодирующая РНК | Содержит некодирующие РНК-области генома, например, tRNA, rRNA |
There is no standard filename extension for a text file containing FASTA formatted sequences. The table below shows each extension and its respective meaning. Extension Meaning Notesfasta, fas, fa generic FASTA Any generic FASTA filefnaFASTA nucleic acidUsed generically to specify nucleic acidsffnFASTA nucleotide of gene regionsContains coding regions for a genomefaaFASTA amino acidContains amino acid sequencesmpfaFASTA amino acidsContains multiple protein sequencesfrnFASTA non coding RNAContains non coding RNA regions for a genome, e. g. tRNA, rRNA
Сжатие
Для сжатия файлов FASTA требуется специальный компрессор, способный обрабатывать оба канала информации: идентификаторы и последовательности. Для достижения лучших результатов сжатия эти данные обычно разделяют на два потока, сжимая их, исходя из предположения об их независимости. Например, алгоритм MFCompress выполняет сжатие без потерь, используя контекстное моделирование и арифметическое кодирование. Genozip, программный пакет для сжатия геномных файлов, использует расширяемую контекстную модель. Результаты сравнительного анализа алгоритмов сжатия файлов FASTA были опубликованы Хоссейни и соавторами в 2016 году и Крюковым и соавторами в 2020 году.
The compression of FASTA files requires a specific compressor to handle both channels of information: identifiers and sequence. For improved compression results, these are mainly divided into two streams where the compression is made assuming independence. For example, the algorithm MFCompress performs lossless compression of these files using context modelling and arithmetic encoding. Genozip, a software package for compressing genomic files, uses an extensible context based model. Benchmarks of FASTA file compression algorithms have been reported by Hosseini et al. in 2016, and Kryukov et al. in 2020.
Шифрование
Шифрование файлов FASTA может быть выполнено с помощью различных инструментов, включая Cryfa и Genozip. Cryfa использует шифрование AES и также обеспечивает сжатие данных. Аналогично, Genozip может шифровать файлы FASTA с использованием AES 256 во время сжатия. A2M/A3M – это семейство форматов, производных от FASTA, используемых для выравнивания последовательностей. В последовательностях A2M/A3M строчные буквы интерпретируются как вставки, которые затем обозначаются точкой ("") в других последовательностях. Эти точки можно удалить для уменьшения размера файла без потери информации. Как и в обычных файлах FASTA, используемых для выравнивания, символ пробела ("") обозначает ровно одну позицию. A3M аналогичен A2M, с дополнительным правилом, что пробелы, выровненные с вставками, также могут быть удалены.
The encryption of FASTA files can be performed with various tools, including Cryfa and Genozip. Cryfa uses AES encryption and also enables data compression. Similarly, Genozip can encrypt FASTA files with AES 256 during compression. A2M/A3M are a family of FASTA derived formats used for sequence alignments. In A2M/A3M sequences, lowercase characters are taken to mean insertions, which are then indicated in the other sequences as the dot ("") character. The dots can be discarded for compactness without loss of information. As with typical FASTA files used in alignments, the gap ("") is taken to mean exactly one position. A3M is similar to A2M, with the added rule that gaps aligned to insertions can too be discarded.
Работа с файлами FASTA
В сообществе доступно множество удобных в использовании скриптов для манипулирования файлами FASTA. Также доступны онлайн-инструменты, такие как FaBox или FASTX Toolkit в серверах Galaxy. Их можно использовать для разделения заголовков/идентификаторов последовательностей, переименования, сокращения или извлечения интересующих последовательностей из больших FASTA-файлов на основе списка необходимых идентификаторов (среди прочих функций). Существует также метод сортировки многофайловых FASTA-файлов на основе дерева (TREE2FASTA), основанный на раскраске и/или аннотации интересующих последовательностей в программе FigTree. Кроме того, пакет Bioconductor Biostrings можно использовать для чтения и манипулирования FASTA-файлами в R.
A plethora of user friendly scripts are available from the community to perform FASTA file manipulations. Online toolboxes, such as FaBox or the FASTX Toolkit within Galaxy servers, are also available. These can be used to segregate sequence headers/identifiers, rename them, shorten them, or extract sequences of interest from large FASTA files based on a list of wanted identifiers (among other available functions). A tree based approach to sorting multi FASTA files (TREE2FASTA) also exists based on the coloring and/or annotation of sequences of interest in the FigTree viewer. Additionally, the Bioconductor Biostrings package can be used to read and manipulate FASTA files in R.
Доступно несколько онлайн-конвертеров форматов для быстрого преобразования многофайловых FASTA-файлов в различные форматы (например, NEXUS, PHYLIP) для использования с различными филогенетическими программами, например, конвертер, доступный на phylogeny.fr.
Several online format converters exist to rapidly reformat multi FASTA files to different formats (e. g. NEXUS, PHYLIP) for use with different phylogenetic programs, such as the converter available on phylogeny. fr.