Введение

Формат файла для последовательностей ДНК или белков. Простота формата FASTA облегчает манипулирование и разбор последовательностей с использованием инструментов обработки текста и языков программирования.

Расширение имени файла

Для текстового файла, содержащего последовательности в формате FASTA, не существует стандартного расширения имени файла. В таблице ниже показаны каждое расширение и его соответствующее значение.

| Расширение | Значение | Примечания |
|---|---|---|
| fasta, fas, fa | generic FASTA | Любой файл в формате FASTA |
| fna | FASTA нуклеиновая кислота | Используется для обозначения нуклеиновых кислот |
| ffn | FASTA нуклеотид генных областей | Содержит кодирующие области генома |
| faa | FASTA аминокислоты | Содержит последовательности аминокислот |
| mpfa | FASTA аминокислоты | Содержит множественные последовательности белков |
| frn | FASTA некодирующая РНК | Содержит некодирующие РНК-области генома, например, tRNA, rRNA |

Сжатие

Для сжатия файлов FASTA требуется специальный компрессор, способный обрабатывать оба канала информации: идентификаторы и последовательности. Для достижения лучших результатов сжатия эти данные обычно разделяют на два потока, сжимая их, исходя из предположения об их независимости. Например, алгоритм MFCompress выполняет сжатие без потерь, используя контекстное моделирование и арифметическое кодирование. Genozip, программный пакет для сжатия геномных файлов, использует расширяемую контекстную модель. Результаты сравнительного анализа алгоритмов сжатия файлов FASTA были опубликованы Хоссейни и соавторами в 2016 году и Крюковым и соавторами в 2020 году.

Шифрование

Шифрование файлов FASTA может быть выполнено с помощью различных инструментов, включая Cryfa и Genozip. Cryfa использует шифрование AES и также обеспечивает сжатие данных. Аналогично, Genozip может шифровать файлы FASTA с использованием AES 256 во время сжатия. A2M/A3M – это семейство форматов, производных от FASTA, используемых для выравнивания последовательностей. В последовательностях A2M/A3M строчные буквы интерпретируются как вставки, которые затем обозначаются точкой ("") в других последовательностях. Эти точки можно удалить для уменьшения размера файла без потери информации. Как и в обычных файлах FASTA, используемых для выравнивания, символ пробела ("") обозначает ровно одну позицию. A3M аналогичен A2M, с дополнительным правилом, что пробелы, выровненные с вставками, также могут быть удалены.

Работа с файлами FASTA

В сообществе доступно множество удобных в использовании скриптов для манипулирования файлами FASTA. Также доступны онлайн-инструменты, такие как FaBox или FASTX Toolkit в серверах Galaxy. Их можно использовать для разделения заголовков/идентификаторов последовательностей, переименования, сокращения или извлечения интересующих последовательностей из больших FASTA-файлов на основе списка необходимых идентификаторов (среди прочих функций). Существует также метод сортировки многофайловых FASTA-файлов на основе дерева (TREE2FASTA), основанный на раскраске и/или аннотации интересующих последовательностей в программе FigTree. Кроме того, пакет Bioconductor Biostrings можно использовать для чтения и манипулирования FASTA-файлами в R.

Доступно несколько онлайн-конвертеров форматов для быстрого преобразования многофайловых FASTA-файлов в различные форматы (например, NEXUS, PHYLIP) для использования с различными филогенетическими программами, например, конвертер, доступный на phylogeny.fr.