Введение

В биоинформатике сборка последовательностей относится к выравниванию и объединению фрагментов из более длинной последовательности ДНК для восстановления исходной последовательности. Это необходимо, поскольку технологии секвенирования ДНК зачастую не могут прочитать весь геном целиком, а выдают лишь небольшие фрагменты длиной от 20 до 30 000 оснований, в зависимости от используемой технологии. Как правило, эти короткие фрагменты (риды) получаются в результате случайного секвенирования геномной ДНК или транскриптов генов (EST). Проблему сборки последовательности можно сравнить с тем, как взять множество копий книги, измельчить каждую из них на разные кусочки, а затем попытаться восстановить текст книги, основываясь только на этих фрагментах. Помимо очевидной сложности этой задачи, существуют и дополнительные практические трудности: исходный текст может содержать множество повторяющихся фрагментов, а некоторые кусочки могут быть изменены в процессе измельчения, содержа ошибки. Кроме того, в текст могут быть добавлены отрывки из других книг, а некоторые фрагменты могут оказаться совершенно нечитаемыми.

Сборщики EST

Экспрессированный тег последовательности, или сборка EST, была ранней стратегией, применявшейся с середины 1990-х до середины 2000-х годов, для сборки отдельных генов, а не целых геномов. Эта задача отличается от сборки генома несколькими аспектами. Входные последовательности для сборки EST представляют собой фрагменты транскрибированной мРНК клетки и охватывают лишь часть всего генома. Ряд алгоритмических проблем при сборке генома и EST различаются. Например, геномы часто содержат значительное количество повторяющихся последовательностей, сконцентрированных в межгенных областях. Транскрибированные гены содержат гораздо меньше повторов, что несколько упрощает сборку. Однако некоторые гены экспрессируются (транскрибируются) в очень больших количествах (например, гены поддержания жизнедеятельности), что означает, что, в отличие от секвенирования генома дробным методом, прочтения не распределены равномерно по всему геному. Сборка EST значительно усложняется такими особенностями, как альтернативный сплайсинг (cis и trans), однонуклеотидный полиморфизм и посттранскрипционные модификации. С 2008 года, после изобретения RNA-Seq, секвенирование EST было заменено этой гораздо более эффективной технологией, описанной в разделе, посвященном de novo сборке транскриптома.

De-novo против сборки картографирования

С точки зрения сложности и временных затрат, de novo сборки на порядки медленнее и требуют больше памяти, чем сборки на основе сопоставления. Это в основном связано с тем, что алгоритм сборки должен сравнивать каждое прочтение с каждым другим прочтением (операция, имеющая наивную временную сложность O(n²)). Современные de novo сборщики генома могут использовать различные типы алгоритмов, основанных на графах, такие как: подход Overlap/Layout/Consensus (OLC), типичный для сборщиков данных Sanger, который опирается на граф перекрытий; подход de Bruijn Graph (DBG), наиболее широко применяемый к коротким прочтениям с платформ Solexa и SOLiD. Он основан на K-мерных графах, которые хорошо работают с огромным количеством коротких прочтений; жадный подход, основанный на графах, который также может использовать один из подходов OLC или DBG. В жадных алгоритмах, основанных на графах, контиги растут за счет жадного расширения, всегда выбирая прочтение, которое находится при следовании по перекрытию с наивысшим баллом. Обращаясь к сравнению с измельченной книгой, приведенному во введении: если для сборки на основе сопоставления у вас будет очень похожая книга в качестве шаблона (возможно, с измененными именами главных героев и несколькими местами), то de novo сборки представляют собой гораздо более сложную задачу, поскольку заранее неизвестно, получится ли из этого научная книга, роман, каталог или даже несколько книг. Кроме того, каждый фрагмент будет сравниваться с каждым другим фрагментом. Обработка повторов в de novo сборке требует построения графа, представляющего соседние повторы. Эту информацию можно получить, прочитав длинный фрагмент, полностью покрывающий повторы, или только его два конца. С другой стороны, в сборке на основе сопоставления участки с множественными или отсутствующими соответствиями обычно оставляют для рассмотрения другой технике сборки.

Контроль качества

Большинство программ для сборки последовательностей имеют встроенные алгоритмы контроля качества, такие как Phred. Однако эти показатели не оценивают полноту сборки с точки зрения генофонда. Некоторые инструменты оценивают качество сборки постфактум. Например, BUSCO (Benchmarking Universal Single Copy Orthologs) – это показатель полноты генов в геноме, наборе генов или транскриптоме, основанный на том, что многие гены присутствуют в большинстве геномов только в одной копии. Первоначальные наборы BUSCO включали 3023 гена для позвоночных, 2675 для членистоногих, 843 для метазоа, 1438 для грибов и 429 для эукариот. В следующей таблице приведен пример для геномов человека и плодовой мухи:
+ Результаты оценки по нотации BUSCO (C,D,F,M в %) Вид генов C:D:F:M:n: Homo sapiens 20,364 99 1.7 0.0 0.0 3,023 Drosophila melanogaster 13,918 99 3.7 0.2 0.0 2,675