Введение
Последовательность нуклеотидов в нуклеиновой кислоте
Последовательность нуклеиновой кислоты – это последовательность оснований в нуклеотидах, формирующих аллели в молекуле ДНК (использующей GACT) или РНК (GACU). Эта последовательность обозначается рядом из набора из пяти различных букв, указывающих порядок нуклеотидов. По соглашению, последовательности обычно представляются от 5'-конца к 3'-концу. Для ДНК, с её двойной спиралью, существуют два возможных направления для записи последовательности; из этих двух используется кодирующая нить. Поскольку нуклеиновые кислоты обычно являются линейными (неразветвленными) полимерами, определение последовательности эквивалентно определению ковалентной структуры всей молекулы. По этой причине последовательность нуклеиновой кислоты также называют первичной структурой. Последовательность представляет собой генетическую информацию. Биологическая дезоксирибонуклеиновая кислота представляет информацию, которая определяет функции организма. Нуклеиновые кислоты также имеют вторичную и третичную структуры. Первичную структуру иногда ошибочно называют "первичной последовательностью". Однако параллельных понятий вторичной или третичной последовательности не существует.
Нуклеотиды
Нуклеиновые кислоты состоят из цепочки соединенных единиц, называемых нуклеотидами. Каждый нуклеотид состоит из трех субъединиц: фосфатная группа и сахар (рибоза в случае РНК, дезоксирибоза в ДНК) образуют основу цепи нуклеиновой кислоты, а к сахару присоединено одно из нескольких нуклеотидных оснований. Нуклеотидные основания важны для спаривания оснований между цепями, что приводит к образованию вторичных и третичных структур более высокого порядка, таких как знаменитая двойная спираль. Возможные символы – A, C, G и T, представляющие четыре нуклеотидных основания цепи ДНК – аденин, цитозин, гуанин и тимин – ковалентно связанные с фосфодиэфирным остовом. В большинстве случаев последовательности записываются непосредственно друг за другом без пробелов, как, например, последовательность AAAGTCTGAC, считываемая слева направо в направлении от 5' к 3'. Относительно транскрипции, последовательность считается кодирующей, если она имеет тот же порядок, что и транскрибированная РНК. Одна последовательность может быть комплементарной другой, что означает, что они имеют соответствующие основания в каждой позиции (т.е. A к T, C к G) и в обратном порядке. Например, комплементарной последовательностью к TTAC является GTAA. Если одна цепь двухцепочечной ДНК считается смысловой, то другая цепь, называемая антисмысловой, будет иметь комплементарную последовательность к смысловой цепи.
Биологическое значение
В биологических системах нуклеиновые кислоты содержат информацию, используемую живой клеткой для синтеза специфических белков. Последовательность нуклеотидных оснований на нити нуклеиновой кислоты транслируется клеточными механизмами в последовательность аминокислот, составляющих белковую цепь. Каждая группа из трех оснований, называемая кодоном, соответствует определенной аминокислоте, и существует специфический генетический код, согласно которому каждая возможная комбинация из трех оснований соответствует конкретной аминокислоте. Центральная догма молекулярной биологии описывает механизм, посредством которого белки синтезируются на основе информации, содержащейся в нуклеиновых кислотах. ДНК транскрибируется в молекулы мРНК, которые перемещаются к рибосоме, где мРНК используется в качестве матрицы для построения белковой цепи. Поскольку нуклеиновые кислоты способны связываться с молекулами, имеющими комплементарные последовательности, различают последовательности "смысла", кодирующие белки, и комплементарную последовательность "антисмысла", которая сама по себе нефункциональна, но может связываться с последовательностью смысла.
Определение последовательности
Секвенирование ДНК — это процесс определения нуклеотидной последовательности заданного фрагмента ДНК. Последовательность ДНК живого организма кодирует необходимую информацию для его выживания и размножения. Поэтому определение последовательности полезно как в фундаментальных исследованиях, направленных на понимание того, почему и как живут организмы, так и в прикладных областях. В силу важности ДНК для живых существ, знание последовательности ДНК может быть полезно практически в любых биологических исследованиях. Например, в медицине это может быть использовано для идентификации, диагностики и потенциальной разработки методов лечения генетических заболеваний. Аналогично, исследования патогенов могут привести к разработке методов лечения инфекционных заболеваний. Биотехнология — это быстро развивающаяся область, обладающая потенциалом для создания множества полезных продуктов и услуг. РНК не секвенируется напрямую. Вместо этого она копируется в ДНК с помощью обратной транскриптазы, а затем эта ДНК секвенируется. Современные методы секвенирования основаны на способности ДНК-полимераз различать отдельные нуклеотиды и поэтому могут различать только четыре основания. Инозин (образующийся из аденозина в процессе редактирования РНК) считывается как G, а 5-метилцитозин (образующийся из цитозина в результате метилирования ДНК) считывается как C. С использованием современных технологий сложно секвенировать небольшие количества ДНК, поскольку сигнал слишком слаб для измерения. Это решается с помощью амплификации методом полимеразной цепной реакции (ПЦР).
Цифровое представление
После получения последовательности нуклеиновой кислоты из организма, она сохраняется в цифровом формате in silico. Цифровые генетические последовательности могут храниться в базах данных последовательностей, подвергаться анализу (см. раздел «Анализ последовательностей» ниже), цифровым образом модифицироваться и использоваться в качестве матриц для создания новой, реальной ДНК с помощью искусственного генного синтеза.
Анализ последовательности
Цифровые генетические последовательности могут быть проанализированы с помощью инструментов биоинформатики, чтобы попытаться определить их функцию.
Генетическое тестирование
ДНК в геноме организма может быть проанализирована для диагностики предрасположенности к наследственным заболеваниям, а также для установления отцовства (генетического отца) ребенка или определения происхождения человека. Как правило, каждый человек несет две вариации каждого гена, одну унаследованную от матери, другую – от отца. По оценкам, геном человека содержит около 20 000–25 000 генов. Помимо изучения хромосом на уровне отдельных генов, генетическое тестирование в широком смысле включает биохимические анализы для выявления возможного наличия генетических заболеваний или мутантных форм генов, связанных с повышенным риском развития генетических нарушений. Генетическое тестирование выявляет изменения в хромосомах, генах или белках. Чаще всего тестирование используется для обнаружения изменений, связанных с наследственными заболеваниями. Результаты генетического теста могут подтвердить или опровергнуть предполагаемое генетическое состояние или помочь оценить вероятность развития или передачи генетического заболевания. В настоящее время используется несколько сотен генетических тестов, и разрабатываются новые.
Выровнение последовательности
В биоинформатике выравнивание последовательностей – это способ упорядочивания последовательностей ДНК, РНК или белков для выявления областей сходства, которые могут быть обусловлены функциональными, структурными или эволюционными взаимосвязями между этими последовательностями. Если две последовательности в выравнивании имеют общего предка, различия могут интерпретироваться как точечные мутации, а пробелы – как мутации вставки или делеции (инделы), возникшие в одной или обеих линиях после их расхождения. В выравнивании белковых последовательностей степень сходства между аминокислотами, занимающими определенную позицию, может служить приблизительной мерой консервативности данной области или последовательного мотива в различных линиях. Отсутствие замен или наличие только высококонсервативных замен (то есть замена аминокислот с похожими биохимическими свойствами боковых цепей) в определенной области последовательности указывает на структурную или функциональную значимость этой области. Хотя нуклеотидные основания ДНК и РНК более схожи между собой, чем аминокислоты, сохранение пар оснований может свидетельствовать об аналогичной функциональной или структурной роли. Вычислительная филогенетика широко использует выравнивание последовательностей при построении и интерпретации филогенетических деревьев, которые применяются для классификации эволюционных взаимоотношений между гомологичными генами, представленными в геномах дивергировавших видов. Степень различий между последовательностями в наборе запросов качественно связана с их эволюционным расстоянием друг от друга. В общих чертах, высокая идентичность последовательностей предполагает, что рассматриваемые последовательности имеют относительно недавнего общего предка, а низкая идентичность – что расхождение произошло давно. Это приближение, основанное на гипотезе «молекулярных часов», согласно которой приблизительно постоянная скорость эволюционных изменений может быть использована для экстраполяции времени, прошедшего с момента расхождения двух генов (то есть времени коалесценции), предполагает, что эффекты мутаций и отбора постоянны в последовательностях. Следовательно, оно не учитывает возможные различия между организмами или видами в скорости восстановления ДНК или возможную функциональную консервацию определенных областей последовательности. (В случае нуклеотидных последовательностей, гипотеза молекулярных часов в своей простейшей форме также не учитывает разницу в частоте встречаемости между синонимичными мутациями, не изменяющими значение кодона, и другими мутациями, приводящими к включению другой аминокислоты в белок.) Более статистически точные методы позволяют варьировать скорость эволюции на каждой ветви филогенетического дерева, что обеспечивает более точную оценку времени коалесценции генов.
Энтропия последовательности
В биоинформатике энтропия последовательности, также известная как сложность последовательности или информационный профиль, является числовой последовательностью, предоставляющей количественную оценку локальной сложности последовательности ДНК, независимо от направления её обработки. Манипулирование информационными профилями позволяет анализировать последовательности, используя методы, не требующие выравнивания, например, для обнаружения мотивов и перестроек.