Введение
Генетический уклон в кодирующей ДНК
Кодоновый уклон относится к различиям в частоте встречаемости синонимичных кодонов в кодирующей ДНК. Кодон – это последовательность из трех нуклеотидов (триплет), кодирующая определенный аминокислотный остаток в полипептидной цепи или сигнал завершения трансляции (стоп-кодоны). Существует 64 различных кодона (61 кодон кодирует аминокислоты и 3 стоп-кодона), но всего 20 различных транслируемых аминокислот. Избыток кодонов позволяет кодировать многие аминокислоты более чем одним кодоном. В силу такой избыточности генетический код считается вырожденным. Генетические коды разных организмов часто демонстрируют склонность к использованию одного из нескольких кодонов, кодирующих одну и ту же аминокислоту, в большей степени, чем других – то есть, частота его встречаемости выше, чем можно было бы ожидать случайно. Механизмы возникновения таких уклонов активно обсуждаются в молекулярной эволюции. Таблицы использования кодонов, содержащие данные о геномном кодоновом уклоне для организмов из GenBank и RefSeq, доступны в проекте HIVE Codon Usage Tables (HIVE CUTs), который включает две отдельные базы данных: CoCoPUTs и TissueCoCoPUTs. Вместе эти базы данных предоставляют исчерпывающую и актуальную статистику об использовании кодонов, пар кодонов и динуклеотидов для всех организмов, для которых доступны данные о последовательности, а также для 52 типов человеческих тканей. Обычно признается, что кодоновый уклон отражает вклад трех основных факторов: генная конверсия со смещением в сторону GC, благоприятствующая кодонам, заканчивающимся на GC, в диплоидных организмах; уклон, отражающий мутационные предпочтения (обычно благоприятствующие кодонам, заканчивающимся на AT); и естественный отбор кодонов, благоприятных с точки зрения трансляции. Оптимальные кодоны в быстрорастущих микроорганизмах, таких как Escherichia coli или Saccharomyces cerevisiae (пекарские дрожжи), отражают состав их геномного пула транспортных РНК (тРНК). Считается, что оптимальные кодоны способствуют достижению более высоких скоростей трансляции и высокой точности. В результате этих факторов, трансляционный отбор, как правило, более силен в генах с высокой экспрессией, что подтверждается для вышеупомянутых организмов. В других организмах, не демонстрирующих высокие темпы роста или имеющих небольшие геномы, оптимизация использования кодонов обычно отсутствует, а предпочтения кодонов определяются характерными мутационными смещениями, наблюдаемыми в данном геноме. Примерами являются Homo sapiens (человек) и Helicobacter pylori. Организмы, демонстрирующие промежуточный уровень оптимизации использования кодонов, включают Drosophila melanogaster (плодовая мушка), Caenorhabditis elegans (нематода), Strongylocentrotus purpuratus (морской еж) и Arabidopsis thaliana (кресс-салат). Известно, что несколько семейств вирусов (герпесвирусы, лентивирусы, папилломавирусы, полиомавирусы, аденовирусы и парвовирусы) кодируют структурные белки, демонстрирующие выраженное смещение в использовании кодонов по сравнению с клеткой-хозяином. Предполагается, что эти кодоновые уклоны играют роль во временной регуляции экспрессии их поздних белков. Природа оптимизации использования кодонов и тРНК является предметом острых дискуссий. Неясно, влияет ли использование кодонов на эволюцию тРНК или наоборот. Разработана как минимум одна математическая модель, в которой использование кодонов и экспрессия тРНК коэволюционируют в режиме обратной связи (то есть, кодоны, уже присутствующие в высоких частотах, повышают экспрессию соответствующих им тРНК, а тРНК, обычно экспрессируемые на высоких уровнях, повышают частоту встречаемости соответствующих им кодонов). Однако эта модель пока не получила экспериментального подтверждения. Другая проблема заключается в том, что эволюция генов тРНК долгое время оставалась малоизученной областью.
Факторы, способствующие этому
Были предложены различные факторы, связанные с предвзятостью использования кодонов, включая уровень экспрессии генов (отражающий отбор для оптимизации процесса трансляции, связанный с обилием тРНК), содержание гуанина и цитозина (ГЦ-содержание, отражающее горизонтальный перенос генов или мутационную предвзятость), асимметрию гуанина и цитозина (GC skew, отражающую специфическую мутационную предвзятость по цепям), консервацию аминокислот, гидрофобность белков, транскрипционный отбор, стабильность РНК, оптимальную температуру роста, адаптацию к гиперсолёной среде и содержание азота в пище.
Мутационная предвзятость против отбора
Хотя механизм отбора кодонов остаётся дискуссионным, возможные объяснения этого смещения можно разделить на две основные категории. Одно из объяснений связано с селекционистской теорией, согласно которой смещение кодонов способствует эффективности и/или точности экспрессии белка и, следовательно, подвергается положительному отбору. Селекционистская модель также объясняет, почему более часто встречающиеся кодоны распознаются более обильными молекулами тРНК, а также корреляцию между предпочтительными кодонами, уровнями тРНК и числом копий генов. Хотя было показано, что скорость включения аминокислот в более часто встречающиеся кодоны значительно выше, чем в редких кодонов, не было доказано, что скорость трансляции напрямую зависит от этого, и, следовательно, предпочтение более часто встречающихся кодонов может не быть напрямую выгодным. Однако увеличение скорости элонгации трансляции может косвенно приносить пользу, повышая клеточную концентрацию свободных рибосом и потенциально скорость инициации для матричных РНК (мРНК). Второе объяснение использования кодонов связано с мутационным смещением – теорией, утверждающей, что смещение кодонов существует из-за неравномерности в паттернах мутаций. Иными словами, некоторые кодоны могут подвергаться большему числу изменений и, следовательно, достигать более низких равновесных частот, также известных как «редкие» кодоны. Различные организмы также демонстрируют различные мутационные смещения, и всё больше данных свидетельствует о том, что уровень GC-содержания в геноме является наиболее значимым параметром, объясняющим различия в кодонах между организмами. Дополнительные исследования показали, что смещение кодонов можно статистически предсказать у прокариот, используя только межгенные последовательности, что опровергает идею о селективном давлении на кодирующие области и дополнительно подтверждает модель мутационного смещения. Однако эта модель сама по себе не может полностью объяснить, почему предпочтительные кодоны распознаются более распространёнными тРНК.
Влияние на транскрипцию или экспрессию генов
Гетерологичная экспрессия генов используется во многих биотехнологических приложениях, включая производство белков и метаболическую инженерию. Поскольку пулы тРНК различаются у разных организмов, скорость транскрипции и трансляции конкретной кодирующей последовательности может быть снижена при переносе в неродной контекст. Для сверхэкспрессированного трансгена соответствующая мРНК составляет значительную долю от общей клеточной РНК, и наличие редких кодонов в транскрипте может приводить к неэффективному использованию и истощению рибосом, что в конечном итоге снижает уровень производства гетерологичных белков. Кроме того, состав гена (например, общее количество редких кодонов и наличие последовательных редких кодонов) также может влиять на точность трансляции. Однако использование кодонов, оптимизированных для пулов тРНК конкретного хозяина, для сверхэкспрессии гетерологичного гена также может вызывать дефицит аминокислот и изменять равновесие пулов тРНК. Этот метод подбора кодонов к обилию тРНК хозяина, называемый оптимизацией кодонов, традиционно применялся для экспрессии гетерологичных генов. Однако новые стратегии оптимизации гетерологичной экспрессии учитывают общее содержание нуклеотидов, такое как локальное сворачивание мРНК, предпочтение кодонных пар, кодонный градиент, кодонная гармонизация или кодонные корреляции. В связи с большим количеством вносимых нуклеотидных изменений, искусственный синтез генов часто необходим для создания такого оптимизированного гена. Специализированный кодонный уклон также наблюдается в некоторых эндогенных генах, например, в генах, участвующих в дефиците аминокислот. Например, ферменты биосинтеза аминокислот предпочтительно используют кодоны, которые плохо адаптированы к нормальному обилию тРНК, но содержат кодоны, адаптированные к пулам тРНК в условиях дефицита. Таким образом, использование кодонов может вносить дополнительный уровень регуляции транскрипции для обеспечения адекватной экспрессии генов в определенных клеточных условиях.
Влияние на сгибание белка
Сворачивание белка in vivo является векториальным, таким образом, N-конец белка выходит из транслирующей рибосомы и становится доступным для растворителя раньше, чем его более C-концевые области. В результате, ко-трансляционное сворачивание белка накладывает ряд пространственных и временных ограничений на формирующуюся полипептидную цепь в ходе ее траектории сворачивания. Поскольку скорость трансляции мРНК связана со сворачиванием белка, а адаптация кодонов – с элонгацией трансляции, было высказано предположение, что манипуляции на уровне последовательности могут быть эффективной стратегией для регуляции или улучшения сворачивания белка. Ряд исследований показал, что паузы в трансляции, вызванные локальной структурой мРНК, возникают для определенных белков и могут быть необходимы для правильного сворачивания. Более того, было показано, что синонимичные мутации оказывают значительное влияние на процесс сворачивания формирующегося белка и могут даже изменять специфичность субстрата ферментов. Эти исследования позволяют предположить, что использование кодонов влияет на скорость, с которой полипептиды векториально высвобождаются из рибосомы, что, в свою очередь, может влиять на пути сворачивания белка в доступном структурном пространстве. Методы, такие как «частота оптимальных кодонов» (Fop), относительная адаптация кодонов (RCA) или индекс адаптации кодонов (CAI), используются для прогнозирования уровней экспрессии генов, в то время как «эффективное число кодонов» (Nc) и энтропия Шеннона из теории информации применяются для измерения равномерности использования кодонов. Многомерные статистические методы, такие как корреспондентный анализ и анализ главных компонент, широко используются для анализа вариаций в использовании кодонов между генами. Существует множество компьютерных программ для реализации вышеперечисленных статистических анализов, включая CodonW, GCUA, INCA и др. Оптимизация кодонов находит применение при разработке синтетических генов и ДНК-вакцин. Для этой цели в сети доступно несколько программных пакетов (см. внешние ссылки).