Введение
Правила, по которым информация, закодированная в генетическом материале, транслируется в белки. Генетический код – это набор правил, используемых живыми клетками для трансляции информации, закодированной в генетическом материале (последовательности нуклеотидных триплетов ДНК или РНК, или кодонов) в белки. Трансляция осуществляется рибосомой, которая соединяет протеиногенные аминокислоты в порядке, заданном матричной РНК (мРНК), используя молекулы транспортной РНК (тРНК) для доставки аминокислот и считывания мРНК по три нуклеотида за раз. Генетический код высоко консервативен у всех организмов и может быть представлен в виде простой таблицы с 64 элементами. Кодоны определяют, какая аминокислота будет добавлена следующей во время биосинтеза белка. За некоторыми исключениями, трехнуклеотидный кодон в последовательности нуклеиновой кислоты определяет одну аминокислоту. Подавляющее большинство генов кодируется по единой схеме (см. таблицу кодонов РНК). Эта схема часто называется каноническим или стандартным генетическим кодом, или просто генетическим кодом, хотя существуют и варианты кодов (например, в митохондриях).
The genetic code is the set of rules used by living cells to translate information encoded within genetic material (DNA or RNA sequences of nucleotide triplets, or codons) into proteins. Translation is accomplished by the ribosome, which links proteinogenic amino acids in an order specified by messenger RNA (mRNA), using transfer RNA (tRNA) molecules to carry amino acids and to read the mRNA three nucleotides at a time. The genetic code is highly similar among all organisms and can be expressed in a simple table with 64 entries. The codons specify which amino acid will be added next during protein biosynthesis. With some exceptions, a three nucleotide codon in a nucleic acid sequence specifies a single amino acid. The vast majority of genes are encoded with a single scheme (see the RNA codon table). That scheme is often referred to as the canonical or standard genetic code, or simply the genetic code, though variant codes (such as in mitochondria) exist.
История
Попытки понять, как кодируются белки, начались после того, как в 1953 году была открыта структура ДНК. Ключевые исследователи, английский биофизик Фрэнсис Крик и американский биолог Джеймс Уотсон, работавшие вместе в лаборатории Кавендиша Кембриджского университета, высказали гипотезу о том, что информация передается из ДНК и существует связь между ДНК и белками. Советский американский физик Джордж Гамов первым предложил работоспособную схему синтеза белка из ДНК. Он предположил, что для кодирования 20 стандартных аминокислот, используемых живыми клетками для построения белков, необходимо использовать наборы из трех оснований (триплетов), что позволило бы закодировать максимум аминокислот. Он назвал это взаимодействие ДНК-белка (первоначальный генетический код) «алмазным кодом». В 1954 году Гамов создал неформальную научную организацию – клуб РНК-Тай, по предложению Уотсона, для ученых с разными взглядами, интересующихся тем, как белки синтезируются из генов. Однако в клубе могло быть только 20 постоянных членов, представляющих каждую из 20 аминокислот, и четыре дополнительных почетных члена, представляющих четыре нуклеотида ДНК. Первый научный вклад клуба, впоследствии названный «одной из самых важных неопубликованных статей в истории науки» и «самой известной неопубликованной работой в анналах молекулярной биологии», был сделан Криком. В январе 1955 года Крик представил членам клуба машинописную работу под названием «О дегенеративных матрицах и гипотезе адаптера: записка для клуба РНК-Тай», которая, по воспоминаниям Уотсона, «полностью изменила наше представление о синтезе белка». Гипотеза заключалась в том, что триплетный код передавался не непосредственно аминокислотам, как полагал Гамов, а переносился другой молекулой – адаптером, который взаимодействует с аминокислотами.
Кодоны
Эксперимент Крика, Бреннера, Барнетта и Уоттса Тобина впервые продемонстрировал, что кодоны состоят из трех оснований ДНК. Маршалл Ниренберг и Дж. Генрих Маттай первыми установили природу кодона в 1961 году. Они использовали безклеточную систему для трансляции последовательности полиурациловой РНК (то есть UUUUU) и обнаружили, что синтезированный ими полипептид состоял исключительно из аминокислоты фенилаланина. Таким образом, они заключили, что кодон UUU кодирует аминокислоту фенилаланин. За этим последовали эксперименты в лаборатории Северо Очоа, которые показали, что последовательность полиаденовой РНК (AAAAA) кодирует полипептид полилизин, а последовательность полицитозиновой РНК (CCCCC) – полипептид полипролин. Следовательно, кодон AAA кодирует аминокислоту лизин, а кодон CCC – аминокислоту пролин. Затем, используя различные сополимеры, была определена большая часть оставшихся кодонов. Последующая работа Хар Гобинда Хораны позволила идентифицировать оставшуюся часть генетического кода. Вскоре после этого Роберт Холли определил структуру транспортной РНК (тРНК), адаптерной молекулы, облегчающей процесс трансляции РНК в белок. Эта работа основывалась на более ранних исследованиях Очоа, за которые последний получил Нобелевскую премию по физиологии или медицине в 1959 году за работы по ферментам синтеза РНК. Развивая эти исследования, Ниренберг и Филипп Ледер раскрыли триплетную природу кода и расшифровали его кодоны. В этих экспериментах различные комбинации мРНК пропускались через фильтр, содержащий рибосомы – клеточные компоненты, осуществляющие трансляцию РНК в белок. Уникальные триплеты способствовали связыванию специфических тРНК с рибосомой. Ледер и Ниренберг смогли определить последовательности 54 из 64 кодонов в своих экспериментах. Хорана, Холли и Ниренберг получили Нобелевскую премию 1968 года за свои работы. Три стоп-кодона были названы их первооткрывателями Ричардом Эпштейном и Чарльзом Штайнбергом. "Amber" был назван в честь их друга Харриса Бернштейна, чья фамилия в переводе с немецкого означает "янтарь". Два других стоп-кодона были названы "охрой" и "опалом", чтобы сохранить тематику "цветовых названий".
Расширенные генетические коды (синтетическая биология)
В широкой академической среде широко распространено представление об эволюции генетического кода от первоначального и неоднозначного к чётко определённому («замороженному») коду с набором из 20 (+2) канонических аминокислот. Однако существуют различные мнения, концепции, подходы и идеи относительно наилучшего способа его экспериментального изменения. Предлагаются даже модели, предсказывающие «точки входа» для внедрения синтетических аминокислот в генетический код. С 2001 года 40 неестественных аминокислот были включены в состав белков путём создания уникальных кодонов (рекодирования) и соответствующих пар тРНК: аминоацил-тРНК-синтетазы для кодирования их с разнообразными физико-химическими и биологическими свойствами, с целью использования в качестве инструмента для изучения структуры и функции белков или создания новых или улучшенных белков. Х. Мураками и М. Сисидо расширили некоторые кодоны до четырёх и пяти оснований. Стивен А. Беннер сконструировал функциональный 65-й (in vivo) кодон. В 2015 году Н. Будиса, Д. Солл и их коллеги сообщили о полной замене всех 20 899 триптофановых остатков (кодонов UGG) на неестественный тиенопиррол-аланин в генетическом коде бактерии Escherichia coli. В 2016 году был создан первый стабильный полусинтетический организм – (одноклеточная) бактерия с двумя синтетическими основаниями (обозначенными X и Y), которые сохранились при делении клеток. В 2017 году исследователи из Южной Кореи сообщили о создании мыши с расширенным генетическим кодом, способной производить белки с неестественными аминокислотами. В мае 2019 года исследователи сообщили о создании нового штамма бактерии Escherichia coli «Syn61». Этот штамм обладает полностью синтетическим геномом, который был рефакторирован (все перекрытия расширены), рекодирован (полностью исключено использование трёх из 64 кодонов) и дополнительно модифицирован для удаления устаревших тРНК и факторов высвобождения. Он полностью жизнеспособен и растёт в 1,6 раза медленнее, чем его природный аналог «MDS42».
Рама для чтения
Читательная рамка определяется начальным триплетом нуклеотидов, с которого начинается трансляция. Она задает рамку для последовательности неперекрывающихся кодонов, известной как «открытая рамка чтения» (ORF). Например, последовательность 5' AAATGAACG 3' (см. рисунок), если считывать с первой позиции, содержит кодоны AAA, TGA и ACG; если считывать со второй позиции, она содержит кодоны AAT и GAA; а если считывать с третьей позиции, она содержит кодоны ATG и AAC. Таким образом, любую последовательность можно считывать в направлении 5' → 3' в трех читательных рамках, каждая из которых может давать различную последовательность аминокислот: в приведенном примере, Lys (K) Trp (W) Thr (T), Asn (N) Glu (E) или Met (M) Asn (N), соответственно (при трансляции с использованием митохондриального кода позвоночных). Когда ДНК двухцепочечная, определяются шесть возможных читательных рамок: три в прямом направлении на одной цепи и три в обратном направлении на противоположной цепи. Три стоп-кодона имеют названия: UAG – янтарь, UGA – опал (иногда также называемый умброй), а UAA – охра. Стоп-кодоны также называются кодонами «окончания» или «бессмысленными». Они сигнализируют об освобождении формирующегося полипептида из рибосомы, поскольку ни одна транспортная РНК (тРНК) не имеет антикодонов, комплементарных этим сигналам остановки, что позволяет фактору высвобождения связываться с рибосомой вместо этого.
Влияние мутаций
В процессе репликации ДНК иногда возникают ошибки при полимеризации комплементарной нити. Эти ошибки, мутации, могут повлиять на фенотип организма, особенно если они происходят в последовательности, кодирующей белок гена. Частота ошибок обычно составляет 1 на 10–100 миллионов оснований благодаря способности ДНК-полимераз к "корректуре". Миссенс-мутации и нонсенс-мутации являются примерами точечных мутаций, которые могут вызывать генетические заболевания, такие как серповидноклеточная анемия и талассемия соответственно. Клинически значимые миссенс-мутации обычно изменяют свойства кодируемого аминокислотного остатка по признаку основности, кислотности, полярности или неполярности, в то время как нонсенс-мутации приводят к образованию стоп-кодона. Мутации, нарушающие рамку считывания в результате вставок или делеций числа нуклеотидов, не кратного трем, называются мутациями со сдвигом рамки считывания. Эти мутации обычно приводят к совершенно иному, чем исходный, переводу и, вероятно, вызывают считывание стоп-кодона, что приводит к усечению белка. Такие мутации могут нарушать функцию белка и поэтому редки в кодирующих последовательностях белков in vivo. Одна из причин редкости наследования мутаций со сдвигом рамки заключается в том, что если кодируемый белок необходим для роста в условиях селективного давления, которому подвергается организм, отсутствие функционального белка может привести к гибели организма до достижения жизнеспособности. Мутации со сдвигом рамки могут вызывать тяжелые генетические заболевания, такие как болезнь Тея-Сакса. Хотя большинство мутаций, изменяющих последовательность белка, вредны или нейтральны, некоторые мутации могут быть полезными. Эти мутации могут позволить мутантному организму лучше переносить определенные стрессовые факторы окружающей среды или быстрее размножаться. В таких случаях мутация имеет тенденцию становиться более распространенной в популяции посредством естественного отбора. Вирусы, использующие РНК в качестве генетического материала, характеризуются высокой скоростью мутаций, что может быть преимуществом, поскольку эти вирусы быстро эволюционируют и, таким образом, уклоняются от защитных реакций иммунной системы. В крупных популяциях бесполых организмов, например, E. coli, могут одновременно возникать множественные полезные мутации. Это явление называется клональной интерференцией и вызывает конкуренцию между мутациями.
Дегенерация
Дегенерация – это избыточность генетического кода. Этот термин был введен Бернфильдом и Ниренбергом. Генетический код обладает избыточностью, но не неоднозначностью (см. таблицы кодонов ниже для полной корреляции). Например, хотя кодоны GAA и GAG кодируют глутаминовую кислоту (избыточность), ни один из них не кодирует другую аминокислоту (отсутствие неоднозначности). Кодоны, кодирующие одну и ту же аминокислоту, могут различаться в любом из трех положений. Например, аминокислота лейцин кодируется кодонами YUR или CUN (UUA, UUG, CUU, CUC, CUA или CUG) (различие в первом или третьем положении указано с использованием нотации IUPAC), в то время как аминокислота серин кодируется кодонами UCN или AGY (UCA, UCG, UCC, UCU, AGU или AGC) (различие в первом, втором или третьем положении). Практическим следствием избыточности является то, что ошибки в третьем положении триплетного кодона часто приводят лишь к синонимичной мутации или ошибке, которая не влияет на белок, поскольку гидрофильность или гидрофобность сохраняются за счет эквивалентной замены аминокислоты; например, кодон NUN (где N – любой нуклеотид) обычно кодирует гидрофобные аминокислоты. NCN кодирует аминокислотные остатки, небольшие по размеру и умеренные по гидропатичности; NAN кодирует аминокислотные остатки среднего размера и гидрофильные. Генетический код настолько хорошо структурирован с точки зрения гидропатичности, что математический анализ (сингулярное разложение) 12 переменных (4 нуклеотида x 3 позиции) дает замечательную корреляцию (C = 0,95) для предсказания гидропатичности кодируемой аминокислоты непосредственно из последовательности триплетных нуклеотидов без трансляции. Обратите внимание, что в таблице ниже восемь аминокислот вообще не подвержены влиянию мутаций в третьем положении кодона, в то время как на рисунке выше мутация во втором положении, вероятно, вызовет радикальное изменение физико-химических свойств кодируемой аминокислоты. Тем не менее, изменения в первом положении кодонов более значимы, чем изменения во втором положении в глобальном масштабе. Это может быть связано с тем, что изменение заряда (с положительного на отрицательный или наоборот) может произойти только при мутациях в первом положении определенных кодонов, но не при изменениях во втором положении любого кодона. Такое изменение заряда может иметь серьезные последствия для структуры или функции белка. Этот аспект, возможно, был в значительной степени недооценен в предыдущих исследованиях.
Нестандартные аминокислоты
В некоторых белках нестандартные аминокислоты замещают стандартные стоп-кодоны в зависимости от связанных сигнальных последовательностей в мРНК. Например, UGA может кодировать селеноцистеин, а UAG – пирролизин. Селеноцистеин стал рассматриваться как 21-я аминокислота, а пирролизин – как 22-я. Хотя генетический код обычно постоянен в организме, археальный прокариот Acetohalobium arabaticum способен расширить свой генетический код с 20 до 21 аминокислоты (включая пирролизин) при различных условиях культивирования.
Вариации
[[Файл:Фацил генетический код логотип. png|thumb|upright=2.3|Логотип генетического кода митохондриального генома Globobulimina pseudospinescens, разработанный FACIL. Программа способна правильно определить, что используется протозойный митохондриальный код. Первая вариация была обнаружена в 1979 году исследователями, изучавшими митохондриальные гены человека. Впоследствии было обнаружено множество незначительных вариантов. Эти незначительные варианты включают, например, трансляцию кодона UGA в триптофан у видов Mycoplasma и трансляцию CUG в серин, а не лейцин, у дрожжей клады CTG (таких как Candida albicans). Поскольку вирусы должны использовать тот же генетический код, что и их хозяева, модификации стандартного генетического кода могут нарушить синтез или функционирование вирусных белков. Однако вирусы, такие как тотивирусы, адаптировались к модификациям генетического кода хозяина. У бактерий и архей GUG и UUG часто служат стартовыми кодонами. В редких случаях определенные белки могут использовать альтернативные стартовые кодоны. Удивительно, но вариации в интерпретации генетического кода существуют также в генах, кодируемых ядерным геномом человека: в 2016 году исследователи, изучавшие трансляцию малатодегидрогеназы, обнаружили, что примерно в 4% мРНК, кодирующих этот фермент, стоп-кодон естественным образом используется для кодирования аминокислот триптофана и аргинина. Этот тип рекодирования индуцируется высоким контекстом прочтения стоп-кодона и называется функциональным трансляционным прочтением. Несмотря на эти различия, все известные природные коды очень похожи. Механизм кодирования одинаков для всех организмов: трехбуквенные кодоны, тРНК, рибосомы, однонаправленное чтение и трансляция отдельных кодонов в отдельные аминокислоты. Наиболее существенные вариации наблюдаются у некоторых цилиат, где значение стоп-кодонов зависит от их положения в мРНК. Вблизи 3'-конца они действуют как терминаторы, а во внутренних позициях либо кодируют аминокислоты, как у Condylostoma magnum, либо вызывают сдвиг рамки считывания рибосомы, как у Euplotes. Происхождение и вариации генетического кода, включая механизмы, лежащие в основе его эволюционируемости, широко изучались, и некоторые исследования были проведены по экспериментальной эволюции генетического кода некоторых организмов.
Вывод
Различные генетические коды, используемые организмом, можно установить, идентифицируя высококонсервативные гены, закодированные в его геноме, и сравнивая использование кодонов с аминокислотами в гомологичных белках других организмов. Например, программа FACIL определяет генетический код, выявляя, какие аминокислоты в гомологичных белковых доменах наиболее часто соответствуют каждому кодону. Полученные вероятности аминокислот (или стоп-кодонов) для каждого кодона отображаются в виде логотипа генетического кода. По состоянию на январь 2022 года наиболее полным обзором генетических кодов является работа Шульгиной и Эдди, которые проанализировали 250 000 прокариотических геномов с помощью инструмента Codetta. Этот инструмент использует аналогичный подход к FACIL, но с использованием более крупной базы данных Pfam. Несмотря на то, что NCBI уже предоставляет 27 таблиц трансляции, авторам удалось обнаружить 5 новых вариантов генетического кода (подтвержденных мутациями тРНК) и исправить несколько неверных присвоений. Позднее Codetta была использована для анализа изменений генетического кода у инфузорий.