Введение

Секвенирование последовательности аминокислот в белке

Секвенирование белка – это практический процесс определения последовательности аминокислот всего или части белка или пептида. Это может использоваться для идентификации белка или характеристики его посттрансляционных модификаций. Как правило, частичное секвенирование белка предоставляет достаточную информацию (один или несколько последовательных фрагментов) для его идентификации путем сопоставления с базами данных последовательностей белков, полученных на основе теоретического перевода генов. Два основных прямых метода секвенирования белков – масс-спектрометрия и деградация Эдмана с использованием белкового секвенатора (секвенсора). Методы масс-спектрометрии в настоящее время наиболее широко применяются для секвенирования и идентификации белков, однако деградация Эдмана остается ценным инструментом для определения N-концевого участка белка.

Определение аминокислотной композиции

Часто бывает полезно знать неупорядоченный аминокислотный состав белка до попытки определения упорядоченной последовательности, поскольку эта информация может помочь выявить ошибки в процессе секвенирования или различить неоднозначные результаты. Знание частоты встречаемости определенных аминокислот также может быть использовано для выбора протеазы, подходящей для расщепления белка. Кроме того, можно определить включение даже небольших количеств нестандартных аминокислот (например, норлейцина) в состав белка. Обобщенный метод, часто называемый аминокислотным анализом, для определения частоты аминокислот заключается в следующем:

Гидролизуйте известное количество белка до составляющих его аминокислот. Разделите и количественно определите полученные аминокислоты каким-либо способом.

Гидролиз

Гидролиз проводят путем нагревания образца белка в 6 М соляной кислоте до 100–110 °C в течение 24 часов или более. Белки с большим количеством объемных гидрофобных групп могут требовать более длительного нагревания. Однако эти условия настолько жесткие, что некоторые аминокислоты (серин, треонин, тирозин, триптофан, глутамин и цистеин) подвергаются разрушению. Чтобы избежать этой проблемы, Biochemistry Online предлагает нагревать отдельные образцы в течение разного времени, анализировать каждый полученный раствор и экстраполировать результаты к нулевому времени гидролиза. Расталл предлагает использовать различные реагенты для предотвращения или уменьшения деградации, такие как тиольные реагенты или фенол для защиты триптофана и тирозина от воздействия хлора, а также предварительно окислять цистеин. Он также предлагает измерять количество выделившегося аммиака для определения степени гидролиза амидной связи.

Разделение и количественное определение

Аминокислоты можно разделить с помощью ионно-обменной хроматографии, а затем дериватизировать для облегчения их обнаружения. Чаще аминокислоты дериватизируют, а затем разделяют с помощью жидкостной хроматографии с обращенной фазой (HPLC). Примером ионно-обменной хроматографии служит NTRC, в котором используется сульфонированный полистирол в качестве матрицы, аминокислоты добавляются в кислотный раствор и через колонку пропускается буфер с постепенно повышающимся pH. Аминокислоты элюируются при достижении pH их соответствующих изоэлектрических точек. После разделения аминокислот их количество определяется добавлением реагента, образующего окрашенное производное. Если количество аминокислот превышает 10 нмоль, для этого можно использовать нингидрин, который при реакции с пролином дает желтый цвет, а с другими аминокислотами – интенсивный фиолетовый. Концентрация аминокислоты пропорциональна поглощению полученного раствора. При очень малых количествах, вплоть до 10 пмоль, можно получить флуоресцентные производные, используя такие реагенты, как орто-фталальдегид (ОФА) или флуорескамин. Для преколоночной дериватизации может быть использован реагент Эдмана для получения производного, обнаруживаемого с помощью УФ-излучения. Более высокая чувствительность достигается при использовании реагента, генерирующего флуоресцентное производное. Дериватизированные аминокислоты подвергаются хроматографии с обращенной фазой, обычно с использованием колонки на основе силикагеля C8 или C18 и оптимизированного градиента элюирования. Элюируемые аминокислоты обнаруживаются с помощью УФ- или флуоресцентного детектора, а площади пиков сравниваются с площадями пиков для дериватизированных стандартов для количественного определения каждой аминокислоты в образце.

Анализ N-концевых аминокислот

Определение того, какая аминокислота формирует N-конец пептидной цепи, полезно по двум причинам: для облегчения упорядочения последовательностей отдельных пептидных фрагментов в цельную цепь и потому, что первый этап деградации Эдмана часто загрязнен примесями и, следовательно, не дает точного определения N-концевой аминокислоты. Обобщенный метод анализа N-концевых аминокислот следующий:

Взаимодействуйте пептид с реагентом, который селективно маркирует концевую аминокислоту. Гидролизуйте белок. Определите аминокислоту с помощью хроматографии и сравнения со стандартами. Существует множество различных реагентов, которые можно использовать для маркировки концевых аминокислот. Все они реагируют с аминогруппами и, следовательно, также связываются с аминогруппами в боковых цепях аминокислот, таких как лизин. По этой причине необходимо проявлять осторожность при интерпретации хроматограмм, чтобы убедиться, что выбран правильный пик. Два наиболее распространенных реагента – это реагент Сангера (1-фтор-2,4-динитробензол) и дансильные производные, такие как дансилхлорид. Также можно использовать фенилизотиоцианат, реагент для деградации Эдмана. Здесь возникают те же вопросы, что и при определении аминокислотного состава, за исключением того, что окрашивание не требуется, поскольку реагенты образуют окрашенные производные и требуется только качественный анализ. Таким образом, аминокислоту не нужно элюировать из хроматографической колонки, достаточно сравнить ее со стандартом. Еще одним фактором, который следует учитывать, является то, что поскольку любые аминогруппы будут реагировать с маркирующим реагентом, нельзя использовать ионообменную хроматографию, а вместо нее следует использовать тонкослойную хроматографию или жидкостную хроматографию высокого давления.

Анализ C-концевой аминокислоты

Количество методов, доступных для анализа аминокислот с C-конца, значительно меньше, чем количество методов анализа аминокислот с N-конца. Наиболее распространенный метод заключается в добавлении карбоксипептидаз в раствор белка, отборе проб через регулярные интервалы и определении терминальной аминокислоты путем анализа графика зависимости концентрации аминокислот от времени. Этот метод особенно полезен для полипептидов и белков с блокированными N-концами. C-терминальное секвенирование существенно поможет в подтверждении первичной структуры белков, предсказанной на основе последовательностей ДНК, и в выявлении любой посттрансляционной модификации продуктов генов, кодируемых известными кодонами.

Деградация Эдмана

Эдманская деградация – очень важная реакция для определения последовательности аминокислот в белке, поскольку она позволяет установить упорядоченный аминокислотный состав белка. Автоматические секвенаторы Эдмана сейчас широко используются и способны определять последовательность пептидов длиной до приблизительно 50 аминокислот. Ниже приведена схема реакции для определения последовательности белка методом деградации Эдмана; некоторые этапы будут рассмотрены подробнее далее. Разрушьте все дисульфидные связи в белке с помощью восстановителя, такого как 2-меркаптоэтанол. Для предотвращения повторного образования связей может потребоваться защитная группа, например, йодоуксусная кислота. Разделите и очистите отдельные цепи белкового комплекса, если их несколько. Определите аминокислотный состав каждой цепи. Определите N-концевые аминокислоты каждой цепи. Разбейте каждую цепь на фрагменты длиной менее 50 аминокислот. Разделите и очистите фрагменты. Определите последовательность каждого фрагмента. Повторите с другим способом расщепления. Соберите последовательность всего белка.

Переваривание на пептидные фрагменты

Пептиды длиной более 50–70 аминокислот нельзя достоверно секвенировать методом деградации Эдмана. Поэтому длинные белковые цепи необходимо расщеплять на небольшие фрагменты, которые затем можно секвенировать индивидуально. Расщепление осуществляется либо эндопептидазами, такими как трипсин или пепсин, либо химическими реагентами, такими как бромистый цианоген. Разные ферменты дают различные паттерны расщепления, а области перекрытия между фрагментами используются для восстановления полной последовательности.

Реакция

Пептид, подлежащий секвенированию, адсорбируется на твердую поверхность. Распространенным субстратом является стекловолокно, покрытое полибреном – катионным полимером. К адсорбированному пептиду добавляют реагент Эдмана, фенилизотиоцианат (PITC), вместе с умеренно основным буферным раствором 12% триметиламина. Это вступает в реакцию с аминогруппой N-концевой аминокислоты. N-концевую аминокислоту затем можно избирательно отщепить добавлением безводной кислоты. Полученное производное изомеризуется с образованием замещенного фенилтиогидантоина, который можно отмыть и идентифицировать с помощью хроматографии, после чего цикл повторяется. Эффективность каждого этапа составляет около 98%, что позволяет надежно определить примерно 50 аминокислот.

Секвенсор белков

Секвенирующий белки — это прибор, который автоматизирует процесс деградации Эдмана. Образец белка или пептида иммобилизуют в реакционной камере белкового секвенатора и проводят деградацию Эдмана. Каждый цикл высвобождает и дериватизирует одну аминокислоту из N-конца белка или пептида, после чего производное высвобожденной аминокислоты идентифицируется методом ВЭЖХ. Процесс секвенирования повторяется для всего полипептида до установления полной измеримой последовательности или до достижения заданного числа циклов.

Идентификация с помощью масс-спектрометрии

Идентификация белка — это процесс определения названия белка, представляющего интерес (POI), на основе его аминокислотной последовательности. Как правило, для идентификации белка путем сопоставления с базами данных последовательностей белков, полученных из последовательностей ДНК соответствующих генов, достаточно экспериментально определить лишь часть последовательности белка. Дальнейшая характеристика белка может включать подтверждение фактических N- и C-концевых участков POI, определение вариантов последовательности и выявление посттрансляционных модификаций.

Протеолитические переваривающие вещества

Описана общая схема идентификации белка. Целевой белок (POI) выделяется, как правило, с помощью SDS-PAGE или хроматографии. Выделенный POI может быть химически модифицирован для стабилизации остатков цистеина (например, S-амидометилированием или S-карбоксиметилированием). POI подвергается расщеплению специфической протеазой для получения пептидов. Трипсин, который селективно расщепляет C-концевую сторону остатков лизина или аргинина, является наиболее часто используемой протеазой. Его преимущества включают: i) частоту встречаемости остатков лизина и аргинина в белках, ii) высокую специфичность фермента, iii) стабильность фермента и iv) пригодность триптических пептидов для масс-спектрометрии. Пептиды могут быть обессолены для удаления ионизируемых примесей и подвергнуты масс-спектрометрии MALDI TOF. Прямое измерение масс пептидов может предоставить достаточную информацию для идентификации белка (см. пептидный массовый отпечаток), но дальнейшая фрагментация пептидов внутри масс-спектрометра часто используется для получения информации об их последовательностях. В качестве альтернативы пептиды могут быть обессолены и разделены с помощью ВЭЖХ в обращенной фазе и введены в масс-спектрометр через источник ESI. LC-ESI MS может предоставлять больше информации, чем MALDI MS для идентификации белка, но требует больше времени работы прибора. В зависимости от типа масс-спектрометра, фрагментация пептидных ионов может происходить различными механизмами, такими как диссоциация, индуцированная столкновением (CID), или распад после источника (PSD). В каждом случае, картина фрагментов ионов пептида предоставляет информацию о его последовательности. Информация, включая измеренную массу предполагаемых пептидных ионов и их фрагментов, затем сопоставляется с расчетными значениями массы, полученными в результате концептуального (in silico) протеолиза и фрагментации баз данных белковых последовательностей. Успешное соответствие будет найдено, если его оценка превышает пороговое значение, основанное на параметрах анализа. Даже если фактический белок отсутствует в базе данных, допускающее ошибки сопоставление позволяет предположить идентификацию белка на основе сходства с гомологичными белками. Для выполнения этого анализа доступно множество программных пакетов. Программные пакеты обычно генерируют отчет, показывающий идентификацию (номер доступа) каждого идентифицированного белка, его оценку соответствия и предоставляют меру относительной силы соответствия при идентификации нескольких белков. Диаграмма совпадающих пептидов на последовательности идентифицированного белка часто используется для отображения охвата последовательности (% белка, обнаруженного в виде пептидов). Если POI предположительно значительно меньше соответствующего белка, диаграмма может указывать, является ли POI N- или C-концевым фрагментом идентифицированного белка.

Определение последовательности De novo

Схема фрагментации пептида позволяет напрямую определять его аминокислотную последовательность методом de novo секвенирования. Полученная последовательность может быть использована для поиска соответствий в базах данных последовательностей белков или для изучения посттрансляционных и химических модификаций. Она может предоставить дополнительные доказательства для идентификации белков, выполненной описанным выше способом.

N- и C-концы

Пептиды, соответствующие при идентификации белка, не обязательно включают N- или C-концы, предсказанные для данного белка. Это может быть обусловлено сложностью идентификации N- или C-концевых пептидов методом масс-спектрометрии (например, из-за их чрезмерной короткости или длины), посттрансляционными модификациями (например, N-концевым ацетилированием) или реальным отличием от предсказанной последовательности. Посттрансляционные модификации или усеченные концы могут быть выявлены при более детальном анализе данных (например, с помощью de novo секвенирования). Повторный протеолиз с использованием протеазы с иной специфичностью также может оказаться полезным.

Постпереводные изменения

Хотя детальное сравнение данных масс-спектрометрии с предсказаниями, основанными на известной последовательности белка, может быть использовано для определения посттрансляционных модификаций, также могут применяться целенаправленные подходы к получению данных. Например, специфическое обогащение фосфопептидов может способствовать выявлению участков фосфорилирования в белке. Альтернативные методы фрагментации пептидов в масс-спектрометре, такие как ETD или ECD, могут предоставить дополнительную информацию о последовательности.

Определение всей массы

Полная масса белка — это сумма масс его аминокислотных остатков, плюс масса молекулы воды и с учетом любых посттрансляционных модификаций. Хотя белки ионизируются хуже, чем пептиды, полученные из них, белок в растворе может быть проанализирован методом ESI MS, а его масса измерена с точностью до 1 части на 20 000 или выше. Этого часто достаточно для подтверждения правильности концов (то есть соответствия измеренной массы белка массе, предсказанной на основе его последовательности) и для определения наличия или отсутствия многих посттрансляционных модификаций.

Ограничения

Протеолиз не всегда приводит к получению набора пептидов, которые легко поддаются анализу и охватывают всю последовательность белка-мишени. Фрагментация пептидов в масс-спектрометре часто не дает ионов, соответствующих разрыву каждой пептидной связи. Следовательно, восстановленная последовательность для каждого пептида не обязательно является полной. Стандартные методы фрагментации не позволяют различить лейцин и изолейцин, поскольку они являются изомерами. Поскольку деградация Эдмана происходит от N-конца белка, она не будет работать, если N-конец был химически модифицирован (например, ацетилированием или образованием пироглутаминовой кислоты). Деградация Эдмана, как правило, не подходит для определения положения дисульфидных мостов. Кроме того, для получения различимых результатов требуется количество пептида не менее 1 пикомоля, что делает ее менее чувствительной, чем масс-спектрометрия.

Прогнозирование по последовательностям ДНК/РНК

В биологии белки образуются в результате трансляции матричной РНК (мРНК), при этом аминокислотная последовательность белка определяется последовательностью кодонов в мРНК. Сама мРНК формируется посредством транскрипции генов и может подвергаться дальнейшей модификации. Эти процессы достаточно хорошо изучены, чтобы использовать компьютерные алгоритмы для автоматизированного предсказания аминокислотных последовательностей белков на основе последовательностей ДНК, например, полученных в проектах секвенирования генома, что привело к созданию крупных баз данных аминокислотных последовательностей, таких как UniProt. Предсказанные аминокислотные последовательности являются важным ресурсом для идентификации белков методом масс-спектрометрии. Ранее, короткие аминокислотные последовательности (10-15 остатков), определенные методом деградации Эдмана, обратно транслировались в последовательности ДНК, которые могли использоваться в качестве зондов или праймеров для выделения молекулярных клонов соответствующего гена или комплементарной ДНК. Затем последовательность клонированной ДНК определялась и использовалась для выведения полной аминокислотной последовательности белка.

Инструменты биоинформатики

Существуют биоинформатические инструменты, помогающие в интерпретации масс-спектров (см. de novo секвенирование пептидов), для сравнения или анализа последовательностей белков (см. анализ последовательностей) или для поиска в базах данных по пептидным или белковым последовательностям (см. BLAST).

Применение в криптографии

Сложность секвенирования белков недавно была предложена как основа для создания программ, работающих ровно k раз, после чего они самоуничтожаются. Построить подобное исключительно программными средствами невозможно, поскольку любое программное обеспечение по своей природе неограниченно клонируемо.