Введение
Техника молекулярной биологии
Серийный анализ экспрессии генов (SAGE) — это транскриптомическая методика, используемая молекулярными биологами для получения моментального представления о популяции мРНК в интересующем образце в виде небольших тегов, соответствующих фрагментам этих транскриптов. С тех пор было разработано несколько вариантов, наиболее заметными из которых являются более надежная версия LongSAGE, RL SAGE и самая последняя SuperSAGE. Многие из них усовершенствовали методику за счет захвата более длинных тегов, что обеспечивает более точную идентификацию исходного гена.
Анализ
Выход SAGE представляет собой список коротких последовательностей-меток и частоту их встречаемости. Используя базы данных последовательностей, исследователь обычно может с определенной степенью уверенности установить, из какой исходной мРНК (а следовательно, из какого гена) была получена данная метка. К спискам меток и их количеству из разных образцов могут быть применены статистические методы для определения генов с повышенной экспрессией. Например, образец нормальной ткани можно сравнить с соответствующей опухолью, чтобы выявить гены, которые проявляют более (или менее) высокую активность.
История
В 1979 году группы из Гарварда и Калтеха расширили основную идею получения копий ДНК мРНК in vitro до амплификации библиотеки таких копий в бактериальных плазмидах. В 1982–1983 годах Грег Сатклифф и его коллеги исследовали возможность отбора случайных или полуслучайных клонов из такой кДНК-библиотеки для секвенирования, а также Putney и соавторы, которые секвенировали 178 клонов из библиотеки кДНК кроличьей мышечной ткани. В 1991 году Адамс и его коллеги ввели термин "экспрессированный тег последовательности" (EST) и инициировали более систематическое секвенирование кДНК в рамках проекта (начиная с 600 кДНК мозга). Идентификация EST происходила быстро, и сейчас миллионы EST доступны в публичных базах данных (например, GenBank). В 1995 году идея сокращения длины тега с 100–800 п.н. до 10–22 п.н. помогла снизить стоимость анализа мРНК. В этом же году Виктор Велюлеску из Онкологического центра Университета Джона Хопкинса опубликовал оригинальный протокол SAGE. Robust LongSage (RL SAGE) дополнительно усовершенствовал протокол LongSAGE, предоставив возможность создания библиотеки из 50 нг мРНК, что значительно меньше, чем предыдущий размер вставки LongSAGE – 2 мкг мРНК.
Суперсаж
SuperSAGE является производным от SAGE, использующим эндонуклеазу типа III EcoP15I фага P1 для вырезания 26-нуклеотидных тегов последовательности из кДНК каждого транскрипта, что увеличивает размер тега как минимум на 6 нуклеотидов по сравнению с предшествующими методами SAGE и LongSAGE. Увеличенный размер тега обеспечивает более точное отнесение тега к соответствующему транскрипту, поскольку каждый дополнительный нуклеотид значительно повышает точность аннотации. Как и в оригинальном протоколе SAGE, формируются так называемые дитаги из тегов с тупыми концами. Однако SuperSAGE позволяет избежать смещения, наблюдаемого при менее случайной лигации 20-нуклеотидных дитагов в LongSAGE. С помощью прямого секвенирования с использованием высокопроизводительных методов секвенирования (секвенирование нового поколения, например, пиросеквенирование) можно одновременно анализировать сотни тысяч или миллионы тегов, получая высокоточные и количественные профили экспрессии генов. Таким образом, профилирование экспрессии генов на основе тегов, также называемое «цифровым профилированием экспрессии генов» (DGE), сегодня позволяет получать наиболее точные профили транскрипции, преодолевая ограничения микромассивов.
3'концовка секвенирования мРНК, массивный анализ концов сДНК
В середине 2010-х годов было разработано несколько методов, сочетающихся с секвенированием нового поколения, которые используют принцип "тега" для "цифрового профилирования экспрессии генов", но без использования фермента мечения. Метод "MACE" (= Массивный анализ концов кДНК) генерирует теги в пределах последних 1500 пар оснований транскрипта. Этот метод больше не зависит от рестрикционных ферментов и, таким образом, позволяет избежать смещений, связанных с отсутствием или положением сайта рестрикции в кДНК. Вместо этого кДНК подвергается случайной фрагментации, и 3'-концы секвенируются с 5'-конца молекулы кДНК, несущей поли(А)-хвост. Длина последовательности тега может быть выбрана произвольно. Благодаря этому теги можно собирать в контиги, а аннотация тегов может быть значительно улучшена. Поэтому MACE также используется для анализа немодельных организмов. Кроме того, более длинные контиги можно сканировать на наличие полиморфизмов. Поскольку в некодирующих областях (UTR) наблюдается большое количество полиморфизмов между индивидуумами, метод MACE может быть применен для определения аллелей, аллель-специфического профилирования экспрессии генов и поиска молекулярных маркеров для селекции. Кроме того, этот подход позволяет определить альтернативную полиадениляцию транскриптов. Поскольку MACE требует только 3'-концов транскриптов, даже частично деградированную РНК можно анализировать с меньшим смещением, зависящим от степени деградации. Метод MACE использует уникальные молекулярные идентификаторы для выявления смещений, возникающих при ПЦР.