Введение
В области молекулярной биологии профилирование экспрессии генов – это измерение активности (экспрессии) тысяч генов одновременно для получения целостной картины клеточной функции. Эти профили могут, например, различать активно делящиеся клетки или демонстрировать реакцию клеток на определенное воздействие. Многие подобные эксперименты измеряют весь геном одновременно, то есть все гены, присутствующие в конкретной клетке. Для анализа можно использовать различные технологии транскриптомики, позволяющие получить необходимые данные. ДНК-микрочипы измеряют относительную активность ранее идентифицированных генов-мишеней. Методы, основанные на секвенировании, такие как RNA-Seq, предоставляют информацию о последовательностях генов в дополнение к их уровню экспрессии.
Предыстория
Профилирование экспрессии — логичный следующий шаг после секвенирования генома: последовательность сообщает нам, на что клетка потенциально способна, а профиль экспрессии — что она фактически делает в данный момент времени. Гены содержат инструкции для создания мРНК (матричной РНК), но в любой момент времени каждая клетка производит мРНК лишь из части своих генов. Если ген используется для производства мРНК, он считается «активным», в противном случае — «неактивным». На то, активен ген или нет, влияет множество факторов, таких как время суток, деление клетки, её микроокружение и химические сигналы от других клеток. Например, клетки кожи, печени и нервной ткани активируют (экспрессируют) несколько отличающиеся гены, и именно это в значительной степени определяет их различия. Таким образом, профиль экспрессии позволяет определить тип клетки, её состояние, окружающую среду и так далее. Эксперименты по профилированию экспрессии часто включают измерение относительного количества мРНК, экспрессируемой в двух или более экспериментальных условиях. Это связано с тем, что изменение уровня определённой последовательности мРНК указывает на изменение потребности в белке, кодируемом этой мРНК, что может свидетельствовать о гомеостатическом ответе или патологическом состоянии. Например, повышенный уровень мРНК, кодирующей алкогольдегидрогеназу, говорит о том, что исследуемые клетки или ткани реагируют на повышенное содержание этанола в окружающей среде. Аналогично, если клетки рака молочной железы экспрессируют более высокие уровни мРНК, связанных с определённым трансмембранным рецептором, чем нормальные клетки, это может указывать на роль этого рецептора в развитии рака молочной железы. Препарат, вмешивающийся в работу этого рецептора, может предотвратить или лечить рак молочной железы. При разработке лекарственного средства можно проводить эксперименты по профилированию экспрессии генов для оценки его токсичности, например, отслеживая изменения в уровнях экспрессии генов цитохрома P450, которые могут служить биомаркером метаболизма лекарственного средства. Профилирование экспрессии генов может стать важным диагностическим инструментом.
Сравнение с протеомикой
Геном человека содержит порядка 20 000 генов, которые совместно работают над производством примерно 1 000 000 различных белков. Это обусловлено альтернативным сплайсингом, а также тем, что клетки вносят существенные изменения в белки посредством посттрансляционной модификации после их первоначальной сборки, поэтому один ген может служить основой для множества возможных вариантов конкретного белка. В любом случае, один эксперимент масс-спектрометрии способен идентифицировать около 2000 белков, или 0,2% от их общего числа. Несмотря на то, что знание точного состава белков, производимых клеткой (протеомика), более значимо, чем знание количества мРНК, синтезируемой каждым геном, профилирование экспрессии генов предоставляет наиболее полную картину, которую можно получить в одном эксперименте. Однако методология протеомики постоянно совершенствуется. У других видов, например, дрожжей, можно идентифицировать более 4000 белков всего за чуть более часа.
2,000 proteins or 0.2% of the total. While knowledge of the precise proteins a cell makes (proteomics) is more relevant than knowing how much messenger RNA is made from each gene, gene expression profiling provides the most global picture possible in a single experiment. However, proteomics methodology is improving. In other species, such as yeast, it is possible to identify over 4,000 proteins in just over one hour.
Использование в создании и тестировании гипотез
Иногда ученый уже имеет представление о происходящем, гипотезу, и проводит эксперимент по профилированию экспрессии с целью потенциально опровергнуть эту гипотезу. Иными словами, ученый делает конкретный прогноз об уровнях экспрессии, который может оказаться неверным. Чаще всего профилирование экспрессии проводится до того, как станет достаточно известно о взаимодействии генов с экспериментальными условиями для формирования проверяемой гипотезы. При отсутствии гипотезы нечего опровергать, но профилирование экспрессии может помочь выявить гипотезу-кандидата для дальнейших исследований. Большинство ранних экспериментов по профилированию экспрессии, и многие современные, имеют такую форму, известную как обнаружение классов. Распространенный подход к обнаружению классов заключается в объединении похожих генов или образцов с использованием одного из множества существующих методов кластеризации, таких как традиционные k-средних или иерархическая кластеризация, или более современные методы, например MCL. Помимо выбора алгоритма кластеризации, пользователю обычно необходимо выбрать подходящую меру близости (расстояние или сходство) между объектами данных. Рисунок выше демонстрирует результат двухмерной кластеризации, в которой похожие образцы (строки, сверху) и похожие генные зонды (столбцы) организованы таким образом, чтобы располагаться близко друг к другу. Самая простая форма обнаружения классов – это перечисление всех генов, изменение уровня экспрессии которых между двумя экспериментальными условиями превышает определенный порог. Предсказание класса сложнее, чем обнаружение классов, но позволяет ответить на вопросы, имеющие непосредственное клиническое значение, например: какова вероятность ответа пациента на данный препарат, исходя из его профиля экспрессии? Для этого требуется большое количество примеров профилей пациентов, успешно ответивших на лечение и не ответивших, а также методы перекрестной проверки для их разграничения.
Ограничения
В общем, исследования профилирования экспрессии сообщают о тех генах, которые показали статистически значимые различия при изменении экспериментальных условий. Как правило, это небольшая часть генома, и на то есть несколько причин. Во-первых, разные клетки и ткани экспрессируют лишь подмножество генов как прямое следствие клеточной дифференцировки, поэтому многие гены неактивны. Во-вторых, многие гены кодируют белки, необходимые для выживания в строго определенных количествах, поэтому их экспрессия часто не меняется. В-третьих, клетки используют множество других механизмов для регуляции белков, помимо изменения количества мРНК, поэтому эти гены могут оставаться постоянно экспрессированными, даже если концентрация белка растет или падает. В-четвертых, финансовые ограничения приводят к тому, что эксперименты по профилированию экспрессии проводятся с небольшим количеством повторов для одного и того же гена в идентичных условиях, что снижает статистическую мощность эксперимента и делает невозможным выявление важных, но незначительных изменений. Наконец, для обсуждения биологической значимости каждого регулируемого гена требуются значительные усилия, поэтому ученые часто ограничиваются рассмотрением лишь части из них. Новые методы анализа микромассивов автоматизируют некоторые аспекты придания биологической значимости результатам профилирования экспрессии, но эта задача остается очень сложной. Относительно небольшое количество генов, представленных в публикациях по профилированию экспрессии, ограничивает степень согласованности результатов, полученных в разных лабораториях. Публикация результатов профилирования экспрессии в общедоступных базах данных микромассивов позволяет исследователям анализировать паттерны экспрессии за пределами опубликованных данных и, возможно, находить сходство с собственной работой.
Валидация измерений высокой пропускной способности
Как микромассивы ДНК, так и количественная ПЦР используют преимущественное связывание или "комплементарное спаривание оснований" комплементарных последовательностей нуклеиновых кислот, и оба метода применяются для профилирования экспрессии генов, часто последовательно. Хотя высокопроизводительные микромассивы ДНК уступают ПЦР в количественной точности, измерение экспрессии нескольких десятков генов с помощью ПЦР занимает примерно столько же времени, сколько измерение всего генома с использованием микромассивов ДНК. Поэтому часто целесообразно сначала проводить полуколичественный анализ экспрессии генов с помощью микромассивов ДНК для выявления генов-кандидатов, а затем подтверждать результаты микромассивов с помощью ПЦР на наиболее интересных кандидатах. Другие эксперименты, такие как вестерн-блоттинг некоторых белковых продуктов дифференциально экспрессируемых генов, делают выводы, основанные на профиле экспрессии, более обоснованными, поскольку уровни мРНК не всегда коррелируют с количеством экспрессируемого белка.
Статистический анализ
Анализ данных микромассивов стал областью интенсивных исследований. Простое утверждение о том, что группа генов регулируется как минимум в два раза, что ранее было обычной практикой, не имеет надёжного статистического обоснования. При пяти или менее повторностях в каждой группе, что типично для микромассивов, одно аномальное наблюдение может создать кажущуюся разницу, превышающую двукратную. Кроме того, произвольное установление порога в два раза не является биологически обоснованным, поскольку исключает из рассмотрения многие гены, имеющие очевидное биологическое значение. Вместо идентификации дифференциально экспрессируемых генов на основе порога изменения экспрессии, можно использовать различные статистические тесты или комплексные тесты, такие как ANOVA, которые учитывают как изменение экспрессии, так и изменчивость для вычисления p-значения – оценки вероятности наблюдения данных исключительно за счёт случайности. Применение p-значений к микромассивам осложняется большим количеством множественных сравнений (генов). Например, p-значение 0,05 обычно считается порогом значимости, поскольку оно оценивает 5% вероятность случайного наблюдения данных. Однако при наличии 10 000 генов на микромассиве 500 генов будут идентифицированы как значимые при p < 0,05, даже если между экспериментальными группами нет различий. Очевидным решением является рассмотрение значимыми только тех генов, которые соответствуют гораздо более строгому критерию p-значения, например, можно применить поправку Бонферрони к p-значениям или использовать расчёт частоты ложных открытий для корректировки p-значений пропорционально количеству параллельных тестов. К сожалению, эти подходы могут сократить количество значимых генов до нуля, даже если гены действительно дифференциально экспрессируются. Современные статистические методы, такие как Rank products, стремятся найти баланс между ложным обнаружением генов из-за случайных колебаний и необнаружением дифференциально экспрессируемых генов. Обычно используемые методы включают анализ значимости микромассивов (SAM), а также широкий спектр методов, доступных в Bioconductor и различных пакетах анализа от биоинформатических компаний. Выбор другого теста обычно приводит к идентификации другого списка значимых генов, поскольку каждый тест основан на определённом наборе предположений и по-разному оценивает определённые характеристики данных. Многие тесты начинаются с предположения о нормальном распределении данных, поскольку это кажется разумной отправной точкой и часто даёт результаты, которые кажутся более значимыми. Некоторые тесты учитывают совместное распределение всех наблюдений генов для оценки общей изменчивости измерений, в то время как другие рассматривают каждый ген изолированно. Многие современные методы анализа микромассивов включают бутстрэп (статистику), машинное обучение или методы Монте-Карло. По мере увеличения числа повторных измерений в эксперименте с микромассивами различные статистические подходы дают всё более схожие результаты, но отсутствие согласованности между различными статистическими методами снижает достоверность результатов. Проект MAQC даёт рекомендации, направляющие исследователей в выборе более стандартных методов (например, совместное использование p-значения и изменения экспрессии для выбора дифференциально экспрессируемых генов), чтобы эксперименты, проводимые в разных лабораториях, были более сопоставимы. В отличие от анализа дифференциально экспрессируемых отдельных генов, другой тип анализа фокусируется на дифференциальной экспрессии или нарушении заранее определённых наборов генов и называется анализом наборов генов. Наборы генов – это группы генов, функционально связанных между собой в соответствии с современными знаниями. Поэтому анализ наборов генов считается подходом к анализу, основанному на знаниях, и остаётся важным фактором для рассмотрения.
Категоризация регулируемых генов
После выявления некоторого набора регулируемых генов, следующим этапом в профилировании экспрессии является поиск закономерностей внутри этого набора. Выполняют ли белки, кодируемые этими генами, схожие функции? Являются ли они химически похожими? Локализуются ли они в сходных клеточных компартментах? Анализ генной онтологии предоставляет стандартизированный подход к определению этих взаимосвязей. Генные онтологии начинаются с очень широких категорий, например, "метаболический процесс", и разбиваются на более узкие, например, "метаболизм углеводов", и, наконец, на весьма специфичные категории, такие как "фосфорилирование инозитола и его производных". Гены обладают и другими характеристиками, помимо биологической функции, химических свойств и клеточной локализации. Можно формировать наборы генов на основе их близости к другим генам, связи с заболеваниями, а также взаимосвязей с лекарственными препаратами или токсинами. База данных молекулярных сигнатур и база данных сравнительной токсикогеномики – примеры ресурсов для категоризации генов различными способами.
Поиск закономерностей среди регулируемых генов
Регулируемые гены классифицируются по их природе и функциям, и в результате могут выявляться важные взаимосвязи между ними. Например, мы можем обнаружить, что определенный ген кодирует белок, который является ферментом, активирующим другой белок, включающий второй ген из нашего списка. Этот второй ген может быть фактором транскрипции, регулирующим еще один ген из нашего списка. Наблюдая за такими связями, мы можем начать подозревать, что они представляют собой нечто большее, чем случайные совпадения в результатах, и что все гены в нашем списке оказались там из-за лежащего в основе биологического процесса. С другой стороны, если выбирать гены случайным образом, можно обнаружить множество генов, имеющих что-то общее. Поэтому нам необходимы строгие статистические процедуры, чтобы проверить, является ли выявляемая биологическая тема значимой. Это особенно актуально при анализе генов, известных своей связью с холестерином. Можно предположить, что экспериментальное воздействие регулирует уровень холестерина, поскольку оно избирательно регулирует гены, связанные с холестерином. Хотя это может быть верно, существует ряд причин, по которым делать однозначный вывод, основываясь только на данных об обогащении, – это неоправданный риск. Одна из ранее упомянутых проблем заключается в том, что регуляция генов не обязательно влияет на регуляцию белков: даже если белки, кодируемые этими генами, выполняют только функцию синтеза холестерина, выявление изменений в их мРНК не дает прямого представления о происходящем на белковом уровне. Вполне возможно, что количество этих белков, связанных с холестерином, остается постоянным в экспериментальных условиях. Во-вторых, даже если уровень белка меняется, возможно, его всегда достаточно для максимальной скорости синтеза холестерина, то есть, лимитирующим фактором в этом процессе является другой белок, не входящий в наш список. Наконец, белки обычно выполняют множество функций, поэтому эти гены могут регулироваться не из-за их общей связи с синтезом холестерина, а из-за общей роли в совершенно независимом процессе. Учитывая вышеизложенные предостережения, следует отметить, что профили экспрессии генов сами по себе не доказывают причинно-следственные связи между воздействием и биологическими эффектами, но они предоставляют уникальные биологические сведения, которые часто бывает трудно получить другими способами.
Выводы
Профилирование экспрессии предоставляет новую информацию о функциях генов в различных условиях. В целом, технология микромассивов позволяет получать надежные профили экспрессии. На основе этих данных можно выдвигать новые гипотезы в области биологии или проверять существующие. Однако масштаб и сложность этих экспериментов часто приводят к множеству возможных интерпретаций. Во многих случаях анализ результатов профилирования экспрессии требует значительно больше усилий, чем само проведение экспериментов. Большинство исследователей применяют несколько статистических методов и разведочный анализ данных перед публикацией результатов профилирования экспрессии, согласовывая свои действия с биоинформатиком или другим специалистом по ДНК-микромассивам. Качественный экспериментальный дизайн, достаточная биологическая репликация и последующие исследования играют ключевую роль в успешном проведении экспериментов по профилированию экспрессии.