Введение
Исследовательский консорциум, изучающий функциональные элементы в ДНК человека и модельных организмов.
Энциклопедия элементов ДНК (ENCODE) – это общедоступный исследовательский проект, целью которого является "создание исчерпывающего перечня функциональных элементов в геноме человека". ENCODE также поддерживает дальнейшие биомедицинские исследования, "создавая общедоступные ресурсы геномных данных, программного обеспечения, инструментов и методов для анализа геномных данных, а также продукты, полученные в результате анализа и интерпретации данных". Являясь продолжением проекта "Геном человека", проект ENCODE направлен на идентификацию всех функциональных элементов в геноме человека. В проекте участвует международный консорциум исследовательских групп, а данные, полученные в ходе проекта, доступны через общедоступные базы данных. Первоначальный выпуск ENCODE состоялся в 2013 году, и с тех пор он постоянно обновляется в соответствии с рекомендациями членов консорциума и широкого научного сообщества, использующего портал для доступа к данным ENCODE. Двойная цель ENCODE – служить общедоступной базой данных для "экспериментальных протоколов, процедур анализа и самих данных", а также "обеспечить использование единого интерфейса для тщательно курируемых метаданных, фиксирующих происхождение данных и обосновывающих их биологическую интерпретацию". Проект начал свою четвертую фазу (ENCODE 4) в феврале 2017 года.
Мотивация и значение
По оценкам, у человека около 20 000 генов, кодирующих белки, что составляет примерно 1,5% ДНК в геноме человека. Основная цель проекта ENCODE – определить роль оставшейся части генома, большая часть которой традиционно считалась «мусорной» ДНК. Активность и экспрессия генов, кодирующих белки, могут модулироваться регуломом – совокупностью различных ДНК-элементов, таких как промоторы, последовательности, регулирующие транскрипцию, а также области структуры хроматина и модификации гистонов. Считается, что изменения в регуляции активности генов могут нарушать выработку белка и клеточные процессы, приводя к заболеваниям. Определение местоположения этих регуляторных элементов и механизмов их влияния на транскрипцию генов может выявить связь между вариациями в экспрессии определенных генов и развитием болезней. ENCODE также задуман как всесторонний ресурс, позволяющий научному сообществу лучше понять, каким образом геном влияет на здоровье человека, и «стимулировать разработку новых методов профилактики и лечения этих заболеваний».
Консорциум ENCODE
Консорциум ENCODE состоит главным образом из ученых, финансируемых Национальным институтом исследования генома человека США (NHGRI). Другие участники, вносящие вклад в проект, включаются в Консорциум или Рабочую группу по анализу данных. Пилотный этап состоял из восьми исследовательских групп и двенадцати групп, участвовавших в этапе разработки технологий ENCODE. После 2007 года число участников расширилось до 440 ученых из 32 лабораторий по всему миру, поскольку пилотный этап официально завершился. В настоящее время консорциум состоит из различных центров, выполняющих разные задачи. ENCODE является членом Международного консорциума эпигенома человека (IHEC). Основным требованием NHGRI к результатам исследований, финансируемых ENCODE, является их бесплатное и широкое распространение среди всех исследователей для продвижения геномных исследований. Исследования ENCODE обеспечивают воспроизводимость и, следовательно, прозрачность программного обеспечения, методов, данных и других инструментов, связанных с геномным анализом, а также производственной фазы. Четвертый этап является продолжением третьего и включает в себя функциональную характеристику и дальнейший интегративный анализ для создания энциклопедии. Целью пилотного этапа было определение набора процедур, которые в комбинации могли бы эффективно и с высокой пропускной способностью точно и всесторонне характеризовать большие участки генома человека. Пилотный этап должен был выявить недостатки в существующем наборе инструментов для обнаружения функциональных последовательностей, а также определить, были ли некоторые из используемых на тот момент методов неэффективными или неподходящими для крупномасштабного применения. Некоторые из этих проблем должны были быть решены на этапе разработки технологий ENCODE, который был направлен на создание новых лабораторных и вычислительных методов, улучшающих нашу способность идентифицировать известные функциональные последовательности или обнаруживать новые функциональные геномные элементы. Результаты первых двух этапов определили оптимальный подход к анализу оставшихся 99% генома человека в экономически эффективной и всеобъемлющей производственной фазе.
Результаты производственной фазы
В сентябре 2012 года проект представил значительно более масштабный набор результатов, состоящий из 30 статей, опубликованных одновременно в нескольких журналах, включая шесть в Nature, шесть в Genome Biology и специальный выпуск с 18 публикациями в Genome Research. Авторы описали создание и начальный анализ 1640 наборов данных, предназначенных для аннотации функциональных элементов во всем геноме человека, интегрируя результаты различных экспериментов в рамках клеточных типов, взаимосвязанных экспериментов с участием 147 различных типов клеток, а также все данные ENCODE с другими ресурсами, такими как кандидатские регионы, полученные в результате полногеномных исследований ассоциаций (GWAS), и эволюционно консервативные регионы. В совокупности эти усилия выявили важные особенности организации и функционирования генома человека, которые были обобщены в обзорной статье следующим образом:
Подавляющее большинство (80,4%) генома человека участвует как минимум в одном биохимическом событии, связанном с РНК и/или хроматином, в по крайней мере одном типе клеток. Значительная часть генома находится вблизи регуляторного события: 95% генома расположены в пределах 8 кб от взаимодействия белка с ДНК (определяемого мотивами последовательностей, связанных с ChIP-seq, или следами DNaseI), а 99% – в пределах 1,7 кб от хотя бы одного из биохимических событий, измеренных ENCODE. Элементы, специфичные для приматов, а также элементы, не демонстрирующие обнаруживаемых ограничений у млекопитающих, в совокупности показывают признаки отрицательного отбора, что позволяет предположить, что некоторые из них могут быть функциональными. Классификация генома на семь состояний хроматина предполагает наличие начального набора из 399 124 областей с характеристиками, схожими с энхансерами, и 70 292 областей с характеристиками, схожими с промоторами, а также сотен тысяч областей покоя. Анализ с высоким разрешением далее разделяет геном на тысячи узких состояний с различными функциональными свойствами. Возможно количественно соотносить производство и процессинг последовательностей РНК как с хроматиновыми метками, так и со связыванием факторов транскрипции (ФТ) в промоторах, что указывает на то, что функциональность промотора может объяснить большую часть вариаций в экспрессии РНК. Многие некодирующие варианты в отдельных геномных последовательностях расположены в функциональных областях, аннотированных ENCODE; их количество, по крайней мере, сопоставимо с количеством вариантов, расположенных в генах, кодирующих белки. Одиночные нуклеотидные полиморфизмы (СНП), связанные с заболеваниями, обогащены в некодирующих функциональных элементах, причем большинство из них находятся внутри или вблизи областей, определенных ENCODE, которые расположены за пределами генов, кодирующих белки. Во многих случаях фенотипы заболеваний можно связать с определенным типом клеток или ФТ. Наиболее заметным результатом стало то, что доля биологически активной ДНК человека значительно выше, чем даже самые оптимистичные предыдущие оценки. В обзорной статье консорциум ENCODE сообщил, что его участникам удалось присвоить биохимические функции более чем 80% генома. Создан лексикон коротких последовательностей ДНК, формирующих мотивы распознавания для белков, связывающихся с ДНК. Было обнаружено около 8,4 миллиона таких последовательностей, составляющих часть общей ДНК, примерно в два раза превышающую размер экзома. Тысячи промоторов транскрипции используют единый стереотипный отпечаток в 50 пар оснований. Представлен предварительный эскиз архитектуры сети человеческих факторов транскрипции, то есть факторов, которые связываются с ДНК для стимуляции или ингибирования экспрессии генов. Сеть оказалась довольно сложной, с факторами, действующими на разных уровнях, а также многочисленными петлями обратной связи различных типов. Проведено измерение доли генома человека, способного транскрибироваться в РНК. Эта доля, по оценкам, составляет более 75% от общей ДНК, что значительно превышает предыдущие оценки. Проект также начал характеризовать типы транскриптов РНК, генерируемых в различных локациях.
Современный
modERN, сокращение от "model organism encyclopedia of regulatory networks", вырос из проекта modENCODE. В рамках проекта объединены группы, работающие с C. elegans и Drosophila, и основное внимание уделяется идентификации дополнительных сайтов связывания транскрипционных факторов этих организмов. Проект стартовал одновременно с третьей фазой ENCODE и планировался к завершению в 2017 году. На сегодняшний день проект опубликовал данные 198 экспериментов, около 500 других экспериментов представлены на рассмотрение и в настоящее время обрабатываются в ЦКК.
Геномная регуляция генов
В начале 2015 года NIH запустила программу "Геномика регуляции генов" (GGR). Целью программы, рассчитанной на три года, является изучение генных сетей и путей в различных системах организма с целью более глубокого понимания механизмов, контролирующих экспрессию генов. Несмотря на то, что проект ENCODE является отдельным от GGR, Центр распространения данных ENCODE (ENCODE DCC) размещает данные GGR на портале ENCODE.
Дорожная карта
В 2008 году NIH начал Консорциум по картографированию эпигенома "Дорожная карта", целью которого было создание "общедоступного ресурса эпигеномных данных человека для стимулирования фундаментальных биологических и исследований, ориентированных на заболевания". В феврале 2015 года консорциум опубликовал статью под названием "Интегративный анализ 111 эталонных эпигеномов человека", которая позволила достичь цели консорциума. Консорциум объединил информацию и аннотировал регуляторные элементы в 127 эталонных эпигеномах, 16 из которых были получены в рамках проекта ENCODE. Данные проекта "Дорожная карта" доступны на портале "Дорожная карта" или портале ENCODE.
Проект fruitENCODE
FruitENCODE: энциклопедия элементов ДНК, участвующих в созревании плодов – это проект, аналогичный ENCODE, направленный на создание наборов данных о метилировании ДНК, модификациях гистонов, областях с повышенной чувствительностью к ДНКазе (DHS), экспрессии генов и связывании факторов транскрипции для всех видов мясистых плодов на различных стадиях развития. Предварительные данные доступны на портале fruitENCODE.