Введение

Коллекция микроскопических пятен ДНК, прикрепленных к твердой поверхности.

Микромассив ДНК (также широко известный как ДНК-чип или биочип) представляет собой коллекцию микроскопических пятен ДНК, прикрепленных к твердой поверхности. Ученые используют микромассивы ДНК для одновременного измерения уровней экспрессии большого числа генов или для генотипирования множественных участков генома. Каждое пятно ДНК содержит пикомоли (10−12 молей) специфической последовательности ДНК, известной как зонды (или репортеры, или олигонуклеотиды). Это могут быть короткие фрагменты гена или другого элемента ДНК, используемые для гибридизации образца кДНК или кРНК (также называемой антисмысловой РНК) – называемой мишенью – в условиях высокой строгости. Гибридизация зонда и мишени обычно обнаруживается и количественно оценивается путем детекции флуорофорами, серебром или хемилюминесцентными метками мишени для определения относительного количества нуклеиновых кислотных последовательностей в мишени. Изначальные массивы нуклеиновых кислот представляли собой макромассивы размером приблизительно 9 см × 12 см, а первая компьютерная система анализа изображений была опубликована в 1981 году. Изобретателем является Патрик О. Браун. Примером применения является использование SNP-массивов для анализа полиморфизмов при сердечно-сосудистых заболеваниях, раке, инфекциях и GWAS-анализе. Также он используется для идентификации структурных вариаций и измерения экспрессии генов.

Принцип

Основным принципом микромассивов является гибридизация между двумя цепями ДНК, свойство комплементарных последовательностей нуклеиновых кислот специфически соединяться друг с другом посредством образования водородных связей между комплементарными парами нуклеотидных оснований. Большое количество комплементарных пар оснований в нуклеотидной последовательности означает более прочную нековалентную связь между двумя цепями. После удаления неспецифически связавшихся последовательностей, гибридизованными останутся только прочно спаренные цепи. Флуоресцентно меченые целевые последовательности, связывающиеся с последовательностью зондов, генерируют сигнал, зависящий от условий гибридизации (например, температуры) и промывки после гибридизации. Общая сила сигнала от пятна (элемента) зависит от количества целевого образца, связывающегося с зондами, присутствующими в этом пятне. Микромассивы используют относительную количественную оценку, при которой интенсивность элемента сравнивается с интенсивностью того же элемента в других условиях, а идентичность элемента определяется по его положению.

Изготовление

Микромассивы могут быть изготовлены различными способами, в зависимости от количества исследуемых зондов, стоимости, требований к индивидуализации и типа решаемого научного вопроса. Массивы от коммерческих поставщиков могут содержать от 10 зондов до 5 миллионов и более зондов микрометрового размера.

Установленные и синтезированные на месте массивы

Микромассивы могут быть изготовлены с использованием различных технологий, включая печать тонкими заостренными штифтами на стеклянных слайдах, фотолитографию с использованием готовых масок, фотолитографию с использованием динамических микрозеркальных устройств, струйную печать или электрохимию на микроэлектродных массивах. В микромассивах, полученных методом нанесения пятен, зонды представляют собой олигонуклеотиды, кДНК или небольшие фрагменты продуктов ПЦР, соответствующие мРНК. Зонды синтезируются перед нанесением на поверхность массива, а затем "наносятся пятнами" на стекло. Распространенный подход использует массив тонких штифтов или игл, управляемых роботизированной рукой, которые погружаются в лунки, содержащие ДНК-зонды, и затем доставляют каждый зонд в определенные места на поверхности массива. Полученная "сетка" зондов представляет собой профили нуклеиновых кислот подготовленных зондов и готова к приему комплементарных "мишеней" кДНК или сРНК, полученных из экспериментальных или клинических образцов. Этот метод используется исследователями по всему миру для производства "собственных" печатных микромассивов в своих лабораториях. Эти массивы могут быть легко настроены для каждого эксперимента, поскольку исследователи могут выбирать зонды и места нанесения пятен на массивах, синтезировать зонды в своей лаборатории (или в сотрудничающей организации) и наносить пятна на массивы. Затем они могут генерировать собственные меченые образцы для гибридизации, гибридизировать образцы с массивом и, наконец, сканировать массивы с помощью собственного оборудования. Это обеспечивает относительно недорогой микромассив, который можно настроить для каждого исследования, и позволяет избежать затрат на покупку часто более дорогих коммерческих массивов, которые могут представлять огромное количество генов, не представляющих интереса для исследователя. Имеются публикации, указывающие на то, что микромассивы, изготовленные в собственных лабораториях, могут не обеспечивать такой же уровень чувствительности по сравнению с коммерческими олигонуклеотидными массивами, возможно, из-за небольших партий и сниженной эффективности нанесения пятен по сравнению с промышленным производством олиго-массивов. В олигонуклеотидных микромассивах зонды представляют собой короткие последовательности, разработанные для соответствия частям последовательности известных или предполагаемых открытых рамок считывания. Хотя олигонуклеотидные зонды часто используются в микромассивах, полученных методом нанесения пятен, термин "олигонуклеотидный массив" чаще всего относится к конкретной технологии производства. Олигонуклеотидные массивы производятся путем нанесения коротких олигонуклеотидных последовательностей, предназначенных для представления одного гена или семейства вариантов сплайсинга генов, путем синтеза этой последовательности непосредственно на поверхности массива вместо нанесения целых последовательностей. Последовательности могут быть длиннее (60-мерные зонды, такие как дизайн Agilent) или короче (25-мерные зонды, производимые Affymetrix), в зависимости от желаемой цели; более длинные зонды более специфичны для отдельных генов-мишеней, а более короткие зонды могут быть нанесены пятнами с более высокой плотностью по всему массиву и дешевле в производстве. Один из методов, используемых для производства олигонуклеотидных массивов, включает фотолитографический синтез (Affymetrix) на подложке из диоксида кремния, где свет и светочувствительные маскирующие агенты используются для "построения" последовательности по одному нуклеотиду за раз по всему массиву. Каждый подходящий зонд избирательно "размаскируется" перед погружением массива в раствор, содержащий один нуклеотид, затем происходит реакция маскировки, и следующий набор зондов размаскируется в подготовку к воздействию другого нуклеотида. После многих повторений последовательности каждого зонда полностью конструируются. В последнее время технология Maskless Array Synthesis от NimbleGen Systems объединила гибкость с большим количеством зондов.

Типичный протокол

Это пример эксперимента с ДНК-микромассивом, включающий подробную информацию для конкретного случая, чтобы лучше объяснить эксперименты с ДНК-микромассивами, одновременно перечисляя модификации для РНК или других альтернативных экспериментов. Два образца, подлежащие сравнению (попарное сравнение), выращиваются/получаются. В данном примере – обработанный образец (случай) и необработанный образец (контроль). Интересующая нуклеиновая кислота очищается: это может быть РНК для профилирования экспрессии, ДНК для сравнительной гибридизации или ДНК/РНК, связанная с определенным белком, который подвергается иммунопреципитации (ChIP-on-chip) для эпигенетических или регуляторных исследований. В этом примере общая РНК (ядерная и цитоплазматическая) изолируется экстракцией фенол-хлороформом-тиоцианатом гуанидина (например, Trizol), которая изолирует большую часть РНК (в то время как колоночные методы имеют порог в 200 нуклеотидов) и, при правильном выполнении, обеспечивает более высокую чистоту. Очищенная РНК анализируется на качество (капиллярным электрофорезом) и количество (например, с помощью спектрометра NanoDrop или NanoPhotometer). Если материал имеет приемлемое качество и присутствует в достаточном количестве (например, >1 мкг, хотя требуемое количество варьируется в зависимости от платформы микромассива), эксперимент может быть продолжен. Меченый продукт генерируется посредством обратной транскрипции с последующей необязательной амплификацией ПЦР. РНК обратной транскрибируется либо олиго(dT)-праймерами (которые усиливают только мРНК), либо случайными праймерами (которые усиливают всю РНК, большая часть которой является рРНК). Микромассивы для микроРНК лигируют олигонуклеотид к очищенной малой РНК (изолированной с помощью фракционирования), которая затем обратной транскрибируется и амплифицируется. Метка добавляется либо во время обратной транскрипции, либо после амплификации, если она выполняется. Направление мечения зависит от микромассива; например, если метка добавляется вместе с RT-смесью, кДНК является антисмысловой, а зонд микромассива – смысловой, за исключением случаев отрицательных контролей. Метка обычно флуоресцентная; только одна машина использует радиоактивные метки. Мечение может быть прямым (не используется) или косвенным (требует стадии конъюгации). Для двухканальных микромассивов стадия конъюгации происходит до гибридизации с использованием аминоаллилуридинтрифосфата (аминоаллилового UTP или aaUTP) и аминореактивных красителей NHS (таких как цианиновые красители); для одноканальных микромассивов стадия конъюгации происходит после гибридизации с использованием биотина и меченого стрептавидина. Модифицированные нуклеотиды (обычно в соотношении 1 aaUTP: 4 TTP (тимидинтрифосфат)) добавляются ферментативно в низком соотношении к нормальным нуклеотидам, обычно приводя к 1 на каждые 60 оснований. Затем aaДНК очищается с помощью колонки (с использованием фосфатного буфера, так как Tris содержит аминогруппы). Аминоаллильная группа – это аминогруппа на длинном линкере, прикрепленном к нуклеобазе, которая реагирует с реактивным красителем. Для контроля артефактов красителя в двухканальных экспериментах может быть выполнена форма репликации, известная как переключение красителей (dye flip); при переключении красителей используется второй слайд с измененными метками (образец, который был помечен Cy3 на первом слайде, помечен Cy5 и наоборот). В этом примере аминоаллиловый UTP присутствует в смеси, полученной обратной транскрипцией. Затем меченые образцы смешиваются с запатентованным гибридизационным раствором, который может состоять из SDS, SSC, декстрансульфата, блокирующего агента (такого как ДНК Cot 1, ДНК спермы лосося, ДНК тимуса телят, PolyA или PolyT), раствора Денхардта или формамина. Смесь денатурируется и добавляется в отверстия микромассива. Отверстия герметизируются, и микромассив гибридизируется либо в гибридизационной печи (hyb oven), где микромассив перемешивается вращением, либо в смесителе, где микромассив перемешивается переменным давлением в отверстиях. После ночной гибридизации все неспецифические связи смываются (SDS и SSC). Микромассив сушится и сканируется машиной, которая использует лазер для возбуждения красителя и измеряет уровни эмиссии с помощью детектора. Изображение выравнивается по шаблону, и интенсивность каждой характеристики (состоящей из нескольких пикселей) количественно оценивается. Сырые данные нормализуются; самый простой метод нормализации – вычитание фоновой интенсивности и масштабирование так, чтобы общая интенсивность характеристик двух каналов была одинаковой, или использование интенсивности референсного гена для расчета t-значения для всех интенсивностей. Более сложные методы включают z-отношение, регрессию loess и lowess, а также RMA (robust multichip analysis) для чипов Affymetrix (одноканальные, кремниевые чипы, олигонуклеотиды короткой длины, синтезированные in situ).

Микромассивы и биоинформатика

Появление недорогих экспериментов с использованием микромассивов породило ряд специфических задач биоинформатики: множественные уровни репликации в дизайне эксперимента (экспериментальный дизайн); разнообразие платформ, независимых групп и форматов данных (стандартизация); статистический анализ данных (анализ данных); сопоставление каждого зонда с измеряемым им мРНК-транскриптом (аннотация); огромный объем данных и необходимость обеспечения их совместного использования (хранение данных).

Экспериментальная конструкция

Из-за биологической сложности экспрессии генов, вопросы экспериментального дизайна, рассматриваемые в статье о профилировании экспрессии, имеют первостепенное значение для получения статистически и биологически достоверных выводов из данных. При планировании эксперимента с использованием микромассивов необходимо учитывать три основных аспекта. Во-первых, репликация биологических образцов необходима для обоснования выводов, сделанных по результатам эксперимента. Во-вторых, технические повторы (например, два образца РНК, полученные из одной экспериментальной единицы) могут помочь оценить точность измерений. Биологические повторы подразумевают независимые выделения РНК, а технические повторы – два аликота из одного и того же выделения. В-третьих, пятна, соответствующие каждому кДНК-клону или олигонуклеотиду, представлены в виде повторов (как минимум дубликатов) на слайде микромассива для оценки технической точности каждой гибридизации. Крайне важно подробно описывать процедуры подготовки и обработки образцов, чтобы правильно идентифицировать независимые единицы в эксперименте и избежать необоснованно завышенных оценок статистической значимости.

Стандартизация

Обмен данными микромассивов затруднен из-за отсутствия стандартизации в производстве платформ, протоколах проведения экспериментов и методах анализа. Это создает проблему совместимости в биоинформатике. Различные инициативы с открытым исходным кодом стремятся упростить обмен и анализ данных, полученных на непатентованных чипах.

Например, контрольный список "Минимальная информация об эксперименте с микромассивами" (MIAME) помогает определить необходимый уровень детализации и внедряется многими журналами как требование к публикациям, содержащим результаты, полученные с помощью микромассивов. Однако MIAME не определяет формат представления информации, поэтому, хотя многие форматы могут соответствовать требованиям MIAME, на данный момент ни один из них не обеспечивает проверку полного семантического соответствия. Проект "Контроль качества микромассивов" (MAQC) реализуется Управлением по санитарному надзору за качеством пищевых продуктов и медикаментов США (FDA) с целью разработки стандартов и показателей контроля качества, которые в конечном итоге позволят использовать данные микромассивов в разработке лекарств, клинической практике и принятии нормативных решений. Общество MGED разработало стандарты для представления результатов экспериментов по экспрессии генов и соответствующих аннотаций.

Анализ данных

Наборы данных микромассивов обычно очень велики, и аналитическая точность зависит от множества переменных. К статистическим задачам относится учет влияния фонового шума и соответствующая нормализация данных. Методы нормализации могут быть адаптированы к конкретным платформам, а в случае коммерческих платформ анализ может быть проприетарным. Алгоритмы, влияющие на статистический анализ, включают:

Анализ изображений: создание сетки, распознавание пятен на сканированном изображении (алгоритм сегментации), удаление или маркировка низкокачественных и малоинтенсивных элементов (так называемое флагирование). Обработка данных: вычитание фона (на основе глобального или локального фона), определение интенсивности пятен и соотношений интенсивностей, визуализация данных (например, график MA), логарифмическое преобразование соотношений, глобальная или локальная нормализация соотношений интенсивностей и сегментация на различные области числа копий с использованием алгоритмов обнаружения переходов. Анализ выявления классов: Этот аналитический подход, иногда называемый неконтролируемой классификацией или поиском знаний, пытается определить, группируются ли микромассивы (объекты, пациенты, мыши и т. д.) или гены в группы. Выявление естественных групп объектов (микромассивов или генов), которые объединяются в кластеры, может способствовать обнаружению новых групп, существование которых ранее было неизвестно. В процессе поиска знаний различные методы неконтролируемой классификации могут применяться к данным микромассивов ДНК для выявления новых кластеров (классов) массивов. Этот подход не основан на гипотезах, а базируется на итеративном распознавании закономерностей или методах статистического обучения для поиска "оптимального" количества кластеров в данных. Примеры методов неконтролируемого анализа включают самоорганизующиеся карты, нейронный газ, кластерный анализ k-средних, иерархический кластерный анализ, кластеризация на основе обработки геномных сигналов и кластерный анализ на основе моделей. Для некоторых из этих методов пользователю также необходимо определить меру расстояния между парами объектов. Хотя обычно используется коэффициент корреляции Пирсона, в литературе было предложено и оценено несколько других мер. Входные данные, используемые в анализе выявления классов, обычно основаны на списках генов с высокой информативностью (низким уровнем шума), основанных на низких значениях коэффициента вариации или высоких значениях энтропии Шеннона и т. д. Определение наиболее вероятного или оптимального числа кластеров, полученных в результате неконтролируемого анализа, называется валидностью кластеризации. Некоторые часто используемые метрики для валидности кластеризации – индекс силуэта, индекс Дэвиса – Боулдина, индекс Данна или статистика Хьюберта. Анализ предсказания класса: Этот подход, называемый контролируемой классификацией, закладывает основу для разработки прогностической модели, в которую можно вводить будущие неизвестные тестовые объекты для предсказания наиболее вероятной принадлежности к классу тестовых объектов. Контролируемый анализ включает методы теста Манна – Уитни, адаптированные к наборам данных микромассивов, которые учитывают множественные сравнения или кластерный анализ. Эти методы оценивают статистическую мощность на основе вариабельности данных и количества экспериментальных повторов и могут помочь минимизировать ошибки I и II рода в анализах. Уменьшение размерности: аналитики часто уменьшают количество измерений (генов) перед анализом данных. Анализ взвешенной сети совместной экспрессии генов широко используется для выявления модулей совместной экспрессии и внутримодульных генов-хабов. Модули могут соответствовать типам клеток или путям. Высокосвязанные внутримодульные хабы наилучшим образом представляют свои соответствующие модули. Данные микромассивов могут потребовать дальнейшей обработки, направленной на уменьшение размерности данных для облегчения понимания и более целенаправленного анализа. Другие методы позволяют анализировать данные, состоящие из небольшого количества биологических или технических повторов; например, тест локального объединенного отклонения (LPE) объединяет стандартные отклонения генов с аналогичными уровнями экспрессии в попытке компенсировать недостаточную репликацию.

Аннотация

Отношение между зондом и мРНК, которую он предназначен обнаруживать, не является простым. Некоторые мРНК могут неспецифически гибридизоваться с зондами в массиве, предназначенными для обнаружения другой мРНК. Кроме того, мРНК могут подвергаться предвзятости при амплификации, зависящей от последовательности или конкретной молекулы. Наконец, зонды, разработанные для обнаружения мРНК определенного гена, могут основываться на геномной EST-информации, ошибочно ассоциированной с этим геном.

Хранение данных

Данные, полученные с помощью микромассивов, оказались более полезными по сравнению с другими аналогичными наборами данных. Большой объем данных, специализированные форматы (такие как MIAME) и усилия по их обработке и систематизации требуют использования специализированных баз данных для хранения. Для интеграции разнородных биологических наборов данных и поддержки анализа было разработано несколько решений для хранения данных с открытым исходным кодом, таких как InterMine и BioMart.

Альтернативные технологии

Прогресс в области массово-параллельного секвенирования привел к разработке технологии RNA-Seq, которая позволяет применять метод «дробовика» для анализа всего транскриптома с целью характеристики и количественной оценки экспрессии генов. В отличие от микрочипов, для которых требуется наличие референсного генома и транскриптома до разработки самого микрочипа, RNA-Seq также может быть использован для новых модельных организмов, геномы которых еще не секвенированы.