Введение
В генетике экспрессированный тег последовательности (EST) – это короткая подпоследовательность последовательности кДНК. ЭСТ могут использоваться для идентификации транскриптов генов и сыграли важную роль в открытии генов и определении их последовательности. Идентификация ЭСТ происходила быстро, и на данный момент в общедоступных базах данных (например, GenBank на 1 января 2013 года, все виды) доступно около 74,2 миллиона ЭСТ. Методы, основанные на ЭСТ, в значительной степени уступили место секвенированию целого генома и транскриптома, а также секвенированию метагенома. ЭСТ является результатом однократного секвенирования клонированной кДНК. кДНК, используемые для генерации ЭСТ, обычно представляют собой отдельные клоны из библиотеки кДНК. Полученная последовательность – это относительно низкокачественный фрагмент, длина которого ограничена современными технологиями примерно 500–800 нуклеотидами. Поскольку эти клоны состоят из ДНК, комплементарной мРНК, ЭСТ представляют собой участки экспрессируемых генов. В базах данных они могут быть представлены как последовательность кДНК/мРНК или как обратный комплемент мРНК – матричная цепь. ЭСТ можно сопоставить с конкретными участками хромосом, используя методы физического картирования, такие как картирование радиационных гибридов, HAPPY-картирование или FISH. В качестве альтернативы, если геном организма, из которого получен ЭСТ, был секвенирован, последовательность ЭСТ можно выровнять с этим геномом с помощью компьютера. Современное понимание набора генов человека включает существование тысяч генов, идентифицированных исключительно на основании данных ЭСТ. В связи с этим ЭСТ стали инструментом для уточнения предсказанных транскриптов этих генов, что приводит к прогнозированию их белковых продуктов и, в конечном итоге, их функции. Более того, условия, в которых были получены эти ЭСТ (ткань, орган, состояние заболевания, например, рак), предоставляют информацию об условиях, в которых действует соответствующий ген. ЭСТ содержат достаточно информации для разработки точных зондов для ДНК-микромассивов, которые затем можно использовать для определения профилей экспрессии генов. Некоторые авторы используют термин «ЭСТ» для описания генов, для которых, помимо тега, существует мало или совсем нет дополнительной информации.
История
В 1979 году группы из Гарварда и Калтеха расширили основную идею получения копий ДНК мРНК in vitro до амплификации библиотеки таких копий в бактериальных плазмидах. В 1982 году Грег Сатклифф и его коллеги исследовали возможность отбора случайных или полуслучайных клонов из такой кДНК-библиотеки для секвенирования. В 1983 году Putney и соавторы секвенировали 178 клонов из кДНК-библиотеки кроличьих мышечных тканей. В 1991 году Адамс и его коллеги ввели термин EST и инициировали более систематическое секвенирование в рамках проекта (начиная с 600 кДНК мозга). Unigene и STACK.
Построение EST-контигов – непростая задача и может приводить к артефактам (контигам, содержащим продукты двух различных генов). Когда полная последовательность генома организма известна и транскрипты аннотированы, можно избежать сборки контигов и напрямую сопоставлять транскрипты с EST. Этот подход используется в системе TissueInfo (см. ниже) и позволяет легко связывать аннотации в геномной базе данных с информацией о тканях, полученной на основе данных EST.
Информация о тканях
Анализ высокопроизводительных ЭСТ часто сталкивается с аналогичными проблемами управления данными. Первая проблема заключается в том, что происхождение тканей в библиотеках EST описано обычным английским языком в dbEST. Это затрудняет написание программ, которые могут однозначно определить, что две библиотеки EST были секвенированы из одной и той же ткани. Аналогично, информация о патологических состояниях ткани не представлена в формате, удобном для машинной обработки. Например, информация о раковой природе библиотеки часто объединена с названием ткани (например, название ткани "глиобластома" указывает, что библиотека EST была секвенирована из ткани мозга, а патологическое состояние – рак). За исключением случаев рака, информация о заболевании часто отсутствует в записях dbEST. Проект TissueInfo был начат в 2000 году для решения этих проблем. Проект предоставляет курированные данные (обновляемые ежедневно) для уточнения происхождения ткани и статуса заболевания (рак/не рак), предлагает онтологию тканей, которая связывает ткани и органы отношениями "является частью" (то есть формализует знания о том, что гипоталамус является частью мозга, а мозг – частью центральной нервной системы), и распространяет программное обеспечение с открытым исходным кодом для связи аннотаций транскриптов из секвенированных геномов с профилями экспрессии тканей, рассчитанными на основе данных в dbEST.