Введение

Структурная геномика стремится описать трехмерную структуру каждого белка, кодируемого данным геномом. Этот геномный подход позволяет использовать высокопроизводительный метод определения структуры посредством сочетания экспериментальных и модельных методов. Принципиальное отличие структурной геномики от традиционного предсказания структуры заключается в том, что структурная геномика пытается определить структуру каждого белка, кодируемого геномом, а не фокусироваться на каком-либо конкретном белке. С появлением полных последовательностей геномов, предсказание структуры может осуществляться быстрее благодаря комбинации экспериментальных и модельных подходов, особенно потому, что наличие большого количества секвенированных геномов и ранее определенных белковых структур позволяет ученым моделировать структуру белка на основе структур ранее определенных гомологов. Поскольку структура белка тесно связана с его функцией, структурная геномика обладает потенциалом для расширения знаний о функции белка. Помимо выяснения функций белков, структурная геномика может использоваться для идентификации новых белковых фолдингов и потенциальных мишеней для разработки лекарств. Структурная геномика включает в себя использование широкого спектра подходов к определению структуры, включая экспериментальные методы с использованием геномных последовательностей или модельные подходы, основанные на последовательной или структурной гомологии с белком с известной структурой, либо на химических и физических принципах для белка, не имеющего гомологии с какой-либо известной структурой. В отличие от традиционной структурной биологии, определение структуры белка в рамках структурной геномики часто (но не всегда) предшествует получению каких-либо сведений о функции белка. Это создает новые задачи в области структурной биоинформатики, а именно – определение функции белка на основе его трехмерной структуры. Структурная геномика делает акцент на высокопроизводительном определении белковых структур, которое выполняется в специализированных центрах структурной геномики. В то время как большинство структурных биологов изучают структуры отдельных белков или групп белков, специалисты по структурной геномике изучают структуры белков в масштабе всего генома. Это подразумевает крупномасштабное клонирование, экспрессию и очистку. Одним из основных преимуществ такого подхода является экономия за счет масштаба. С другой стороны, научная ценность некоторых полученных структур иногда ставится под сомнение. В статье, опубликованной в журнале Science в январе 2006 года, анализируется область структурной геномики. Одним из преимуществ структурной геномики, например, Инициативы по структуре белка, является то, что научное сообщество получает немедленный доступ к новым структурам, а также к реагентам, таким как клоны и белки. Недостатком является то, что многие из этих структур относятся к белкам с неизвестной функцией и не сопровождаются соответствующими публикациями. Это требует новых способов передачи этой структурной информации широкому исследовательскому сообществу. Биоинформатическое ядро Совместного центра структурной геномики (JCSG) недавно разработало вики-подход, а именно Сеть открытой аннотации белковых структур (TOPSAN), для аннотации белковых структур, получаемых в высокопроизводительных центрах структурной геномики.

Голы

Одна из целей структурной геномики — выявление новых белковых сводок. Экспериментальные методы определения структуры белка требуют белков, которые хорошо экспрессируются и/или кристаллизуются, что может создавать предвзятость в отношении типов белковых сводок, которые удается выяснить с помощью этих экспериментов. Геномный подход, основанный на моделировании, такой как ab initio моделирование, может быть более эффективным в выявлении новых белковых сводок, чем экспериментальные подходы, поскольку он не ограничен экспериментальными ограничениями. Функция белка зависит от его трехмерной структуры, а эти трехмерные структуры консервативны в большей степени, чем последовательности аминокислот. Таким образом, высокопроизводительные методы определения структуры, используемые в структурной геномике, могут расширить наше понимание функций белков. Это также имеет потенциальные последствия для разработки лекарств и белковой инженерии. Более того, добавление каждого белка в структурную базу данных повышает вероятность того, что в ней появятся гомологичные последовательности других неизвестных белков. Инициатива по определению структуры белка (PSI) — это многоаспектный проект, финансируемый Национальными институтами здоровья при участии различных академических и промышленных партнеров, направленный на расширение знаний о структуре белка с использованием подхода структурной геномики и совершенствование методологии определения структуры.

Методы

Структурная геномика использует завершенные последовательности геномов различными способами для определения структуры белков. Последовательность гена целевого белка также может быть сравнена с известной последовательностью, и структурная информация может быть получена на основе структуры известного белка. Структурная геномика может использоваться для предсказания новых белковых сворачиваний, опираясь на другие структурные данные. Кроме того, структурная геномика может применять подход, основанный на моделировании, который использует гомологию между неизвестным белком и решенной структурой белка.

Методы de novo

Завершенные последовательности генома позволяют клонировать и экспрессировать в виде белка каждый открытый кадр считывания (ORF) – часть гена, которая, вероятно, содержит последовательность для мРНК и белка. Затем эти белки очищают и кристаллизуют, после чего определяют их структуру одним из двух методов: рентгеновской кристаллографии и ядерного магнитного резонанса (ЯМР). Полная последовательность генома позволяет разработать все необходимые праймеры для амплификации всех ORF, клонирования их в бактерии и последующей экспрессии. Применение подхода, основанного на анализе всего генома, к этому традиционному методу определения структуры белка позволяет экспрессировать сразу все белки, закодированные геномом. Этот подход обеспечивает возможность определения структуры каждого белка, кодируемого геномом.

Моделирование ab initio

Этот подход использует данные о последовательности аминокислот в белке и химические и физические взаимодействия между этими аминокислотами для предсказания трехмерной структуры белков, не имеющих гомологии с известными структурами белков. Одним из наиболее успешных методов моделирования "с нуля" (ab initio) является программа Rosetta, которая разделяет белок на короткие фрагменты и располагает короткие полипептидные цепи в локальную конформацию с низкой энергией. Rosetta доступна для коммерческого и некоммерческого использования, в том числе через общедоступную программу Robetta.

Моделирование на основе последовательности

Этот метод моделирования сравнивает последовательность генов неизвестного белка с последовательностями белков с известными структурами. В зависимости от степени сходства между последовательностями, структура известного белка может быть использована в качестве модели для определения структуры неизвестного белка. Считается, что для высокоточного моделирования требуется как минимум 50% идентичности последовательности аминокислот между неизвестным белком и решенной структурой. Идентичность последовательности в диапазоне 30-50% дает модель средней точности, а идентичность последовательности ниже 30% – модели с низкой точностью. Предполагается, что для представления всех структурных мотивов хотя бы один раз и, следовательно, для возможности точного определения структуры любого неизвестного белка посредством моделирования, необходимо определить структуру как минимум 16 000 белков. Однако одним из недостатков этого метода является то, что структура сохраняется лучше, чем последовательность, и поэтому моделирование, основанное на последовательности, может быть не самым точным способом предсказания структуры белка.

Нарезка

В основе построения структурных моделей методом трединга лежит сходство укладки, а не идентичность последовательностей аминокислот. Этот метод может помочь выявить отдалённо родственные белки и использовать для предсказания молекулярных функций.

Примеры структурной геномики

В настоящее время ведется ряд работ по определению структуры каждого белка в данном протеоме.

Thermotoga maritima протеома

Одной из текущих целей Совместного центра структурной геномики (JCSG), являющегося частью инициативы по структуре белков (PSI), является определение структур для всех белков в Thermotoga maritima, термофильной бактерии. *Thermotoga maritima* была выбрана в качестве объекта структурной геномики благодаря относительно небольшому геному, состоящему из 1877 генов, и предположению, что белки, экспрессируемые термофильной бактерией, будет проще кристаллизовать. Лесли и соавторы использовали *Escherichia coli* для экспрессии всех открытых рамок считывания (ORF) *T. maritima*. Затем эти белки были кристаллизованы, и структуры успешно кристаллизованных белков были определены с помощью рентгеновской кристаллографии. В частности, этот подход структурной геномики позволил определить структуру белка TM0449, который оказался уникальным по своей структуре, поскольку не проявлял структурного сходства с каким-либо известным белком.

Протеом Mycobacterium tuberculosis (бактерии туберкулеза)

Целью Консорциума структурной геномики туберкулеза является определение структур потенциальных мишеней для разработки лекарственных препаратов в Mycobacterium tuberculosis, бактерии, вызывающей туберкулез. Разработка новых методов лечения туберкулеза особенно важна в связи с растущей проблемой мультирезистентного туберкулеза. Полностью секвенированный геном M. tuberculosis позволил ученым клонировать многие из этих белковых мишеней в экспрессионные векторы для очистки и определения их структуры методом рентгеновской кристаллографии. Исследования выявили ряд белковых мишеней для определения структуры, включая внеклеточные белки, предположительно участвующие в патогенезе, белки, регулирующие метаболизм железа, существующие мишени для лекарств и белки с предсказанной новой укладкой. На данный момент структура определена для 708 белков, кодируемых геномом M. tuberculosis.