Введение

Форма биологического моделирования

Моделирование метаболической сети, также известное как реконструкция метаболической сети или анализ метаболических путей, позволяет получить глубокое понимание молекулярных механизмов конкретного организма. В частности, эти модели устанавливают связь между геномом и молекулярной физиологией. Реконструкция разбивает метаболические пути (такие как гликолиз и цикл Кребса) на отдельные реакции и ферменты, и анализирует их в контексте всей сети. Говоря простыми словами, реконструкция собирает всю релевантную метаболическую информацию организма и компилирует ее в математическую модель. Валидация и анализ реконструкций позволяют выявить ключевые характеристики метаболизма, такие как продуктивность роста, распределение ресурсов, устойчивость сети и незаменимость генов. Эти знания затем могут быть применены для создания новых биотехнологий. В общем, процесс построения реконструкции выглядит следующим образом:
Создание черновика реконструкции
Уточнение модели
Преобразование модели в математическое/вычислительное представление
Оценка и отладка модели посредством экспериментов

Связанный метод анализа потокового баланса направлен на математическое моделирование метаболизма в реконструкциях метаболических сетей геномного масштаба.

Метаболическая реконструкция в масштабе генома

Метаболическая реконструкция предоставляет высоко математическую, структурированную платформу для понимания системной биологии метаболических путей в организме. Интеграция биохимических метаболических путей с быстродоступными аннотированными последовательностями генома привела к разработке так называемых метаболических моделей геномного масштаба. Проще говоря, эти модели сопоставляют метаболические гены с метаболическими путями. В целом, чем больше информации о физиологии, биохимии и генетике доступно для целевого организма, тем выше предсказательная способность реконструированных моделей. С технической точки зрения, процесс реконструкции прокариотических и эукариотических метаболических сетей в основном одинаков. Однако реконструкция эукариот, как правило, более сложна из-за размера геномов, полноты знаний и множества клеточных компартментов. Первый многоклеточный организм, *C. elegans*, был реконструирован в 1998 году. С тех пор было создано множество реконструкций. Список реконструкций, преобразованных в модель и экспериментально подтвержденных, можно найти по адресу http://sbrg.ucsd.edu/InSilicoOrganisms/OtherOrganisms.

Организм | Гены в геноме | Гены в модели | Реакции | Метаболиты | Дата реконструкции | Ссылка
------- | -------- | -------- | -------- | -------- | -------- | --------
*Haemophilus influenzae* | 1,775 | 296 | 488 | 343 | июнь 1999 |
*Saccharomyces cerevisiae* | 6,183 | 708 | 1,175 | 584 | февраль 2003 |
*Mus musculus* | 28,287 | 473 | 1220 | 872 | январь 2005 |
*Homo sapiens* | 21,090 | 3,623 | 3,673 | | январь 2007 |
*Mycobacterium tuberculosis* | 4,402 | 661 | 939 | 828 | июнь 2007 |
*Bacillus subtilis* | 4,114 | 844 | 1,020 | 988 | сентябрь 2007 |
*Synechocystis sp. PCC6803* | 3,221 | 633 | 831 | 704 | октябрь 2008 |
*Salmonella typhimurium* | 4,489 | 1,083 | 1,087 | 774 | апрель 2009 |
*Arabidopsis thaliana* | 27,379 | 1,419 | 1,567 | 1,748 | февраль 2010 |

Ресурсы

Поскольку временные рамки разработки реконструкций относительно недавние, большинство реконструкций создавалось вручную. Однако в настоящее время существует немало ресурсов, позволяющих полуавтоматически собирать эти реконструкции, что обусловлено значительными затратами времени и усилий, необходимыми для их построения. Предварительную быструю реконструкцию можно разработать автоматически, используя такие инструменты, как PathoLogic или ERGO в сочетании с энциклопедиями, такими как MetaCyc, а затем доработать вручную с помощью ресурсов, таких как PathwayTools. Эти полуавтоматические методы позволяют быстро создать черновой вариант, сохраняя при этом возможность точной настройки при получении новых экспериментальных данных. Только таким образом область метаболических реконструкций сможет успевать за постоянно растущим числом аннотированных геномов.

Базы данных

Киотская энциклопедия генов и геномов (KEGG): биоинформатическая база данных, содержащая информацию о генах, белках, реакциях и метаболических путях. Раздел «Организмы KEGG», разделенный на эукариоты и прокариоты, охватывает множество организмов, для которых можно искать информацию о генах и ДНК, вводя название интересующего фермента. BioCyc, EcoCyc и MetaCyc: BioCyc – это коллекция из 3000 баз данных путей/геномов (на октябрь 2013 года), каждая из которых посвящена одному организму. Например, EcoCyc – это высокодетализированная биоинформатическая база данных о геноме и метаболической реконструкции Escherichia coli, включающая подробное описание сигнальных путей и регуляторной сети E. coli. База данных EcoCyc может служить парадигмой и моделью для любой реконструкции. Кроме того, MetaCyc, энциклопедия экспериментально определенных метаболических путей и ферментов, содержит 2100 метаболических путей и 11 400 метаболических реакций (на октябрь 2013 года). ENZYME: база данных номенклатуры ферментов (часть протеомического сервера ExPASy Швейцарского института биоинформатики). После поиска конкретного фермента в базе данных, ресурс предоставляет информацию о катализируемой им реакции. ENZYME имеет прямые ссылки на другие базы данных генов/ферментов/литературы, такие как KEGG, BRENDA и PUBMED. BRENDA: всеобъемлющая база данных ферментов, позволяющая осуществлять поиск фермента по имени, номеру EC или организму. BiGG: база знаний о биохимически, генетически и геномно структурированных реконструкциях метаболических сетей генома. metaTIGER: коллекция метаболических профилей и филогеномной информации о таксономически разнообразных эукариотах, предоставляющая новые возможности для просмотра и сравнения метаболических профилей между организмами. В следующей таблице кратко сравнивается область применения каждой базы данных. Область применения баз данных Ферменты Гены Реакции Пути Метаболиты KEGG X X X X X BioCyc X X X X X MetaCyc X X X X ENZYME X X X BRENDA X X X BiGG X X X

Инструменты для моделирования метаболизма

Pathway Tools: пакет программного обеспечения для биоинформатики, помогающий в создании баз данных путей/геномов, таких как EcoCyc. Разработанный Питером Карпом и его коллегами из Исследовательской группы биоинформатики SRI International, Pathway Tools имеет несколько компонентов. Модуль PathoLogic использует аннотированный геном организма и выводит вероятные метаболические реакции и пути для создания новой базы данных путей/геномов. Компонент MetaFlux может генерировать количественную метаболическую модель из этой базы данных путей/геномов, используя анализ баланса потоков. Компонент Navigator предоставляет обширные инструменты запросов и визуализации, такие как визуализация метаболитов, путей и полной метаболической сети. ERGO: сервис на основе подписки, разработанный Integrated Genomics. Он интегрирует данные со всех уровней, включая геномные, биохимические данные, литературу и высокопроизводительный анализ, в комплексную удобную для пользователя сеть метаболических и неметаболических путей. KEGGtranslator: простое в использовании автономное приложение, которое визуализирует и конвертирует файлы KEGG (XML-файлы в формате KGML) в различные форматы вывода. В отличие от других переводчиков, KEGGtranslator поддерживает множество форматов вывода, способен дополнять информацию в переведенных документах (например, аннотации MIRIAM) сверх объема документа KGML и дополняет недостающие компоненты фрагментарных реакций в пределах пути, чтобы обеспечить возможность их моделирования. KEGGtranslator преобразует эти файлы в SBML, BioPAX, SIF, SBGN, SBML с расширением для качественного моделирования, GML, GraphML, JPG, GIF, LaTeX и т.д. ModelSEED: онлайн-ресурс для анализа, сравнения, реконструкции и курации метаболических моделей генома. Пользователи могут отправлять последовательности геномов в систему аннотации RAST, а полученная аннотация может быть автоматически передана в ModelSEED для создания предварительной метаболической модели. ModelSEED автоматически создает сеть метаболических реакций, ассоциации ген-белок-реакция для каждой реакции и реакцию состава биомассы для каждого генома, чтобы получить модель микробного метаболизма, которую можно смоделировать с помощью анализа баланса потоков. MetaMerge: алгоритм для полуавтоматического согласования пары существующих реконструкций метаболических сетей в единую модель метаболической сети. CoReCo: алгоритм автоматической реконструкции метаболических моделей родственных видов. Первая версия программного обеспечения использовала KEGG в качестве базы данных реакций для связи с прогнозами EC-номеров от CoReCo. Его автоматическое заполнение пробелов с использованием атомной карты всех реакций создает функциональные модели, готовые к моделированию.

Инструменты для литературы

PUBMED: Это онлайн-библиотека, разработанная Национальным центром биотехнологической информации, содержащая обширную коллекцию медицинских журналов. С помощью ссылки, предоставленной ENZYME, поиск можно направить на интересующий организм, чтобы получить публикации о ферменте и его применении в этом организме.

Методика разработки реконструкции

Реконструкция создается путем компиляции данных из указанных выше источников. Инструменты баз данных, такие как KEGG и BioCyc, могут использоваться совместно для поиска всех метаболических генов в интересующем организме. Эти гены сравниваются с генами близкородственных организмов, для которых уже существуют реконструкции, чтобы выявить гомологичные гены и реакции. Гомологичные гены и реакции переносятся из известных реконструкций для формирования предварительной реконструкции интересующего организма. Инструменты, такие как ERGO, Pathway Tools и Model SEED, могут объединять данные в метаболические и неметаболические пути, формируя сеть этих путей. Затем эти сети верифицируются и дорабатываются перед преобразованием в математическую модель.

Усовершенствование модели

Первоначальная метаболическая реконструкция генома обычно далека от совершенства из-за высокой изменчивости и разнообразия микроорганизмов. Зачастую в базах данных метаболических путей, таких как KEGG и MetaCyc, имеются "пробелы", то есть существует преобразование субстрата в продукт (то есть ферментативная активность), для которого в геноме отсутствует известный белок, кодирующий фермент, осуществляющий этот катализ. Кроме того, в полуавтоматически созданных реконструкциях некоторые пути могут быть предсказаны ошибочно и фактически не происходить в предполагаемом виде. Любую новую реакцию, отсутствующую в базах данных, необходимо добавить в реконструкцию. Это итеративный процесс, циклически сочетающий экспериментальную и вычислительную фазы. По мере получения новой информации о целевом организме модель корректируется для более точного прогнозирования метаболического и фенотипического поведения клетки. Наличие или отсутствие определенных реакций метаболизма влияет на количество реагентов и продуктов, доступных для других реакций в данном пути, поскольку продукты одной реакции становятся реагентами для другой. То есть продукты одной реакции могут взаимодействовать с другими белками или соединениями, образуя новые белки или соединения в присутствии различных ферментов или катализаторов.

Экстремальные пути

Прайс, Рид и Папин из лаборатории Палссона используют метод сингулярного разложения (SVD) экстремальных путей для понимания регуляции метаболизма красных кровяных телец человека. Экстремальные пути – это выпуклые базисные векторы, состоящие из стационарных функций метаболической сети. Для любой конкретной метаболической сети всегда существует уникальный набор экстремальных путей. Более того, согласно Стеллингу (2002), как и элементарные моды или экстремальные пути, они однозначно определяются структурой сети и обеспечивают полное описание конуса потока. Однако новое описание значительно компактнее. В отличие от элементарных мод и экстремальных путей, которые используют внутреннее описание, основанное на образующих векторах конуса потока, MMB используют внешнее описание конуса потока. Этот подход основан на наборах ограничений неотрицательности. Эти ограничения можно соотнести с необратимыми реакциями и, следовательно, имеют прямую биохимическую интерпретацию. Метаболическую сеть можно охарактеризовать с помощью MMB и обратимого метаболического пространства.

Анализ баланса потоков

Другой подход к моделированию метаболической сети — это анализ баланса потоков. Этот метод использует линейное программирование, но, в отличие от анализа элементарных режимов и экстремальных путей, в итоге даёт только одно решение. Линейное программирование обычно применяется для получения максимального значения целевой функции, которую необходимо оптимизировать, и, следовательно, при использовании анализа баланса потоков находится единственное решение задачи оптимизации. Более того, может возникнуть необходимость в оценке математической структуры системы дифференциальных уравнений, поскольку реальные кинетические законы реакций в исследуемой системе неизвестны. Для этого программа SBMLsqueezer позволяет автоматически создавать подходящие кинетические законы для всех реакций в сети.

Синтетическая доступность

Синтетическая доступность – это простой подход к сетевому моделированию, целью которого является предсказание летальности выключения метаболических генов. Метод синтетической доступности использует топологию метаболической сети для вычисления суммы минимального числа шагов, необходимых для прохождения по графу метаболической сети от исходных веществ – метаболитов, доступных организму из внешней среды, – к конечным продуктам – метаболитам, необходимым для выживания организма. Для имитации выключения гена реакции, катализируемые этим геном, удаляются из сети, и метрика синтетической доступности пересчитывается. Предполагается, что увеличение общего числа шагов приводит к летальности. Вундерлих и Мирни показали, что этот простой, не требующий параметров подход предсказывает летальность при выключении генов у E. coli и S. cerevisiae, а также сопоставим по точности с анализом элементарных режимов и анализом баланса потоков в различных средах.