Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Форма биологического моделирования
Form of biological modelling
Моделирование метаболической сети, также известное как реконструкция метаболической сети или анализ метаболических путей, позволяет получить глубокое понимание молекулярных механизмов конкретного организма. В частности, эти модели устанавливают связь между геномом и молекулярной физиологией. Реконструкция разбивает метаболические пути (такие как гликолиз и цикл Кребса) на отдельные реакции и ферменты, и анализирует их в контексте всей сети. Говоря простыми словами, реконструкция собирает всю релевантную метаболическую информацию организма и компилирует ее в математическую модель. Валидация и анализ реконструкций позволяют выявить ключевые характеристики метаболизма, такие как продуктивность роста, распределение ресурсов, устойчивость сети и незаменимость генов. Эти знания затем могут быть применены для создания новых биотехнологий. В общем, процесс построения реконструкции выглядит следующим образом:
Создание черновика реконструкции
Уточнение модели
Преобразование модели в математическое/вычислительное представление
Оценка и отладка модели посредством экспериментов
Metabolic network modelling, also known as metabolic network reconstruction or metabolic pathway analysis, allows for an in depth insight into the molecular mechanisms of a particular organism. In particular, these models correlate the genome with molecular physiology. A reconstruction breaks down metabolic pathways (such as glycolysis and the citric acid cycle) into their respective reactions and enzymes, and analyzes them within the perspective of the entire network. In simplified terms, a reconstruction collects all of the relevant metabolic information of an organism and compiles it in a mathematical model. Validation and analysis of reconstructions can allow identification of key features of metabolism such as growth yield, resource distribution, network robustness, and gene essentiality. This knowledge can then be applied to create novel biotechnology. In general, the process to build a reconstruction is as follows:
Draft a reconstruction
Refine the model
Convert model into a mathematical/computational representation
Evaluate and debug model through experimentation
Связанный метод анализа потокового баланса направлен на математическое моделирование метаболизма в реконструкциях метаболических сетей геномного масштаба.
The related method of flux balance analysis seeks to mathematically simulate metabolism in genome scale reconstructions of metabolic networks.
Метаболическая реконструкция в масштабе генома
Метаболическая реконструкция предоставляет высоко математическую, структурированную платформу для понимания системной биологии метаболических путей в организме. Интеграция биохимических метаболических путей с быстродоступными аннотированными последовательностями генома привела к разработке так называемых метаболических моделей геномного масштаба. Проще говоря, эти модели сопоставляют метаболические гены с метаболическими путями. В целом, чем больше информации о физиологии, биохимии и генетике доступно для целевого организма, тем выше предсказательная способность реконструированных моделей. С технической точки зрения, процесс реконструкции прокариотических и эукариотических метаболических сетей в основном одинаков. Однако реконструкция эукариот, как правило, более сложна из-за размера геномов, полноты знаний и множества клеточных компартментов. Первый многоклеточный организм, *C. elegans*, был реконструирован в 1998 году. С тех пор было создано множество реконструкций. Список реконструкций, преобразованных в модель и экспериментально подтвержденных, можно найти по адресу http://sbrg.ucsd.edu/InSilicoOrganisms/OtherOrganisms.
A metabolic reconstruction provides a highly mathematical, structured platform on which to understand the systems biology of metabolic pathways within an organism. The integration of biochemical metabolic pathways with rapidly available, annotated genome sequences has developed what are called genome scale metabolic models. Simply put, these models correlate metabolic genes with metabolic pathways. In general, the more information about physiology, biochemistry and genetics is available for the target organism, the better the predictive capacity of the reconstructed models. Mechanically speaking, the process of reconstructing prokaryotic and eukaryotic metabolic networks is essentially the same. Having said this, eukaryote reconstructions are typically more challenging because of the size of genomes, coverage of knowledge, and the multitude of cellular compartments. The first multicellular organism, C. elegans, was reconstructed in 1998. Since then, many reconstructions have been formed. For a list of reconstructions that have been converted into a model and experimentally validated, see http://sbrg. ucsd. edu/InSilicoOrganisms/OtherOrganisms. Organism Genes in Genome Genes in Model Reactions Metabolites Date of reconstruction Reference Haemophilus influenzae 1,775 296 488 343 June 1999 Saccharomyces cerevisiae 6,183 708 1,175 584 February 2003 Mus musculus 28,287 473 1220 872 January 2005 Homo sapiens 21,090 3,623 3,673 January 2007 Mycobacterium tuberculosis 4,402 661 939 828 June 2007 Bacillus subtilis 4,114 844 1,020 988 September 2007 Synechocystis sp. PCC6803 3,221 633 831 704 October 2008 Salmonella typhimurium 4,489 1,083 1,087 774 April 2009 Arabidopsis thaliana 27,379 1,419 1,567 1,748 February 2010
A metabolic reconstruction provides a highly mathematical, structured platform on which to understand the systems biology of metabolic pathways within an organism. The integration of biochemical metabolic pathways with rapidly available, annotated genome sequences has developed what are called genome scale metabolic models. Simply put, these models correlate metabolic genes with metabolic pathways. In general, the more information about physiology, biochemistry and genetics is available for the target organism, the better the predictive capacity of the reconstructed models. Mechanically speaking, the process of reconstructing prokaryotic and eukaryotic metabolic networks is essentially the same. Having said this, eukaryote reconstructions are typically more challenging because of the size of genomes, coverage of knowledge, and the multitude of cellular compartments. The first multicellular organism, C. elegans, was reconstructed in 1998. Since then, many reconstructions have been formed. For a list of reconstructions that have been converted into a model and experimentally validated, see http://sbrg. ucsd. edu/InSilicoOrganisms/OtherOrganisms. Organism Genes in Genome Genes in Model Reactions Metabolites Date of reconstruction Reference Haemophilus influenzae 1,775 296 488 343 June 1999 Saccharomyces cerevisiae 6,183 708 1,175 584 February 2003 Mus musculus 28,287 473 1220 872 January 2005 Homo sapiens 21,090 3,623 3,673 January 2007 Mycobacterium tuberculosis 4,402 661 939 828 June 2007 Bacillus subtilis 4,114 844 1,020 988 September 2007 Synechocystis sp. PCC6803 3,221 633 831 704 October 2008 Salmonella typhimurium 4,489 1,083 1,087 774 April 2009 Arabidopsis thaliana 27,379 1,419 1,567 1,748 February 2010
Ресурсы
Поскольку временные рамки разработки реконструкций относительно недавние, большинство реконструкций создавалось вручную. Однако в настоящее время существует немало ресурсов, позволяющих полуавтоматически собирать эти реконструкции, что обусловлено значительными затратами времени и усилий, необходимыми для их построения. Предварительную быструю реконструкцию можно разработать автоматически, используя такие инструменты, как PathoLogic или ERGO в сочетании с энциклопедиями, такими как MetaCyc, а затем доработать вручную с помощью ресурсов, таких как PathwayTools. Эти полуавтоматические методы позволяют быстро создать черновой вариант, сохраняя при этом возможность точной настройки при получении новых экспериментальных данных. Только таким образом область метаболических реконструкций сможет успевать за постоянно растущим числом аннотированных геномов.
Because the timescale for the development of reconstructions is so recent, most reconstructions have been built manually. However, now, there are quite a few resources that allow for the semi automatic assembly of these reconstructions that are utilized due to the time and effort necessary for a reconstruction. An initial fast reconstruction can be developed automatically using resources like PathoLogic or ERGO in combination with encyclopedias like MetaCyc, and then manually updated by using resources like PathwayTools. These semi automatic methods allow for a fast draft to be created while allowing the fine tune adjustments required once new experimental data is found. It is only in this manner that the field of metabolic reconstructions will keep up with the ever increasing numbers of annotated genomes.
Базы данных
Киотская энциклопедия генов и геномов (KEGG): биоинформатическая база данных, содержащая информацию о генах, белках, реакциях и метаболических путях. Раздел «Организмы KEGG», разделенный на эукариоты и прокариоты, охватывает множество организмов, для которых можно искать информацию о генах и ДНК, вводя название интересующего фермента. BioCyc, EcoCyc и MetaCyc: BioCyc – это коллекция из 3000 баз данных путей/геномов (на октябрь 2013 года), каждая из которых посвящена одному организму. Например, EcoCyc – это высокодетализированная биоинформатическая база данных о геноме и метаболической реконструкции Escherichia coli, включающая подробное описание сигнальных путей и регуляторной сети E. coli. База данных EcoCyc может служить парадигмой и моделью для любой реконструкции. Кроме того, MetaCyc, энциклопедия экспериментально определенных метаболических путей и ферментов, содержит 2100 метаболических путей и 11 400 метаболических реакций (на октябрь 2013 года). ENZYME: база данных номенклатуры ферментов (часть протеомического сервера ExPASy Швейцарского института биоинформатики). После поиска конкретного фермента в базе данных, ресурс предоставляет информацию о катализируемой им реакции. ENZYME имеет прямые ссылки на другие базы данных генов/ферментов/литературы, такие как KEGG, BRENDA и PUBMED. BRENDA: всеобъемлющая база данных ферментов, позволяющая осуществлять поиск фермента по имени, номеру EC или организму. BiGG: база знаний о биохимически, генетически и геномно структурированных реконструкциях метаболических сетей генома. metaTIGER: коллекция метаболических профилей и филогеномной информации о таксономически разнообразных эукариотах, предоставляющая новые возможности для просмотра и сравнения метаболических профилей между организмами. В следующей таблице кратко сравнивается область применения каждой базы данных. Область применения баз данных Ферменты Гены Реакции Пути Метаболиты KEGG X X X X X BioCyc X X X X X MetaCyc X X X X ENZYME X X X BRENDA X X X BiGG X X X
Kyoto Encyclopedia of Genes and Genomes (KEGG): a bioinformatics database containing information on genes, proteins, reactions, and pathways. The ‘KEGG Organisms’ section, which is divided into eukaryotes and prokaryotes, encompasses many organisms for which gene and DNA information can be searched by typing in the enzyme of choice. BioCyc, EcoCyc, and MetaCyc: BioCyc Is a collection of 3,000 pathway/genome databases (as of Oct 2013), with each database dedicated to one organism. For example, EcoCyc is a highly detailed bioinformatics database on the genome and metabolic reconstruction of Escherichia coli, including thorough descriptions of E. coli signaling pathways and regulatory network. The EcoCyc database can serve as a paradigm and model for any reconstruction. Additionally, MetaCyc, an encyclopedia of experimentally defined metabolic pathways and enzymes, contains 2,100 metabolic pathways and 11,400 metabolic reactions (Oct 2013). ENZYME: An enzyme nomenclature database (part of the ExPASy proteonomics server of the Swiss Institute of Bioinformatics). After searching for a particular enzyme on the database, this resource gives you the reaction that is catalyzed. ENZYME has direct links to other gene/enzyme/literature databases such as KEGG, BRENDA, and PUBMED. BRENDA: A comprehensive enzyme database that allows for an enzyme to be searched by name, EC number, or organism. BiGG: A knowledge base of biochemically, genetically, and genomically structured genome scale metabolic network reconstructions. metaTIGER: Is a collection of metabolic profiles and phylogenomic information on a taxonomically diverse range of eukaryotes which provides novel facilities for viewing and comparing the metabolic profiles between organisms. This table quickly compares the scope of each database. Database Scope Enzymes Genes Reactions Pathways Metabolites KEGG X X X X X BioCyc X X X X X MetaCyc X X X X ENZYME X X XBRENDA X X XBiGG X X X
Инструменты для моделирования метаболизма
Pathway Tools: пакет программного обеспечения для биоинформатики, помогающий в создании баз данных путей/геномов, таких как EcoCyc. Разработанный Питером Карпом и его коллегами из Исследовательской группы биоинформатики SRI International, Pathway Tools имеет несколько компонентов. Модуль PathoLogic использует аннотированный геном организма и выводит вероятные метаболические реакции и пути для создания новой базы данных путей/геномов. Компонент MetaFlux может генерировать количественную метаболическую модель из этой базы данных путей/геномов, используя анализ баланса потоков. Компонент Navigator предоставляет обширные инструменты запросов и визуализации, такие как визуализация метаболитов, путей и полной метаболической сети. ERGO: сервис на основе подписки, разработанный Integrated Genomics. Он интегрирует данные со всех уровней, включая геномные, биохимические данные, литературу и высокопроизводительный анализ, в комплексную удобную для пользователя сеть метаболических и неметаболических путей. KEGGtranslator: простое в использовании автономное приложение, которое визуализирует и конвертирует файлы KEGG (XML-файлы в формате KGML) в различные форматы вывода. В отличие от других переводчиков, KEGGtranslator поддерживает множество форматов вывода, способен дополнять информацию в переведенных документах (например, аннотации MIRIAM) сверх объема документа KGML и дополняет недостающие компоненты фрагментарных реакций в пределах пути, чтобы обеспечить возможность их моделирования. KEGGtranslator преобразует эти файлы в SBML, BioPAX, SIF, SBGN, SBML с расширением для качественного моделирования, GML, GraphML, JPG, GIF, LaTeX и т.д. ModelSEED: онлайн-ресурс для анализа, сравнения, реконструкции и курации метаболических моделей генома. Пользователи могут отправлять последовательности геномов в систему аннотации RAST, а полученная аннотация может быть автоматически передана в ModelSEED для создания предварительной метаболической модели. ModelSEED автоматически создает сеть метаболических реакций, ассоциации ген-белок-реакция для каждой реакции и реакцию состава биомассы для каждого генома, чтобы получить модель микробного метаболизма, которую можно смоделировать с помощью анализа баланса потоков. MetaMerge: алгоритм для полуавтоматического согласования пары существующих реконструкций метаболических сетей в единую модель метаболической сети. CoReCo: алгоритм автоматической реконструкции метаболических моделей родственных видов. Первая версия программного обеспечения использовала KEGG в качестве базы данных реакций для связи с прогнозами EC-номеров от CoReCo. Его автоматическое заполнение пробелов с использованием атомной карты всех реакций создает функциональные модели, готовые к моделированию.
Pathway Tools: A bioinformatics software package that assists in the construction of pathway/genome databases such as EcoCyc. Developed by Peter Karp and associates at the SRI International Bioinformatics Research Group, Pathway Tools has several components. Its PathoLogic module takes an annotated genome for an organism and infers probable metabolic reactions and pathways to produce a new pathway/genome database. Its MetaFlux component can generate a quantitative metabolic model from that pathway/genome database using flux balance analysis. Its Navigator component provides extensive query and visualization tools, such as visualization of metabolites, pathways, and the complete metabolic network. ERGO: A subscription based service developed by Integrated Genomics. It integrates data from every level including genomic, biochemical data, literature, and high throughput analysis into a comprehensive user friendly network of metabolic and nonmetabolic pathways. KEGGtranslator: an easy to use stand alone application that can visualize and convert KEGG files (KGML formatted XML files) into multiple output formats. Unlike other translators, KEGGtranslator supports a plethora of output formats, is able to augment the information in translated documents (e. g., MIRIAM annotations) beyond the scope of the KGML document, and amends missing components to fragmentary reactions within the pathway to allow simulations on those. KEGGtranslator converts these files to SBML, BioPAX, SIF, SBGN, SBML with qualitative modeling extension, GML, GraphML, JPG, GIF, LaTeX, etc. ModelSEED: An online resource for the analysis, comparison, reconstruction, and curation of genome scale metabolic models. Users can submit genome sequences to the RAST annotation system, and the resulting annotation can be automatically piped into the ModelSEED to produce a draft metabolic model. The ModelSEED automatically constructs a network of metabolic reactions, gene protein reaction associations for each reaction, and a biomass composition reaction for each genome to produce a model of microbial metabolism that can be simulated using Flux Balance Analysis. MetaMerge: algorithm for semi automatically reconciling a pair of existing metabolic network reconstructions into a single metabolic network model. CoReCo: algorithm for automatic reconstruction of metabolic models of related species. The first version of the software used KEGG as reaction database to link with the EC number predictions from CoReCo. Its automatic gap filling using atom map of all the reactions produce functional models ready for simulation.
Инструменты для литературы
PUBMED: Это онлайн-библиотека, разработанная Национальным центром биотехнологической информации, содержащая обширную коллекцию медицинских журналов. С помощью ссылки, предоставленной ENZYME, поиск можно направить на интересующий организм, чтобы получить публикации о ферменте и его применении в этом организме.
PUBMED: This is an online library developed by the National Center for Biotechnology Information, which contains a massive collection of medical journals. Using the link provided by ENZYME, the search can be directed towards the organism of interest, thus recovering literature on the enzyme and its use inside of the organism.
Методика разработки реконструкции
Реконструкция создается путем компиляции данных из указанных выше источников. Инструменты баз данных, такие как KEGG и BioCyc, могут использоваться совместно для поиска всех метаболических генов в интересующем организме. Эти гены сравниваются с генами близкородственных организмов, для которых уже существуют реконструкции, чтобы выявить гомологичные гены и реакции. Гомологичные гены и реакции переносятся из известных реконструкций для формирования предварительной реконструкции интересующего организма. Инструменты, такие как ERGO, Pathway Tools и Model SEED, могут объединять данные в метаболические и неметаболические пути, формируя сеть этих путей. Затем эти сети верифицируются и дорабатываются перед преобразованием в математическую модель.
A reconstruction is built by compiling data from the resources above. Database tools such as KEGG and BioCyc can be used in conjunction with each other to find all the metabolic genes in the organism of interest. These genes will be compared to closely related organisms that have already developed reconstructions to find homologous genes and reactions. These homologous genes and reactions are carried over from the known reconstructions to form the draft reconstruction of the organism of interest. Tools such as ERGO, Pathway Tools and Model SEED can compile data into pathways to form a network of metabolic and non metabolic pathways. These networks are then verified and refined before being made into a mathematical simulation.
Усовершенствование модели
Первоначальная метаболическая реконструкция генома обычно далека от совершенства из-за высокой изменчивости и разнообразия микроорганизмов. Зачастую в базах данных метаболических путей, таких как KEGG и MetaCyc, имеются "пробелы", то есть существует преобразование субстрата в продукт (то есть ферментативная активность), для которого в геноме отсутствует известный белок, кодирующий фермент, осуществляющий этот катализ. Кроме того, в полуавтоматически созданных реконструкциях некоторые пути могут быть предсказаны ошибочно и фактически не происходить в предполагаемом виде. Любую новую реакцию, отсутствующую в базах данных, необходимо добавить в реконструкцию. Это итеративный процесс, циклически сочетающий экспериментальную и вычислительную фазы. По мере получения новой информации о целевом организме модель корректируется для более точного прогнозирования метаболического и фенотипического поведения клетки. Наличие или отсутствие определенных реакций метаболизма влияет на количество реагентов и продуктов, доступных для других реакций в данном пути, поскольку продукты одной реакции становятся реагентами для другой. То есть продукты одной реакции могут взаимодействовать с другими белками или соединениями, образуя новые белки или соединения в присутствии различных ферментов или катализаторов.
An initial metabolic reconstruction of a genome is typically far from perfect due to the high variability and diversity of microorganisms. Often, metabolic pathway databases such as KEGG and MetaCyc will have "holes", meaning that there is a conversion from a substrate to a product (i. e., an enzymatic activity) for which there is no known protein in the genome that encodes the enzyme that facilitates the catalysis. What can also happen in semi automatically drafted reconstructions is that some pathways are falsely predicted and don't actually occur in the predicted manner. Any new reaction not present in the databases needs to be added to the reconstruction. This is an iterative process that cycles between the experimental phase and the coding phase. As new information is found about the target organism, the model will be adjusted to predict the metabolic and phenotypical output of the cell. The presence or absence of certain reactions of the metabolism will affect the amount of reactants/products that are present for other reactions within the particular pathway. This is because products in one reaction go on to become the reactants for another reaction, i. e. products of one reaction can combine with other proteins or compounds to form new proteins/compounds in the presence of different enzymes or catalysts.
Экстремальные пути
Прайс, Рид и Папин из лаборатории Палссона используют метод сингулярного разложения (SVD) экстремальных путей для понимания регуляции метаболизма красных кровяных телец человека. Экстремальные пути – это выпуклые базисные векторы, состоящие из стационарных функций метаболической сети. Для любой конкретной метаболической сети всегда существует уникальный набор экстремальных путей. Более того, согласно Стеллингу (2002), как и элементарные моды или экстремальные пути, они однозначно определяются структурой сети и обеспечивают полное описание конуса потока. Однако новое описание значительно компактнее. В отличие от элементарных мод и экстремальных путей, которые используют внутреннее описание, основанное на образующих векторах конуса потока, MMB используют внешнее описание конуса потока. Этот подход основан на наборах ограничений неотрицательности. Эти ограничения можно соотнести с необратимыми реакциями и, следовательно, имеют прямую биохимическую интерпретацию. Метаболическую сеть можно охарактеризовать с помощью MMB и обратимого метаболического пространства.
Price, Reed, and Papin, from the Palsson lab, use a method of singular value decomposition (SVD) of extreme pathways in order to understand regulation of a human red blood cell metabolism. Extreme pathways are convex basis vectors that consist of steady state functions of a metabolic network. For any particular metabolic network, there is always a unique set of extreme pathways available. Furthermore, Price, Reed, and Papin, According to Stelling (2002), Like elementary modes or extreme pathways, these are uniquely determined by the network, and yield a complete description of the flux cone. However, the new description is much more compact. In contrast with elementary modes and extreme pathways, which use an inner description based on generating vectors of the flux cone, MMBs are using an outer description of the flux cone. This approach is based on sets of non negativity constraints. These can be identified with irreversible reactions, and thus have a direct biochemical interpretation. One can characterize a metabolic network by MMBs and the reversible metabolic space.
Анализ баланса потоков
Другой подход к моделированию метаболической сети — это анализ баланса потоков. Этот метод использует линейное программирование, но, в отличие от анализа элементарных режимов и экстремальных путей, в итоге даёт только одно решение. Линейное программирование обычно применяется для получения максимального значения целевой функции, которую необходимо оптимизировать, и, следовательно, при использовании анализа баланса потоков находится единственное решение задачи оптимизации. Более того, может возникнуть необходимость в оценке математической структуры системы дифференциальных уравнений, поскольку реальные кинетические законы реакций в исследуемой системе неизвестны. Для этого программа SBMLsqueezer позволяет автоматически создавать подходящие кинетические законы для всех реакций в сети.
A different technique to simulate the metabolic network is to perform flux balance analysis. This method uses linear programming, but in contrast to elementary mode analysis and extreme pathways, only a single solution results in the end. Linear programming is usually used to obtain the maximum potential of the objective function that you are looking at, and therefore, when using flux balance analysis, a single solution is found to the optimization problem. One step further, it may be desired to estimate the mathematical structure of the differential equation system because the real rate laws are not known for the reactions within the system under study. To this end, the program SBMLsqueezer allows automatic creation of appropriate rate laws for all reactions with the network.
Синтетическая доступность
Синтетическая доступность – это простой подход к сетевому моделированию, целью которого является предсказание летальности выключения метаболических генов. Метод синтетической доступности использует топологию метаболической сети для вычисления суммы минимального числа шагов, необходимых для прохождения по графу метаболической сети от исходных веществ – метаболитов, доступных организму из внешней среды, – к конечным продуктам – метаболитам, необходимым для выживания организма. Для имитации выключения гена реакции, катализируемые этим геном, удаляются из сети, и метрика синтетической доступности пересчитывается. Предполагается, что увеличение общего числа шагов приводит к летальности. Вундерлих и Мирни показали, что этот простой, не требующий параметров подход предсказывает летальность при выключении генов у E. coli и S. cerevisiae, а также сопоставим по точности с анализом элементарных режимов и анализом баланса потоков в различных средах.
Synthetic accessibility is a simple approach to network simulation whose goal is to predict which metabolic gene knockouts are lethal. The synthetic accessibility approach uses the topology of the metabolic network to calculate the sum of the minimum number of steps needed to traverse the metabolic network graph from the inputs, those metabolites available to the organism from the environment, to the outputs, metabolites needed by the organism to survive. To simulate a gene knockout, the reactions enabled by the gene are removed from the network and the synthetic accessibility metric is recalculated. An increase in the total number of steps is predicted to cause lethality. Wunderlich and Mirny showed this simple, parameter free approach predicted knockout lethality in E. coli and S. cerevisiae as well as elementary mode analysis and flux balance analysis in a variety of media.