Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
Компьютерная геномика – это применение вычислительного и статистического анализа для интерпретации биологической информации на основе последовательностей генома и связанных с ними данных, включая последовательности ДНК и РНК, а также другие "постгеномные" данные (то есть экспериментальные данные, полученные с использованием технологий, требующих знания последовательности генома, таких как микромассивы геномной ДНК). В сочетании с вычислительными и статистическими методами изучения функции генов и анализом статистических ассоциаций, эта область часто называется вычислительной и статистической генетикой/геномикой. Таким образом, компьютерную геномику можно рассматривать как подраздел биоинформатики и вычислительной биологии, но с акцентом на использовании полных геномов (в отличие от отдельных генов) для понимания принципов, по которым ДНК организма определяет его биологию на молекулярном уровне и выше. В условиях современного изобилия больших биологических данных, вычислительные исследования стали одним из важнейших инструментов для биологических открытий.
Computational genomics refers to the use of computational and statistical analysis to decipher biology from genome sequences and related data, including both DNA and RNA sequence as well as other "post genomic" data (i. e., experimental data obtained with technologies that require the genome sequence, such as genomic DNA microarrays). These, in combination with computational and statistical approaches to understanding the function of the genes and statistical association analysis, this field is also often referred to as Computational and Statistical Genetics/genomics. As such, computational genomics may be regarded as a subset of bioinformatics and computational biology, but with a focus on using whole genomes (rather than individual genes) to understand the principles of how the DNA of a species controls its biology at the molecular level and beyond. With the current abundance of massive biological datasets, computational studies have become one of the most important means to biological discovery.
Биосинтетические геновые кластеры
Были разработаны биоинформатические инструменты для предсказания, определения обилия и экспрессии таких кластеров генов в образцах микробиома на основе метагеномных данных. Учитывая значительный объем метагеномных данных, фильтрация и кластеризация являются важными этапами работы этих инструментов. Эти процессы могут включать методы снижения размерности, такие как Minhash. В BiG SLiCE демонстрируется полезность подобных анализов посредством реконструкции глобальной карты вторичного метаболического разнообразия в таксономическом контексте для выявления неизученного биосинтетического потенциала, что открывает новые возможности для ускорения поиска природных соединений и представляет собой первый шаг к созданию глобальной, взаимосвязанной и доступной для поиска сети BGC. По мере секвенирования геномов все большего числа малоизученных таксонов, можно получать больше информации для выявления их потенциально новых химических свойств.
Bioinformatic tools have been developed to predict, and determine the abundance and expression of, this kind of gene cluster in microbiome samples, from metagenomic data. Since the size of metagenomic data is considerable, filtering and clusterization thereof are important parts of these tools. These processes can consist of dimensionality reduction techniques, such as Minhash, across BiG SLiCE demonstrate the utility of such analyses by reconstructing a global map of secondary metabolic diversity across taxonomy to identify uncharted biosynthetic potential, opens up new possibilities to accelerate natural product discovery and offers a first step towards constructing a global and searchable interconnected network of BGCs. As more genomes are sequenced from understudied taxa, more information can be mined to highlight their potentially novel chemistry.