Введение
Вычислительный анализ больших, сложных наборов биологических данных
the journal
Bioinformatics (/audio=en us bioinformatics. ogg/,/b//aɪ//.//oʊ/,/ɪ//n//f//ɚ/'/m//æ//t//ɪ//k//s/) is an interdisciplinary field of science that develops methods and software tools for understanding biological data, especially when the data sets are large and complex. Bioinformatics uses biology, chemistry, physics, computer science, computer programming, information engineering, mathematics and statistics to analyze and interpret biological data. The subsequent process of analyzing and interpreting data is referred to as computational biology. Computational, statistical, and computer programming techniques have been used for computer simulation analyses of biological queries. They include reused specific analysis "pipelines", particularly in the field of genomics, such as by the identification of genes and single nucleotide polymorphisms (SNPs). These pipelines are used to better understand the genetic basis of disease, unique adaptations, desirable properties (esp. in agricultural species), or differences between populations. Bioinformatics also includes proteomics, which tries to understand the organizational principles within nucleic acid and protein sequences. Image and signal processing allow extraction of useful results from large amounts of raw data. In the field of genetics, it aids in sequencing and annotating genomes and their observed mutations. Bioinformatics includes text mining of biological literature and the development of biological and gene ontologies to organize and query biological data. It also plays a role in the analysis of gene and protein expression and regulation. Bioinformatics tools aid in comparing, analyzing and interpreting genetic and genomic data and more generally in the understanding of evolutionary aspects of molecular biology. At a more integrative level, it helps analyze and catalogue the biological pathways and networks that are an important part of systems biology. In structural biology, it aids in the simulation and modeling of DNA, RNA, proteins as well as biomolecular interactions.
журнал Bioinformatics (/audio=en us bioinformatics.ogg/,/b//aɪ//.//oʊ/,/ɪ//n//f//ɚ/'/m//æ//t//ɪ//k//s/) – это междисциплинарная область науки, разрабатывающая методы и программные инструменты для понимания биологических данных, особенно когда наборы данных велики и сложны. Биоинформатика использует биологию, химию, физику, информатику, компьютерное программирование, информационную инженерию, математику и статистику для анализа и интерпретации биологических данных. Последующий процесс анализа и интерпретации данных называется вычислительной биологией. Вычислительные, статистические и методы компьютерного программирования используются для компьютерного моделирования и анализа биологических задач. Они включают в себя повторно используемые специализированные аналитические "конвейеры", особенно в области геномики, такие как идентификация генов и однонуклеотидных полиморфизмов (СНП). Эти конвейеры используются для лучшего понимания генетической основы заболеваний, уникальных адаптаций, ценных свойств (особенно у сельскохозяйственных видов) или различий между популяциями. Биоинформатика также включает протеомику, которая стремится понять организационные принципы в последовательностях нуклеиновых кислот и белков. Обработка изображений и сигналов позволяет извлекать полезные результаты из больших объемов необработанных данных. В области генетики она помогает в секвенировании и аннотировании геномов и их наблюдаемых мутаций. Биоинформатика включает в себя интеллектуальный анализ биологической литературы и разработку биологических и генных онтологий для организации и поиска биологических данных. Она также играет роль в анализе экспрессии и регуляции генов и белков. Инструменты биоинформатики помогают сравнивать, анализировать и интерпретировать генетические и геномные данные и, в более широком смысле, понимать эволюционные аспекты молекулярной биологии. На более интегративном уровне она помогает анализировать и каталогизировать биологические пути и сети, которые являются важной частью системной биологии. В структурной биологии она помогает в моделировании и симуляции ДНК, РНК, белков, а также биомолекулярных взаимодействий.
the journal
Bioinformatics (/audio=en us bioinformatics. ogg/,/b//aɪ//.//oʊ/,/ɪ//n//f//ɚ/'/m//æ//t//ɪ//k//s/) is an interdisciplinary field of science that develops methods and software tools for understanding biological data, especially when the data sets are large and complex. Bioinformatics uses biology, chemistry, physics, computer science, computer programming, information engineering, mathematics and statistics to analyze and interpret biological data. The subsequent process of analyzing and interpreting data is referred to as computational biology. Computational, statistical, and computer programming techniques have been used for computer simulation analyses of biological queries. They include reused specific analysis "pipelines", particularly in the field of genomics, such as by the identification of genes and single nucleotide polymorphisms (SNPs). These pipelines are used to better understand the genetic basis of disease, unique adaptations, desirable properties (esp. in agricultural species), or differences between populations. Bioinformatics also includes proteomics, which tries to understand the organizational principles within nucleic acid and protein sequences. Image and signal processing allow extraction of useful results from large amounts of raw data. In the field of genetics, it aids in sequencing and annotating genomes and their observed mutations. Bioinformatics includes text mining of biological literature and the development of biological and gene ontologies to organize and query biological data. It also plays a role in the analysis of gene and protein expression and regulation. Bioinformatics tools aid in comparing, analyzing and interpreting genetic and genomic data and more generally in the understanding of evolutionary aspects of molecular biology. At a more integrative level, it helps analyze and catalogue the biological pathways and networks that are an important part of systems biology. In structural biology, it aids in the simulation and modeling of DNA, RNA, proteins as well as biomolecular interactions.
История
Первое определение термина «биоинформатика» было предложено Паулиеном Хогевегом и Беном Геспером в 1970 году для обозначения изучения информационных процессов в живых системах. Это определение позиционировало биоинформатику как область, параллельную биохимии (изучению химических процессов в биологических системах). Компьютеры стали незаменимы в молекулярной биологии после того, как последовательности белков стали доступны благодаря определению Фредериком Сэнгером последовательности инсулина в начале 1950-х годов. Ручное сравнение множества последовательностей оказалось нецелесообразным. Маргарет Оукли Дейхофф, пионер в этой области, создала одну из первых баз данных последовательностей белков, первоначально опубликованную в виде книг, а также разработала методы выравнивания последовательностей и изучения молекулярной эволюции. Еще одним из первых исследователей в области биоинформатики был Элвин А. Кабат, который начал проводить анализ биологических последовательностей в 1970 году, выпустив свои всеобъемлющие труды по последовательностям антител в онлайн-доступе совместно с Тай Те Ву в период с 1980 по 1991 год. В 1970-х годах новые методы секвенирования ДНК были применены к бактериофагам MS2 и øX174, а полученные расширенные нуклеотидные последовательности были проанализированы с использованием информационных и статистических алгоритмов. Эти исследования продемонстрировали, что известные характеристики, такие как кодирующие сегменты и триплетный код, выявляются при помощи простых статистических анализов и стали подтверждением концепции перспективности биоинформатики.
Анализ последовательности
С тех пор как бактериофаг Φ X174 был секвенирован в 1977 году, последовательности ДНК тысяч организмов были расшифрованы и сохранены в базах данных. Эта информация о последовательностях анализируется для выявления генов, кодирующих белки, гены РНК, регуляторные последовательности, структурные мотивы и повторяющиеся участки. Сравнение генов внутри вида или между разными видами позволяет выявить сходство в функциях белков или родственные связи между видами (использование молекулярной систематики для построения филогенетических деревьев). В связи с постоянно растущим объемом данных, ручной анализ последовательностей ДНК давно стал невозможным. Компьютерные программы, такие как BLAST, регулярно используются для поиска последовательностей – по состоянию на 2008 год, из более чем 260 000 организмов, содержащих свыше 190 миллиардов нуклеотидов.
Секвенирование ДНК
Перед тем, как последовательности могут быть проанализированы, они извлекаются из хранилища данных, такого как GenBank. Секвенирование ДНК по-прежнему остается непростой задачей, поскольку необработанные данные могут содержать шум или быть подвержены воздействию слабых сигналов. Для различных экспериментальных методов секвенирования ДНК были разработаны алгоритмы определения оснований.
Сборка последовательности
Большинство методов секвенирования ДНК дают короткие фрагменты последовательности, которые необходимо собрать для получения полных последовательностей генов или геномов. Метод секвенирования "дробовиком" (использованный Институтом геномных исследований (TIGR) для секвенирования первого бактериального генома, Haemophilus influenzae) генерирует последовательности многих тысяч небольших фрагментов ДНК (длиной от 35 до 900 нуклеотидов, в зависимости от используемой технологии секвенирования). Концы этих фрагментов перекрываются, и при правильном выравнивании с помощью программы сборки генома их можно использовать для восстановления полного генома. Секвенирование "дробовиком" позволяет быстро получать данные о последовательности, но сборка фрагментов может быть довольно сложной задачей для крупных геномов. Для генома размером с человеческий может потребоваться несколько дней вычислительного времени на компьютерах с большой памятью и многопроцессорной архитектурой, чтобы собрать фрагменты, и полученная сборка обычно содержит множество пробелов, которые необходимо будет заполнить позднее. Секвенирование "дробовиком" является предпочтительным методом для секвенирования практически всех геномов (в отличие от методов обрыва цепи или химической деградации), а алгоритмы сборки генома – важнейшая область биоинформатических исследований.
Сравнительная геномика
Основой сравнительного геномного анализа является установление соответствия между генами (ортологический анализ) или другими геномными признаками у разных организмов. Межгеномные карты строятся для прослеживания эволюционных процессов, ответственных за расхождение двух геномов. Множество эволюционных событий, действующих на различных организационных уровнях, формируют эволюцию генома. На самом низком уровне точечные мутации влияют на отдельные нуклеотиды. На более высоком уровне крупные хромосомные сегменты подвергаются дупликации, латеральному переносу, инверсии, транспозиции, делеции и вставке. Целые геномы вовлечены в процессы гибридизации, полиплоидизации и эндосимбиоза, приводящие к быстрому видообразованию. Сложность эволюции генома ставит перед разработчиками математических моделей и алгоритмов множество сложных задач, требующих использования широкого спектра алгоритмических, статистических и математических методов – от точных, эвристических, алгоритмов с фиксированными параметрами и приближенных алгоритмов для задач, основанных на принципах экономии, до алгоритмов Монте-Карло с цепочкой Маркова для байесовского анализа задач, основанных на вероятностных моделях. Многие из этих исследований базируются на выявлении гомологии последовательностей для отнесения последовательностей к семействам белков.
Пангеномика
Пангеномика – это концепция, предложенная в 2005 году Теттелином и Медини. Пангеном является полный набор генов конкретной монофилетической таксономической группы. Изначально применявшийся к близкородственным штаммам вида, он может быть использован и в более широком контексте, например, для рода, класса и т.д. Он подразделяется на две части: ядро генома – набор генов, общих для всех исследуемых геномов (часто это гены-хаускиперы, необходимые для выживания), и вариабельный/гибкий геном – набор генов, присутствующих не во всех, а лишь в некоторых из исследуемых геномов. Биоинформатический инструмент BPGA может быть использован для характеристики пангенома бактериальных видов.
Генетика болезни
По состоянию на 2013 год, наличие эффективной высокопроизводительной технологии секвенирования нового поколения позволяет выявлять причины многих различных заболеваний человека. Простая менделевская наследственность наблюдается более чем при 3000 заболеваний, идентифицированных в онлайн-базе данных «Менделевская наследственность человека», однако сложные заболевания представляют большую сложность. Исследования ассоциаций обнаружили множество отдельных генетических регионов, каждый из которых слабо связан со сложными заболеваниями (такими как бесплодие, рак молочной железы и болезнь Альцгеймера), вместо единой причины. В настоящее время существует ряд проблем, связанных с использованием генов для диагностики и лечения, например, неопределенность в отношении значимости конкретных генов или стабильности результатов, предоставляемых алгоритмами. Исследования геномных ассоциаций успешно идентифицировали тысячи общих генетических вариантов, связанных со сложными заболеваниями и признаками; однако эти общие варианты объясняют лишь небольшую долю наследуемости. Редкие варианты могут объяснять часть недостающей наследуемости. Крупномасштабные исследования секвенирования всего генома позволили быстро секвенировать миллионы геномов, в результате чего были идентифицированы сотни миллионов редких вариантов. Функциональные аннотации предсказывают эффект или функцию генетического варианта и помогают приоритизировать редкие функциональные варианты, а их включение может эффективно повысить статистическую мощность анализа ассоциаций редких вариантов в исследованиях секвенирования всего генома. Разработаны инструменты, обеспечивающие комплексный анализ ассоциаций редких вариантов для данных секвенирования всего генома, включая интеграцию данных генотипов и их функциональных аннотаций, проведение анализа ассоциаций, обобщение результатов и визуализацию. Мета-анализ исследований секвенирования всего генома представляет собой перспективное решение проблемы сбора больших выборок для выявления редких вариантов, связанных со сложными фенотипами.
Анализ мутаций в раковых заболеваниях
При раке геномы пораженных клеток перестраиваются сложными или непредсказуемыми способами. Помимо микромассивов однонуклеотидных полиморфизмов, выявляющих точечные мутации, вызывающие рак, олигонуклеотидные микромассивы могут использоваться для идентификации хромосомных усилений и делеций (так называемая сравнительная геномная гибридизация). Эти методы детекции генерируют терабайты данных на один эксперимент. Данные часто содержат значительную вариабельность, или шум, поэтому разрабатываются методы скрытых марковских моделей и анализа точек изменения для определения истинных изменений числа копий генов. Для выявления рака по мутациям в экзоме можно использовать два важных принципа. Во-первых, рак – это заболевание, характеризующееся накоплением соматических мутаций в генах. Во-вторых, рак содержит драйверные мутации, которые необходимо отличать от пассажирских. Дальнейшее развитие биоинформатики может позволить классифицировать типы рака путем анализа драйверных мутаций в геноме. Кроме того, в будущем может стать возможным отслеживание пациентов по мере прогрессирования заболевания на основе секвенирования образцов опухоли. Еще один тип данных, требующий разработки новых информатических подходов, – это анализ рецидивирующих поражений, обнаруживаемых во многих опухолях.
Анализ экспрессии генов
Экспрессию многих генов можно определить, измеряя уровни мРНК с использованием различных методов, включая микромассивы, секвенирование экспрессированных тегов последовательности ДНК (EST), последовательный анализ секвенирования тегов экспрессии генов (SAGE), массивное параллельное секвенирование сигнатур (MPSS), секвенирование РНК, также известное как секвенирование всего транскриптома (WTSS), или различные варианты мультиплексной in situ гибридизации. Все эти методы крайне подвержены шуму и/или систематическим ошибкам при биологических измерениях, и важная область исследований в вычислительной биологии посвящена разработке статистических инструментов для отделения сигнала от шума в высокопроизводительных исследованиях экспрессии генов. Такие исследования часто используются для выявления генов, вовлеченных в развитие заболевания: например, можно сравнить данные микромассивов, полученные из раковых эпителиальных клеток, с данными из нераковых клеток, чтобы определить транскрипты, экспрессия которых повышена или понижена в конкретной популяции раковых клеток.
Анализ экспрессии белка
Протеиновые микромассивы и высокопроизводительная (HT) масс-спектрометрия (MS) позволяют получить картину белкового состава биологического образца. Первый подход сталкивается с аналогичными проблемами, что и микромассивы, предназначенные для мРНК, а второй – с задачей сопоставления больших объемов масс-спектрометрических данных с теоретическими массами, рассчитанными на основе баз данных последовательностей белков, и сложным статистическим анализом образцов при обнаружении множества неполных пептидов для каждого белка. Локализацию клеточных белков в ткани можно определить с помощью аффинной протеомики, представленной в виде пространственных данных, полученных на основе иммуногистохимии и тканевых микромассивов.
Анализ регулирования
Регуляция генов – это сложный процесс, в котором сигнал, например внеклеточный сигнал, такой как гормон, в конечном итоге приводит к увеличению или уменьшению активности одного или нескольких белков. Биоинформатические методы применяются для изучения различных этапов этого процесса. Например, экспрессия генов может регулироваться расположенными поблизости элементами в геноме. Промоторный анализ включает идентификацию и изучение последовательных мотивов в ДНК, окружающей кодирующую область гена. Эти мотивы влияют на степень транскрипции этой области в мРНК. Элементы-усилители, находящиеся далеко от промотора, также могут регулировать экспрессию генов посредством трехмерных взаимодействий, образующих петли. Эти взаимодействия могут быть определены биоинформатическим анализом экспериментов по захвату хромосомной конформации. Данные об экспрессии могут быть использованы для выведения закономерностей регуляции генов: можно сравнить данные микрочипов из широкого спектра состояний организма, чтобы сформулировать гипотезы о генах, участвующих в каждом состоянии. В одноклеточном организме можно сравнить стадии клеточного цикла, а также различные стрессовые условия (тепловой шок, голодание и т.д.). Затем к данным об экспрессии могут быть применены алгоритмы кластеризации для определения генов, которые коэкспрессируются. Например, в вышележащих областях (промоторах) коэкспрессируемых генов можно искать избыточно представленные регуляторные элементы. Примеры алгоритмов кластеризации, применяемых для кластеризации генов, включают кластеризацию k-средних, самоорганизующиеся карты (SOM), иерархическую кластеризацию и методы консенсусной кластеризации.
Анализ клеточной организации
Разработано несколько подходов к анализу локализации органелл, генов, белков и других компонентов внутри клеток. В онтологии генов существует категория «клеточный компонент», предназначенная для описания субклеточной локализации в многочисленных биологических базах данных.
Микроскопия и анализ изображений
Микроскопические изображения позволяют определить местоположение органелл и молекул, которые могут являться причиной нарушений при заболеваниях.
Локализация белка
Нахождение локализации белков позволяет нам предсказывать их функции. Это называется предсказанием функции белков. Например, если белок обнаружен в ядре, он может быть вовлечен в регуляцию генов или сплайсинг. В то же время, если белок находится в митохондриях, он может участвовать в дыхании или других метаболических процессах. Существуют хорошо развитые ресурсы для предсказания подклеточной локализации белков, включая базы данных подклеточной локализации белков и инструменты для предсказания.
Ядерная организация хроматина
Данные, полученные в результате экспериментов по захвату конформации хромосом с высокой пропускной способностью, таких как Hi-C (эксперимент) и ChIA-PET, могут предоставить информацию о трехмерной структуре и ядерной организации хроматина. Биоинформатические задачи в этой области включают в себя разделение генома на домены, например, топологически ассоциирующие домены (TAD), которые организованы вместе в трехмерном пространстве.
Структурная биоинформатика
Поиск структуры белков — важная область применения биоинформатики. Критическая оценка прогнозирования структуры белка (CASP) — это открытое соревнование, в котором исследовательские группы со всего мира представляют модели белков для оценки предсказаний структуры неизвестных белков.
Последовательность аминокислот
Линейная последовательность аминокислот белка называется первичной структурой. Первичную структуру можно легко определить по последовательности кодонов в гене ДНК, который его кодирует. В большинстве белков первичная структура однозначно определяет трехмерную структуру белка в его естественной среде. Исключением является неправильно свернутый белок, вовлеченный в губчатую энцефалопатию крупного рогатого скота. Эта структура связана с функцией белка. Дополнительная структурная информация включает вторичную, третичную и четвертичную структуры. Общее решение для предсказания функции белка остается нерешенной проблемой. Большинство усилий до сих пор направлено на эвристические методы, которые работают в большинстве случаев.
Гомология
В геномной области биоинформатики гомология используется для предсказания функции гена: если последовательность гена А, функция которого известна, гомологична последовательности гена В, функция которого неизвестна, можно предположить, что ген В может выполнять функцию, аналогичную функции гена А. В структурной биоинформатике гомология используется для определения, какие части белка важны для формирования структуры и взаимодействия с другими белками. Гомологическое моделирование используется для предсказания структуры неизвестного белка на основе структур существующих гомологичных белков. Примером этого является гемоглобин у человека и гемоглобин в бобовых (леггемоглобин), которые являются дальними родственниками из одного и того же суперсемейства белков. Оба выполняют одну и ту же функцию – транспорт кислорода в организме. Хотя аминокислотные последовательности этих белков совершенно различны, их белковые структуры практически идентичны, что отражает их схожие функции и общего предка. Другие методы предсказания структуры белка включают протеиновый трединг и моделирование de novo (с нуля) на основе физических принципов. Другой аспект структурной биоинформатики – использование белковых структур для моделей виртуального скрининга, таких как модели «количество-активность» и протеохемиометрические модели (PCM). Кроме того, кристаллическая структура белка может быть использована в моделировании, например, для изучения связывания лигандов и in silico мутагенеза. Программное обеспечение AlphaFold, разработанное компанией Google DeepMind в 2021 году и основанное на алгоритмах глубокого обучения, значительно превосходит все другие методы прогнозирования и предоставило предсказанные структуры для сотен миллионов белков в базе данных структур белков AlphaFold.
Сетевая и системная биология
Сетевой анализ направлен на понимание взаимосвязей в биологических сетях, таких как метаболические или сети белок-белковых взаимодействий. Хотя биологические сети могут быть построены на основе одного типа молекул или сущностей (например, генов), сетевая биология часто стремится к интеграции различных типов данных, таких как белки, малые молекулы, данные об экспрессии генов и другие, которые связаны между собой физически, функционально или и тем, и другим. Системная биология предполагает использование компьютерного моделирования клеточных подсистем (таких как сети метаболитов и ферментов, составляющих метаболизм, пути передачи сигналов и сети регуляции генов) для анализа и визуализации сложных взаимосвязей этих клеточных процессов. Искусственная жизнь или виртуальная эволюция пытается понять эволюционные процессы посредством компьютерного моделирования простых (искусственных) форм жизни.
Сети молекулярного взаимодействия
Десятки тысяч трехмерных структур белков были определены с помощью рентгеновской кристаллографии и спектроскопии ядерного магнитного резонанса белков (ЯМР белков), и центральный вопрос в структурной биоинформатике заключается в том, насколько практически возможно предсказывать возможные белок-белковые взаимодействия, основываясь исключительно на этих трехмерных формах, без проведения экспериментов по изучению белок-белковых взаимодействий. Разработано множество методов для решения задачи докинга белков, однако, похоже, в этой области еще предстоит проделать значительную работу. К другим изучаемым взаимодействиям относятся белок-лиганд (включая лекарственные препараты) и белок-пептид. Молекулярно-динамическое моделирование движения атомов вокруг вращающихся связей лежит в основе вычислительных алгоритмов, называемых алгоритмами докинга, используемых для изучения молекулярных взаимодействий.
Информатика биоразнообразия
Информатика биоразнообразия занимается сбором и анализом данных о биоразнообразии, таких как таксономические базы данных или данные о микробиомах. Примеры таких анализов включают филогенетические исследования, моделирование экологической ниши, картографирование видового богатства, ДНК-штрихкодирование и инструменты для идентификации видов. Растущим направлением также является макроэкология, то есть изучение взаимосвязи биоразнообразия с экологией и антропогенным воздействием, например, изменением климата.
Анализ данных с высокой пропускной способностью в одной ячейке
Для анализа данных, полученных из отдельных клеток с высокой пропускной способностью и низким разрешением измерений, таких как данные, полученные при проточной цитометрии, используются вычислительные методы. Эти методы обычно включают в себя выявление популяций клеток, релевантных для конкретного состояния заболевания или экспериментальных условий.
Онтологии и интеграция данных
Биологические онтологии — это направленные ациклические графы контролируемых словарей. Они создают категории для биологических понятий и описаний, чтобы их можно было легко анализировать с помощью компьютеров. При такой категоризации становится возможным получить дополнительную ценность от комплексного и интегрированного анализа. OBO Foundry — это была попытка стандартизировать определенные онтологии. Одной из наиболее распространенных является онтология генов, описывающая функции генов. Существуют также онтологии, описывающие фенотипы.
Программное обеспечение и инструменты
Программные инструменты для биоинформатики включают простые инструменты командной строки, более сложные графические программы и независимые веб-сервисы. Они разрабатываются биоинформатическими компаниями или государственными организациями.
Веб-сервисы в области биоинформатики
Интерфейсы на основе SOAP и REST были разработаны, чтобы клиентские компьютеры могли использовать алгоритмы, данные и вычислительные ресурсы серверов, расположенных в других частях мира. Главное преимущество заключается в том, что конечным пользователям не нужно заниматься обслуживанием программного обеспечения и баз данных. EBI классифицирует основные биоинформатические сервисы на три категории: SSS (Sequence Search Services), MSA (Multiple Sequence Alignment) и BSA (Biological Sequence Analysis). Доступность этих сервисно-ориентированных биоинформатических ресурсов демонстрирует применимость веб-решений в биоинформатике, охватывая диапазон от набора независимых инструментов с общим форматом данных, объединенных под единым веб-интерфейсом, до интегрируемых, распределенных и расширяемых систем управления биоинформатическими рабочими процессами.
Биокомпьютер и биокомпьютерные объекты
В 2014 году Управление по санитарному надзору за качеством пищевых продуктов и медикаментов США (FDA) спонсировало конференцию, проведенную на территории кампуса Национальных институтов здоровья (NIH) в Бетесде, для обсуждения воспроизводимости результатов в биоинформатике. В течение последующих трех лет консорциум заинтересованных сторон регулярно встречался для обсуждения концепции, которая впоследствии стала парадигмой BioCompute. В этот консорциум входили представители государственных органов, промышленности и академических учреждений. Руководители сессий представляли различные подразделения FDA и институты и центры NIH, некоммерческие организации, такие как Проект «Вариом человека» и Европейская федерация медицинской информатики, а также исследовательские институты, включая Стэнфордский университет, Нью-Йоркский центр генома и Университет имени Джорджа Вашингтона. Было решено, что парадигма BioCompute будет реализована в форме цифровых «лабораторных журналов», обеспечивающих воспроизводимость, повторение, проверку и повторное использование протоколов биоинформатики. Это было предложено для обеспечения большей преемственности в исследовательской группе при естественной текучке кадров и для содействия обмену идеями между группами. FDA финансировало эту работу с целью повышения прозрачности и доступности информации о конвейерах обработки данных для своих регулирующих органов. В 2016 году группа вновь собралась в NIH в Бетесде и обсудила возможность создания объекта BioCompute – конкретной реализации парадигмы BioCompute. Результаты этой работы были оформлены в виде документа «стандартного пробного использования» и препринта, загруженного на bioRxiv. Объект BioCompute позволяет обмениваться данными в формате JSON между сотрудниками, соавторами и регулирующими органами.
Образовательные платформы
Биоинформатика преподается не только в очной форме в магистратуре многих университетов. Благодаря вычислительной природе биоинформатики она хорошо подходит для обучения с использованием компьютеров и онлайн-обучения. Программные платформы, разработанные для обучения биоинформатике, включают Rosalind и онлайн-курсы, предлагаемые через учебный портал Швейцарского института биоинформатики. Канадские биоинформатические семинары предоставляют видео и слайды с учебных семинаров на своем веб-сайте под лицензией Creative Commons. Проект 4273π (или 4273pi) также предлагает бесплатные образовательные материалы с открытым исходным кодом. Курс работает на недорогих компьютерах Raspberry Pi и используется для обучения как взрослых, так и школьников. 4273 активно разрабатывается консорциумом ученых и научных сотрудников, которые проводят биоинформатические исследования на уровне передовых разработок, используя компьютеры Raspberry Pi и операционную систему 4273π. Платформы MOOC также предлагают онлайн-сертификаты по биоинформатике и смежным дисциплинам, включая специализацию Coursera по биоинформатике (UC San Diego) и специализацию по геномической науке о данных (Johns Hopkins), а также XSeries EdX «Анализ данных для наук о жизни» (Harvard).
Конференции
Существует несколько крупных конференций, посвященных биоинформатике. Среди наиболее известных – Intelligent Systems for Molecular Biology (ISMB), Европейская конференция по вычислительной биологии (ECCB) и Research in Computational Molecular Biology (RECOMB).