Введение

Сборник биоинформатических баз данных

KEGG (Киотская энциклопедия генов и геномов) – это коллекция баз данных, посвященных геномам, биологическим путям, заболеваниям, лекарственным препаратам и химическим веществам. KEGG используется в биоинформатических исследованиях и образовании, включая анализ данных в геномике, метагеномике, метаболомике и других "омиксных" исследованиях, моделирование и симуляцию в системной биологии, а также трансляционные исследования в разработке лекарств. Проект базы данных KEGG был инициирован в 1995 году Минору Канехиса, профессором Института химических исследований Киотского университета, в рамках японской программы по геному человека. Предвидя потребность в компьютеризированном ресурсе для биологической интерпретации данных о последовательности генома, он начал разработку базы данных KEGG PATHWAY. Это коллекция карт KEGG PATHWAY, созданных вручную, представляющих экспериментальные знания о метаболизме и различных других функциях клетки и организма. Каждая карта пути содержит сеть молекулярных взаимодействий и реакций и предназначена для связи генов в геноме с продуктами генов (в основном белками) в данном пути. Это позволило разработать метод анализа, называемый картографированием KEGG-путей, при котором геномный состав сравнивается с базой данных KEGG PATHWAY для определения путей и связанных с ними функций, которые, вероятно, кодируются в геноме. По мнению разработчиков, KEGG является "компьютерным представлением" биологической системы. Он объединяет строительные блоки и принципиальные схемы системы – в частности, генетические строительные блоки генов и белков, химические строительные блоки малых молекул и реакций, а также принципиальные схемы молекулярных взаимодействий и реакционных сетей. Эта концепция реализована в следующих базах данных KEGG, которые классифицируются по системной, геномной, химической и медицинской информации. Системная информация
PATHWAY: карты путей для клеточных и организменных функций
MODULE: модули или функциональные единицы генов
BRITE: иерархические классификации биологических сущностей
Геномная информация
GENOME: полные геномы
GENES: гены и белки в полных геномах
ORTHOLOGY: ортологические группы генов в полных геномах
Химическая информация
COMPOUND, GLYCAN: химические соединения и гликаны
REACTION, RPAIR, RCLASS: химические реакции
ENZYME: номенклатура ферментов
Медицинская информация
DISEASE: заболевания человека
DRUG: одобренные лекарственные препараты
ENVIRON: лекарственные средства растительного происхождения и вещества, связанные со здоровьем

Геномная информация

Через несколько месяцев после запуска проекта KEGG в 1995 году был опубликован первый отчет о полностью секвенированном бактериальном геноме. С тех пор все опубликованные полные геномы накапливаются в KEGG для эукариот и прокариот. База данных KEGG GENES содержит информацию на уровне генов/белков, а база данных KEGG GENOME – информацию на уровне организмов для этих геномов. База данных KEGG GENES состоит из наборов генов для полных геномов, и генам в каждом наборе присваиваются аннотации, устанавливающие соответствия со схемами карт путей KEGG, модулей KEGG и иерархий BRITE. Эти соответствия устанавливаются на основе концепции ортологов. Карты KEGG-путей создаются на основе экспериментальных данных, полученных на конкретных организмах, но разработаны таким образом, чтобы быть применимыми и к другим организмам, поскольку различные организмы, такие как человек и мышь, часто имеют идентичные пути, состоящие из функционально идентичных генов, называемых ортологическими генами или ортологами. Все гены в базе данных KEGG GENES группируются в такие ортологи в базе данных KEGG ORTHOLOGY (KO). Поскольку узлам (генным продуктам) карт путей KEGG, а также модулям KEGG и иерархиям BRITE присваиваются идентификаторы KO, соответствия устанавливаются, как только гены в геноме аннотируются идентификаторами KO с помощью процедуры аннотации генома в KEGG. Набор генов ферментов в геноме позволит идентифицировать сети взаимосвязей ферментов при наложении на карты путей KEGG, которые, в свою очередь, характеризуют сети трансформации химических структур, позволяя интерпретировать биосинтетический и биодеградационный потенциал организма. Альтернативно, набор метаболитов, идентифицированных в метаболоме, приведет к пониманию ферментативных путей и вовлеченных генов ферментов. Базы данных в категории химической информации, которые в совокупности называются KEGG LIGAND, организованы на основе знаний о химической сети. В начале проекта KEGG, KEGG LIGAND состояла из трех баз данных: KEGG COMPOUND для химических соединений, KEGG REACTION для химических реакций и KEGG ENZYME для реакций в ферментной номенклатуре. В настоящее время существуют дополнительные базы данных: KEGG GLYCAN для гликанов и две вспомогательные базы данных реакций, называемые RPAIR (выравнивание пар реагентов) и RCLASS (класс реакций). KEGG COMPOUND также был расширен, чтобы включать различные соединения, такие как ксенобиотики, в дополнение к метаболитам.

Информация о здоровье

В KEGG заболевания рассматриваются как измененные состояния биологической системы, вызванные факторами, нарушающими генетические факторы и факторы окружающей среды, а лекарственные препараты – как различные типы таких факторов. База данных KEGG PATHWAY включает в себя как нормальные, так и измененные состояния биологических систем. Однако, для большинства заболеваний невозможно построить карты патологических путей из-за недостаточного понимания молекулярных механизмов. В базе данных KEGG DISEASE используется альтернативный подход, который просто каталогизирует известные генетические и экологические факторы, связанные с заболеваниями. Эти каталоги в конечном итоге могут привести к созданию более полных схем связей заболеваний. База данных KEGG DRUG содержит активные ингредиенты одобренных лекарственных средств в Японии, США и Европе. Они различаются по химической структуре и/или химическим компонентам и связаны с молекулами-мишенями, метаболизирующими ферментами и другой информацией о молекулярных сетях взаимодействия, представленной в картах путей KEGG и иерархиях BRITE. Это обеспечивает комплексный анализ взаимодействия лекарственных средств с геномной информацией. Необработанные лекарственные средства и другие вещества, связанные со здоровьем, не относящиеся к категории одобренных лекарственных средств, хранятся в базе данных KEGG ENVIRON. Базы данных, относящиеся к медицинской информации, коллективно называются KEGG MEDICUS и включают в себя также инструкции по применению ко всем лекарственным средствам, продаваемым в Японии.

Модель подписки

В июле 2011 года KEGG внедрила платную подписку для скачивания данных по FTP в связи со значительным сокращением государственного финансирования. KEGG остается свободно доступным через свой веб-сайт, однако введение платной подписки вызвало обсуждения об устойчивом развитии биоинформатических баз данных.