Введение

Биоинформатические подходы к иммунологии
В академической среде вычислительная иммунология – это область науки, объединяющая высокопроизводительные геномные и биоинформатические подходы в иммунологии. Главная цель этой области заключается в преобразовании иммунологических данных в вычислительные задачи, решении этих задач с помощью математических и вычислительных методов и последующей интерпретации полученных результатов с иммунологической точки зрения.

Введение

Иммунная система – сложная система человеческого организма, и её понимание является одной из самых трудных задач в биологии. Исследования в области иммунологии важны для понимания механизмов, лежащих в основе защиты организма, а также для разработки лекарств от иммунологических заболеваний и поддержания здоровья. Недавние достижения в геномных и протеомных технологиях кардинально изменили иммунологические исследования. Секвенирование геномов человека и других модельных организмов привело к экспоненциальному росту объемов данных, релевантных для иммунологии, и одновременно в научной литературе и клинических записях накапливаются огромные массивы функциональных и клинических данных. Последние успехи в биоинформатике или вычислительной биологии помогли осмыслить и организовать эти крупномасштабные данные, что дало начало новой области, известной как вычислительная иммунология или иммуноинформатика. Вычислительная иммунология является ветвью биоинформатики и основывается на схожих концепциях и инструментах, таких как выравнивание последовательностей и инструменты для предсказания структуры белка. Иммуномика – это дисциплина, аналогичная геномике и протеомике. Это наука, которая объединяет иммунологию с компьютерными науками, математикой, химией и биохимией для масштабного анализа функций иммунной системы. Она направлена на изучение сложных белок-белковых взаимодействий и сетей, что позволяет лучше понять иммунные ответы и их роль в нормальном, патологическом и восстановительном состояниях. Вычислительная иммунология является частью иммуномики, специализирующейся на анализе крупномасштабных экспериментальных данных.

История

Компьютерная иммунология зародилась более 90 лет назад с теоретического моделирования эпидемиологии малярии. В то время акцент делался на использовании математических методов для изучения распространения заболеваний. С тех пор эта область расширилась, включив в себя все остальные аспекты процессов, происходящих в иммунной системе, и связанных с ними заболеваний.

Иммунологическая база данных

После недавних достижений в области секвенирования и протеомики наблюдается многократное увеличение объема генерируемых молекулярных и иммунологических данных. Эти данные настолько разнообразны, что могут быть классифицированы в различных базах данных в зависимости от их использования в исследованиях. На сегодняшний день в коллекции баз данных Nucleic Acids Research (NAR) зарегистрировано 31 различная иммунологическая база данных, представленных в следующей таблице, а также некоторые другие базы данных, связанные с иммунитетом. Информация в таблице взята из описаний баз данных в коллекции NAR Database Collection.

Описание базы данных | База данных
------- | --------
ALPSbase | База данных аутоиммунного лимфопролиферативного синдрома
AntigenDB | Последовательности, структура и другие данные о патогенных антигенах
AntiJen | Количественные данные о связывании пептидов и белков, представляющих иммунологический интерес
BCIpep | Эта база данных хранит информацию обо всех экспериментально определенных B-клеточных эпитопах антигенных белков. Это курируемая база данных, в которой подробная информация об эпитопах собирается и компилируется из опубликованной литературы и существующих баз данных. Она охватывает широкий спектр патогенных организмов, таких как вирусы, бактерии, простейшие и грибки. Каждая запись в базе данных содержит полную информацию о B-клеточном эпитопе, включая последовательности аминокислот, источник антигенного белка, иммуногенность, модельный организм и тест на генерацию/нейтрализацию антител.
dbMHC | dbMHC предоставляет доступ к последовательностям HLA, инструментам для поддержки генетического тестирования локусов HLA, частотам аллелей HLA и гаплотипов более чем 90 популяций по всему миру, а также к клиническим наборам данных о трансплантации гемопоэтических стволовых клеток, инсулинозависимом сахарном диабете (IDDM), ревматоидном артрите (RA), нарколепсии и спондилоартропатии. Дополнительную информацию можно найти по ссылке http://www.oxfordjournals.org/nar/database/summary/604
DIGIT | База данных последовательностей иммуноглобулинов и интегрированных инструментов
FIMM | FIMM – это интегрированная база данных функциональной молекулярной иммунологии, ориентированная на T-клеточный ответ на специфические для заболевания антигены. FIMM предоставляет полностью процитированную информацию, интегрированную с инструментами поиска данных и анализа последовательностей для HLA, пептидов, T-клеточных эпитопов, антигенов, заболеваний и является одной из основ будущих исследований в области вычислительной иммунологии. Данные о белках антигенов обогащены более чем 27 000 последовательностями из не избыточной базы данных SwissProt TREMBL TREMBL NEW (SPTR) антигенов, аналогичных или связанных с антигенами FIMM у различных видов, чтобы облегчить всесторонний анализ консервативных или переменных T-клеточных эпитопов.
GPX | Атлас экспрессии макрофагов GPX (GPX MEA) – это онлайн-ресурс для исследований экспрессии различных типов клеток макрофагов после обработки патогенами и иммуномодуляторами. GPX MEA соответствует стандарту MIAME и включает в себя объективную оценку качества для каждого эксперимента. Особое внимание уделяется строгому учету дизайна эксперимента и позволяет проводить статистический анализ данных экспрессии из различных экспериментов с использованием микроматриц. Это первый пример базы данных экспрессии генов макрофагов, который позволяет эффективно идентифицировать паттерны транскрипции, предоставляя новые сведения о биологии этой клеточной системы.
HaptenDB | Это всеобъемлющая база данных молекул гаптенов. Это курируемая база данных, в которой информация собирается и компилируется из опубликованной литературы и веб-ресурсов. В настоящее время база данных содержит более 1700 записей, каждая из которых предоставляет подробную информацию о молекуле гаптена, включая: i) природу гаптена; ii) методы производства антигаптенных антител; iii) информацию о белке-носителе; iv) метод конъюгации; v) метод анализа (используемый для характеристики) и vi) специфичность антител. Haptendb охватывает широкий спектр гаптенов, от антибиотиков, имеющих биомедицинское значение, до пестицидов. Эта база данных будет очень полезна для изучения серологических реакций и производства антител.
HPTAA | HPTAA – это база данных потенциальных опухолевых антигенов, использующая данные экспрессии из различных платформ, включая тщательно отобранные общедоступные данные экспрессии микроматриц, данные GEO SAGE и данные экспрессии Unigene.
IEDB 3D | Структурные данные в базе данных иммунных эпитопов
IL2Rgbase | Мутации, вызывающие тяжелый комбинированный иммунодефицит, сцепленный с X-хромосомой
IMGT | IMGT – это интегрированный ресурс знаний, специализирующийся на генах IG, TR, MHC, суперсемействе IG, суперсемействе MHC и связанных белках иммунной системы человека и других позвоночных. IMGTW включает 6 баз данных, 15 онлайн-инструментов для анализа последовательностей, генов и 3D-структур, а также более 10 000 страниц ресурсов в Интернете. Стандартизация данных, основанная на IMGT ONTOLOGY, была одобрена ВОЗ/IUIS.
IMGT/GENE DB | IMGT/GENE DB – это исчерпывающая геномная база данных IMGT® для генов иммуноглобулинов (IG) и Т-клеточных рецепторов (TR) человека и мыши, а также, в стадии разработки, других позвоночных (например, крысы). IMGT/GENE DB является частью IMGT®, международной информационной системы ImMunoGeneTics®, высококачественного интегрированного ресурса знаний, специализирующегося на IG, TR, комплексе главного гистосовместимости (MHC) человека и других позвоночных, а также связанных белках иммунной системы (RPI), принадлежащих к суперсемейству иммуноглобулинов (IgSF) и суперсемейству MHC (MhcSF).
IMGT/HLA | В настоящее время существует более 1600 официально признанных аллелей HLA, и эти последовательности доступны научному сообществу через базу данных IMGT/HLA. В 1998 году база данных IMGT/HLA была опубликована. С тех пор база данных расширилась и является основным источником информации для изучения последовательностей комплекса главного гистосовместимости человека. Первоначальный выпуск базы данных содержал отчеты об аллелях, инструменты выравнивания, инструменты отправки, а также подробные описания исходных клеток. База данных обновляется ежеквартально всеми новыми и подтверждающими последовательностями, представленными в Комитет номенклатуры ВОЗ, и в среднем в каждом ежеквартальном выпуске добавляется дополнительно 75 новых и подтверждающих последовательностей. База данных IMGT/HLA предоставляет централизованный ресурс для всех заинтересованных, центрально или периферически, в системе HLA.
IMGT/LIGM DB | IMGT/LIGM DB – это исчерпывающая база данных IMGT® нуклеотидных последовательностей иммуноглобулинов (IG) и Т-клеточных рецепторов (TR) человека и других позвоночных, с трансляцией для полностью аннотированных последовательностей, созданная в 1989 году LIGM (http://www.imgt.org/textes/IMGTinformation/LIGM.html), Монпелье, Франция, в Интернете с июля 1995 года. IMGT/LIGM DB является первой и крупнейшей базой данных IMGT®, международной информационной системы ImMunoGeneTics®, высококачественного интегрированного ресурса знаний, специализирующегося на IG, TR, комплексе главного гистосовместимости (MHC) человека и других позвоночных, а также связанных белках иммунной системы (RPI), принадлежащих к суперсемейству иммуноглобулинов (IgSF) и суперсемейству MHC (MhcSF). Данные последовательностей IMGT/LIGM DB идентифицируются по номеру доступа EMBL/GenBank/DDBJ. Единственным источником данных для IMGT/LIGM DB является EMBL, который обменивается данными с GenBank и DDBJ.
Interferon Stimulated Gene Database | Интерфероны (IFN) – это семейство мультифункциональных цитокинов, которые активируют транскрипцию подмножества генов. Продукты генов, индуцированные IFN, отвечают за противовирусные, антипролиферативные и иммуномодулирующие свойства этого цитокина. Чтобы получить более полное представление о генах, регулируемых IFN, мы использовали различные форматы микроматриц для идентификации более 400 генов, стимулированных интерфероном (ISG). Чтобы облегчить распространение этих данных, мы составили базу данных, состоящую из ISG, отнесенных к функциональным категориям. База данных полностью доступна для поиска и содержит ссылки на информацию о последовательностях и Unigene. База данных и данные микроматриц доступны в World Wide Web по адресу (http://www.lerner.ccf...

Инструменты

Различные вычислительные, математические и статистические методы доступны и описаны в литературе. Эти инструменты полезны для сбора, анализа и интерпретации иммунологических данных. К ним относятся текстовая добыча (text mining), управление информацией, анализ последовательностей, анализ молекулярных взаимодействий и математические модели, позволяющие проводить расширенное моделирование иммунной системы и иммунологических процессов. Предпринимаются попытки извлечения интересных и сложных закономерностей из неструктурированных текстовых документов в иммунологической области, например, категоризация информации о перекрестной реактивности аллергенов, использование программ BLAST и TreeView, а также специализированные инструменты иммуноинформатики, такие как EpiMatrix, IMGT/V QUEST для анализа последовательностей IG и TR, IMGT/Collier de Perles и IMGT/StructuralQuery для анализа структуры вариабельных доменов IG. Методы, основанные на сравнении последовательностей, разнообразны и применяются для анализа консервации последовательностей HLA, подтверждения происхождения последовательностей вируса иммунодефицита человека (ВИЧ) и построения гомологичных моделей для анализа резистентности полимеразы вируса гепатита B к ламивудину и эмтрицитабину. Также существуют вычислительные модели, ориентированные на белок-белковые взаимодействия и сети. Доступны инструменты для картирования Т- и В-клеточных эпитопов, прогнозирования участков расщепления протеасомой и прогнозирования пептидов, транспортируемых TAP. Экспериментальные данные имеют решающее значение для разработки и обоснования моделей, предназначенных для прогнозирования различных молекулярных мишеней. Инструменты вычислительной иммунологии представляют собой сочетание экспериментальных данных и математически разработанных вычислительных методов.

Аллергия

Аллергия, хотя и является важным разделом иммунологии, также существенно различается у разных людей, а иногда даже у генетически близких особей. Оценка аллергенного потенциала белка сосредоточена на трех основных аспектах: (i) иммуногенности; (ii) перекрестной реактивности; и (iii) клинических проявлениях. Иммуногенность обусловлена реакцией B-клеток, продуцирующих IgE-антитела, и/или T-клеток на конкретный аллерген. Поэтому исследования иммуногенности в основном направлены на выявление участков распознавания аллергенов B- и T-клетками. Трехмерные структурные свойства аллергенов определяют их аллергенность. Использование инструментов иммуноинформатики может быть полезным для прогнозирования аллергенности белков и будет играть все более важную роль в скрининге новых пищевых продуктов перед их широким внедрением для потребления человеком. Таким образом, прилагаются значительные усилия для создания надежных и всеобъемлющих баз данных по аллергии и их объединения с хорошо валидированными инструментами прогнозирования, чтобы обеспечить выявление потенциальных аллергенов в генетически модифицированных лекарствах и продуктах питания. Хотя разработки находятся на начальной стадии, Всемирная организация здравоохранения и Продовольственная и сельскохозяйственная организация ООН предложили руководства по оценке аллергенности генетически модифицированных продуктов питания. Согласно Codex Alimentarius, белок считается потенциально аллергенным, если он имеет идентичность в ≥6 последовательных аминокислот или ≥35% сходства последовательности в окне из 80 аминокислот с известным аллергеном. Несмотря на наличие этих правил, их внутренние ограничения становятся все более очевидными, и о случаях, не соответствующих правилам, сообщалось неоднократно.

Функции иммунной системы

Используя эту технологию, можно понять модель, лежащую в основе иммунной системы. Она была использована для моделирования Т-клеточной супрессии, миграции периферических лимфоцитов, памяти Т-клеток, толерантности, функции тимуса и сетей антител. Модели помогают предсказывать динамику токсичности патогенов и Т-клеточной памяти в ответ на различные стимулы. Существуют также несколько моделей, полезных для понимания природы специфичности в иммунной сети и иммуногенности. Например, это позволило изучить функциональную связь между транспортом пептидов TAP и представлением антигена HLA класса I. TAP – это трансмембранный белок, ответственный за транспорт антигенных пептидов в эндоплазматический ретикулум, где молекулы MHC класса I могут связываться с ними и представлять их Т-клеткам. Поскольку TAP не связывает все пептиды с одинаковой силой, аффинность связывания TAP может влиять на способность конкретного пептида получить доступ к пути MHC класса I. Искусственная нейронная сеть (ANN), компьютерная модель, была использована для изучения связывания пептидов с человеческим TAP и его взаимосвязи со связыванием MHC класса I. С помощью этого метода было обнаружено, что аффинность пептидов, связывающихся с HLA через TAP, различается в зависимости от соответствующего супертипа HLA. Это исследование может иметь важные последствия для разработки иммунотерапевтических препаратов и вакцин на основе пептидов. Это демонстрирует возможности моделирования для понимания сложных иммунных взаимодействий.

Информатика рака

Рак является результатом соматических мутаций, которые дают раковым клеткам селективное преимущество в росте. В последнее время крайне важно выявлять новые мутации. Методы геномики и протеомики используются во всем мире для идентификации мутаций, связанных с каждым конкретным видом рака, и их лечением. Вычислительные инструменты применяются для прогнозирования роста и поверхностных антигенов на раковых клетках. Имеются публикации, описывающие целенаправленный подход к оценке мутаций и риска развития рака. Алгоритм CanPredict использовался для определения степени сходства конкретного гена с известными генами, вызывающими рак. Иммунология рака приобрела такую значимость, что объём данных в этой области стремительно растёт. Сети взаимодействия белков предоставляют ценную информацию о tumorigenesis у человека. Раковые белки демонстрируют сетевую топологию, отличную от топологии нормальных белков в человеческой интерактоме. Иммуноинформатика оказалась полезной для повышения эффективности опухолевой вакцинации. Недавно были проведены новаторские исследования, посвященные анализу динамики иммунной системы организма в ответ на искусственно индуцированный иммунитет, вызванный стратегиями вакцинации. Другие инструменты моделирования используют предсказанные раковые пептиды для прогнозирования иммуноспецифических противораковых реакций, зависящих от конкретного HLA. Вероятно, эти ресурсы значительно расширятся в ближайшем будущем, и иммуноинформатика станет одной из ключевых областей развития в данной сфере.