Введение
Ген, предположительно связанный с заболеванием.
Подход, основанный на генах-кандидатах, при проведении исследований генетической ассоциации фокусируется на выявлении связей между генетической изменчивостью в пределах заранее определенных генов, представляющих интерес, и фенотипами или состояниями заболевания. Это отличается от полногеномных исследований ассоциаций (GWAS), которые представляют собой гипотезо-независимый подход, сканирующий весь геном на предмет ассоциаций между распространенными генетическими вариантами (обычно SNP) и интересующими признаками. Гены-кандидаты чаще всего отбираются для изучения на основе априорных знаний о биологической функции гена и его влиянии на рассматриваемый признак или заболевание. Обоснование фокусировки на аллельной изменчивости в конкретных, биологически релевантных областях генома заключается в том, что определенные аллели в пределах гена могут напрямую влиять на функцию этого гена и приводить к вариациям фенотипа или состояния заболевания, которое исследуется. Этот подход часто использует дизайн исследования «случай-контроль», чтобы попытаться ответить на вопрос: «Встречается ли определенный аллель гена-кандидата чаще у пациентов с заболеванием, чем у пациентов без заболевания?» или высоконадежные попытки репликации. Неспособность исследований генов-кандидатов выявить конкретные гены, лежащие в основе таких признаков, объясняется недостаточной статистической мощностью, низкой априорной вероятностью того, что ученые смогут правильно определить конкретный аллель в конкретном гене, связанный с признаком, ненадлежащими методологическими подходами и «копанием» в данных.
The candidate gene approach to conducting genetic association studies focuses on associations between genetic variation within pre specified genes of interest, and phenotypes or disease states. This is in contrast to genome wide association studies (GWAS), which is a hypothesis free approach that scans the entire genome for associations between common genetic variants (typically SNPs) and traits of interest. Candidate genes are most often selected for study based on a priori knowledge of the gene's biological functional impact on the trait or disease in question. The rationale behind focusing on allelic variation in specific, biologically relevant regions of the genome is that certain alleles within a gene may directly impact the function of the gene in question and lead to variation in the phenotype or disease state being investigated. This approach often uses the case control study design to try to answer the question, "Is one allele of a candidate gene more frequently seen in subjects with the disease than in subjects without the disease?" or highly powered replication attempts. The failure of candidate gene studies to shed light on the specific genes underlying such traits has been ascribed to insufficient statistical power, low prior probability that scientists can correctly guess a specific allele within a specific gene that is related to a trait, poor methodological practices, and data dredging.
Выбор
Подходящие гены-кандидаты обычно отбираются на основе известных биологических, физиологических или функциональных связей с рассматриваемым заболеванием. Этот подход ограничен своей зависимостью от существующих знаний о биологии заболевания, как известной, так и теоретической. Однако, современные молекулярные инструменты позволяют глубже понять механизмы развития заболеваний и выявлять потенциальные области интереса в геноме. Исследования полногеномного ассоциирования (GWAS) и картирование количественных признаков (QTL) анализируют общую изменчивость по всему геному и, таким образом, могут обнаружить новые области интереса, расположенные в или рядом с потенциальными генами-кандидатами. Данные микроматриц позволяют исследователям изучать дифференциальную экспрессию генов в группах пациентов и контрольных образцов, что помогает выявить новые потенциальные гены, представляющие интерес. Значительная вариабельность между организмами иногда затрудняет разграничение нормальных вариаций в однонуклеотидных полиморфизмах (SNP) от вариаций, связанных с заболеванием, в генах-кандидатах. При анализе больших объемов данных существует ряд других факторов, способствующих определению наиболее вероятного варианта. К ним относятся приоритетность SNP, относительный риск функциональных изменений в генах и неравновесие сцепления между SNP. Для изучения генов различных видов доступно множество онлайн-баз данных. Gene – одна из таких баз данных, предоставляющая доступ к информации о фенотипах, путях и вариациях многих генов у разных видов. При изучении функциональных взаимодействий между генами в метаболических путях, Консорциум Gene Ontology может помочь в картировании этих связей. Проект GO описывает продукты генов тремя различными способами, независимо от вида: биологические процессы, клеточные компоненты и молекулярные функции. Использование этой информации может расширить априорные знания о пути и, следовательно, помочь в выборе наиболее вероятного гена-кандидата, участвующего в этом пути. Topp Gene – еще одна полезная база данных, позволяющая пользователям расставлять приоритеты генам-кандидатам с помощью функциональных аннотаций или сетевого анализа. ToppGene помогает исследователям выбирать подмножество наиболее вероятных генов-кандидатов из больших наборов, полученных, вероятно, с помощью высокопроизводительных геномных технологий. Lynx – это интегрированная платформа системной биологии, позволяющая пользователям расставлять приоритеты генам-кандидатам, используя как функциональные аннотации, так и сети ассоциаций между генами. Lynx предоставляет два сложных инструмента для приоритизации, Cheetoh и PINTA, помогающие пользователям выбирать гены-кандидаты из всего генома на основе их релевантности входному списку генов, который может представлять собой список известных генов, способствующих определенному заболеванию или фенотипу, или список дифференциально экспрессированных генов, полученных с помощью секвенирования РНК нового поколения.
До подхода к кандидату-гену
До того, как подход, основанный на кандидатных генах, был полностью разработан, для выявления генов, связанных с заболеваниями, использовались различные другие методы. Эти методы изучали генетическую связь и позиционное клонирование посредством генетического скрининга и были эффективны в выявлении генов, определяющих относительный риск при менделевских заболеваниях. Однако при изучении сложных заболеваний эти методы оказываются менее полезными по нескольким причинам: для большинства человеческих заболеваний переменная экспрессивность фенотипа является типичной. Это затрудняет выбор конкретной возрастной группы или фенотипического маркера для включения в исследование.
Критика
Исследование генов-кандидатов стремится сбалансировать использование данных, пытаясь минимизировать вероятность получения ложноположительных или ложноотрицательных результатов. Это требует осторожного отношения к результатам отдельных генетических ассоциаций. Одной из критических замечаний является то, что результаты ассоциаций в исследованиях генов-кандидатов часто трудно воспроизвести в последующих исследованиях. Например, недавнее исследование 18 хорошо изученных генов-кандидатов, связанных с депрессией (каждый из них упоминается в 10 или более публикациях), не выявило значимой связи с депрессией, несмотря на использование выборок на порядки величины больше, чем в исходных публикациях. Помимо статистических проблем (например, недостаточной мощности исследований), стратификация популяции часто рассматривается как причина этой непоследовательности; поэтому необходимо также проявлять осторожность в отношении критериев, определяющих конкретный фенотип, а также других вариаций в дизайне исследования. В исследовании Ким и др. гены, связанные с признаком ожирения у свиней и людей, были идентифицированы с использованием сравнительной геномики и хромосомной наследуемости. Используя эти два метода, исследователи смогли преодолеть критику, заключающуюся в том, что исследования генов-кандидатов основываются исключительно на априорных знаниях. Сравнительная геномика была проведена путем изучения количественных признаков локусов (QTL) человека и свиней с использованием метода, известного как комплексный анализ геномных признаков (GCTA), что позволило исследователям сопоставить генетическую изменчивость с конкретными хромосомами. Это позволило параметру наследуемости пролить свет на то, где наблюдается фенотипическая изменчивость в определенных хромосомных областях, тем самым распространяясь на кандидатные маркеры и гены в этих областях. В других исследованиях также могут использоваться вычислительные методы для поиска генов-кандидатов широким, взаимодополняющим способом, как, например, в исследовании Тиффин и др., посвященном генам, связанным с диабетом 2 типа. Федер разработал целостный подход к изучению Hsp70, гена-кандидата, который, как предполагается, играет роль в адаптации организма к стрессу. *D. melanogaster* является весьма полезным модельным организмом для изучения этого признака благодаря возможности использования разнообразных генетических подходов для изучения гена-кандидата. В рамках этого исследования использовались как генетическая модификация гена-кандидата (с использованием сайт-специфической гомологичной рекомбинации и экспрессии различных белков), так и изучение естественной изменчивости Hsp70. Автор пришел к выводу, что результаты этих исследований дают многогранное представление о Hsp70. Манипуляции с генами-кандидатами также наблюдаются в исследовании Каспара Ч. Чатера, посвященном происхождению и функции устьиц у *Physcomitrella patens*, мха. PpSMF1, PpSMF2 и PpSCRM1 были тремя генами-кандидатами, которые были нокаутированы с помощью гомологичной рекомбинации для выявления каких-либо изменений в развитии устьиц. В эксперименте по нокаутированию Чатер обнаружил, что PpSMF1 и PpSCRM1 отвечают за развитие устьиц у *P. patens*. Путем конструирования и модификации этих генов-кандидатов им удалось подтвердить связь между этим геном и изменением фенотипа. Понимание естественного и исторического контекста, в котором функционируют эти фенотипы, путем изучения структуры естественного генома, дополнило это.