Введение
Статистика, количественно определяющая связь между двумя событиями.
Коэффициент шансов (OR) – это статистика, которая количественно определяет силу связи между двумя событиями, А и В. Коэффициент шансов определяется как отношение шансов наступления А при наличии В к шансам наступления А при отсутствии В, или, эквивалентно (в силу симметрии), как отношение шансов наступления В при наличии А к шансам наступления В при отсутствии А. Два события независимы тогда и только тогда, когда OR равно 1, то есть шансы наступления одного события одинаковы как при наличии, так и при отсутствии другого события. Если OR больше 1, то А и В связаны (коррелируют) в том смысле, что присутствие В по сравнению с его отсутствием повышает шансы наступления А, и симметрично – присутствие А повышает шансы наступления В. И наоборот, если OR меньше 1, то А и В отрицательно коррелируют, и присутствие одного события снижает шансы наступления другого события. Важно отметить, что коэффициент шансов симметричен по отношению к обоим событиям, и не подразумевает причинно-следственной связи (корреляция не означает причинность): OR больше 1 не доказывает, что В вызывает А, или что А вызывает В. Две схожие статистики, часто используемые для количественной оценки связей, – это относительный риск (RR) и абсолютное снижение риска (ARR). Зачастую параметром, представляющим наибольший интерес, является RR, который представляет собой отношение вероятностей, аналогичное шансам, используемым в OR. Однако, доступные данные часто не позволяют вычислить RR или ARR, но позволяют вычислить OR, например, в когортных исследованиях, как описано ниже. С другой стороны, если одно из событий (А или В) достаточно редкое (в эпидемиологии это называется предположением о редком заболевании), то OR приблизительно равно соответствующему RR. OR играет важную роль в логистической модели.
Интуиция из примера для мирян
Если мы подбросим непредвзятую монету, вероятность выпадения орла и решки равны – обе составляют 50%. Представьте, что у нас есть смещенная монета, которая делает выпадение орла в два раза более вероятным. Но что означает "в два раза более вероятно" с точки зрения вероятности? Это не может означать буквальное удвоение значения вероятности, так как 50% превратится в 100%. Скорее, удваиваются коэффициенты (шансы): с коэффициента 1:1 до коэффициента 2:1.
Мотивирующий пример в контексте предположения о редких заболеваниях
Предположим, что утечка радиации в деревне с населением в 1000 человек привела к увеличению заболеваемости редким заболеванием. Общее число людей, подвергшихся воздействию радиации, составило , из которых у развилось заболевание и остались здоровыми. Общее число людей, не подвергшихся воздействию, составило , из которых у развилось заболевание и остались здоровыми. Мы можем представить эти данные в таблице сопряженности: риск развития заболевания при воздействии равен , а риск развития заболевания при отсутствии воздействия равен . Очевидный способ сравнить риски – использовать их отношение, называемое относительным риском. Коэффициент шансов (odds ratio) отличается. Шансы заболеть при воздействии равны , а шансы заболеть при отсутствии воздействия равны . Коэффициент шансов – это отношение этих двух значений.
The risk of developing the disease given exposure is and of developing the disease given non exposure is One obvious way to compare the risks is to use the ratio of the two, the relative risk. The odds ratio is different. The odds of getting the disease if exposed is and the odds if not exposed is The odds ratio is the ratio of the two,
As illustrated by this example, in a rare disease case like this, the relative risk and the odds ratio are almost the same. By definition, rare disease implies that and Thus, the denominators in the relative risk and odds ratio are almost the same ( and
Relative risk is easier to understand than the odds ratio, but one reason to use odds ratio is that usually, data on the entire population is not available and random sampling must be used. In the example above, if it were very costly to interview villagers and find out if they were exposed to the radiation, then the prevalence of radiation exposure would not be known, and neither would the values of or One could take a random sample of fifty villagers, but quite possibly such a random sample would not include anybody with the disease, since only 2.6% of the population are diseased. Instead, one might use a case control study in which all 26 diseased villagers are interviewed as well as a random sample of 26 who do not have the disease. The results might turn out as follows ("might", because this is a random sample):
The odds in this sample of getting the disease given that someone is exposed is 20/10 and the odds given that someone is not exposed is 6/16. The odds ratio is thus The relative risk, however, cannot be calculated, because it is the ratio of the risks of getting the disease and we would need and to figure those out. Because the study selected for people with the disease, half the people in the sample have the disease and it is known that that is more than the population wide prevalence. It is standard in the medical literature to calculate the odds ratio and then use the rare disease assumption (which is usually reasonable) to claim that the relative risk is approximately equal to it. This not only allows for the use of case control studies, but makes controlling for confounding variables such as weight or age using regression analysis easier and has the desirable properties discussed in other sections of this article of invariance and insensitivity to the type of sampling.
Как показывает этот пример, в случае редкого заболевания, как в данном случае, относительный риск и коэффициент шансов почти одинаковы. По определению, редкое заболевание подразумевает, что и . Таким образом, знаменатели в формулах относительного риска и коэффициента шансов почти одинаковы ( и ).
The risk of developing the disease given exposure is and of developing the disease given non exposure is One obvious way to compare the risks is to use the ratio of the two, the relative risk. The odds ratio is different. The odds of getting the disease if exposed is and the odds if not exposed is The odds ratio is the ratio of the two,
As illustrated by this example, in a rare disease case like this, the relative risk and the odds ratio are almost the same. By definition, rare disease implies that and Thus, the denominators in the relative risk and odds ratio are almost the same ( and
Relative risk is easier to understand than the odds ratio, but one reason to use odds ratio is that usually, data on the entire population is not available and random sampling must be used. In the example above, if it were very costly to interview villagers and find out if they were exposed to the radiation, then the prevalence of radiation exposure would not be known, and neither would the values of or One could take a random sample of fifty villagers, but quite possibly such a random sample would not include anybody with the disease, since only 2.6% of the population are diseased. Instead, one might use a case control study in which all 26 diseased villagers are interviewed as well as a random sample of 26 who do not have the disease. The results might turn out as follows ("might", because this is a random sample):
The odds in this sample of getting the disease given that someone is exposed is 20/10 and the odds given that someone is not exposed is 6/16. The odds ratio is thus The relative risk, however, cannot be calculated, because it is the ratio of the risks of getting the disease and we would need and to figure those out. Because the study selected for people with the disease, half the people in the sample have the disease and it is known that that is more than the population wide prevalence. It is standard in the medical literature to calculate the odds ratio and then use the rare disease assumption (which is usually reasonable) to claim that the relative risk is approximately equal to it. This not only allows for the use of case control studies, but makes controlling for confounding variables such as weight or age using regression analysis easier and has the desirable properties discussed in other sections of this article of invariance and insensitivity to the type of sampling.
Относительный риск легче понять, чем коэффициент шансов, но одна из причин использования коэффициента шансов заключается в том, что данные о всей популяции обычно недоступны, и необходимо использовать случайную выборку. В приведенном выше примере, если бы опрос жителей деревни и выяснение факта их подверженности радиации были очень затратными, то распространенность воздействия радиации была бы неизвестна, и, следовательно, неизвестны были бы значения или . Можно было бы провести случайную выборку из пятидесяти жителей деревни, но вполне возможно, что такая выборка не включала бы ни одного заболевшего, поскольку только 2,6% населения страдает этим заболеванием. Вместо этого можно использовать исследование типа «случай-контроль», в котором опрашиваются все 26 заболевших жителей деревни, а также случайная выборка из 26 здоровых жителей. Результаты могут быть следующими ("могут быть", поскольку это случайная выборка): шансы заболеть в данной выборке при условии воздействия равны 20/10, а шансы заболеть при условии отсутствия воздействия равны 6/16. Коэффициент шансов, таким образом, равен . Однако относительный риск рассчитать нельзя, поскольку он является отношением рисков заболевания, и для этого нам нужно знать и . Поскольку в исследовании отбирались люди с заболеванием, половина выборки страдает этим заболеванием, и известно, что это больше, чем распространенность заболевания в общей популяции. В медицинской литературе принято рассчитывать коэффициент шансов, а затем использовать предположение о редком заболевании (которое обычно обосновано), чтобы утверждать, что относительный риск приблизительно равен ему. Это не только позволяет использовать исследования типа «случай-контроль», но и упрощает контроль за вмешивающимися факторами, такими как вес или возраст, с помощью регрессионного анализа, а также обладает желательными свойствами инвариантности и нечувствительности к типу выборки, которые обсуждаются в других разделах этой статьи.
The risk of developing the disease given exposure is and of developing the disease given non exposure is One obvious way to compare the risks is to use the ratio of the two, the relative risk. The odds ratio is different. The odds of getting the disease if exposed is and the odds if not exposed is The odds ratio is the ratio of the two,
As illustrated by this example, in a rare disease case like this, the relative risk and the odds ratio are almost the same. By definition, rare disease implies that and Thus, the denominators in the relative risk and odds ratio are almost the same ( and
Relative risk is easier to understand than the odds ratio, but one reason to use odds ratio is that usually, data on the entire population is not available and random sampling must be used. In the example above, if it were very costly to interview villagers and find out if they were exposed to the radiation, then the prevalence of radiation exposure would not be known, and neither would the values of or One could take a random sample of fifty villagers, but quite possibly such a random sample would not include anybody with the disease, since only 2.6% of the population are diseased. Instead, one might use a case control study in which all 26 diseased villagers are interviewed as well as a random sample of 26 who do not have the disease. The results might turn out as follows ("might", because this is a random sample):
The odds in this sample of getting the disease given that someone is exposed is 20/10 and the odds given that someone is not exposed is 6/16. The odds ratio is thus The relative risk, however, cannot be calculated, because it is the ratio of the risks of getting the disease and we would need and to figure those out. Because the study selected for people with the disease, half the people in the sample have the disease and it is known that that is more than the population wide prevalence. It is standard in the medical literature to calculate the odds ratio and then use the rare disease assumption (which is usually reasonable) to claim that the relative risk is approximately equal to it. This not only allows for the use of case control studies, but makes controlling for confounding variables such as weight or age using regression analysis easier and has the desirable properties discussed in other sections of this article of invariance and insensitivity to the type of sampling.
Определение в терминах групповых коэффициентов
Коэффициент отношения шансов – это отношение шансов наступления события в одной группе к шансам его наступления в другой группе. Этот термин также используется для обозначения выборочных оценок этого отношения. Эти группы могут быть, например, мужчинами и женщинами, экспериментальной и контрольной группами, или любой другой дихотомической классификацией. Если вероятности события в каждой из групп равны p1 (для первой группы) и p2 (для второй группы), то отношение шансов рассчитывается следующим образом: где qx = 1 − px. Отношение шансов, равное 1, указывает на то, что изучаемое состояние или событие с одинаковой вероятностью может произойти в обеих группах. Отношение шансов, большее 1, указывает на то, что состояние или событие более вероятно произойдет в первой группе. А отношение шансов, меньшее 1, указывает на то, что состояние или событие менее вероятно произойдет в первой группе. Отношение шансов должно быть неотрицательным, если оно определено. Оно не определено, если p2q1 равно нулю, то есть если p2 равно нулю или q1 равно нулю.
where qx = 1 − px. An odds ratio of 1 indicates that the condition or event under study is equally likely to occur in both groups. An odds ratio greater than 1 indicates that the condition or event is more likely to occur in the first group. And an odds ratio less than 1 indicates that the condition or event is less likely to occur in the first group. The odds ratio must be nonnegative if it is defined. It is undefined if p2q1 equals zero, i. e., if p2 equals zero or q1 equals zero.
Роль в логистической регрессии
Логистическая регрессия – это один из способов обобщения отношения шансов на случай, отличный от двух бинарных переменных. Предположим, у нас есть бинарная зависимая переменная Y и бинарная независимая переменная X, а также другие независимые переменные Z1, …, Zp, которые могут быть как бинарными, так и не бинарными. Если мы используем множественную логистическую регрессию для моделирования зависимости Y от X, Z1, …, Zp, то оцененный коэффициент при X связан с условным отношением шансов. В частности, на уровне популяции
, таким образом, является оценкой этого условного отношения шансов. Интерпретация заключается в том, что это оценка отношения шансов между Y и X при фиксированных значениях Z1, …, Zp.
Использование в количественных исследованиях
Из-за широкого использования логистической регрессии, отношение шансов широко применяется во многих областях медицинских и социальных научных исследований. Отношение шансов обычно используется в опросах, в эпидемиологии и для представления результатов некоторых клинических исследований, например, в исследованиях типа «случай-контроль». В отчётах его часто обозначают аббревиатурой "OR". При объединении данных из нескольких опросов, результат часто выражают как "объединённое отношение шансов".
Отношение к относительным рискам
Как объяснено в разделе "Мотивирующий пример", относительный риск обычно предпочтительнее коэффициента шансов для понимания взаимосвязи между риском и какой-либо переменной, такой как радиация или новый препарат. В этом разделе также объясняется, что если выполняется предположение о редкости заболевания, то коэффициент шансов является хорошим приближением к относительному риску и имеет некоторые преимущества перед ним. Когда предположение о редкости заболевания не выполняется, не скорректированный коэффициент шансов может завышать относительный риск, но современные методы позволяют легко использовать те же данные для оценки относительного риска, разности рисков, базовых вероятностей или других показателей. Если известен абсолютный риск в группе, не подвергавшейся воздействию, преобразование между этими двумя показателями рассчитывается следующим образом: Однако большинство авторов считают, что относительный риск легко интерпретируется. В одном исследовании члены национальной организации пациентов в 3,5 раза чаще, чем не члены, слышали о распространенном методе лечения этого заболевания, однако коэффициент шансов составил 24, а в статье утверждалось, что члены были «более чем в 20 раз чаще слышали» об этом методе лечения. Исследование статей, опубликованных в двух журналах, показало, что в 26% статей, использующих коэффициент шансов, он интерпретировался как отношение рисков. Это может отражать простую ситуацию, когда авторы, не понимая сути, выбирают наиболее впечатляющую и подходящую для публикации цифру. Предлагается представлять коэффициент шансов в качестве меры величины эффекта только тогда, когда отношение рисков невозможно оценить напрямую. Другой альтернативный оценщик – оценщик Мантеля-Хензеля.
Связанная статистика
Существует множество других обобщающих статистик для таблиц сопряженности, которые измеряют связь между двумя событиями, такие как Yule's Y и Yule's Q; эти две статистики нормализованы таким образом, что для независимых событий они равны 0, для полностью коррелированных – 1, а для полностью отрицательно коррелированных – -1. Он исследовал их и утверждал, что эти меры ассоциации должны быть функциями отношения шансов, которое он называл отношением перекрестной связи.
Коэффициент вероятности для сопоставимого исследования
Исследование "случай-контроль" включает отбор репрезентативных выборок пациентов с заболеванием ("случаи") и без него ("контроли"). Эти выборки обычно независимы друг от друга. Наблюдается предшествующая распространенность воздействия определенного фактора риска среди участников обеих выборок. Это позволяет оценить отношение шансов развития заболевания у подвергшихся воздействию по сравнению с не подвергшимися воздействию, как указано выше. Однако в некоторых случаях целесообразно сопоставлять "случаи" и "контроли" по одному или нескольким вмешивающимся факторам. В этом случае предшествующее воздействие интересующего фактора определяется для каждого "случая" и соответствующего ему "контроля". Данные можно представить в следующей таблице.