Введение
Статистическая мера величины явления. В статистике размер эффекта – это значение, измеряющее силу связи между двумя переменными в популяции или оценка этой величины на основе выборки. Он может относиться к значению статистики, рассчитанной на основе выборки данных, значению параметра для гипотетической популяции или к уравнению, которое определяет, как статистика или параметры приводят к значению размера эффекта. Примеры размеров эффекта включают корреляцию между двумя переменными, коэффициент регрессии в регрессионном анализе, разность средних или риск наступления определенного события (например, сердечного приступа). Размеры эффектов дополняют статистическое тестирование гипотез и играют важную роль в анализе мощности, планировании объема выборки и мета-анализе. Совокупность методов анализа данных, связанных с размерами эффектов, называется статистикой оценки. Размер эффекта является важным компонентом при оценке силы статистического утверждения и представляет собой первый пункт (величина) в критериях MAGIC. Стандартное отклонение размера эффекта имеет критическое значение, поскольку оно указывает на степень неопределенности в измерении. Слишком большое стандартное отклонение делает измерение практически бессмысленным. В мета-анализе, где целью является объединение нескольких размеров эффектов, неопределенность в размере эффекта используется для взвешивания размеров эффектов, так что более крупные исследования считаются более значимыми, чем небольшие. Неопределенность в размере эффекта рассчитывается по-разному для каждого типа размера эффекта, но обычно требует знания только размера выборки исследования (N) или количества наблюдений (n) в каждой группе. Сообщение о размерах эффектов или их оценках (оценка эффекта [EE], оценка эффекта) считается хорошей практикой при представлении результатов эмпирических исследований во многих областях. Сообщение о размерах эффектов облегчает интерпретацию важности результата исследования, в отличие от его статистической значимости. Размеры эффектов особенно важны в социальных науках и медицинских исследованиях (где величина эффекта лечения имеет значение). Размеры эффектов могут измеряться в относительных или абсолютных величинах. В случае относительных размеров эффектов две группы сравниваются непосредственно друг с другом, как в отношении шансов и относительных рисках. Для абсолютных размеров эффектов большее абсолютное значение всегда указывает на более сильный эффект. Многие типы измерений могут быть выражены как в абсолютных, так и в относительных величинах, и их можно использовать вместе, поскольку они передают разную информацию. Авторитетная рабочая группа в психологическом исследовательском сообществе дала следующую рекомендацию:
In statistics, an effect size is a value measuring the strength of the relationship between two variables in a population, or a sample based estimate of that quantity. It can refer to the value of a statistic calculated from a sample of data, the value of a parameter for a hypothetical population, or to the equation that operationalizes how statistics or parameters lead to the effect size value. Examples of effect sizes include the correlation between two variables, the regression coefficient in a regression, the mean difference, or the risk of a particular event (such as a heart attack) happening. Effect sizes complement statistical hypothesis testing, and play an important role in power analyses, sample size planning, and in meta analyses. The cluster of data analysis methods concerning effect sizes is referred to as estimation statistics. Effect size is an essential component when evaluating the strength of a statistical claim, and it is the first item (magnitude) in the MAGIC criteria. The standard deviation of the effect size is of critical importance, since it indicates how much uncertainty is included in the measurement. A standard deviation that is too large will make the measurement nearly meaningless. In meta analysis, where the purpose is to combine multiple effect sizes, the uncertainty in the effect size is used to weigh effect sizes, so that large studies are considered more important than small studies. The uncertainty in the effect size is calculated differently for each type of effect size, but generally only requires knowing the study's sample size (N), or the number of observations (n) in each group. Reporting effect sizes or estimates thereof (effect estimate [EE], estimate of effect) is considered good practice when presenting empirical research findings in many fields. The reporting of effect sizes facilitates the interpretation of the importance of a research result, in contrast to its statistical significance. Effect sizes are particularly prominent in social science and in medical research (where size of treatment effect is important). Effect sizes may be measured in relative or absolute terms. In relative effect sizes, two groups are directly compared with each other, as in odds ratios and relative risks. For absolute effect sizes, a larger absolute value always indicates a stronger effect. Many types of measurements can be expressed as either absolute or relative, and these can be used together because they convey different information. A prominent task force in the psychology research community made the following recommendation:
Quotation|Always present effect sizes for primary outcomes If the units of measurement are meaningful on a practical level (e. g., number of cigarettes smoked per day), then we usually prefer an unstandardized measure (regression coefficient or mean difference) to a standardized measure (r or d). Another example where effect sizes may be distorted is in a multiple trial experiment, where the effect size calculation is based on the averaged or aggregated response across the trials. Smaller studies sometimes show different, often larger, effect sizes than larger studies. This phenomenon is known as the small study effect, which may signal publication bias.
Цитата: «Всегда представляйте размеры эффекта для основных результатов. Если единицы измерения имеют практическое значение (например, количество выкуриваемых сигарет в день), то мы обычно предпочитаем нестандартизированную меру (регрессионный коэффициент или разность средних) стандартизированной мере (r или d).» Другой пример, когда размеры эффекта могут быть искажены, – это эксперимент с несколькими испытаниями, где расчет размера эффекта основан на усредненном или агрегированном ответе по всем испытаниям. Небольшие исследования иногда показывают другие, часто более крупные, размеры эффекта, чем более крупные исследования. Это явление известно как эффект небольшого исследования, который может указывать на предвзятость публикаций.
In statistics, an effect size is a value measuring the strength of the relationship between two variables in a population, or a sample based estimate of that quantity. It can refer to the value of a statistic calculated from a sample of data, the value of a parameter for a hypothetical population, or to the equation that operationalizes how statistics or parameters lead to the effect size value. Examples of effect sizes include the correlation between two variables, the regression coefficient in a regression, the mean difference, or the risk of a particular event (such as a heart attack) happening. Effect sizes complement statistical hypothesis testing, and play an important role in power analyses, sample size planning, and in meta analyses. The cluster of data analysis methods concerning effect sizes is referred to as estimation statistics. Effect size is an essential component when evaluating the strength of a statistical claim, and it is the first item (magnitude) in the MAGIC criteria. The standard deviation of the effect size is of critical importance, since it indicates how much uncertainty is included in the measurement. A standard deviation that is too large will make the measurement nearly meaningless. In meta analysis, where the purpose is to combine multiple effect sizes, the uncertainty in the effect size is used to weigh effect sizes, so that large studies are considered more important than small studies. The uncertainty in the effect size is calculated differently for each type of effect size, but generally only requires knowing the study's sample size (N), or the number of observations (n) in each group. Reporting effect sizes or estimates thereof (effect estimate [EE], estimate of effect) is considered good practice when presenting empirical research findings in many fields. The reporting of effect sizes facilitates the interpretation of the importance of a research result, in contrast to its statistical significance. Effect sizes are particularly prominent in social science and in medical research (where size of treatment effect is important). Effect sizes may be measured in relative or absolute terms. In relative effect sizes, two groups are directly compared with each other, as in odds ratios and relative risks. For absolute effect sizes, a larger absolute value always indicates a stronger effect. Many types of measurements can be expressed as either absolute or relative, and these can be used together because they convey different information. A prominent task force in the psychology research community made the following recommendation:
Quotation|Always present effect sizes for primary outcomes If the units of measurement are meaningful on a practical level (e. g., number of cigarettes smoked per day), then we usually prefer an unstandardized measure (regression coefficient or mean difference) to a standardized measure (r or d). Another example where effect sizes may be distorted is in a multiple trial experiment, where the effect size calculation is based on the averaged or aggregated response across the trials. Smaller studies sometimes show different, often larger, effect sizes than larger studies. This phenomenon is known as the small study effect, which may signal publication bias.
Связь со статистикой испытаний
Размеры эффекта, рассчитанные на основе выборки, отличаются от тестовых статистик, используемых в проверке гипотез, тем, что они оценивают силу (величину) какого-либо, например, видимого взаимосвязи, а не определяют уровень значимости, отражающий вероятность того, что наблюдаемая величина взаимосвязи могла возникнуть случайно. Размер эффекта не определяет напрямую уровень значимости, и наоборот. При достаточно большом размере выборки любое ненулевое статистическое сравнение всегда покажет статистически значимый результат, если только размер эффекта в генеральной совокупности не равен нулю (и даже в этом случае статистическая значимость будет проявляться с частотой, соответствующей уровню ошибки первого рода). Например, выборочный коэффициент корреляции Пирсона, равный 0,01, будет статистически значимым при размере выборки 1000. Сообщение только о значимом p-значении из этого анализа может быть вводящим в заблуждение, если корреляция 0,01 слишком мала, чтобы представлять интерес в конкретной области применения.
Интерпретация
Следует ли интерпретировать размер эффекта как малый, средний или большой, зависит от его предметной области и операционального определения. Коэн отметил, что при использовании его общепринятых критериев для "среднего" размера эффекта, "вы выберете тот же размер выборки независимо от точности или надежности вашего инструмента, или от однородности или разнообразия вашей выборки. Очевидно, что здесь игнорируются важные соображения. Исследователи должны интерпретировать практическую значимость своих результатов, опираясь на осмысленный контекст или оценивая количественно их вклад в знания, а описания размера эффекта Коэна могут служить полезной отправной точкой". Они предложили, что "адекватными нормами являются те, которые основаны на распределении размеров эффектов для сопоставимых показателей результатов, полученных в результате сопоставимых вмешательств, направленных на сопоставимые выборки". Таким образом, если исследование в области, где большинство вмешательств дают незначительный эффект, показало небольшой эффект (по критериям Коэна), эти новые критерии назвали бы его "большим". См. также парадокс Абельсона и парадокс Савиловского.
Типы
Известно примерно от 50 до 100 различных показателей размера эффекта. Многие показатели размера эффекта разных типов можно преобразовать в другие, поскольку многие из них оценивают различие между двумя распределениями и, следовательно, математически связаны. Например, коэффициент корреляции можно преобразовать в d Коэна и наоборот.
Семейство корреляции: размеры эффектов, основанные на "объясненном отклонении"
Эти размеры эффекта оценивают долю дисперсии в эксперименте, которая "объясняется" или "учитывается" моделью эксперимента (объясненная дисперсия).
Коэффициент корреляции
Корреляция Пирсона, часто обозначаемая r и введенная Карлом Пирсоном, широко используется в качестве меры размера эффекта при наличии парных количественных данных; например, при изучении связи между весом при рождении и продолжительностью жизни. Коэффициент корреляции также может применяться к бинарным данным. Значение r Пирсона может изменяться от -1 до 1, где -1 указывает на идеальную отрицательную линейную зависимость, 1 – на идеальную положительную линейную зависимость, а 0 – на отсутствие линейной зависимости между двумя переменными. Коэн предлагает следующие ориентиры для социальных наук:
Размер эффекта r Малый 0,10 Средний 0,30 Большой 0,50
Коэффициент определения (r2 или R2)
Относительной мерой эффекта является r², коэффициент детерминации (также называемый R² или "r в квадрате"), вычисляемый как квадрат коэффициента корреляции Пирсона r. В случае парных данных это показатель доли общей дисперсии двух переменных, изменяющийся от 0 до 1. Например, при r = 0,21 коэффициент детерминации равен 0,0441, что означает, что 4,4% дисперсии каждой из переменных объясняется другой переменной. r² всегда положительный, поэтому не указывает направление корреляции между двумя переменными.
Эта в квадрате (η2)
Эта квадрата описывает отношение дисперсии зависимой переменной, объясненное предиктором, при контроле за другими предикторами, что делает его аналогичным r². Эта квадрата является смещенной оценкой дисперсии, объясненной моделью в генеральной совокупности (она оценивает только размер эффекта в выборке). Эта оценка имеет тот же недостаток, что и r²: добавление каждой новой переменной автоматически увеличивает значение η². Кроме того, она измеряет дисперсию, объясненную в выборке, а не в генеральной совокупности, что означает, что она всегда будет переоценивать размер эффекта, хотя эта смещенность уменьшается с увеличением размера выборки.
Стекло" Δ
В 1976 году Джин В. Гласс предложил оценку размера эффекта, использующую только стандартное отклонение второй группы. Подобно другим показателям, основанным на стандартизированной разнице, CRT (кластерная рандомизированная схема) предполагает рандомизацию кластеров, таких как школы или классы, по различным условиям и часто применяется в образовательных исследованиях.
is like the other measures based on a standardized difference CRTs involve randomising clusters, such as schools or classrooms, to different conditions and are frequently used in education research.
Ψ, стандартный эффект среднеквадратичного корня
Аналогичным оценщиком размера эффекта для множественных сравнений (например, ANOVA) является стандартизованное среднее квадратичное отклонение эффекта, вычисленное как корень из Ψ.
Омега Коэна (ω)
Другой показатель величины эффекта, используемый для критерия хи-квадрат, – омега Коэна. Он определяется как
where p0i is the proportion of the ith cell under H0, p1i is the proportion of the ith cell under H1 and m is the number of cells. In Statistical Power Analysis for the Behavioral Sciences (1988, pp.224 225), Cohen gives the following general guideline for interpreting omega (see table below), but warns against its "possible inaptness in any given substantive context" and advises to use context relevant judgment instead. Effect Size Small 0.10Medium 0.30Large 0.50
где p0i – доля i-й ячейки при нулевой гипотезе (H0), p1i – доля i-й ячейки при альтернативной гипотезе (H1), а m – количество ячеек. В книге «Анализ статистической мощности в поведенческих науках» (1988, с. 224–225) Коэн предлагает следующие общие рекомендации по интерпретации омега (см. таблицу ниже), но предостерегает от ее «возможной неадекватности в конкретном контексте» и советует вместо этого руководствоваться содержательной значимостью.
where p0i is the proportion of the ith cell under H0, p1i is the proportion of the ith cell under H1 and m is the number of cells. In Statistical Power Analysis for the Behavioral Sciences (1988, pp.224 225), Cohen gives the following general guideline for interpreting omega (see table below), but warns against its "possible inaptness in any given substantive context" and advises to use context relevant judgment instead. Effect Size Small 0.10Medium 0.30Large 0.50
Размер эффекта: Малый – 0,10; Средний – 0,30; Большой – 0,50.
where p0i is the proportion of the ith cell under H0, p1i is the proportion of the ith cell under H1 and m is the number of cells. In Statistical Power Analysis for the Behavioral Sciences (1988, pp.224 225), Cohen gives the following general guideline for interpreting omega (see table below), but warns against its "possible inaptness in any given substantive context" and advises to use context relevant judgment instead. Effect Size Small 0.10Medium 0.30Large 0.50
Коэффициент шансов
Коэффициент шансов (OR) – еще один полезный показатель размера эффекта. Он уместен, когда исследовательский вопрос фокусируется на степени связи между двумя бинарными переменными. Например, рассмотрим исследование навыков правописания. В контрольной группе два ученика сдают курс за каждого, кто не сдал, таким образом, шансы сдать равны два к одному (или 2/1 = 2). В экспериментальной группе шесть учеников сдают курс на каждого, кто не сдал, следовательно, шансы сдать равны шесть к одному (или 6/1 = 6). Размер эффекта можно вычислить, заметив, что шансы сдать в экспериментальной группе в три раза выше, чем в контрольной группе (потому что 6, деленное на 2, равно 3). Таким образом, коэффициент шансов равен 3. Статистики коэффициента шансов используют другую шкалу, чем d Коэна, поэтому эта «3» не сопоставима с d Коэна, равным 3.
Относительный риск
Относительный риск (RR), также называемый коэффициентом риска, – это просто риск (вероятность) наступления события по отношению к некоторой независимой переменной. Эта мера эффекта отличается от отношения шансов тем, что она сравнивает вероятности, а не шансы, но асимптотически приближается к последнему при малых вероятностях. Используя приведенный выше пример, вероятность успешного результата для участников контрольной и лечебной групп составляет 2/3 (или 0,67) и 6/7 (или 0,86) соответственно. Эффект можно вычислить так же, как и ранее, но используя вероятности. Следовательно, относительный риск равен 1,28. Поскольку использовались достаточно высокие вероятности успеха, разница между относительным риском и отношением шансов значительна. Если бы в качестве события рассматривалась неудача (с меньшей вероятностью), а не успех, разница между этими двумя мерами эффекта была бы не такой большой. Обе меры полезны, но имеют различные статистические применения. В медицинских исследованиях отношение шансов обычно используется в исследованиях типа «случай-контроль», поскольку обычно оцениваются именно шансы, а не вероятности. Относительный риск обычно используется в рандомизированных контролируемых исследованиях и когортных исследованиях, однако относительный риск может приводить к завышению оценки эффективности вмешательств.
Доверительные интервалы с помощью параметров нецентральности
Доверительные интервалы стандартизированных мер эффекта, особенно d Коэна и η², основаны на вычислении доверительных интервалов для параметров нецентральности (ncp). Распространенный подход к построению доверительного интервала для ncp заключается в определении критических значений ncp, соответствующих хвостовым квантилям α/2 и (1 − α/2) для наблюдаемой статистики. Пакеты SAS и R MBESS предоставляют функции для поиска критических значений ncp.