Введение

Статистическая мера величины явления. В статистике размер эффекта – это значение, измеряющее силу связи между двумя переменными в популяции или оценка этой величины на основе выборки. Он может относиться к значению статистики, рассчитанной на основе выборки данных, значению параметра для гипотетической популяции или к уравнению, которое определяет, как статистика или параметры приводят к значению размера эффекта. Примеры размеров эффекта включают корреляцию между двумя переменными, коэффициент регрессии в регрессионном анализе, разность средних или риск наступления определенного события (например, сердечного приступа). Размеры эффектов дополняют статистическое тестирование гипотез и играют важную роль в анализе мощности, планировании объема выборки и мета-анализе. Совокупность методов анализа данных, связанных с размерами эффектов, называется статистикой оценки. Размер эффекта является важным компонентом при оценке силы статистического утверждения и представляет собой первый пункт (величина) в критериях MAGIC. Стандартное отклонение размера эффекта имеет критическое значение, поскольку оно указывает на степень неопределенности в измерении. Слишком большое стандартное отклонение делает измерение практически бессмысленным. В мета-анализе, где целью является объединение нескольких размеров эффектов, неопределенность в размере эффекта используется для взвешивания размеров эффектов, так что более крупные исследования считаются более значимыми, чем небольшие. Неопределенность в размере эффекта рассчитывается по-разному для каждого типа размера эффекта, но обычно требует знания только размера выборки исследования (N) или количества наблюдений (n) в каждой группе. Сообщение о размерах эффектов или их оценках (оценка эффекта [EE], оценка эффекта) считается хорошей практикой при представлении результатов эмпирических исследований во многих областях. Сообщение о размерах эффектов облегчает интерпретацию важности результата исследования, в отличие от его статистической значимости. Размеры эффектов особенно важны в социальных науках и медицинских исследованиях (где величина эффекта лечения имеет значение). Размеры эффектов могут измеряться в относительных или абсолютных величинах. В случае относительных размеров эффектов две группы сравниваются непосредственно друг с другом, как в отношении шансов и относительных рисках. Для абсолютных размеров эффектов большее абсолютное значение всегда указывает на более сильный эффект. Многие типы измерений могут быть выражены как в абсолютных, так и в относительных величинах, и их можно использовать вместе, поскольку они передают разную информацию. Авторитетная рабочая группа в психологическом исследовательском сообществе дала следующую рекомендацию:

Цитата: «Всегда представляйте размеры эффекта для основных результатов. Если единицы измерения имеют практическое значение (например, количество выкуриваемых сигарет в день), то мы обычно предпочитаем нестандартизированную меру (регрессионный коэффициент или разность средних) стандартизированной мере (r или d).» Другой пример, когда размеры эффекта могут быть искажены, – это эксперимент с несколькими испытаниями, где расчет размера эффекта основан на усредненном или агрегированном ответе по всем испытаниям. Небольшие исследования иногда показывают другие, часто более крупные, размеры эффекта, чем более крупные исследования. Это явление известно как эффект небольшого исследования, который может указывать на предвзятость публикаций.

Связь со статистикой испытаний

Размеры эффекта, рассчитанные на основе выборки, отличаются от тестовых статистик, используемых в проверке гипотез, тем, что они оценивают силу (величину) какого-либо, например, видимого взаимосвязи, а не определяют уровень значимости, отражающий вероятность того, что наблюдаемая величина взаимосвязи могла возникнуть случайно. Размер эффекта не определяет напрямую уровень значимости, и наоборот. При достаточно большом размере выборки любое ненулевое статистическое сравнение всегда покажет статистически значимый результат, если только размер эффекта в генеральной совокупности не равен нулю (и даже в этом случае статистическая значимость будет проявляться с частотой, соответствующей уровню ошибки первого рода). Например, выборочный коэффициент корреляции Пирсона, равный 0,01, будет статистически значимым при размере выборки 1000. Сообщение только о значимом p-значении из этого анализа может быть вводящим в заблуждение, если корреляция 0,01 слишком мала, чтобы представлять интерес в конкретной области применения.

Интерпретация

Следует ли интерпретировать размер эффекта как малый, средний или большой, зависит от его предметной области и операционального определения. Коэн отметил, что при использовании его общепринятых критериев для "среднего" размера эффекта, "вы выберете тот же размер выборки независимо от точности или надежности вашего инструмента, или от однородности или разнообразия вашей выборки. Очевидно, что здесь игнорируются важные соображения. Исследователи должны интерпретировать практическую значимость своих результатов, опираясь на осмысленный контекст или оценивая количественно их вклад в знания, а описания размера эффекта Коэна могут служить полезной отправной точкой". Они предложили, что "адекватными нормами являются те, которые основаны на распределении размеров эффектов для сопоставимых показателей результатов, полученных в результате сопоставимых вмешательств, направленных на сопоставимые выборки". Таким образом, если исследование в области, где большинство вмешательств дают незначительный эффект, показало небольшой эффект (по критериям Коэна), эти новые критерии назвали бы его "большим". См. также парадокс Абельсона и парадокс Савиловского.

Типы

Известно примерно от 50 до 100 различных показателей размера эффекта. Многие показатели размера эффекта разных типов можно преобразовать в другие, поскольку многие из них оценивают различие между двумя распределениями и, следовательно, математически связаны. Например, коэффициент корреляции можно преобразовать в d Коэна и наоборот.

Семейство корреляции: размеры эффектов, основанные на "объясненном отклонении"

Эти размеры эффекта оценивают долю дисперсии в эксперименте, которая "объясняется" или "учитывается" моделью эксперимента (объясненная дисперсия).

Коэффициент корреляции

Корреляция Пирсона, часто обозначаемая r и введенная Карлом Пирсоном, широко используется в качестве меры размера эффекта при наличии парных количественных данных; например, при изучении связи между весом при рождении и продолжительностью жизни. Коэффициент корреляции также может применяться к бинарным данным. Значение r Пирсона может изменяться от -1 до 1, где -1 указывает на идеальную отрицательную линейную зависимость, 1 – на идеальную положительную линейную зависимость, а 0 – на отсутствие линейной зависимости между двумя переменными. Коэн предлагает следующие ориентиры для социальных наук:

Размер эффекта r Малый 0,10 Средний 0,30 Большой 0,50

Коэффициент определения (r2 или R2)

Относительной мерой эффекта является r², коэффициент детерминации (также называемый R² или "r в квадрате"), вычисляемый как квадрат коэффициента корреляции Пирсона r. В случае парных данных это показатель доли общей дисперсии двух переменных, изменяющийся от 0 до 1. Например, при r = 0,21 коэффициент детерминации равен 0,0441, что означает, что 4,4% дисперсии каждой из переменных объясняется другой переменной. r² всегда положительный, поэтому не указывает направление корреляции между двумя переменными.

Эта в квадрате (η2)

Эта квадрата описывает отношение дисперсии зависимой переменной, объясненное предиктором, при контроле за другими предикторами, что делает его аналогичным r². Эта квадрата является смещенной оценкой дисперсии, объясненной моделью в генеральной совокупности (она оценивает только размер эффекта в выборке). Эта оценка имеет тот же недостаток, что и r²: добавление каждой новой переменной автоматически увеличивает значение η². Кроме того, она измеряет дисперсию, объясненную в выборке, а не в генеральной совокупности, что означает, что она всегда будет переоценивать размер эффекта, хотя эта смещенность уменьшается с увеличением размера выборки.

Стекло" Δ

В 1976 году Джин В. Гласс предложил оценку размера эффекта, использующую только стандартное отклонение второй группы. Подобно другим показателям, основанным на стандартизированной разнице, CRT (кластерная рандомизированная схема) предполагает рандомизацию кластеров, таких как школы или классы, по различным условиям и часто применяется в образовательных исследованиях.

Ψ, стандартный эффект среднеквадратичного корня

Аналогичным оценщиком размера эффекта для множественных сравнений (например, ANOVA) является стандартизованное среднее квадратичное отклонение эффекта, вычисленное как корень из Ψ.

Омега Коэна (ω)

Другой показатель величины эффекта, используемый для критерия хи-квадрат, – омега Коэна. Он определяется как

где p0i – доля i-й ячейки при нулевой гипотезе (H0), p1i – доля i-й ячейки при альтернативной гипотезе (H1), а m – количество ячеек. В книге «Анализ статистической мощности в поведенческих науках» (1988, с. 224–225) Коэн предлагает следующие общие рекомендации по интерпретации омега (см. таблицу ниже), но предостерегает от ее «возможной неадекватности в конкретном контексте» и советует вместо этого руководствоваться содержательной значимостью.

Размер эффекта: Малый – 0,10; Средний – 0,30; Большой – 0,50.

Коэффициент шансов

Коэффициент шансов (OR) – еще один полезный показатель размера эффекта. Он уместен, когда исследовательский вопрос фокусируется на степени связи между двумя бинарными переменными. Например, рассмотрим исследование навыков правописания. В контрольной группе два ученика сдают курс за каждого, кто не сдал, таким образом, шансы сдать равны два к одному (или 2/1 = 2). В экспериментальной группе шесть учеников сдают курс на каждого, кто не сдал, следовательно, шансы сдать равны шесть к одному (или 6/1 = 6). Размер эффекта можно вычислить, заметив, что шансы сдать в экспериментальной группе в три раза выше, чем в контрольной группе (потому что 6, деленное на 2, равно 3). Таким образом, коэффициент шансов равен 3. Статистики коэффициента шансов используют другую шкалу, чем d Коэна, поэтому эта «3» не сопоставима с d Коэна, равным 3.

Относительный риск

Относительный риск (RR), также называемый коэффициентом риска, – это просто риск (вероятность) наступления события по отношению к некоторой независимой переменной. Эта мера эффекта отличается от отношения шансов тем, что она сравнивает вероятности, а не шансы, но асимптотически приближается к последнему при малых вероятностях. Используя приведенный выше пример, вероятность успешного результата для участников контрольной и лечебной групп составляет 2/3 (или 0,67) и 6/7 (или 0,86) соответственно. Эффект можно вычислить так же, как и ранее, но используя вероятности. Следовательно, относительный риск равен 1,28. Поскольку использовались достаточно высокие вероятности успеха, разница между относительным риском и отношением шансов значительна. Если бы в качестве события рассматривалась неудача (с меньшей вероятностью), а не успех, разница между этими двумя мерами эффекта была бы не такой большой. Обе меры полезны, но имеют различные статистические применения. В медицинских исследованиях отношение шансов обычно используется в исследованиях типа «случай-контроль», поскольку обычно оцениваются именно шансы, а не вероятности. Относительный риск обычно используется в рандомизированных контролируемых исследованиях и когортных исследованиях, однако относительный риск может приводить к завышению оценки эффективности вмешательств.

Доверительные интервалы с помощью параметров нецентральности

Доверительные интервалы стандартизированных мер эффекта, особенно d Коэна и η², основаны на вычислении доверительных интервалов для параметров нецентральности (ncp). Распространенный подход к построению доверительного интервала для ncp заключается в определении критических значений ncp, соответствующих хвостовым квантилям α/2 и (1 − α/2) для наблюдаемой статистики. Пакеты SAS и R MBESS предоставляют функции для поиска критических значений ncp.