Введение
Вероятность совершения ошибок I рода при проведении множественных проверок гипотез.
В статистике, уровень значимости для семейства ошибок (FWER) – это вероятность совершения одной или нескольких ложных открытий, или ошибок I рода, при проведении множественных проверок гипотез.
Ошибки в семейных и экспериментальных исследованиях
Джон Туки разработал в 1953 году концепцию уровня ошибок для семейства тестов как вероятность совершения ошибки I рода среди заданной группы, или "семьи" тестов. Райан (1959) предложил связанную концепцию уровня ошибок для эксперимента, который представляет собой вероятность совершения ошибки I рода в данном эксперименте. Таким образом, уровень ошибок для эксперимента является уровнем ошибок для семейства тестов, где семейство включает все тесты, проводимые в рамках эксперимента. Как объяснил Райан (1959, примечание 3), эксперимент может содержать два или более семейства множественных сравнений, каждое из которых относится к конкретному статистическому выводу и каждое из которых имеет свой собственный отдельный уровень ошибок для семейства.
Процедуры контроля
Существуют как классические решения, обеспечивающие строгий контроль FWER, так и более новые разработки.
Процедура Шидака
Проверка каждой гипотезы на уровне α – это поправка Сидака для множественных сравнений. Эта процедура обладает большей мощностью, чем поправка Бонферрони, но прирост мощности невелик. Эта процедура может не обеспечивать контроль над семейной вероятностью ошибки (FWER), если тесты отрицательно зависимы.
Процедура Туки
Процедура Тьюки применима только для попарных сравнений. Она предполагает независимость проверяемых наблюдений, а также однородность дисперсии (гомоскедастичность). Процедура вычисляет для каждой пары статистику студентизированного размаха: где – большее из двух сравниваемых средних, – меньшее, а – стандартная ошибка для рассматриваемых данных. Тест Тьюки по сути является t-критерием Стьюдента, но с поправкой на ошибку первого рода для множественных сравнений.
Исправление Даннетта
Чарльз Даннетт (1955, 1966) описал альтернативный способ корректировки уровня значимости альфа при сравнении k групп с одной и той же контрольной группой. В настоящее время известный как тест Даннетта, этот метод менее строг, чем поправка Бонферрони.
Процедуры переотбора образцов
Процедуры Бонферрони и Холма контролируют FWER при любой структуре зависимости p-значений (или, эквивалентно, индивидуальных статистик проверки гипотез). По сути, это достигается за счет учета структуры зависимости «наихудшего случая» (которая близка к независимости для большинства практических целей). Однако такой подход оказывается излишне консервативным, если зависимость на самом деле положительная. В качестве крайнего примера, при полной положительной зависимости фактически проводится только один тест, и, следовательно, FWER не завышается. Учет структуры зависимости p-значений (или индивидуальных статистик проверки гипотез) позволяет получить более мощные процедуры. Этого можно достичь, применяя методы перевыборки, такие как бутстрап и перестановки. Процедура Westfall и Young (1993) требует выполнения определенного условия, которое не всегда соблюдается на практике (а именно, пивотальность подмножеств). Процедуры Romano и Wolf (2005a,b) не требуют этого условия и, следовательно, обладают большей общей применимостью.
Процедура среднего гармонического значения p
Процедура гармонического среднего значения p (HMP) предоставляет многоуровневый тест, который превосходит по мощности коррекцию Бонферрони, оценивая значимость групп гипотез при контроле ошибки первого рода в сильном смысле. Значимость любого подмножества тестов оценивается путем вычисления HMP для этого подмножества, где веса суммируются до единицы (т.е. ). Приблизительная процедура, контролирующая ошибку первого рода в сильном смысле на уровне приблизительно α, отвергает нулевую гипотезу об отсутствии значимых p-значений в подмножестве, когда HMP < (где ). Это приближение обосновано для малых значений α (например, 0.05) и становится сколь угодно точным при α, стремящемся к нулю. Также доступен асимптотически точный тест (см. основную статью).
Альтернативные подходы
Контроль FWER обеспечивает более жесткий контроль над ложноположительными результатами по сравнению с процедурами контроля частоты ложных открытий (FDR). Контроль FWER ограничивает вероятность хотя бы одного ложноположительного результата, в то время как контроль FDR ограничивает (в широком смысле) ожидаемую долю ложноположительных результатов. Таким образом, процедуры FDR обладают большей мощностью, но за счет увеличения вероятности ошибок первого рода, то есть отклонения верных нулевых гипотез. С другой стороны, контроль FWER менее строг, чем контроль уровня ошибок для всей совокупности, который ограничивает ожидаемое число ошибок в совокупности. Поскольку контроль FWER связан с вероятностью хотя бы одного ложноположительного результата, он, в отличие от контроля уровня ошибок для всей совокупности, не считает множественные одновременные ложноположительные результаты более серьезными, чем одно ложноположительное. Коррекция Бонферрони часто рассматривается как средство контроля только FWER, но на самом деле она также контролирует уровень ошибок для всей совокупности.