Введение

Понятие в инференциальной статистике.
В статистическом проверке гипотез результат считается статистически значимым, если результат, по крайней мере, столь же "экстремальный", был бы крайне маловероятен, если бы нулевая гипотеза была верна. P-значение результата – это вероятность получения результата, по крайней мере, столь же экстремального, при условии, что нулевая гипотеза верна. Результат признается статистически значимым, согласно стандартам исследования, когда p-значение меньше или равно уровню значимости. Уровень значимости для исследования выбирается до сбора данных и обычно устанавливается на уровне 5% или ниже – в зависимости от области исследования. В любом эксперименте или наблюдении, включающем выборку из генеральной совокупности, всегда существует вероятность того, что наблюдаемый эффект возник исключительно из-за ошибки выборки. Однако, если p-значение наблюдаемого эффекта меньше или равно уровню значимости, исследователь может заключить, что эффект отражает характеристики всей генеральной совокупности.

Метод проверки статистической значимости результатов был разработан в начале XX века. Термин "значимость" здесь не подразумевает важность, и статистическая значимость отличается от исследовательской, теоретической или практической значимости. Например, термин "клиническая значимость" относится к практической важности эффекта лечения.

История

Статистическая значимость берет начало в 18 веке в работах Джона Арбутнота и Пьера Симона Лапласа, которые вычислили p-значение для соотношения полов у человека при рождении, исходя из нулевой гипотезы о равной вероятности рождения мальчиков и девочек; подробности см. В 1925 году Рональд Фишер развил идею статистического тестирования гипотез, которую он назвал «тестами значимости», в своей публикации «Статистические методы для научных работников». Фишер предложил вероятность, равную одной из двадцати (0,05), в качестве удобного порогового значения для отклонения нулевой гипотезы. В статье 1933 года Ежи Нейман и Эгон Пирсон назвали этот порог уровнем значимости и рекомендовали устанавливать его заранее, до начала сбора данных. Несмотря на первоначальное предложение Фишера использовать значение 0,05 в качестве уровня значимости, он не предполагал, что это значение должно быть фиксированным. В своей публикации 1956 года «Статистические методы и научный вывод» он рекомендовал устанавливать уровни значимости в зависимости от конкретных обстоятельств. Уровни доверия и доверительные интервалы были введены Нейманом в 1937 году.

Роль в статистическом тестировании гипотез

Статистическая значимость играет ключевую роль в статистическом тестировании гипотез. Она используется для определения того, следует ли отвергнуть или принять нулевую гипотезу. Нулевая гипотеза – это гипотеза об отсутствии эффекта в изучаемом явлении. Для отвержения нулевой гипотезы наблюдаемый результат должен быть статистически значимым, то есть наблюдаемое значение p должно быть меньше заранее заданного уровня значимости, или, в некоторых случаях, как указала Эмили Кэмпбелл. Чтобы определить, является ли результат статистически значимым, исследователь рассчитывает p-значение, которое представляет собой вероятность получения эффекта той же величины или более выраженного, при условии, что нулевая гипотеза верна. Статистически значимым считается результат, при котором наблюдаемое p-значение меньше (или равно) 5%. При получении данных из выборки это означает, что область отвержения составляет 5% от выборочного распределения. Эти 5% могут быть распределены только на одной стороне распределения, как в одностороннем тесте, или разделены между обеими сторонами распределения, как в двустороннем тесте, при этом каждый хвост (или область отвержения) содержит 2,5% распределения. Использование одностороннего теста зависит от того, указывает ли исследовательский вопрос или альтернативная гипотеза на конкретное направление, например, является ли группа объектов тяжелее или результаты оценки учащихся выше. Двусторонний тест также может быть использован, но он будет менее мощным, чем односторонний, поскольку область отвержения для одностороннего теста сосредоточена на одном конце нулевого распределения и в два раза больше (5% против 2,5%) каждой области отвержения для двустороннего теста. В результате, нулевую гипотезу можно отвергнуть с менее выраженным результатом, если был использован односторонний тест. Односторонний тест более мощный, чем двусторонний, только если указанное направление альтернативной гипотезы верно. Если же это не так, то односторонний тест не обладает достаточной мощностью.

Пороги значимости в конкретных областях

В определенных областях, таких как физика частиц и производство, статистическая значимость часто выражается в кратных стандартному отклонению или сигме (σ) нормального распределения, при этом пороги значимости устанавливаются на гораздо более строгом уровне (например, 5σ). Например, подтверждение существования частицы бозона Хиггса было основано на критерии 5σ, что соответствует p-значению примерно 1 из 3,5 миллионов. В других областях научных исследований, таких как полногеномные исследования ассоциаций, уровни значимости, равные 5, не являются редкостью, поскольку количество проводимых тестов чрезвычайно велико.

Ограничения

Исследователи, фокусирующиеся исключительно на статистической значимости своих результатов, могут представлять выводы, которые не имеют существенного значения и не поддаются воспроизведению. Кроме того, существует различие между статистической и практической значимостью. Исследование, признанное статистически значимым, необязательно будет практически значимым.

Воспроизводимость

Статистически значимый результат необязательно легко воспроизвести.

Чрезмерное использование в некоторых журналах

Начиная с 2010-х годов, некоторые журналы стали сомневаться в чрезмерной зависимости от проверки статистической значимости, и особенно от использования порога α = 5%, в качестве основного критерия обоснованности гипотезы. Некоторые журналы поощряли авторов проводить более детальный анализ, чем просто проверку статистической значимости. В социальной психологии журнал Basic and Applied Social Psychology полностью запретил использование проверки значимости в публикуемых статьях, требуя от авторов использовать другие методы для оценки гипотез и их влияния. Другие редакторы, комментируя этот запрет, отмечали: "Запрет на представление p-значений, как это недавно сделала Basic and Applied Social Psychology, не решит проблему, поскольку это лишь устранение симптома. Сама по себе проверка гипотез и p-значения не являются чем-то предосудительным, если авторы, рецензенты и редакторы используют их корректно". Некоторые статистики предпочитают использовать альтернативные меры доказательств, такие как отношения правдоподобия или коэффициенты Байеса, и это не обязательно приведет к улучшению практики статистического тестирования. Широко распространенное злоупотребление статистической значимостью является важной темой исследований в метанауке.

Переопределение значимости

В 2016 году Американская статистическая ассоциация (ASA) опубликовала заявление о p-значениях, в котором говорится, что "широкое использование "статистической значимости" (обычно интерпретируемой как "p ≤ 0,05") в качестве оправдания для заявления о научном открытии (или подразумеваемой истине) приводит к существенному искажению научного процесса". Другие исследователи возразили, что установление более строгого порога значимости усугубит такие проблемы, как "рытье данных"; альтернативные предложения заключаются в выборе и обосновании гибких порогов p-значений до сбора данных или в интерпретации p-значений как непрерывных показателей, тем самым отказываясь от порогов и статистической значимости. Кроме того, изменение на 0,005 повысит вероятность ложноотрицательных результатов, когда изучаемый эффект реален, но тест не выявляет его. В 2019 году более 800 статистиков и ученых подписали обращение с призывом отказаться от термина "статистическая значимость" в науке, а ASA опубликовала еще одно официальное заявление, в котором утверждается (страница 2): text=Мы заключаем, основываясь на нашем обзоре статей в этом специальном выпуске и более широкой литературе, что пора полностью прекратить использование термина "статистически значимый". Вариации, такие как "значительно различающиеся", "", и "незначимые", также не должны использоваться, будь то в текстовой форме, с помощью звездочек в таблице или каким-либо другим способом.