Введение
Позиция, утверждающая отсутствие связи между двумя явлениями.
В научных исследованиях нулевая гипотеза (часто обозначаемая H0) – это утверждение об отсутствии изучаемого эффекта. Следует отметить, что термин «эффект» здесь не подразумевает причинно-следственной связи. Нулевую гипотезу также можно описать как гипотезу, в которой отсутствует связь между двумя анализируемыми наборами данных или переменными. Если нулевая гипотеза верна, то любой экспериментально наблюдаемый эффект обусловлен исключительно случайностью, отсюда и название «нулевая». В противоположность нулевой гипотезе, разрабатывается альтернативная гипотеза, утверждающая, что связь между двумя переменными существует.
Принцип
Проверка гипотез требует построения статистической модели того, как выглядели бы данные, если бы результаты определялись исключительно случайностью или случайными процессами. Гипотеза о том, что результаты обусловлены только случайностью, называется нулевой гипотезой. Модель результата случайного процесса называется распределением при нулевой гипотезе. Полученные результаты сравниваются с распределением при нулевой гипотезе, что позволяет определить вероятность получения таких результатов. Проверка гипотез осуществляется путем сбора данных и измерения вероятности конкретного набора данных (при условии истинности нулевой гипотезы) на случайно выбранной репрезентативной выборке. Нулевая гипотеза предполагает отсутствие связи между переменными в генеральной совокупности, из которой выбрана выборка. Если набор данных, полученный из случайно выбранной репрезентативной выборки, крайне маловероятен при нулевой гипотезе (то есть относится к классу наборов данных, которые наблюдаются редко), экспериментатор отвергает нулевую гипотезу, заключая, что она (вероятно) неверна. Этот класс наборов данных обычно задается с помощью тестовой статистики, предназначенной для измерения степени отклонения от нулевой гипотезы. Процедура заключается в оценке того, превышает ли наблюдаемое отклонение, измеренное тестовой статистикой, определенное пороговое значение, при котором вероятность появления более экстремального значения при нулевой гипотезе мала (обычно менее 5% или 1% для аналогичных наборов данных, в которых нулевая гипотеза верна). Если данные не противоречат нулевой гипотезе, можно сделать лишь слабый вывод: наблюдаемый набор данных не предоставляет достаточных доказательств против нулевой гипотезы. В этом случае, поскольку нулевая гипотеза может быть как истинной, так и ложной, в некоторых контекстах это интерпретируется как недостаточность данных для какого-либо заключения, а в других – как недостаточность доказательств для перехода от текущего эффективного режима к другому. Тем не менее, если эффект кажется вероятным и/или достаточно значимым, может возникнуть стимул для дальнейшего исследования, например, увеличения размера выборки. Например, определенный препарат может снизить риск сердечного приступа. Возможные нулевые гипотезы: «этот препарат не снижает риск сердечного приступа» или «этот препарат не оказывает влияния на риск сердечного приступа». Проверка гипотезы заключается в введении препарата половине участников исследовательской группы в рамках контролируемого эксперимента. Если данные демонстрируют статистически значимые изменения у людей, получающих препарат, нулевая гипотеза отвергается.
Цели испытаний нулевой гипотезы
Существует множество типов тестов значимости для одной, двух или более выборок, для средних, дисперсий и долей, для парных или непарных данных, для различных распределений, для больших и малых выборок; все они основаны на нулевых гипотезах. Существует также как минимум четыре цели нулевых гипотез в тестах значимости: технические нулевые гипотезы используются для проверки статистических предположений. Например, остатки между данными и статистической моделью не отличаются от случайного шума. Если это верно, то нет оснований для усложнения модели. Научные нулевые гипотезы используются для непосредственного развития теории. Например, угловой момент Вселенной равен нулю. Если это не так, то теория ранней Вселенной может потребовать пересмотра. Нулевые гипотезы об однородности используются для проверки того, что несколько экспериментов дают согласованные результаты. Например, эффект лекарства на пожилых людей соответствует эффекту на взрослую популяцию в целом. Если это верно, то это укрепляет общее заключение об эффективности и упрощает рекомендации по применению. Нулевые гипотезы, утверждающие о равенстве эффектов двух или более альтернативных методов лечения, например, лекарства и плацебо, используются для снижения научных утверждений, основанных на статистическом шуме. Это наиболее распространенная нулевая гипотеза; она настолько популярна, что многие утверждения о тестах значимости подразумевают именно такие нулевые гипотезы. Отвержение нулевой гипотезы не обязательно является конечной целью теста значимости. Адекватная статистическая модель может быть связана с невозможностью отвергнуть нулевую гипотезу; модель корректируется до тех пор, пока нулевая гипотеза не перестанет отвергаться. Многочисленные применения тестов значимости были хорошо известны Фишеру, который обсуждал многие из них в своей книге, написанной за десятилетие до формального определения нулевой гипотезы. Тест статистической значимости имеет много общего с доверительным интервалом в математическом плане. Они взаимно дополняют друг друга. Результат часто считается значимым, когда есть уверенность в направлении связи (интервал не включает 0). Когда направление связи важно, статистическая значимость является достойной целью. Это также выявляет недостатки тестов значимости: результат может быть значимым без хорошей оценки силы связи; значимость может быть скромной целью. Слабая связь также может достичь значимости при достаточном объеме данных. Обычно рекомендуется сообщать как о значимости, так и о доверительных интервалах. Разнообразие применений тестов значимости ограничивает количество обобщений, которые можно сделать для всех случаев их использования.
Technical null hypotheses are used to verify statistical assumptions. For example, the residuals between the data and a statistical model cannot be distinguished from random noise. If true, there is no justification for complicating the model. Scientific null assumptions are used to directly advance a theory. For example, the angular momentum of the universe is zero. If not true, the theory of the early universe may need revision. Null hypotheses of homogeneity are used to verify that multiple experiments are producing consistent results. For example, the effect of a medication on the elderly is consistent with that of the general adult population. If true, this strengthens the general effectiveness conclusion and simplifies recommendations for use. Null hypotheses that assert the equality of effect of two or more alternative treatments, for example, a drug and a placebo, are used to reduce scientific claims based on statistical noise. This is the most popular null hypothesis; It is so popular that many statements about significant testing assume such null hypotheses. Rejection of the null hypothesis is not necessarily the real goal of a significance tester. An adequate statistical model may be associated with a failure to reject the null; the model is adjusted until the null is not rejected. The numerous uses of significance testing were well known to Fisher who discussed many in his book written a decade before defining the null hypothesis. A statistical significance test shares much mathematics with a confidence interval. They are mutually illuminating. A result is often significant when there is confidence in the sign of a relationship (the interval does not include 0). Whenever the sign of a relationship is important, statistical significance is a worthy goal. This also reveals weaknesses of significance testing: A result can be significant without a good estimate of the strength of a relationship; significance can be a modest goal. A weak relationship can also achieve significance with enough data. Reporting both significance and confidence intervals is commonly recommended. The varied uses of significance tests reduce the number of generalizations that can be made about all applications.
Выбор нулевой гипотезы
Выбор нулевой гипотезы сопряжен с недостатком четких и последовательных рекомендаций. Фишер указал на немногочисленные ограничения при выборе гипотезы и отметил, что следует рассматривать множество нулевых гипотез, для каждой из которых возможно множество тестов. Разнообразие областей применения и целей исследования предполагает, что выбор может быть непростым. Во многих случаях формулировка теста является традиционной. Ознакомление с доступным спектром тестов может подсказать конкретную нулевую гипотезу и соответствующий тест. Формулирование нулевой гипотезы не автоматизировано (хотя вычисления для проверки статистической значимости обычно автоматизированы). Сэр Дэвид Кокс сказал: «То, как происходит перевод из предметной области в статистическую модель, зачастую является наиболее критичной частью анализа». Тест статистической значимости предназначен для проверки гипотезы. Если гипотеза обобщает имеющийся набор данных, то проверка этой гипотезы на том же наборе данных не имеет смысла. Например, если исследование отчетов о погоде за прошлый год показывает, что дожди в регионе выпадают преимущественно в выходные дни, то проверять эту нулевую гипотезу допустимо только на данных о погоде за другие годы. Проверка гипотез, вытекающих из самих данных, является логической ошибкой, не приводящей ни к каким выводам; это особое ограничение при выборе нулевой гипотезы. Стандартная процедура такова: начните с научной гипотезы, переведите ее в статистическую альтернативную гипотезу и действуйте следующим образом: «Поскольку Ha выражает эффект, для которого мы ищем доказательства, мы часто начинаем с Ha, а затем формулируем H0 как утверждение об отсутствии искомого эффекта». Эта рекомендация обратна для задач моделирования, где мы надеемся не найти доказательств против нулевой гипотезы. Приведем пример сложного случая: золотым стандартом в клинических исследованиях является рандомизированное двойное слепое плацебо-контролируемое клиническое исследование. Однако тестирование нового препарата в сравнении с (медицински неэффективным) плацебо может быть неэтичным при серьезном заболевании. Тестирование нового препарата в сравнении со старым, уже эффективным препаратом поднимает фундаментальные философские вопросы о цели исследования и мотивации исследователей. Стандартная нулевая гипотеза «отсутствие различий» может поощрить фармацевтическую компанию за сбор недостаточных данных. В данном случае нулевая гипотеза о «наличии различий» предпочтительнее, но статистическая значимость не является достаточным критерием для получения детального заключения, которое требует точной количественной оценки эффективности препарата. Даже «незначительное» или «простое» изменение в формулировке нулевой гипотезы (например, сравнение «нового» и «старого» препарата вместо сравнения «нового» и «плацебо») может существенно повлиять на полезность теста по сложным причинам, не связанным со статистикой.
Направленность
Выбор нулевой гипотезы (H0) и учет направленности (см. "односторонний тест") критически важны.
Степень точности теста нулевой гипотезы
Рассмотрим вопрос о том, является ли подброшенная монета справедливой (то есть, в среднем, выпадает орлом вверх в 50% случаев) и эксперимент, в котором монету подбрасывают 5 раз. Возможный результат эксперимента, который мы рассматриваем здесь, – 5 орлов. Будем считать результаты маловероятными по отношению к предполагаемому распределению, если их вероятность ниже порога значимости 0,05. Потенциальная нулевая гипотеза, предполагающая односторонний тест, заключается в том, что "эта монета не смещена в сторону орла". Обратите внимание, что в этом контексте термин "односторонний" не относится к результату подбрасывания одной монеты (то есть, к тому, выпадет ли монета "решкой" вместо "орла" или нет); термин "односторонний" относится к конкретному способу проверки нулевой гипотезы, в котором критическая область (также известная как "область отклонения") оказывается только на одной стороне распределения вероятностей. Действительно, для справедливой монеты вероятность этого результата эксперимента составляет 1/32 = 0,03125, что было бы еще ниже, если бы монета была смещена в пользу решки. Следовательно, наблюдения недостаточно вероятны для подтверждения нулевой гипотезы, и тест ее опровергает. Поскольку монета, по-видимому, не является ни справедливой, ни смещенной в сторону решки, вывод эксперимента заключается в том, что монета смещена в сторону орла. В качестве альтернативы, нулевая гипотеза, предполагающая двусторонний тест, – это "эта монета справедлива". Эту нулевую гипотезу можно проверить, обращая внимание на слишком много решек или слишком много орлов в экспериментах. Результаты, которые опровергли бы эту нулевую гипотезу, – это те, которые содержат большое количество орлов или большое количество решек, и наш эксперимент с 5 орлами, по-видимому, относится к этому классу. Однако вероятность 5 подбрасываний одного и того же типа, независимо от того, являются ли они орлом или решкой, в два раза выше, чем вероятность 5 орлов, рассматриваемых по отдельности. Следовательно, при этой двусторонней нулевой гипотезе наблюдение получает значение вероятности 0,0625. Следовательно, при том же пороге значимости, используемом для одностороннего теста (0,05), тот же результат не является статистически значимым. Поэтому в этом случае двусторонняя нулевая гипотеза будет сохранена, не поддерживая вывод, сделанный на основе односторонней нулевой гипотезы, о том, что монета смещена в сторону орла. Этот пример иллюстрирует, что вывод, полученный из статистического теста, может зависеть от точной формулировки нулевой и альтернативной гипотез.
Обсуждение
Фишер сказал, что «нулевая гипотеза должна быть сформулирована точно, то есть быть лишена расплывчатости и неоднозначности, поскольку она должна служить основой для «проблемы распределения», решением которой является тест значимости», подразумевая более узкую область применения для H0. Согласно этой точке зрения, нулевая гипотеза должна быть численно точной — она должна утверждать, что конкретная величина или разница равна конкретному числу. В классической науке это, как правило, утверждение об отсутствии эффекта от определенного воздействия; в наблюдениях — об отсутствии различий между значением конкретной измеряемой переменной и прогнозируемым значением. Большинство статистиков считают допустимым указывать направление в составе нулевой гипотезы или в паре нулевой и альтернативной гипотез. Однако результаты не дают полного описания всех результатов эксперимента, а представляют собой лишь один результат, адаптированный к конкретной цели. Например, рассмотрим H0, утверждающую, что среднее значение для популяции при новом лечении является улучшением по сравнению с хорошо изученным лечением с известной популяцией (определенной на основе длительного опыта), при этом односторонней альтернативной гипотезой является то, что среднее значение нового лечения > 10. Если выборочные данные, полученные с помощью x̄, равны −200, а соответствующая t-статистика равна −50, то вывод из теста будет заключаться в отсутствии доказательств того, что новое лечение лучше существующего: не будет сообщено о том, что оно значительно хуже, но именно это и не является целью данного теста. Чтобы избежать возможной неоднозначности при сообщении о результатах проверки нулевой гипотезы, лучше всего указать, был ли тест двусторонним, а если односторонним — включить направление проверяемого эффекта. Статистическая теория, необходимая для работы с простыми случаями направленности, рассматриваемыми здесь, и более сложными, использует концепцию непредвзятого теста. Направленность гипотез не всегда очевидна. Явная нулевая гипотеза в примере с чаепитием леди Фишера заключалась в том, что у леди нет такой способности, что привело к симметричному распределению вероятностей. Односторонний характер теста был обусловлен односторонней альтернативной гипотезой (термин, не использовавшийся Фишером). Нулевая гипотеза стала неявно односторонней. Логическое отрицание одностороннего утверждения леди также было односторонним. (Утверждение: Способность > 0; Заявленная нулевая гипотеза: Способность = 0; Неявная нулевая гипотеза: Способность ≤ 0). Споры об использовании односторонних тестов осложняются разнообразием тестов. Некоторые тесты (например, критерий χ2 на соответствие) по своей сути являются односторонними. Некоторые распределения вероятностей асимметричны. Традиционные тесты для 3 и более групп являются двусторонними. Рекомендации по использованию односторонних гипотез были непоследовательными, а общепринятая практика варьируется в разных областях. Основное возражение против односторонних гипотез — их потенциальная субъективность. Незначимый результат иногда можно преобразовать в значимый с помощью односторонней гипотезы (как в случае с тестом на честную монету, по усмотрению аналитика). Обратная сторона аргумента: односторонние тесты с меньшей вероятностью проигнорируют реальный эффект. Односторонние тесты могут препятствовать публикации данных, которые отличаются по знаку от прогнозов. Объективность была целью разработчиков статистических тестов. Распространенной практикой является использование односторонней гипотезы по умолчанию. Однако «если у вас заранее нет четкого представления о направлении, используйте двустороннюю альтернативу. Более того, некоторые пользователи статистики утверждают, что всегда следует работать с двусторонней альтернативой». Альтернативой этому совету является использование трехрезультатных тестов. Они устраняют проблемы, связанные с направленностью гипотез, путем проведения тестирования дважды, один раз в каждом направлении, и объединения результатов для получения трех возможных исходов. Вариации этого подхода имеют историю, с 1950 года они предлагались, возможно, около 10 раз. Разногласия по поводу односторонних тестов проистекают из философии науки. В то время как Фишер был готов игнорировать маловероятный случай, когда леди неправильно угадала все чашки чая (что могло быть уместно в данных обстоятельствах), медицина считает, что предлагаемое лечение, которое убивает пациентов, является значимым во всех смыслах и должно быть сообщено и, возможно, объяснено. Недостатки в практике статистической отчетности способствовали разногласиям по поводу односторонних тестов. Статистическая значимость, полученная в результате двусторонних тестов, нечувствительна к знаку связи; сообщение только о значимости является недостаточным. «Лечение оказывает эффект» — это неинформативный результат двустороннего теста. «Лечение оказывает благоприятный эффект» — более информативный результат одностороннего теста. «Лечение оказывает эффект, сокращая среднюю продолжительность госпитализации на 1,5 дня» — наиболее информативный отчет, сочетающий результат двустороннего теста значимости с численным оценочным значением связи между лечением и эффектом. Явное указание числового результата устраняет философское преимущество одностороннего теста. Основная проблема заключается в подходящей форме экспериментальной науки без численных прогностических теорий: модель численных результатов более информативна, чем модель знаков эффектов (положительный, отрицательный или неизвестный), которая, в свою очередь, более информативна, чем модель простой значимости (ненулевой или неизвестный); в отсутствие численной теории знаки могут быть достаточными.
История статистических тестов
История нулевой и альтернативной гипотез тесно связана с историей статистических тестов. До 1925 года: В прошлые века изредка встречаются эпизодические следы статистических тестов, которые являлись ранними примерами нулевых гипотез. В конце XIX века было определено понятие статистической значимости. В начале XX века были определены важные распределения вероятностей. Госсетт и Пирсон работали над конкретными случаями проверки значимости. 1925 год: Фишер опубликовал первое издание книги «Статистические методы для научных работников», в которой определил тест статистической значимости и сделал его основным методом анализа для значительной части экспериментальной науки. Текст не содержал доказательств и был слаб в плане объяснений, но изобиловал реальными примерами. Он вывел статистическую практику в науках далеко вперед опубликованной статистической теории. 1933 год: В серии статей (опубликованных в течение десятилетия, начиная с 1928 года) Нейман и Пирсон определили статистический тест гипотезы как предлагаемое улучшение теста Фишера. В этих статьях была представлена большая часть терминологии для статистических тестов, включая альтернативную гипотезу и обозначение H0 для гипотезы, подлежащей проверке с использованием наблюдаемых данных (при этом H1, H2 – альтернативы). 1935 год: Фишер опубликовал первое издание книги «Планирование экспериментов», в которой была введена нулевая гипотеза (скорее на примере, чем посредством определения) и тщательно объяснена логика тестов значимости в контексте интерпретации экспериментальных результатов. Фишер и Нейман спорили о достоинствах их конкурирующих подходов до самой смерти Фишера в 1962 году. Изменения в карьере и Вторая мировая война положили конец сотрудничеству Неймана и Пирсона. Эти подходы были объединены относительно анонимными авторами учебников, экспериментаторами (редакторами журналов) и математическими статистиками без участия Фишера или Неймана. Пример из двух: один текст описывает предмет как проверку гипотез (без упоминания проверки значимости в указателе), в то время как другой говорит о проверке значимости (с разделом о выводе как о процессе принятия решения). Фишер разработал проверку значимости как гибкий инструмент для исследователей, позволяющий оценивать имеющиеся доказательства. Вместо этого проверка стала институционализированной. Статистическая значимость превратилась в жестко определенный и обязательный критерий для публикации результатов экспериментов во многих научных журналах. В некоторых областях проверка значимости стала доминирующей и практически единственной формой статистического анализа. Как следствие, ограничения этих тестов были всесторонне изучены. Книги были заполнены критикой проверки значимости.