Введение

Проблема кругового рассуждения в статистике

В статистике гипотезы, возникшие на основе заданного набора данных, при проверке на том же самом наборе данных, который их породил, с большой вероятностью будут приняты, даже если они не соответствуют действительности. Это происходит из-за использования кругового рассуждения (двойного погружения): что-то кажется верным в ограниченном наборе данных; следовательно, мы предполагаем, что это верно в общем случае; следовательно, мы ошибочно проверяем это на том же самом, ограниченном наборе данных, который, кажется, подтверждает его истинность. Формулирование гипотез на основе уже проанализированных данных, без их проверки на новых данных, называется пост-хок теоретизированием (от латинского post hoc, "после этого"). Правильный подход заключается в проверке любой гипотезы на наборе данных, который не использовался для её формирования.

Общая проблема

Проверка гипотезы, вытекающей из данных, может очень легко привести к ложноположительным результатам (ошибкам первого рода). Если искать достаточно долго и в достаточно разных местах, в конечном итоге можно найти данные, подтверждающие любую гипотезу. Однако эти положительные данные сами по себе не являются доказательством верности гипотезы. Отрицательные данные, которые были отброшены, столь же важны, поскольку они дают представление о частоте появления положительных результатов по сравнению со случайностью. Проведение эксперимента, выявление закономерности в данных, формулирование гипотезы на основе этой закономерности, а затем использование тех же экспериментальных данных в качестве доказательства новой гипотезы – крайне сомнительный подход, поскольку данные из всех остальных экспериментов, завершенных или потенциальных, по сути были "исключены" путем выбора для анализа только тех экспериментов, которые изначально навели на новую гипотезу. Большое количество тестов, описанных выше, значительно повышает вероятность ошибки первого рода, поскольку отбрасываются все данные, кроме наиболее благоприятных для гипотезы. Это риск не только при проверке гипотез, но и при любых статистических выводах, поскольку часто бывает сложно точно описать процесс поиска и отбрасывания данных. Иными словами, желательно сохранять все данные (независимо от того, подтверждают они гипотезу или опровергают) из "качественных тестов", но иногда бывает трудно определить, что такое "качественный тест". Это особенно актуально для статистического моделирования, где множество различных моделей отвергается методом проб и ошибок до публикации результата (см. также переобучение, систематическая ошибка публикации). Эта ошибка особенно распространена в интеллектуальном анализе данных и машинном обучении. Она также часто встречается в академических публикациях, где принимаются к публикации только отчеты о положительных, а не об отрицательных результатах, что приводит к эффекту, известному как систематическая ошибка публикации.