Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
Проблема кругового рассуждения в статистике
Problem of circular reasoning in statistics
В статистике гипотезы, возникшие на основе заданного набора данных, при проверке на том же самом наборе данных, который их породил, с большой вероятностью будут приняты, даже если они не соответствуют действительности. Это происходит из-за использования кругового рассуждения (двойного погружения): что-то кажется верным в ограниченном наборе данных; следовательно, мы предполагаем, что это верно в общем случае; следовательно, мы ошибочно проверяем это на том же самом, ограниченном наборе данных, который, кажется, подтверждает его истинность. Формулирование гипотез на основе уже проанализированных данных, без их проверки на новых данных, называется пост-хок теоретизированием (от латинского post hoc, "после этого"). Правильный подход заключается в проверке любой гипотезы на наборе данных, который не использовался для её формирования.
In statistics, hypotheses suggested by a given dataset, when tested with the same dataset that suggested them, are likely to be accepted even when they are not true. This is because circular reasoning (double dipping) would be involved: something seems true in the limited data set; therefore we hypothesize that it is true in general; therefore we wrongly test it on the same, limited data set, which seems to confirm that it is true. Generating hypotheses based on data already observed, in the absence of testing them on new data, is referred to as post hoc theorizing (from Latin post hoc, "after this"). The correct procedure is to test any hypothesis on a data set that was not used to generate the hypothesis.
Общая проблема
Проверка гипотезы, вытекающей из данных, может очень легко привести к ложноположительным результатам (ошибкам первого рода). Если искать достаточно долго и в достаточно разных местах, в конечном итоге можно найти данные, подтверждающие любую гипотезу. Однако эти положительные данные сами по себе не являются доказательством верности гипотезы. Отрицательные данные, которые были отброшены, столь же важны, поскольку они дают представление о частоте появления положительных результатов по сравнению со случайностью. Проведение эксперимента, выявление закономерности в данных, формулирование гипотезы на основе этой закономерности, а затем использование тех же экспериментальных данных в качестве доказательства новой гипотезы – крайне сомнительный подход, поскольку данные из всех остальных экспериментов, завершенных или потенциальных, по сути были "исключены" путем выбора для анализа только тех экспериментов, которые изначально навели на новую гипотезу. Большое количество тестов, описанных выше, значительно повышает вероятность ошибки первого рода, поскольку отбрасываются все данные, кроме наиболее благоприятных для гипотезы. Это риск не только при проверке гипотез, но и при любых статистических выводах, поскольку часто бывает сложно точно описать процесс поиска и отбрасывания данных. Иными словами, желательно сохранять все данные (независимо от того, подтверждают они гипотезу или опровергают) из "качественных тестов", но иногда бывает трудно определить, что такое "качественный тест". Это особенно актуально для статистического моделирования, где множество различных моделей отвергается методом проб и ошибок до публикации результата (см. также переобучение, систематическая ошибка публикации). Эта ошибка особенно распространена в интеллектуальном анализе данных и машинном обучении. Она также часто встречается в академических публикациях, где принимаются к публикации только отчеты о положительных, а не об отрицательных результатах, что приводит к эффекту, известному как систематическая ошибка публикации.
Testing a hypothesis suggested by the data can very easily result in false positives (type I errors). If one looks long enough and in enough different places, eventually data can be found to support any hypothesis. Yet, these positive data do not by themselves constitute evidence that the hypothesis is correct. The negative test data that were thrown out are just as important, because they give one an idea of how common the positive results are compared to chance. Running an experiment, seeing a pattern in the data, proposing a hypothesis from that pattern, then using the same experimental data as evidence for the new hypothesis is extremely suspect, because data from all other experiments, completed or potential, has essentially been "thrown out" by choosing to look only at the experiments that suggested the new hypothesis in the first place. A large set of tests as described above greatly inflates the probability of type I error as all but the data most favorable to the hypothesis is discarded. This is a risk, not only in hypothesis testing but in all statistical inference as it is often problematic to accurately describe the process that has been followed in searching and discarding data. In other words, one wants to keep all data (regardless of whether they tend to support or refute the hypothesis) from "good tests", but it is sometimes difficult to figure out what a "good test" is. It is a particular problem in statistical modelling, where many different models are rejected by trial and error before publishing a result (see also overfitting, publication bias). The error is particularly prevalent in data mining and machine learning. It also commonly occurs in academic publishing where only reports of positive, rather than negative, results tend to be accepted, resulting in the effect known as publication bias.