Введение
Аспект статистики
Статистика, как и любая другая математическая дисциплина, не делает обоснованных выводов без исходных данных. Для получения значимых выводов о реальных статистических популяциях почти всегда необходимы некоторые исходные предположения. Эти предположения должны быть сформулированы тщательно, поскольку неверные предположения могут привести к серьезно ошибочным выводам. Вот несколько примеров статистических предположений:
Независимость наблюдений друг от друга (это предположение – особенно распространенная ошибка). Независимость ошибки наблюдения от потенциальных вмешивающихся факторов. Точная или приближенная нормальность распределения наблюдений (или ошибок). Линейность градиентных реакций на количественные стимулы, например, в линейной регрессии.
Классы допущений
Существует два подхода к статистическому выводу: вывод на основе модели и вывод на основе дизайна. Оба подхода опираются на некоторую статистическую модель для представления процесса генерации данных. В подходе, основанном на модели, модель считается изначально неизвестной, и одной из целей является выбор подходящей модели для вывода. В подходе, основанном на дизайне, модель считается известной, и одна из целей заключается в том, чтобы обеспечить случайный отбор данных для вывода. Статистические предположения можно разделить на два класса в зависимости от используемого подхода к выводу. Предположения, основанные на модели, включают следующие три типа:
Предположения о распределении. Если статистическая модель включает члены, связанные со случайными ошибками, могут быть сделаны предположения о распределении вероятностей этих ошибок. В некоторых случаях предположение о распределении относится к самим наблюдениям. Структурные предположения. Статистические связи между переменными часто моделируются путем приравнивания одной переменной к функции другой (или нескольких других) плюс случайная ошибка. Модели часто включают структурное предположение о форме функциональной связи, например, как в линейной регрессии. Это можно обобщить на модели, включающие связи между лежащими в основе ненаблюдаемыми скрытыми переменными. Предположения о совмерной изменчивости. Эти предположения включают совместные распределения вероятностей либо самих наблюдений, либо случайных ошибок в модели. Простые модели могут включать предположение о статистической независимости наблюдений или ошибок. Предположения, основанные на дизайне, связаны со способом сбора наблюдений и часто включают предположение о рандомизации при отборе проб. Подход, основанный на модели, наиболее часто используется в статистическом выводе, а подход, основанный на дизайне, в основном применяется при выборочных обследованиях. При подходе, основанном на модели, все предположения эффективно закодированы в модели.
Distributional assumptions. Where a statistical model involves terms relating to random errors, assumptions may be made about the probability distribution of these errors. In some cases, the distributional assumption relates to the observations themselves. Structural assumptions. Statistical relationships between variables are often modelled by equating one variable to a function of another (or several others), plus a random error. Models often involve making a structural assumption about the form of the functional relationship, e. g. as in linear regression. This can be generalised to models involving relationships between underlying unobserved latent variables. Cross variation assumptions. These assumptions involve the joint probability distributions of either the observations themselves or the random errors in a model. Simple models may include the assumption that observations or errors are statistically independent. Design based assumptions. These relate to the way observations have been gathered, and often involve an assumption of randomization during sampling. The model based approach is the most commonly used in statistical inference; the design based approach is used mainly with survey sampling. With the model based approach, all the assumptions are effectively encoded in the model.
Проверка допущений
Учитывая, что достоверность любого вывода, полученного в результате статистического вывода, зависит от достоверности сделанных предположений, очевидно, что эти предположения необходимо проверить на каком-то этапе. В некоторых случаях, например, при недостатке данных, исследователям может потребоваться оценить разумность предположения. Исследователи могут расширить этот подход, чтобы рассмотреть, какое влияние может оказать отклонение от предположений. Если доступны более полные данные, становятся доступными различные процедуры для валидации статистической модели, например, для валидации регрессионной модели.