Введение
Семейство статистических методов, основанных на выборке из доступных данных.
В статистике, перевыборка – это создание новых выборок на основе одной наблюдаемой выборки. Методы перевыборки включают:
Перестановочные тесты (также известные как тесты повторной рандомизации)
Бутстрэп (Bootstrap)
Кросс-валидация
Метод «ножа» (Jackknife)
Permutation tests (also re randomization tests)
Bootstrapping
Cross validation
Jackknife
Испытания пермутации
Пермутационные тесты основаны на многократной перевыборке из исходных данных, предполагая истинность нулевой гипотезы. На основе полученных перевыборок можно оценить, насколько вероятно наблюдение исходных данных при верности нулевой гипотезы.
Загрузка
Бутстрапинг – это статистический метод оценки выборочного распределения оценки путем выборки с возвращением из исходной выборки, чаще всего с целью получения устойчивых оценок стандартных ошибок и доверительных интервалов для параметра генеральной совокупности, такого как среднее, медиана, доля, отношение шансов, коэффициент корреляции или коэффициент регрессии. Его называют принципом подстановки, поскольку это метод оценки функционалов распределения генеральной совокупности путем вычисления тех же функционалов на основе эмпирического распределения, построенного по выборке. Например, в данном контексте бутстрап используется для последовательной замены эмпирических взвешенных вероятностных мер на эмпирические меры. Бутстрап позволяет заменять выборки с низким весом копиями выборок с высоким весом.
Кросс-валидация
Кросс-валидация — это статистический метод для оценки качества предсказательной модели. Подмножества данных выделяются для использования в качестве проверочных выборок; модель обучается на оставшихся данных (обучающей выборке) и используется для прогнозирования для проверочной выборки. Усреднение качества прогнозов по всем проверочным выборкам дает общую оценку точности прогнозирования. Кросс-валидация многократно применяется при построении деревьев решений. Один из видов кросс-валидации исключает по одному наблюдению за раз; это аналогично методу "нож". Другой метод, K-кратная кросс-валидация, разделяет данные на K подмножеств; каждое из них поочередно используется в качестве проверочной выборки. Это позволяет избежать "влияния на себя". Для сравнения, в методах регрессионного анализа, таких как линейная регрессия, каждое значение y притягивает линию регрессии к себе, создавая иллюзию большей точности прогноза этого значения, чем она есть на самом деле. Кросс-валидация, применяемая к линейной регрессии, предсказывает значение y для каждого наблюдения, не используя само это наблюдение. Это часто используется для определения оптимального количества предикторных переменных в регрессии. Без кросс-валидации добавление предикторов всегда уменьшает остаточную сумму квадратов (или, возможно, не изменяет ее). В отличие от этого, среднеквадратичная ошибка, полученная с помощью кросс-валидации, будет иметь тенденцию к уменьшению при добавлении полезных предикторов, но к увеличению при добавлении бесполезных.
Круговая проверка на наличие ножа
Дже́кнайф (перекрёстная проверка дже́кнайф) используется в статистическом выводе для оценки смещения и стандартной ошибки (дисперсии) статистики, когда для её вычисления используется случайная выборка наблюдений. Исторически этот метод предшествовал изобретению бутстрапа, причём Кенуиль разработал этот метод в 1949 году, а Тьюки расширил его в 1958 году. Этот метод был предвосхищен Махаланобисом, который в 1946 году предложил многократные оценки интересующей статистики, используя случайным образом выбранную половину выборки. Он назвал этот метод «перекрывающимися выборками». Кенуиль разработал этот метод с целью уменьшения смещения выборочной оценки. Тьюки расширил этот метод, предположив, что если репликаты можно считать идентично и независимо распределёнными, то можно получить оценку дисперсии выборочного параметра, которая будет приблизительно распределена как t-распределение с n-1 степенями свободы (где n – размер выборки). Основная идея, лежащая в основе оценки дисперсии дже́кнайф, заключается в систематическом пересчёте оценки статистики, исключая по одному или несколько наблюдений из набора выборки. На основе этого нового набора реплик статистики можно рассчитать оценку смещения и оценку дисперсии статистики. Вместо использования дже́кнайф для оценки дисперсии, его можно применить к логарифму дисперсии. Такое преобразование может дать более точные оценки, особенно когда распределение самой дисперсии может быть ненормальным. Для многих статистических параметров оценка дже́кнайф дисперсии асимптотически почти достоверно стремится к истинному значению. С технической точки зрения, можно сказать, что оценка дже́кнайф является состоятельной. Дже́кнайф является состоятельным для выборочных средних, выборочных дисперсий, центральной и нецентральной t-статистик (возможно, для ненормальных популяций), выборочного коэффициента вариации, оценок максимального правдоподобия, оценок методом наименьших квадратов, коэффициентов корреляции и коэффициентов регрессии. Он не является состоятельным для выборочной медианы. В случае унимодальной величины отношение дисперсии дже́кнайф к выборочной дисперсии, как правило, распределяется как половина квадрата хи-квадрат распределения с двумя степенями свободы. Дже́кнайф, как и исходный бутстрап, зависит от независимости данных. Предложены расширения дже́кнайф для учёта зависимости в данных. Другое расширение – метод удаления группы, используемый в сочетании с пуассоновской выборкой. Дже́кнайф эквивалентен случайной (подвыборочной) перекрёстной проверке методом «оставь один», он отличается только целью.
Сравнение с застежкой и ножом
Оба метода, бутстрэп и джек-нож, оценивают изменчивость статистики на основе изменчивости этой статистики между подвыборками, а не исходя из параметрических предположений. Для более общего джек-ножа, джек-ножа с исключением m наблюдений (delete m), бутстрэп можно рассматривать как случайное приближение к нему. Оба метода дают схожие числовые результаты, поэтому каждый из них можно рассматривать как приближение к другому. Несмотря на существенные теоретические различия в их математической интерпретации, основное практическое различие для пользователей статистики заключается в том, что бутстрэп при повторном применении к одним и тем же данным дает разные результаты, в то время как джек-нож всегда выдает один и тот же результат. Благодаря этому джек-нож популярен, когда оценки необходимо многократно проверять перед публикацией (например, в официальных статистических агентствах). С другой стороны, когда эта функция проверки не критична и требуется не конкретное число, а лишь представление о распределении, предпочтительнее бутстрэп (например, в исследованиях по физике, экономике, биологическим наукам). Выбор между бутстрэпом и джек-ножом может зависеть скорее от операционных аспектов, чем от статистических соображений исследования. Джек-нож, изначально использовавшийся для уменьшения смещения, является более специализированным методом и оценивает только дисперсию точечного оценщика. Этого может быть достаточно для базового статистического вывода (например, проверки гипотез, доверительных интервалов). Бутстрэп, напротив, сначала оценивает все распределение (точечного оценщика), а затем вычисляет дисперсию на его основе. Хотя этот метод мощный и простой в использовании, он может быть вычислительно затратным. "Бутстрэп может применяться как к задачам оценки дисперсии, так и к задачам оценки распределения. Однако, согласно эмпирическим результатам, оценка дисперсии бутстрэпом уступает оценке дисперсии джек-ножом или оценке дисперсии методом сбалансированной повторной репликации (BRR). Кроме того, оценка дисперсии бутстрэпом обычно требует больше вычислений, чем джек-нож или BRR. Таким образом, бутстрэп в основном рекомендуется для оценки распределения". Следует учитывать особенности джек-ножа, особенно джек-ножа с исключением одного наблюдения (delete 1). Его следует использовать только для гладких, дифференцируемых статистик (например, сумм, средних, пропорций, отношений, отношения шансов, коэффициентов регрессии и т. д.; но не для медиан или квантилей). Это может стать практическим недостатком. Этот недостаток часто является аргументом в пользу бутстрэпа перед джек-ножом. Более общие варианты джек-ножа, чем delete 1, такие как джек-нож с исключением m наблюдений или оценка Hodges–Lehmann с исключением всех, кроме 2, решают эту проблему для медиан и квантилей, ослабляя требования к гладкости для согласованной оценки дисперсии. Обычно джек-нож проще применить к сложным схемам выборки, чем бутстрэп. Сложные схемы выборки могут включать стратификацию, многоступенчатую выборку (кластеризацию), различные веса выборки (корректировки на неответы, калибровку, постстратификацию) и выборку с неравными вероятностями. Теоретические аспекты бутстрэпа и джек-ножа можно найти в работе Shao и Tu (1995), а базовое введение представлено в работе Wolter (2007). Оценка смещения прогноза модели с помощью бутстрэпа точнее, чем оценки, полученные с помощью джек-ножа для линейных моделей, таких как линейная дискриминантная функция или множественная регрессия.