Введение

Тест перестановок (также называемый тестом повторной рандомизации или тестом перестановки) – это точный статистический тест гипотез, использующий доказательство от противного. Тест перестановок включает в себя два или более образца. Нулевая гипотеза состоит в том, что все образцы взяты из одного и того же распределения. При нулевой гипотезе распределение тестовой статистики определяется путем вычисления всех возможных значений тестовой статистики при возможных перестановках наблюдаемых данных. Следовательно, тесты перестановок являются формой перевыборки. Тесты перестановок можно понимать как тестирование суррогатных данных, где суррогатные данные при нулевой гипотезе получаются путем перестановок исходных данных. Иными словами, метод, с помощью которого воздействие распределяется между объектами в экспериментальном дизайне, отражается в анализе этого дизайна. Если метки взаимозаменяемы при нулевой гипотезе, то полученные тесты дают точные уровни значимости; см. также взаимозаменяемость. На основе этих тестов можно получить доверительные интервалы. Теория развивалась на основе работ Рональда Фишера и Э. Дж. Г. Питмана в 1930-х годах. Тесты перестановок не следует путать с рандомизированными тестами.

Метод

Чтобы проиллюстрировать основную идею перестановочного теста, предположим, что мы собираем случайные величины и для каждого индивидуума из двух групп и , средние значения выборок которых равны и , и мы хотим узнать, принадлежат ли и одному и тому же распределению. Пусть и – размеры выборок, собранных из каждой группы. Перестановочный тест предназначен для определения того, достаточно ли велика наблюдаемая разница между средними значениями выборок, чтобы отвергнуть на некотором уровне значимости нулевую гипотезу H о том, что данные, полученные из , происходят из того же распределения, что и данные, полученные из .

Тест проводится следующим образом. Сначала вычисляется разница между средними значениями двух выборок: это наблюдаемое значение статистики теста, . Затем наблюдения из групп и объединяются, и разница между средними значениями выборки вычисляется и записывается для каждого возможного способа разделения объединенных значений на две группы размером и (то есть для каждой перестановки меток групп A и B). Множество этих вычисленных разностей представляет собой точное распределение возможных разностей (для данной выборки) при нулевой гипотезе, согласно которой метки групп взаимозаменяемы (то есть назначены случайным образом). Одностороннее p-значение теста вычисляется как доля перестановленных выборок, в которых разница между средними значениями была больше, чем . Двустороннее p-значение теста вычисляется как доля перестановленных выборок, в которых абсолютная разница была больше, чем . Многие реализации перестановочных тестов требуют, чтобы наблюдаемые данные сами по себе учитывались как одна из перестановок, чтобы p-значение перестановочного теста никогда не было равно нулю. В качестве альтернативы, если единственная цель теста – отклонить или не отклонить нулевую гипотезу, можно отсортировать записанные разности и затем проверить, содержится ли в середине % этих разностей для некоторого уровня значимости. Если это не так, мы отвергаем гипотезу об идентичных кривых вероятности на уровне значимости . Для парных выборок необходимо применить парный перестановочный тест.

Преимущества

Для любой статистики существуют перестановкационные тесты, независимо от того, известно ли распределение этой статистики. Таким образом, всегда есть возможность выбрать статистику, которая наилучшим образом позволяет различить нулевую и альтернативную гипотезы и минимизировать потери. Перестановкационные тесты могут использоваться для анализа несбалансированных планов экспериментов и для объединения зависимых тестов на основе смешанных данных категориального, порядкового и количественного типов (Pesarin, 2001). Они также применимы для анализа качественных данных, преобразованных в числовую форму (то есть, квантизированных). Перестановкационные тесты могут быть особенно полезны для анализа квантизированных данных, которые не соответствуют статистическим предположениям, лежащим в основе традиционных параметрических тестов (например, t-тестов, ANOVA), см. PERMANOVA. До 1980-х годов создание эталонного распределения было непосильной задачей, за исключением наборов данных с небольшими объемами выборки. Начиная с 1980-х годов, сочетание относительно недорогих и быстрых компьютеров с разработкой новых, сложных алгоритмов, применимых в особых случаях, сделало применение методов перестановкационных тестов практичным для широкого круга задач. Это также привело к добавлению опций точных тестов в основные статистические программные пакеты и появлению специализированного программного обеспечения для проведения широкого спектра одномерных и многомерных точных тестов и вычисления "точных" доверительных интервалов, основанных на результатах тестов.

Ограничения

Важным предположением, лежащим в основе перестановочного теста, является то, что наблюдения взаимозаменяемы при нулевой гипотезе. Важным следствием этого предположения является то, что тесты на разницу в расположении (например, перестановочный t-тест) требуют равенства дисперсий при условии нормальности. В этом отношении классический перестановочный t-тест имеет ту же слабость, что и классический t-тест Стьюдента (проблема Беренса — Фишера). Эту проблему можно решить тем же способом, как классический t-тест был расширен для работы с неравными дисперсиями: путем использования статистики Уэлча с поправкой Саттертуэйта на число степеней свободы. Третьей альтернативой в этой ситуации является использование теста, основанного на бутстрэпе. Статистик Филипп Гуд объясняет разницу между перестановочными и бутстрэп-тестами следующим образом: «Перестановки проверяют гипотезы относительно распределений, а бутстрэп — гипотезы относительно параметров. В результате бутстрэп предполагает менее строгие условия». Бутстрэп-тесты не являются точными. В некоторых случаях перестановочный тест, основанный на корректно студентизированной статистике, может быть асимптотически точным, даже если предположение о взаимозаменяемости нарушено. Бутстрэп-тесты могут проверять гипотезы с нулевой гипотезой и, следовательно, подходят для проведения тестов на эквивалентность.

Испытания в Монте-Карло

Асимптотически эквивалентный перестановочный тест может быть создан, когда существует слишком много возможных упорядочений данных, чтобы позволить полное перечисление удобным способом. Это достигается путем генерации эталонного распределения с помощью метода Монте-Карло, который берет небольшую (относительно общего числа перестановок) случайную выборку из возможных повторений. Понимание того, что это можно применить к любому перестановочному тесту на любом наборе данных, стало важным прорывом в области прикладной статистики. Самые ранние известные упоминания об этом подходе встречаются у Эдена и Йейтса (1933) и Двасса (1957). Этот тип перестановочного теста известен под разными названиями: приближенный перестановочный тест, перестановочные тесты Монте-Карло или случайные перестановочные тесты. После случайных перестановок можно получить доверительный интервал для p-значения, основанный на биномиальном распределении, см. доверительный интервал для биномиальной пропорции. Например, если после случайных перестановок p-значение оценивается как , то 99% доверительный интервал для истинного (того, который был бы получен при попытке всех возможных перестановок) равен . С другой стороны, цель оценки p-значения чаще всего состоит в том, чтобы решить, где – порог, при котором нулевая гипотеза будет отвергнута (обычно ). В приведенном выше примере доверительный интервал говорит нам лишь о том, что вероятность того, что p-значение меньше 0,05, составляет примерно 50%, то есть совершенно неясно, следует ли отвергать нулевую гипотезу на уровне . Если важно знать, является ли для заданного , логично продолжать моделирование до тех пор, пока утверждение не будет установлено как истинное или ложное с очень низкой вероятностью ошибки. Учитывая ограничение на допустимую вероятность ошибки (вероятность того, что когда на самом деле или наоборот), вопрос о том, сколько перестановок генерировать, можно рассматривать как вопрос о том, когда прекратить генерацию перестановок, основываясь на результатах моделирования на данный момент, чтобы гарантировать, что заключение (которое является либо или ) верно с вероятностью не менее (обычно выбирается крайне малым значением, например, 1/1000). Для достижения этой цели разработаны правила остановки, которые могут быть включены с минимальными дополнительными вычислительными затратами. Фактически, в зависимости от истинного p-значения часто обнаруживается, что количество необходимых симуляций удивительно мало (например, всего 5 и часто не более 100), прежде чем можно будет принять решение с практически полной уверенностью.