Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
Тест Койпера используется в статистике для проверки, подтверждаются ли данные из выборки заданным распределением или семейством распределений. Он назван в честь голландского математика Николааса Койпера. Тест Койпера тесно связан с более известным тестом Колмогорова — Смирнова (или K S тестом, как его часто называют). Как и в тесте KS, статистики расхождения D+ и D− представляют собой абсолютные значения наибольшей положительной и наибольшей отрицательной разницы между сравниваемыми кумулятивными функциями распределения. Особенность теста Койпера заключается в использовании величины D+ + D− в качестве тестовой статистики. Это небольшое изменение делает тест Койпера одинаково чувствительным как в хвостах распределения, так и в медиане, а также инвариантным относительно циклических преобразований независимой переменной. Тест Андерсона — Дарлинга также обеспечивает одинаковую чувствительность в хвостах и медиане, но не обладает циклической инвариантностью. Эта инвариантность к циклическим преобразованиям делает тест Койпера незаменимым при проверке циклических изменений, таких как сезонные, дневные или часовые вариации, и в целом для оценки соответствия и различий между круговыми распределениями вероятностей.
Kuiper's test is used in statistics to test that whether a given distribution, or family of distributions, is contradicted by evidence from a sample of data. It is named after Dutch mathematician Nicolaas Kuiper. Kuiper's test is closely related to the better known Kolmogorov–Smirnov test (or K S test as it is often called). As with the K S test, the discrepancy statistics D+ and D− represent the absolute sizes of the most positive and most negative differences between the two cumulative distribution functions that are being compared. The trick with Kuiper's test is to use the quantity D+ + D− as the test statistic. This small change makes Kuiper's test as sensitive in the tails as at the median and also makes it invariant under cyclic transformations of the independent variable. The Anderson–Darling test is another test that provides equal sensitivity at the tails as the median, but it does not provide the cyclic invariance. This invariance under cyclic transformations makes Kuiper's test invaluable when testing for cyclic variations by time of year or day of the week or time of day, and more generally for testing the fit of, and differences between, circular probability distributions.
Пример
Мы могли бы проверить гипотезу о том, что компьютеры выходят из строя чаще в определенное время года, чем в другое. Для этого мы собрали бы даты, когда компьютеры из тестового набора вышли из строя, и построили бы эмпирическую функцию распределения. Нулевая гипотеза состоит в том, что отказы распределены равномерно. Статистика Куйпера не изменяется при изменении начала года и не требует разбиения отказов по месяцам или подобным категориям. Другой статистический критерий, обладающий этим свойством, – статистика Уотсона, связанная с тестом Крамера — фон Мизеса. Однако, если отказы происходят преимущественно в выходные дни, многие тесты на равномерное распределение, такие как KS и Куйпера, могут это пропустить, поскольку выходные дни распределены в течение всего года. Эта неспособность различать распределения, имеющие гребенчатую форму, от непрерывных равномерных распределений является ключевой проблемой для всех статистических показателей, основанных на варианте теста KS. Тест Куйпера, применяемый ко времени событий по модулю одной недели, способен обнаружить такую закономерность. Использование времен событий, модулированных с помощью KS-теста, может приводить к различным результатам в зависимости от фазировки данных. В этом примере KS-тест может обнаружить неравномерность, если данные начинаются с субботы, но не сможет обнаружить ее, если неделя начинается со среды.
We could test the hypothesis that computers fail more during some times of the year than others. To test this, we would collect the dates on which the test set of computers had failed and build an empirical distribution function. The null hypothesis is that the failures are uniformly distributed. Kuiper's statistic does not change if we change the beginning of the year and does not require that we bin failures into months or the like. Another test statistic having this property is the Watson statistic, which is related to the Cramér–von Mises test. However, if failures occur mostly on weekends, many uniform distribution tests such as K S and Kuiper would miss this, since weekends are spread throughout the year. This inability to distinguish distributions with a comb like shape from continuous uniform distributions is a key problem with all statistics based on a variant of the K S test. Kuiper's test, applied to the event times modulo one week, is able to detect such a pattern. Using event times that have been modulated with the K S test can result in different results depending on how the data is phased. In this example, the K S test may detect the non uniformity if the data is set to start the week on Saturday, but fail to detect the non uniformity if the week starts on Wednesday.