Введение
Тип статистики Устойчивая статистика - это статистика, которая сохраняет свои свойства, даже если базовые распределение предположения неверны. Для многих общих проблем, таких как оценка местоположения, масштаба и регрессивных параметров, были разработаны надежные статистические методы. Одна из причин - создание статистических методов, которые не подвержены чрезмерному влиянию отклонений. Другая мотивация - обеспечить методы с хорошей производительностью, когда есть небольшие отклонения от параметрического распределения. Например, надежные методы хорошо работают для смеси двух нормальных распределений с разными стандартными отклонениями; в соответствии с этой моделью, не надежные методы, такие как t-тест, работают плохо.
Robust statistics are statistics which maintain their properties even if the underlying distributional assumptions are incorrect. Robust statistical methods have been developed for many common problems, such as estimating location, scale, and regression parameters. One motivation is to produce statistical methods that are not unduly affected by outliers. Another motivation is to provide methods with good performance when there are small departures from a parametric distribution. For example, robust methods work well for mixtures of two normal distributions with different standard deviations; under this model, non robust methods like a t test work poorly.
Введение
Надежная статистика стремится предоставить методы, которые подражают популярным статистическим методам, но не подвержены чрезмерному влиянию отклонений или других небольших отклонений от модельных допущений. В статистике классические методы оценки в значительной степени опираются на допущения, которые часто не выполняются на практике. В частности, часто предполагается, что ошибки данных распределены нормально, по крайней мере приблизительно, или что центральная теорема о пределе может быть использована для получения нормально распределенных оценок. К сожалению, когда в данных есть отклонения, классические оценщики часто имеют очень плохую производительность, если судить с использованием точки разбивки и функции влияния, описанной ниже. Практическое воздействие проблем, наблюдаемых в функции влияния, может быть изучено эмпирически путем изучения распределения выборки предлагаемых оценщиков в модели смеси, где смешивается небольшое количество (15% часто достаточно) загрязнения. Например, можно использовать смесь 95% нормального распределения и 5% нормального распределения с тем же средним, но значительно более высоким стандартным отклонением (представляющим отклонения). Надежная параметрическая статистика может осуществляться двумя способами: разработкой оценщиков таким образом, чтобы предварительно выбранное поведение функции влияния достигалось заменой оценщиков, которые являются оптимальными при предположении нормального распределения, оценщиками, которые являются оптимальными для, или, по крайней мере, получены для, других распределений: например, с использованием t-распределения с низкой степенью свободы (высокий куртоз) или с смесью двух или более распределений. Для следующих задач были изучены надежные оценки: оценка параметров местоположения, оценка параметров масштаба, оценка коэффициентов регрессии, оценка состояний модели в моделях, выраженных в форме пространства состояний, для которых стандартный метод эквивалентен фильтру Калмана.
by designing estimators so that a pre selected behaviour of the influence function is achieved
by replacing estimators that are optimal under the assumption of a normal distribution with estimators that are optimal for, or at least derived for, other distributions: for example using the t distribution with low degrees of freedom (high kurtosis) or with a mixture of two or more distributions. Robust estimates have been studied for the following problems:
estimating location parameters
estimating scale parameters
estimating regression coefficients
estimation of model states in models expressed in state space form, for which the standard method is equivalent to a Kalman filter.
Определение
Существуют различные определения "устойчивой статистики". Строго говоря, надежная статистика устойчива к ошибкам в результатах, вызванным отклонениями от допущений (например, нормальности). Это означает, что если предположения выполнены только приблизительно, то надежный оценщик все равно будет иметь разумную эффективность и разумно небольшую предвзятость, а также будет асимптотически непредвзятым, что означает, что предвзятость имеет тенденцию к 0, поскольку размер выборки имеет тенденцию к бесконечности. Обычно наиболее важным случаем является распределение надежности надежности для нарушения допущений о базовом распределении данных.
Разнообразие применений
Хотя в этой статье рассматриваются общие принципы для одновариантных статистических методов, существуют также надежные методы для регрессионных задач, обобщенных линейных моделей и параметрической оценки различных распределений.
Меры надежности
Основными инструментами, используемыми для описания и измерения надежности, являются точка разрыва, функция влияния и кривая чувствительности.
Точка разрыва
Интуитивно, точка разбивки оценщика - это доля неправильных наблюдений (например, произвольно больших наблюдений), с которыми может справиться оценщик, прежде чем дать неправильный (например, произвольно большой) результат. Обычно асимптотический (бесконечный образец) предел указывается как точка разбивки, хотя конечная точка разбивки образца может быть более полезной. Например, учитывая независимые случайные переменные и соответствующие реализации , мы можем использовать для оценки среднего значения. Такой оценщик имеет точку разбивки 0 (или точку разбивки конечной выборки), потому что мы можем произвольно увеличить его, просто изменив любую из следующих характеристик: чем выше точка разбивки оценщика, тем он более надежен. Интуитивно мы можем понять, что точка разбивки не может превышать 50%, потому что если более половины наблюдений загрязнены, невозможно различить основную и загрязняющую распределения. Поэтому максимальная точка разбивки составляет 0,5, и есть оценщики, которые достигают такой точки разбивки. Например, медиана имеет точку разбивки 0,5. Средняя величина при урезании на X% имеет точку разбивки X%, для выбранного уровня X. и содержит больше деталей. Уровень и точки разрыва мощности испытаний исследуются в статистике с высокими точками разрыва иногда называют устойчивой статистикой.
The higher the breakdown point of an estimator, the more robust it is. Intuitively, we can understand that a breakdown point cannot exceed 50% because if more than half of the observations are contaminated, it is not possible to distinguish between the underlying distribution and the contaminating distribution Therefore, the maximum breakdown point is 0.5 and there are estimators which achieve such a breakdown point. For example, the median has a breakdown point of 0.5. The X% trimmed mean has a breakdown point of X%, for the chosen level of X. and contain more details. The level and the power breakdown points of tests are investigated in
Statistics with high breakdown points are sometimes called resistant statistics.
Пример: данные о скорости света
В примере скорости света, удаление двух самых низких наблюдений приводит к изменению средней величины с 26,2 до 27,75, изменение на 1,55. Оценка масштаба, полученная методом Qn, составляет 6,3. Мы можем разделить это на квадратный корень размера выборки, чтобы получить надежную стандартную ошибку, и мы находим, что эта величина равна 0,78. Таким образом, изменение среднего значения, полученное в результате удаления двух отклонений, примерно в два раза больше, чем устойчивая стандартная ошибка. Среднее значение скорости света с 10%-ной отрезкой составляет 27,43. Удаление двух самых низких наблюдений и пересчет дает 27.67. На среднее значение, полученное в результате сокращения, меньше влияют отходные значения и имеет более высокую точку разбивки. Если мы заменим самый низкий показатель, -44, на -1000, среднее значение становится 11,73, тогда как среднее значение с 10% сокращением все равно составляет 27,43. Во многих областях прикладной статистики распространено преобразование данных в логические, чтобы сделать их почти симметричными. Очень маленькие значения становятся большими отрицательными при преобразовании логарифма, а нули становятся отрицательно бесконечными. Поэтому этот пример представляет практический интерес.
Чувствительность к местному сдвигу
Это значение, которое очень похоже на постоянную Липшица, представляет собой эффект перемещения наблюдения слегка из соседней точки, т. е. добавление наблюдения в и удаление одного в .
Оценщики М
(Математический контекст данного пункта приведен в разделе о эмпирических функциях влияния.) Исторически было предложено несколько подходов к надежной оценке, включая R-оценщики и L-оценщики. Однако, в настоящее время, по-видимому, в данной области доминируют М-оценщики в результате их общего характера, их потенциала для высоких точек разбивки и сравнительно высокой эффективности. См. М. Оценщики не являются по своей сути надежными. Однако они могут быть спроектированы таким образом, чтобы достичь благоприятных свойств, включая прочность. M-эстиматор является обобщением максимально вероятных оценщиков (MLE), которые определяются путем максимизации или, эквивалентно, минимизации В 1964 году Губер предложил обобщить это до минимизации , где есть некоторая функция. Поэтому МЛЭ являются особым случаем М-оценщиков (отсюда и название: "оценщики типа максимальной вероятности"). Минимизация часто может быть сделана путем дифференцирования и решения , где (если есть производная). Было предложено несколько вариантов. На двух нижеприведенных рисунках показаны четыре функции и их соответствующие функции. Для квадратированных ошибок она увеличивается с ускоряющейся скоростью, в то время как для абсолютных ошибок она увеличивается с постоянной скоростью. При использовании Винсоризации вводится смесь этих двух эффектов: для малых значений x, увеличивается в квадрате, но как только выбранный порог достигнут (1,5 в этом примере), скорость увеличения становится постоянной. Этот оценщик Винсора также известен как функция потери Хьюбера. Функция двумерности Туки (также известная как бискварт) вначале ведет себя аналогично функции квадратной ошибки, но при больших ошибках функция уменьшается.
M estimators are not inherently robust. However, they can be designed to achieve favourable properties, including robustness. M estimator are a generalization of maximum likelihood estimators (MLEs) which is determined by maximizing or, equivalently, minimizing In 1964, Huber proposed to generalize this to the minimization of , where is some function. MLE are therefore a special case of M estimators (hence the name: "Maximum likelihood type" estimators). Minimizing can often be done by differentiating and solving , where (if has a derivative). Several choices of and have been proposed. The two figures below show four functions and their corresponding functions. For squared errors, increases at an accelerating rate, whilst for absolute errors, it increases at a constant rate. When Winsorizing is used, a mixture of these two effects is introduced: for small values of x, increases at the squared rate, but once the chosen threshold is reached (1.5 in this example), the rate of increase becomes constant. This Winsorised estimator is also known as the Huber loss function. Tukey's biweight (also known as bisquare) function behaves in a similar way to the squared error function at first, but for larger errors, the function tapers off.
Свойства оценщиков М
Оценщики M не обязательно относятся к функции плотности вероятности. Поэтому, обычные подходы к выводу, которые возникают из теории вероятности, в целом не могут быть использованы. Можно показать, что оценщики M асимптотически нормально распределены, так что, пока их стандартные ошибки могут быть вычислены, доступен приблизительный подход к выводу. Поскольку оценщики M нормальны только асимптотически, для небольших размеров выборки может быть целесообразным использовать альтернативный подход к выводу, такой как загрузка. Однако оценки М не обязательно являются уникальными (т.е. может быть более одного решения, удовлетворяющего уравнениям). Кроме того, возможно, что любая конкретная выборка может содержать больше отклонений, чем точка разбивки оценщика. Поэтому при разработке схем загрузки требуется некоторая осторожность. Конечно, как мы видели с скоростью света пример, среднее только нормально распределяется асимптотически и когда отклонения присутствуют приближение может быть очень плохим даже для довольно больших образцов. Однако классические статистические тесты, в том числе основанные на среднем, обычно ограничены номинальным размером теста. То же самое не относится к оценщикам M, а уровень ошибок типа I может быть значительно выше номинального уровня. Эти соображения никак не "опровергают" оценку M. Они лишь показывают, что при их использовании, как и при использовании любого другого метода оценки, требуется некоторая осторожность.
Выбор ψ и ρ
Во многих практических ситуациях выбор функции не имеет решающего значения для получения хорошей надежной оценки, и многие варианты дают аналогичные результаты, которые предлагают большие улучшения с точки зрения эффективности и предвзятости по сравнению с классическими оценками при наличии отклонений. Теоретически, функции должны быть предпочтительнее, и функция Tukey's biweight (также известная как бискваренная) является популярным выбором. рекомендую функцию двухместного веса с эффективностью при нормальном настройке на 85%.
Связанные понятия
Ориентировочная величина - это функция данных, основное распределение популяции которой является членом параметрического семейства, не зависящего от значений параметров. Помощная статистика - это функция, которая также является статистикой, то есть рассчитывается только с точки зрения данных. Такие функции надежны для параметров в том смысле, что они независимы от значений параметров, но не надежны для модели в том смысле, что они предполагают базовую модель (параметрическое семейство), и на самом деле такие функции часто очень чувствительны к нарушениям допущений модели. Таким образом, тестовая статистика, часто составляемая с точки зрения этих данных, не чувствительна к допущениям о параметрах, все еще очень чувствительна к допущениям модели.
Замена отклонений и недостающих значений
Замена недостающих данных называется импутация. Если отсутствует относительно мало точек, существуют некоторые модели, которые могут быть использованы для оценки значений для завершения ряда, например, замена отсутствующих значений средним или медианой данных. Простая линейная регрессия также может быть использована для оценки недостающих значений. Кроме того, в данные иногда могут быть включены отклонения с помощью средних величин, других оценочных значений, кроме стандартного отклонения (например, MAD) и Winsorization. При расчетах среднего значения с подрезанными значениями фиксированный процент данных убрали с каждого конца упорядоченных данных, таким образом устраняя отклонения. Затем среднее значение рассчитывается с использованием оставшихся данных. Winsorizing предполагает принятие отклонения путем замены его следующим самым высоким или следующим самым низким значением, в зависимости от обстоятельств. Однако использование этих типов моделей для прогнозирования отсутствующих значений или отклонений в длинных временных рядах затруднительно и часто ненадежно, особенно если количество заполняемых значений относительно велико по сравнению с общей длиной записи. Точность оценки зависит от того, насколько хороша и репрезентативна модель и насколько длится период отсутствия значений. Когда динамическая эволюция предполагается в ряде, проблема отсутствия точек данных становится упражнением в многовариантном анализе (а не в одновариантном подходе большинства традиционных методов оценки отсутствующих значений и отклонений). В таких случаях многовариантная модель будет более репрезентативной, чем одновариантная, для прогнозирования отсутствующих значений. Самоорганизующаяся карта Кохонена (KSOM) предлагает простую и надежную многовариантную модель для анализа данных, обеспечивая тем самым хорошие возможности для оценки недостающих значений, принимая во внимание их связь или корреляцию с другими соответствующими переменными в записи данных. Стандартные фильтры Калмана не устойчивы к отклонениям. С этой целью недавно было показано, что модификация теоремы Масрелиэса может иметь дело с отклонениями. Один из распространенных подходов к обработке отклонений в анализе данных заключается в том, чтобы сначала выявить отклонения, а затем использовать эффективный метод оценки (например, наименьшие квадраты). Хотя этот подход часто полезен, необходимо иметь в виду две проблемы. Во-первых, метод обнаружения отклонений, который опирается на невысокую первоначальную соответствие может страдать от эффекта маскировки, то есть группа отклонений может маскировать друг друга и избежать обнаружения. Во-вторых, если для выявления отклонений используется высокая первоначальная разбивка, то последующий анализ может унаследовать некоторые неэффективности первоначального оценщика.