Введение

Наблюдение, значительно отличающееся от других в статистике и науке о данных – статистический термин.

В статистике выбросом является точка данных, которая значительно отличается от других наблюдений. Выброс может быть вызван изменчивостью измерения, указывать на новые данные или быть результатом экспериментальной ошибки; последние иногда исключаются из набора данных. Выброс может быть признаком интересной возможности, но также может вызывать серьезные проблемы в статистическом анализе. Выбросы могут возникать случайно в любом распределении, но они могут указывать на новое поведение или структуры в наборе данных, ошибку измерения или на то, что популяция имеет тяжелый хвост распределения. В случае ошибки измерения их следует исключить или использовать статистику, устойчивую к выбросам, в то время как в случае тяжелых хвостов распределения это указывает на высокую асимметрию распределения и требует осторожности при использовании инструментов или интуиции, предполагающих нормальное распределение. Частой причиной выбросов является смесь двух распределений, которые могут представлять собой две различные подпопуляции или указывать на различие между «правильным измерением» и «ошибкой измерения»; это моделируется смесью распределений. В большинстве больших выборок данных некоторые точки данных будут находиться дальше от среднего значения выборки, чем считается разумным. Это может быть связано со случайной систематической ошибкой или недостатками в теории, породившей предполагаемое семейство распределений вероятностей, или же некоторые наблюдения значительно отклоняются от центра данных. Таким образом, выбросы могут указывать на ошибочные данные, некорректные процедуры или области, в которых определенная теория может быть недействительна. Однако в больших выборках небольшое количество выбросов ожидаемо (и не связано с какими-либо аномальными условиями). Выбросы, будучи наиболее экстремальными наблюдениями, могут включать максимальное или минимальное значение выборки, или оба, в зависимости от того, являются ли они чрезвычайно высокими или низкими. Однако максимальные и минимальные значения выборки не всегда являются выбросами, поскольку они могут быть не слишком далеки от других наблюдений. Наивная интерпретация статистики, полученной из наборов данных, содержащих выбросы, может быть вводящей в заблуждение. Например, если вычислять среднюю температуру 10 объектов в комнате, и девять из них находятся между 20 и 25 градусами Цельсия, но духовка нагрета до 175 °C, медиана данных будет между 20 и 25 °C, а средняя температура – между 35,5 и 40 °C. В этом случае медиана лучше отражает температуру случайно выбранного объекта (но не температуру в комнате), чем среднее значение; наивно интерпретировать среднее значение как «типичный образец», эквивалентный медиане, неверно. Как показано в этом примере, выбросы могут указывать на точки данных, принадлежащие к другой популяции, чем остальная часть выборки. Оценки, способные справляться с выбросами, называются устойчивыми: медиана является устойчивой статистикой центральной тенденции, в то время как среднее значение – нет. Однако среднее значение, как правило, является более точной оценкой.

Возникновение и причины

В случае нормально распределённых данных, правило трёх сигм означает, что примерно одно из 22 наблюдений будет отличаться от среднего значения более чем в два раза от стандартного отклонения, а одно из 370 – более чем в три раза. В выборке из 1000 наблюдений наличие до пяти наблюдений, отклоняющихся от среднего значения более чем в три раза, находится в пределах ожидаемого, что менее чем в два раза превышает ожидаемое число и, следовательно, лежит в пределах одного стандартного отклонения от ожидаемого числа – см. распределение Пуассона – и не указывает на аномалию. Однако, если размер выборки составляет всего 100, уже три таких выброса являются поводом для беспокойства, поскольку их число более чем в 11 раз превышает ожидаемое. В общем случае, если априори известна природа распределения генеральной совокупности, можно проверить, значительно ли отклоняется число выбросов от ожидаемого: для заданного порога (при котором вероятность попадания образцов за этот порог равна p) данного распределения, число выбросов будет следовать биномиальному распределению с параметром p, которое, как правило, можно хорошо аппроксимировать распределением Пуассона с λ = pn. Таким образом, если взять нормальное распределение с порогом в 3 стандартных отклонения от среднего значения, p составляет примерно 0,3%, и, следовательно, для 1000 испытаний можно приближённо оценить количество образцов, отклонение которых превышает 3 сигмы, распределением Пуассона с λ = 3.

Причины

Отклонения могут иметь множество аномальных причин. Физический аппарат для измерений мог испытать кратковременную неисправность. Могла произойти ошибка при передаче или переписывании данных. Отклонения возникают из-за изменений в поведении системы, мошеннических действий, человеческой ошибки, инструментальной ошибки или просто из-за естественных отклонений в популяциях. Образец мог быть загрязнен элементами, не входящими в исследуемую популяцию. В качестве альтернативы, отклонение может быть результатом недостатка в принятой теории, требующего дальнейшего изучения исследователем. Кроме того, патологическое проявление отклонений определенного типа встречается в различных наборах данных, указывая на то, что механизм, порождающий данные, может отличаться на экстремальных значениях (эффект Кинга).

Критерий Пирса

Предлагается определить в серии наблюдений предел ошибки, за которым все наблюдения, содержащие столь значительную ошибку, могут быть отброшены, при условии, что имеется достаточное количество таких наблюдений. Принцип, на основе которого предлагается решить эту задачу, заключается в том, что предлагаемые наблюдения следует отбрасывать, когда вероятность системы ошибок, полученной при их сохранении, меньше, чем вероятность системы ошибок, полученной при их отбрасывании, умноженная на вероятность появления именно такого количества, и не более, аномальных наблюдений. (Цитируется в редакционной примечании на странице 516 у Пирса (издание 1982 года) из "Руководства по астрономии 2:558" Шовене).

Ограждения Тукея

Другие методы отмечают наблюдения на основе таких мер, как межквартильный размах. Например, если Q₁ и Q₃ – нижний и верхний квартили соответственно, то выбросом можно определить любое наблюдение, выходящее за пределы диапазона:

Q₁ - k * IQR ≤ x ≤ Q₃ + k * IQR

для некоторой неотрицательной константы k. Этот тест был предложен Джоном Тьюки, где k = 1.5 указывает на "выброс", а k = 3 указывает на данные, которые "сильно отклоняются".

В обнаружении аномалий

В различных областях, таких как статистика, обработка сигналов, финансы, эконометрика, производство, сети и интеллектуальный анализ данных, задача обнаружения аномалий может решаться и другими способами. Некоторые из них основаны на расстоянии и плотности, например, Local Outlier Factor (LOF). Другие подходы могут использовать расстояние до k ближайших соседей для классификации наблюдений как аномалий или нормальных значений.

Работа с отклонениями

Выбор способа обработки выброса должен зависеть от его причины. Некоторые оценки крайне чувствительны к выбросам, в частности, оценка матриц ковариации.

Сохранение

Даже если модель нормального распределения подходит для анализируемых данных, выбросы ожидаемы при больших объемах выборки и не должны автоматически отбрасываться в этом случае. Вместо этого следует использовать метод, устойчивый к выбросам, для моделирования или анализа данных, содержащих естественные выбросы. Однако, если это возможно, предпочтительнее исправить ошибочное значение. С другой стороны, удаление точки данных исключительно на основании того, что она является выбросом, – это спорная практика, часто подвергаемая критике со стороны многих ученых и преподавателей, поскольку это обычно ставит под сомнение статистические результаты. Исключение также может быть следствием процесса измерения, например, когда эксперимент не способен точно измерить такие экстремальные значения, что приводит к цензурированным данным. В задачах регрессии альтернативным подходом может быть исключение только тех точек, которые оказывают существенное влияние на оцененные коэффициенты, используя, например, расстояние Кука. Если точка (или точки) данных исключены из анализа, это должно быть четко указано в последующем отчете.

Необычное распределение

Следует рассмотреть возможность того, что исходное распределение данных не является приблизительно нормальным и имеет "тяжелые хвосты". Например, при выборке из распределения Коши дисперсия выборки возрастает с увеличением размера выборки, выборочное среднее не стремится к сходимости при увеличении размера выборки, а выбросы встречаются значительно чаще, чем в нормальном распределении. Даже незначительное различие в толщине хвостов может существенно повлиять на ожидаемое количество экстремальных значений.

Неопределенность в отношении членства в наборе

Подход, основанный на принадлежности к множеству, рассматривает неопределенность, соответствующую i-му измерению неизвестного случайного вектора x, как заданную множеством Xi (вместо функции плотности вероятности). Если выбросов не происходит, вектор x должен принадлежать пересечению всех множеств Xi. При наличии выбросов это пересечение может быть пустым, и необходимо исключить небольшое количество множеств Xi (минимально возможное), чтобы избежать противоречий. Это достигается с помощью понятия q-расслабленного пересечения. Как показано на рисунке, q-расслабленное пересечение представляет собой множество всех векторов x, принадлежащих всем множествам, за исключением q из них. Множества Xi, не пересекающиеся с q-расслабленным пересечением, могут быть идентифицированы как выбросы.

Альтернативные модели

В случаях, когда причина выбросов известна, может быть возможно учесть этот эффект в структуре модели, например, используя иерархическую байесовскую модель или модель смесей.