Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
В устойчивой статистике критерий Пирса — это правило для исключения выбросов из наборов данных, разработанное Бенджамином Пирсом.
In robust statistics, Peirce's criterion is a rule for eliminating outliers from data sets, which was devised by Benjamin Peirce.
Проблема отклонений
В наборах данных, содержащих вещественные числовые измерения, подозрительными выбросами считаются измеренные значения, которые кажутся лежащими за пределами скопления большинства других значений данных. Выбросы существенно изменили бы оценку положения, если бы для обобщающей статистики положения использовалось арифметическое среднее. Проблема заключается в том, что арифметическое среднее очень чувствительно к включению любых выбросов; в статистической терминологии арифметическое среднее не является устойчивым. В присутствии выбросов у статистика есть два варианта. Во-первых, статистик может удалить подозрительные выбросы из набора данных, а затем использовать арифметическое среднее для оценки параметра положения. Во-вторых, статистик может использовать устойчивую статистику, такую как медиана. Критерий Пирса – это статистическая процедура для выявления и исключения выбросов.
In data sets containing real numbered measurements, the suspected outliers are the measured values that appear to lie outside the cluster of most of the other data values. The outliers would greatly change the estimate of location if the arithmetic average were to be used as a summary statistic of location. The problem is that the arithmetic mean is very sensitive to the inclusion of any outliers; in statistical terminology, the arithmetic mean is not robust. In the presence of outliers, the statistician has two options. First, the statistician may remove the suspected outliers from the data set and then use the arithmetic mean to estimate the location parameter. Second, the statistician may use a robust statistic, such as the median statistic. Peirce's criterion is a statistical procedure for eliminating outliers.
Реализация Python
Для того, чтобы использовать критерий Пирса, необходимо сначала понять входные и выходные данные. Анализ регрессии (или подгонка кривых к данным) приводит к остаточным ошибкам (или разнице между подогнанной кривой и точками наблюдения). Следовательно, каждой точке наблюдения соответствует остаточная ошибка для данной кривой. Возводя остаточную ошибку в квадрат (т.е. в степень два), остаточные ошибки представляются в виде положительных значений. Если квадрат ошибки слишком велик (т.е. из-за неточного наблюдения), это может вызвать проблемы с параметрами регрессии (например, наклоном и пересечением для линейной кривой), полученными при подгонке кривой. Идея Пирса заключалась в статистическом определении того, что считать ошибкой "слишком большой" и, следовательно, идентифицировать как "выброс", который можно удалить из наблюдений для улучшения соответствия между наблюдениями и кривой. К. Томсен установил, что для выполнения расчета необходимо три параметра: количество пар наблюдений (N), количество выбросов, которые необходимо удалить (n), и количество параметров регрессии (например, коэффициентов), используемых при подгонке кривой для получения остаточных значений (m). Конечным результатом этого процесса является вычисление порогового значения (квадратной ошибки), при котором наблюдения с квадратной ошибкой меньше этого порога следует сохранять, а наблюдения с квадратной ошибкой больше этого значения следует удалять (т.е. как выбросы). Поскольку критерий Пирса не принимает наблюдения, параметры подгонки или остаточные ошибки в качестве входных данных, выходные данные необходимо соотнести с данными. Умножение среднего значения всех квадратичных ошибок (т.е. среднеквадратичной ошибки) на пороговую квадратичную ошибку (т.е. выходное значение этой функции) позволит получить пороговое значение, специфичное для данных, используемое для идентификации выбросов. Следующий код на Python возвращает значения x в квадрате для заданного (первой колонки) и (верхней строки) в таблице 1 (m = 1) и таблице 2 (m = 2) Gould 1855. Благодаря методу итераций Ньютона, таблицы поиска, такие как N в зависимости от log Q (таблица III в Gould, 1855) и x в зависимости от log R (таблица III в Peirce, 1852 и таблица IV в Gould, 1855), больше не требуются.
In order to use Peirce's criterion, one must first understand the input and return values. Regression analysis (or the fitting of curves to data) results in residual errors (or the difference between the fitted curve and the observation points). Therefore, each observation point has a residual error associated with a fitted curve. By taking the square (i. e., residual error raised to the power of two), residual errors are expressed as positive values. If the squared error is too large (i. e., due to a poor observation) it can cause problems with the regression parameters (e. g., slope and intercept for a linear curve) retrieved from the curve fitting. It was Peirce's idea to statistically identify what constituted an error as "too large" and therefore being identified as an "outlier" which could be removed from the observations to improve the fit between the observations and a curve. K. Thomsen identified that three parameters were needed to perform the calculation: the number of observation pairs (N), the number of outliers to be removed (n), and the number of regression parameters (e. g., coefficients) used in the curve fitting to get the residuals (m). The end result of this process is to calculate a threshold value (of squared error) whereby observations with a squared error smaller than this threshold should be kept and observations with a squared error larger than this value should be removed (i. e., as an outlier). Because Peirce's criterion does not take observations, fitting parameters, or residual errors as an input, the output must be re associated with the data. Taking the average of all the squared errors (i. e., the mean squared error) and multiplying it by the threshold squared error (i. e., the output of this function) will result in the data specific threshold value used to identify outliers. The following Python code returns x squared values for a given (first column) and (top row) in Table 1 (m = 1) and Table 2 (m = 2) of Gould 1855. Due to the Newton method of iteration, look up tables, such as N versus log Q (Table III in Gould, 1855) and x versus log R (Table III in Peirce, 1852 and Table IV in Gould, 1855) are no longer necessary.
R внедрение
Код Томсена был успешно интегрирован в следующий вызов функции "findx" К. Дардисом и С. Мюллером в 2012 году, который возвращает максимальное отклонение ошибки. В дополнение к коду Python, представленному в предыдущем разделе, здесь также представлен эквивалент на R – "peirce dev", который возвращает квадрат максимального отклонения ошибки. Эти две функции возвращают эквивалентные значения, либо возводя в квадрат значение, возвращаемое функцией "findx", либо извлекая квадратный корень из значения, возвращаемого функцией "peirce dev". Различия возникают в обработке ошибок. Например, функция "findx" возвращает NaN для недопустимых данных, а "peirce dev" возвращает 0 (что позволяет продолжить вычисления без дополнительной обработки NA-значений). Кроме того, функция "findx" не предусматривает обработку ошибок, когда количество потенциальных выбросов приближается к количеству наблюдений (возникает ошибка отсутствующего значения и предупреждение NaN). Как и в версии на Python, квадрат ошибки (т.е. ), возвращаемый функцией "peirce dev", необходимо умножить на среднюю квадратичную ошибку подгонки модели, чтобы получить квадрат дельты (т.е. Δ2). Используйте Δ2 для сравнения квадратов ошибок подгонки модели. Любые пары наблюдений с квадратом ошибки, превышающим Δ2, считаются выбросами и могут быть удалены из модели. Необходимо разработать итератор для проверки возрастающих значений n до тех пор, пока количество идентифицированных выбросов (путем сравнения Δ2 с квадратами ошибок подгонки модели) не станет меньше предполагаемого (т.е. n Пирса).
Thomsen's code has been successfully written into the following function call, "findx" by C. Dardis and S. Muller in 2012 which returns the maximum error deviation, To complement the Python code presented in the previous section, the R equivalent of "peirce dev" is also presented here which returns the squared maximum error deviation, These two functions return equivalent values by either squaring the returned value from the "findx" function or by taking the square root of the value returned by the "peirce dev" function. Differences occur with error handling. For example, the "findx" function returns NaNs for invalid data while "peirce dev" returns 0 (which allows for computations to continue without additional NA value handling). Also, the "findx" function does not support any error handling when the number of potential outliers increases towards the number of observations (throws missing value error and NaN warning). Just as with the Python version, the squared error (i. e., ) returned by the "peirce dev" function must be multiplied by the mean squared error of the model fit to get the squared delta value (i. e., Δ2). Use Δ2 to compare the squared error values of the model fit. Any observation pairs with a squared error greater than Δ2 are considered outliers and can be removed from the model. An iterator should be written to test increasing values of n until the number of outliers identified (comparing Δ2 to model fit squared errors) is less than those assumed (i. e., Peirce's n).