Деректерден қате мәндерді жою критерийі: Пирс критериі
Peirce's criterion
Бенджамин Пирс критериі – деректерден қате мәлімдемелерді жою ережесі. Статистикада қолданылады, орташа есептеуге әсер ететін сыртқы мәндерді анықтайды.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Қатаң статистикада Пирс критерийі — Бенджамин Пирс жасаған деректер жиынынан сыртқы мәндерді (аутлиерлерді) жою қағидасы.
In robust statistics, Peirce's criterion is a rule for eliminating outliers from data sets, which was devised by Benjamin Peirce.
Аутсалер проблемасы
Нақты сандық өлшемдері бар деректер жиынында күдікті аномалиялар – бұл басқа деректердің көп бөлігінен тысқары орналасқандай көрінетін өлшенген мәндер. Егер арифметикалық орташа орналасудың жиынтық статистикасы ретінде қолданылса, аномалиялар орналасу бағалауын күрт өзгертеді. Мәселе мында, арифметикалық орташа кез келген аномалияның енгізілуіне өте сезімтал; статистикалық терминологияда арифметикалық орташа тұрақты емес. Аномалиялар болған жағдайда, статистик екі мүмкіндікке ие. Біріншіден, статистик деректер жиынынан күдікті аномалияларды алып тастап, содан кейін арифметикалық орташаны орналасу параметрін бағалау үшін пайдалана алады. Екіншіден, статистик медиана сияқты тұрақты статистиканы қолдана алады. Пирс критерийі – аномалияларды жоюға арналған статистикалық процедура.
In data sets containing real numbered measurements, the suspected outliers are the measured values that appear to lie outside the cluster of most of the other data values. The outliers would greatly change the estimate of location if the arithmetic average were to be used as a summary statistic of location. The problem is that the arithmetic mean is very sensitive to the inclusion of any outliers; in statistical terminology, the arithmetic mean is not robust. In the presence of outliers, the statistician has two options. First, the statistician may remove the suspected outliers from the data set and then use the arithmetic mean to estimate the location parameter. Second, the statistician may use a robust statistic, such as the median statistic. Peirce's criterion is a statistical procedure for eliminating outliers.
Python-ты іске асыру
Пирс критериін қолдану үшін алдымен кіріс және қайтарым мәндерін түсіну қажет. Регрессиялық талдау (немесе деректерге қисықтарды бейімдеу) қалдық қателерге (немесе бейімделген қисық пен бақылау нүктелері арасындағы айырмашылыққа) әкеледі. Сондықтан, әрбір бақылау нүктесі бейімделген қисықпен байланысты қалдық қатеге ие. Қалдық қателерді оң мәндер ретінде көрсету үшін квадраттау (яғни, қалдық қателіктің квадратына көтеру) қолданылады. Егер квадраттық қате тым үлкен болса (яғни, нашар бақылаудың нәтижесінде), қисыққа бейімдеуден алынған регрессия параметрлерімен (мысалы, сызықтық қисық үшін еңіс және қиылысу нүктесі) проблемалар туындауы мүмкін. Пирстің идеясы – қателікті статистикалық тұрғыдан «өте үлкен» деп анықтау және осылайша «аутлиер» ретінде белгілеу, оны бақылаулардан алып тастау арқылы бақылаулар мен қисық арасындағы сәйкестікті жақсарту. К. Томсен есептеуді жүзеге асыру үшін үш параметр қажет екенін анықтады: бақылау жұптарының саны (N), алынып тасталатын аутлиерлердің саны (n) және қалдықтарды алу үшін қисыққа бейімдеуде қолданылатын регрессия параметрлерінің саны (мысалы, коэффициенттер) (m). Бұл процестің соңғы нәтижесі – квадраттық қателіктің шекті мәнін есептеу болып табылады, онда осы шекті мәннен кіші квадраттық қателігі бар бақылаулар сақталуы керек, ал осы мәннен үлкен квадраттық қателігі бар бақылаулар алынып тасталуы керек (яғни, аутлиер ретінде). Пирс критериі бақылауларды, бейімдеу параметрлерін немесе қалдық қателерді кіріс ретінде қабылдамайды, сондықтан нәтиже деректермен қайта байланыстырылуы керек. Барлық квадраттық қателердің орташасы (яғни, орташа квадраттық қате) алынып, оны шекті квадраттық қатемен (яғни, осы функцияның нәтижесі) көбейту нәтижесінде аутлиерлерді анықтау үшін қолданылатын дерекке тән шекті мән шығады. Төмендегі Python коды Гульдтың 1855 жылғы 1-кестесінде (m = 1) және 2-кестесінде (m = 2) берілген (бірінші баған) және (жоғарғы қатар) үшін x-тің квадраттық мәндерін қайтарады. Ньютонның итерациялық әдісіне байланысты, N-ге қарсы log Q (Гульдтың 1855 жылғы III кестесі) және x-ке қарсы log R (Пирстің 1852 жылғы III кестесі және Гульдтың 1855 жылғы IV кестесі) сияқты анықтамалық кестелерді қарау қажеттілігі жойылды.
In order to use Peirce's criterion, one must first understand the input and return values. Regression analysis (or the fitting of curves to data) results in residual errors (or the difference between the fitted curve and the observation points). Therefore, each observation point has a residual error associated with a fitted curve. By taking the square (i. e., residual error raised to the power of two), residual errors are expressed as positive values. If the squared error is too large (i. e., due to a poor observation) it can cause problems with the regression parameters (e. g., slope and intercept for a linear curve) retrieved from the curve fitting. It was Peirce's idea to statistically identify what constituted an error as "too large" and therefore being identified as an "outlier" which could be removed from the observations to improve the fit between the observations and a curve. K. Thomsen identified that three parameters were needed to perform the calculation: the number of observation pairs (N), the number of outliers to be removed (n), and the number of regression parameters (e. g., coefficients) used in the curve fitting to get the residuals (m). The end result of this process is to calculate a threshold value (of squared error) whereby observations with a squared error smaller than this threshold should be kept and observations with a squared error larger than this value should be removed (i. e., as an outlier). Because Peirce's criterion does not take observations, fitting parameters, or residual errors as an input, the output must be re associated with the data. Taking the average of all the squared errors (i. e., the mean squared error) and multiplying it by the threshold squared error (i. e., the output of this function) will result in the data specific threshold value used to identify outliers. The following Python code returns x squared values for a given (first column) and (top row) in Table 1 (m = 1) and Table 2 (m = 2) of Gould 1855. Due to the Newton method of iteration, look up tables, such as N versus log Q (Table III in Gould, 1855) and x versus log R (Table III in Peirce, 1852 and Table IV in Gould, 1855) are no longer necessary.
R іске асыру
Томсеннің коды 2012 жылы C. Дардис және S. Мюллердің "findx" функциясы арқылы сәтті жазылды, ол ең үлкен қате ауытқуын қайтарады. Алдыңғы бөлімде ұсынылған Python кодын толықтыру үшін, "peirce dev" R эквиваленті де ұсынылады, ол квадратталған ең үлкен қате ауытқуын қайтарады. Бұл екі функция "findx" функциясынан алынған мәнді квадраттау арқылы немесе "peirce dev" функциясынан алынған мәннің квадрат түбірін алу арқылы эквивалентті мәндерді қайтарады. Қателерді өңдеуде айырмашылықтар бар. Мысалы, "findx" функциясы жарамсыз деректер үшін NaN қайтарады, ал "peirce dev" 0 қайтарады (бұл қосымша NA мәндерін өңдеусіз есептеулерді жалғастыруға мүмкіндік береді). Сондай-ақ, "findx" функциясы, потенциалды аномалиялардың саны байқаулар санына жақындағанда, қателерді өңдеуді қолдамайды (жоғалған мән қатесі және NaN ескертуін шығарады). Python нұсқасындағыдай, "peirce dev" функциясы қайтаратын квадратталған қате (яғни, ) квадратталған дельта мәнін (яғни, Δ2) алу үшін модельдің орташа квадратталған қатесімен көбейтілуі керек. Модельге сәйкестіктің квадратталған қателік мәндерін салыстыру үшін Δ2 пайдаланылады. Δ2-ден жоғары квадратталған қатесі бар кез келген бақылау жұптары аномалиялар деп есептеледі және модельден алынып тасталуы мүмкін. Δ2-ге модельге сәйкес келетін квадратталған қателерді салыстыру арқылы анықталған аномалиялар саны болжамнан кем болғанша, n-нің өсетін мәндерін тексеру үшін итератор жазылуы керек (яғни Пирс n).
Thomsen's code has been successfully written into the following function call, "findx" by C. Dardis and S. Muller in 2012 which returns the maximum error deviation, To complement the Python code presented in the previous section, the R equivalent of "peirce dev" is also presented here which returns the squared maximum error deviation, These two functions return equivalent values by either squaring the returned value from the "findx" function or by taking the square root of the value returned by the "peirce dev" function. Differences occur with error handling. For example, the "findx" function returns NaNs for invalid data while "peirce dev" returns 0 (which allows for computations to continue without additional NA value handling). Also, the "findx" function does not support any error handling when the number of potential outliers increases towards the number of observations (throws missing value error and NaN warning). Just as with the Python version, the squared error (i. e., ) returned by the "peirce dev" function must be multiplied by the mean squared error of the model fit to get the squared delta value (i. e., Δ2). Use Δ2 to compare the squared error values of the model fit. Any observation pairs with a squared error greater than Δ2 are considered outliers and can be removed from the model. An iterator should be written to test increasing values of n until the number of outliers identified (comparing Δ2 to model fit squared errors) is less than those assumed (i. e., Peirce's n).