Кіріспе
Статистикада және дерек ғылымында басқалардан ерекше байқау – статистикалық термин. Статистикада аутлаер (outlier) – басқа байқаулардан айтарлықтай өзгешелік танытатын дерек нүктесі. Аутлаер өлшемдегі өзгеріске, жаңа деректердің белгісіне немесе эксперименттік қателіктің нәтижесіне байланысты болуы мүмкін; соңғылары кейде деректер жиынтығынан шығарылады. Аутлаер қызықты мүмкіндіктің көрсеткіші болуы мүмкін, бірақ статистикалық талдауларда қиындықтар тудыруы да мүмкін. Аутлаерлер кез келген үлестірімде кездейсоқ пайда болуы мүмкін, бірақ олар деректер жиынтығындағы жаңа мінез-құлықты немесе құрылымды, өлшем қатесін немесе популяцияның ауыр құйрықты үлестірімін көрсетуі мүмкін. Өлшем қатесі болған жағдайда, оларды жою немесе аутлаерлерге төзімді статистиканы пайдалану қажет, ал ауыр құйрықты үлестірімдер болған жағдайда, үлестірімнің жоғары қисықтығын ескеру керек және қалыпты үлестірімді болжайтын құралдарды немесе интуицияларды пайдалануда сақ болу керек. Аутлаерлердің жиі кездесуінің себебі екі үлестірімнің қосылысы болуы мүмкін, олар екі түрлі субпопуляцияны білдіруі мүмкін немесе «дұрыс сынақ» пен «өлшем қатесін» көрсетуі мүмкін; мұндай жағдайлар аралас модельмен сипатталады. Деректердің үлкен үлгілерінде кейбір дерек нүктелері үлгідегі орташадан ақылға қонымды шектен тыс алыс болуы мүмкін. Бұл кездейсоқ жүйелі қатеге немесе теориядағы кемшіліктерге байланысты болуы мүмкін, бұл ықтималдық үлестірілімдерінің болжамды отбасын тудырады, немесе кейбір байқаулар деректердің орталығынан алыс болуы мүмкін. Сондықтан, ерекше нүктелер қате деректерді, қате процедураларды немесе белгілі бір теорияның жарамсыз болуы мүмкін аймақтарды көрсетуі мүмкін. Алайда, үлкен үлгілерде аз сандағы аутлаерлер күтілуі мүмкін (бұл ешқандай аномальды жағдайға байланысты емес). Ең экстремалды байқаулар болғандықтан, аутлаерлер өте жоғары немесе төмен болуына байланысты, үлгідегі ең жоғары немесе ең төменгі мәндерді немесе екеуін де қамтуы мүмкін. Алайда, үлгідегі ең жоғары және ең төменгі мәндер әрқашан аутлаерлер болмайды, өйткені олар басқа байқаулардан ерекше алыс болмауы мүмкін. Аутлаерлерді қамтитын деректер жиынтығынан алынған статистикалық мәліметтерді түсіндіруді бұрмалауға болады. Мысалы, егер бөлмедегі 10 заттың орташа температурасын есептесек, олардың тоғызы 20-25 градус Цельсий аралығында болса, бірақ пештің температурасы 175 °C болса, деректердің медианасы 20-25 °C аралығында болады, бірақ орташа температурасы 35,5-40 °C аралығында болады. Бұл жағдайда медиана кездейсоқ алынған заттың температурасын (бірақ бөлмедегі температураны емес) орташадан гөрі жақсы көрсетеді; орташаны «типілі үлгі» деп түсіндіру, медианаға тең деп есептеу дұрыс емес. Осы жағдайда көрсетілгендей, аутлаерлер басқа жиынтықтан басқа популяцияға жататын дерек нүктелерін көрсетуі мүмкін. Аутлаерлерді шеше алатын бағалаушылар берік деп аталады: медиана – орталық тенденцияның берік статистикасы, ал орташасы емес. Алайда, орташа есеппен алғанда, бұл нақтырақ бағалау болып табылады.
the statistical term
In statistics, an outlier is a data point that differs significantly from other observations. An outlier may be due to a variability in the measurement, an indication of novel data, or it may be the result of experimental error; the latter are sometimes excluded from the data set. An outlier can be an indication of exciting possibility, but can also cause serious problems in statistical analyses. Outliers can occur by chance in any distribution, but they can indicate novel behaviour or structures in the data set, measurement error, or that the population has a heavy tailed distribution. In the case of measurement error, one wishes to discard them or use statistics that are robust to outliers, while in the case of heavy tailed distributions, they indicate that the distribution has high skewness and that one should be very cautious in using tools or intuitions that assume a normal distribution. A frequent cause of outliers is a mixture of two distributions, which may be two distinct sub populations, or may indicate 'correct trial' versus 'measurement error'; this is modeled by a mixture model. In most larger samplings of data, some data points will be further away from the sample mean than what is deemed reasonable. This can be due to incidental systematic error or flaws in the theory that generated an assumed family of probability distributions, or it may be that some observations are far from the center of the data. Outlier points can therefore indicate faulty data, erroneous procedures, or areas where a certain theory might not be valid. However, in large samples, a small number of outliers is to be expected (and not due to any anomalous condition). Outliers, being the most extreme observations, may include the sample maximum or sample minimum, or both, depending on whether they are extremely high or low. However, the sample maximum and minimum are not always outliers because they may not be unusually far from other observations. Naive interpretation of statistics derived from data sets that include outliers may be misleading. For example, if one is calculating the average temperature of 10 objects in a room, and nine of them are between 20 and 25 degrees Celsius, but an oven is at 175 °C, the median of the data will be between 20 and 25 °C but the mean temperature will be between 35.5 and 40 °C. In this case, the median better reflects the temperature of a randomly sampled object (but not the temperature in the room) than the mean; naively interpreting the mean as "a typical sample", equivalent to the median, is incorrect. As illustrated in this case, outliers may indicate data points that belong to a different population than the rest of the sample set. Estimators capable of coping with outliers are said to be robust: the median is a robust statistic of central tendency, while the mean is not. However, the mean is generally a more precise estimator.
Оқиғалар мен себептері
Қалыпты таралымды деректер үшін үш сигма ережесі бойынша, шамамен 22 бақылаудың біреуі орташа мәннен екі немесе одан да көп стандартты ауытқумен өзгешеленеді, ал 370-тің біреуі стандартты ауытқудан үш есе көп ауытқытайды. 1000 бақылаудан тұратын үлгіде орташа мәннен үш есе артық стандартты ауытқумен өзгешеленетін бес бақылаудың болуы, күтілетін саннан екі есе аз болғандықтан және демек күтілетін саннан 1 стандартты ауытқу шегінде болғандықтан, қалыпты жағдай. (Поусон таралымын қараңыз) Бұл аномалияны көрсетпейді. Егер үлгі көлемі 100 болса, онда үш мұндай мән күтілетіннен 11 есе көп болғандықтан, алаңдауға себеп болады. Жалпы, егер популяция таралымының сипаты бұрыннан белгілі болса, ауытқушы мәндер санының күтілетіннен қатты өзгешелігін тексеруге болады: берілген таралымның белгілі бір кесу шегі үшін (яғни үлгілер p ықтималдығымен кесу шегінен тысқары шығады), ауытқушы мәндер саны p параметрімен биномдық таралымды ұстанады, оны әдетте λ = pn арқылы Поусон таралымымен жақсы жуықтауға болады. Демек, егер орташа мәннен 3 стандартты ауытқуды кесу шегі ретінде алсақ, қалыпты таралым үшін p шамамен 0,3% құрайды, сондықтан 1000 тәжірибе үшін 3 сигмадан артық ауытқуы бар үлгілер санын Поусон таралымы арқылы λ = 3 шамасында бағалауға болады.
Себептер
Аномальдық мәндердің көптеген себептері болуы мүмкін. Өлшемдерді алуға арналған физикалық құрал уақытша бұзушылыққа ұшыраған болуы мүмкін. Деректерді беру немесе жазу кезінде қателіктер туындауы мүмкін. Аномальдық мәндер жүйе мінез-құлқының өзгеруінен, адалдықтан жалтарудан, адам қателігінен, құрал қателігінен немесе популяциядағы табиғи ауытқулардан пайда болады. Үлгі зертенеін жатқан популяциядан тыс элементтермен ластанған болуы мүмкін. Басқаша айтқанда, аномальдық мән қабылданған теориядағы кемшіліктің салдары болуы мүмкін, бұл зерттеушіге қосымша зерттеу жүргізуді талап етеді. Сонымен қатар, белгілі бір формадағы аномальдық мәндердің патологиялық көрінісі әртүрлі деректер жиынтығында кездеседі, бұл деректердің себептік механизмі ең шекті жағдайда өзгеше болуы мүмкін екенін көрсетеді (Кинг эффектісі).
Пирстің критерийі
Байқаулар сериясында қателік шегін анықтау ұсынылады, одан асып кеткен қателі бар барлық байқаулар, егер мұндай байқаулар жеткілікті болса, қабылданбауы керек. Бұл мәселені шешуге ұсынылған принцип – ұсынылған байқауларды қабылдамау керек, егер оларды сақтап қалу арқылы алынған қателер жүйесінің ықтималдығы, оларды қабылдамау арқылы алынған қателер жүйесінің ықтималдығына, сондай-ақ мұндай және одан артық емес аномальды байқаулар жасау ықтималдығының көбейтіндісінен кем болса. (Шовененің Астрономия жөніндегі нұсқаулық 2:558-бетінен Пирске (1982 жылғы басылым) 516-беттегі редакторлық түсіндірмеде келтірілген.)
Тукейдің қоршаулары
Басқа әдістер квартиль аралығы сияқты өлшемдерге негізделген байқауларды белгілейді. Мысалы, егер және төменгі және жоғарғы квартилдер болса, онда ауытқуды мына ауқымнан тыс кез келген байқау деп анықтауға болады:
кейбір теріс емес тұрақты үшін Джон Туки осы тестті ұсынды, мұнда "ауытқуды" білдіреді, ал – "өте алыс" деректерді.
Аномалияны анықтау
Статистика, сигналдарды өңдеу, қаржы, эконометрия, өндіріс, желілер және деректерді талдау сияқты түрлі салаларда аномалияларды анықтау міндеті басқаша шешілуі мүмкін. Олардың кейбіреуі қашықтық пен тығыздыққа негізделуі мүмкін, мысалы, Жергілікті аномалиялық фактор (LOF). Ал кейбір тәсілдер k ең жақын көршіге дейінгі қашықтықты пайдаланып, деректерді аномалиялық немесе аномалиялық емес деп белгілейді.
Аутсайлерлермен жұмыс істеу
Аутлаерлерді қалай өңдеу керектігі олардың себебіне байланысты болуы керек. Кейбір бағалаушылар аутлаерлерге өте сезімтал, атап айтқанда ковариациялық матрицаларды бағалау кезінде.
Сақтау
Тіпті қалыпты үлестіру моделі талдауға алынған деректерге сай келсе де, үлкен үлгілерде сыртқы мәндер кездесуі мүмкін және мұндай жағдайда оларды автоматты түрде жоққа шығаруға болмайды. Оның орнына, табиғи түрде туындаған сыртқы мәндері бар деректерді модельдеу немесе талдау үшін сыртқы мәндерге төзімді әдіс қолдану керек. Дегенмен, қате мәнді мүмкін болса, түзету артық болмас. Ал, деректерді сыртқы мән болғандықтан ғана алып тастау – көптеген ғалымдар мен оқытушылар наразылық білдіретін, статистикалық нәтижелерді күштен шығаратын даулы тәжірибе. Деректерді алып тастау себебі өлшеу процесімен де байланысты болуы мүмкін, мысалы, эксперимент мұндай шекті мәндерді өлшеуге жеткілікті мүмкіндік бермеген жағдайда цензураланған деректер пайда болады. Регрессиялық есептерде, Кук қашықтығы сияқты өлшемді пайдаланып, бағаланған коэффициенттерге күшті әсер ететін нүктелерді ғана алып тастауға болады. Егер деректерді талдау кезінде дерек нүктесі (немесе нүктелері) алынып тасталса, бұл туралы кез келген келесі есепте анық көрсетілуі керек.
Қалыпты емес үлестірулер
Деректердің негізгі таралуы шамамен қалыпты емес, "қалың құйрықтары" бар мүмкіндігін қарастыру керек. Мысалы, Коши таралымынан үлгі алғанда, үлгінің дисперсиясы үлгі көлемімен бірге артады, үлгінің орташасы үлгі көлемі ұлғайған сайын жинақталмайды және қалыпты таралымға қарағанда ерекше мәндердің жиілігі күрт артады. Құйрықтардың қалыңдығындағы тіпті шағын айырмашылық та күтілетін экстремалды мәндер санына елеулі әсер ете алады.
Жинақтың мүшелігіне қатысты белгісіздіктер
Жинақ мүшелігі әдісінде белгісіз кездейсоқ вектордың i-інші өлшеміне байланысты белгісіздік, жинақ Xi арқылы (ықтималдық тығыздық функциясының орнына) көрсетіледі. Егер сыртқы мәндер болмаса, x барлық Xi жинақтарының қиылысында болуы керек. Егер сыртқы мәндер пайда болса, бұл қиылыс бос болуы мүмкін, сондықтан біз кез келген қарама-қайшылықты болдырмау үшін Xi жинақтарының шағын санын (мүмкіндігінше ең аз) жеңілдетуіміз керек. Бұл q-жеңілдетілген қиылыс ұғымын қолдану арқылы іске асырылуы мүмкін. Суретте көрсетілгендей, q-жеңілдетілген қиылыс, q жинағынан басқа барлық жинақтарға жататын барлық x жинағына сәйкес келеді. Q-жеңілдетілген қиылысты қиып өтпейтін Xi жинақтары сыртқы мәндер болуы мүмкін деп күдіктенуге болады.
Балама үлгілер
Егер ауытқулардың себебі белгілі болса, осы әсерді модель құрылымына қосу мүмкін, мысалы, иерархиялық Байес моделі немесе аралас модельді пайдалану арқылы.