Кіріспе

Статистикада дерек жиынтығын талдау тәсілі

Статистикада зерттеулік деректерді талдау (ЭДА) – дерек жиынтығын талдау тәсілі, олардың негізгі ерекшеліктерін қорытындылауға, көбінесе статистикалық графикалық және басқа деректерді визуализациялау әдістерін пайдалануға бағытталған. Статистикалық модель қолданылуы мүмкін немесе қолданылмауы мүмкін, бірақ ЭДА негізінен деректер ресми модельдеуден тыс қандай ақпарат бере алатынын анықтауға арналған, сондай-ақ дәстүрлі гипотезаларды тексеруден өзгеше. Джон Туки 1970 жылдан бері зерттеулік деректерді талдауды статистикалықтарды деректерді зерттеуге және, мүмкін, жаңа деректерді жинауға және тәжірибелер жүргізуге алып келетін гипотезаларды құруға ынталандыру үшін ұсынды. ЭДА бастапқы деректерді талдаудан (ИДА) ерекшеленеді, ол модельге сәйкестік және гипотезаларды тексеру үшін қажетті талаптарды тексеруге, жоқ мәндерді өңдеуге және қажет болған жағдайда айнымалыларды өзгертуге көбірек назар аударады. ЭДА ИДА-ны қамтиды.

Шолу

1961 жылы Туки деректерді талдауды былай анықтады: «Деректерді талдау процедуралары, мұндай процедуралардың нәтижелерін түсіндіру техникалары, талдауды жеңілдету, нақтырақ немесе дәлдірек ету үшін деректерді жинауды жоспарлау жолдары және деректерді талдауға қолданылатын (математикалық) статистиканың барлық құралдары мен нәтижелері». Зерттеу деректерді талдау – деректерді талдау және зерттеу, сондай-ақ деректер жиынтығының негізгі сипаттамаларын қорытындылауға бағытталған талдау әдісі. ЭДА-ның басты артықшылығы – талдау жүргізілгеннен кейін деректерді визуализациялау мүмкіндігін ұсыну. Тукидің ЭДА-ны қолдауы статистикалық есептеу пакеттерін, әсіресе Bell Labs-те S-ті дамытуға ықпал етті. S бағдарламалау тілі S PLUS және R жүйелерін қалыптастырды. Статистикалық есептеу орталарының бұл отбасы динамикалық визуализациялау мүмкіндіктерін едәуір жақсартты, бұл статистиктерге қосымша зерттеуді қажет ететін деректердегі ерекшеліктерді, трендтерді және үлгілерді анықтауға мүмкіндік берді. Тукидің ЭДА-сы статистикалық теориядағы тағы екі дамумен байланысты болды: сенімді статистика және параметрлік емес статистика, екеуі де статистикалық модельдерді құрудағы статистикалық қорытындылардың қателіктеріне сезімталдығын азайтуға тырысты. Туки сандық деректердің бес негізгі көрсеткішін пайдалануды ұсынды – екі шекті мән (максималды және минималды), медиана және квартильдер, өйткені бұл медиана мен квартильдер, эмпирикалық үлестірілімнің функциялары ретінде, орташа және стандартты ауытқудан айырмашылығы, барлық үлестірілімдер үшін анықталады; сонымен қатар, квартильдер мен медиана қисық немесе ауыр құйрықты үлестірілімдерге дәстүрлі көрсеткіштерге (орташа және стандартты ауытқуға) қарағанда төзімді. S, S PLUS және R пакеттері қайта іріктеу статистикасын пайдаланатын процедураларды қамтиды, мысалы, Quenouille және Tukey-дің jackknife әдісі мен Efron-ның bootstrap әдісі, бұл параметрлік емес және сенімді (көптеген мәселелер үшін). Зерттеу деректерді талдау, сенімді статистика, параметрлік емес статистика және статистикалық бағдарламалау тілдерін дамыту статистиктердің ғылыми және инженерлік мәселелерді шешу жұмысын жеңілдетті. Мұндай мәселелерге жартылай өткізгіштерді жасау және Bell Labs-ті қызықтырған коммуникациялық желілерді түсіну кірді. Бұл статистикалық дамулардың барлығы Тукидің қолдауымен статистикалық гипотезаларды тестілеудің аналитикалық теориясын толықтыруға арналған, әсіресе Лаплас дәстүрінің экспоненциалдық отбасыларға баса назар аударуын.

Мысал

ЭДА нәтижелері негізгі талдау міндетіне тәуелсіз. Мұны түсіндіру үшін Кук және авторлардың мысалын қарастырайық. Мұнда талдау міндеті – қонақтардың официантқа беретін ұсынысын ең жақсы болжайтын айнымалыларды табу. Бұл міндет үшін жиналған деректердегі айнымалылар: ұсыныс сомасы, жалпы есеп, төлеушінің жынысы, темекі шегушілер/шемемейтіндер бөлімі, күнің уақыты, апта күні және топтың мөлшері. Негізгі талдау міндетіне жауап айнымалысы болып табылатын ұсыныс үлесін регрессиялық модельге сәйкес келтіру арқылы қол жеткізіледі. Орнатылған модель:

(ұсыныс үлесі) = 0,18 + 0,01 × (топтың мөлшері)

Бұл модельде тамақтану тобының мөлшері бір адамға артқан сайын (есептің жоғарылауына алып келеді), ұсыныс үлесі орташа есеппен 1%-ға төмендейді. Алайда, деректерді зерттеу осы модельде сипатталмаған басқа қызықты ерекшеліктерді ашады. Графиктерден алынған мәліметтер регрессиялық модель көрсеткеннен өзгеше, бірақ эксперимент осы басқа тенденцияларды зерттеу үшін жоспарланбаған. Деректерді зерттеу арқылы табылған үлгілер алдын ала күтпеген ұсыныстарды ұсынады және бұл қызықты жаңа эксперименттерге әкелуі мүмкін, онда гипотезалар ресми түрде айтылып, жаңа деректер жинау арқылы тексеріледі.

Бағдарламалық жасақтама

JMP, SAS институтының ЭҚЖ пакеті. KNIME, Konstanz Information Miner – Eclipse-ке негізделген ашық деректерді зерттеу платформасы. Minitab, өнеркәсіптік және корпоративтік ортада кеңінен қолданылатын ЭҚЖ және жалпы статистикалық пакет. Orange, ашық дереккөзді деректерді өндіру және машиналық оқыту бағдарламалық жасақтамасы. Python, деректерді өндіру және машиналық оқытуда кеңінен қолданылатын ашық кодты бағдарламалау тілі. R, статистикалық есептеулер мен графика үшін ашық кодты бағдарламалау тілі. Python-мен бірге дерек ғылымы үшін ең танымал тілдердің бірі. TinkerPlots, жоғарғы сынып және орта мектеп оқушылары үшін ЭҚЖ бағдарламалық жасақтамасы. Weka, мақсатты проекциялық іздеу сияқты визуализациялау және ЭҚЖ құралдарын қамтитын ашық деректерді өндіру пакеті.