Статистикадағы деректерді зерттеу талдауы (EDA) – деректердің негізгі ерекшеліктерін анықтау, гипотеза құру және көрінеулендіру әдісі. Модельдеуден өзгеше!
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Статистикада дерек жиынтығын талдау тәсілі
Approach of analyzing data sets in statistics
Статистикада зерттеулік деректерді талдау (ЭДА) – дерек жиынтығын талдау тәсілі, олардың негізгі ерекшеліктерін қорытындылауға, көбінесе статистикалық графикалық және басқа деректерді визуализациялау әдістерін пайдалануға бағытталған. Статистикалық модель қолданылуы мүмкін немесе қолданылмауы мүмкін, бірақ ЭДА негізінен деректер ресми модельдеуден тыс қандай ақпарат бере алатынын анықтауға арналған, сондай-ақ дәстүрлі гипотезаларды тексеруден өзгеше. Джон Туки 1970 жылдан бері зерттеулік деректерді талдауды статистикалықтарды деректерді зерттеуге және, мүмкін, жаңа деректерді жинауға және тәжірибелер жүргізуге алып келетін гипотезаларды құруға ынталандыру үшін ұсынды. ЭДА бастапқы деректерді талдаудан (ИДА) ерекшеленеді, ол модельге сәйкестік және гипотезаларды тексеру үшін қажетті талаптарды тексеруге, жоқ мәндерді өңдеуге және қажет болған жағдайда айнымалыларды өзгертуге көбірек назар аударады. ЭДА ИДА-ны қамтиды.
In statistics, exploratory data analysis (EDA) is an approach of analyzing data sets to summarize their main characteristics, often using statistical graphics and other data visualization methods. A statistical model can be used or not, but primarily EDA is for seeing what the data can tell us beyond the formal modeling and thereby contrasts traditional hypothesis testing. Exploratory data analysis has been promoted by John Tukey since 1970 to encourage statisticians to explore the data, and possibly formulate hypotheses that could lead to new data collection and experiments. EDA is different from initial data analysis (IDA), which focuses more narrowly on checking assumptions required for model fitting and hypothesis testing, and handling missing values and making transformations of variables as needed. EDA encompasses IDA.
Шолу
1961 жылы Туки деректерді талдауды былай анықтады: «Деректерді талдау процедуралары, мұндай процедуралардың нәтижелерін түсіндіру техникалары, талдауды жеңілдету, нақтырақ немесе дәлдірек ету үшін деректерді жинауды жоспарлау жолдары және деректерді талдауға қолданылатын (математикалық) статистиканың барлық құралдары мен нәтижелері». Зерттеу деректерді талдау – деректерді талдау және зерттеу, сондай-ақ деректер жиынтығының негізгі сипаттамаларын қорытындылауға бағытталған талдау әдісі. ЭДА-ның басты артықшылығы – талдау жүргізілгеннен кейін деректерді визуализациялау мүмкіндігін ұсыну. Тукидің ЭДА-ны қолдауы статистикалық есептеу пакеттерін, әсіресе Bell Labs-те S-ті дамытуға ықпал етті. S бағдарламалау тілі S PLUS және R жүйелерін қалыптастырды. Статистикалық есептеу орталарының бұл отбасы динамикалық визуализациялау мүмкіндіктерін едәуір жақсартты, бұл статистиктерге қосымша зерттеуді қажет ететін деректердегі ерекшеліктерді, трендтерді және үлгілерді анықтауға мүмкіндік берді. Тукидің ЭДА-сы статистикалық теориядағы тағы екі дамумен байланысты болды: сенімді статистика және параметрлік емес статистика, екеуі де статистикалық модельдерді құрудағы статистикалық қорытындылардың қателіктеріне сезімталдығын азайтуға тырысты. Туки сандық деректердің бес негізгі көрсеткішін пайдалануды ұсынды – екі шекті мән (максималды және минималды), медиана және квартильдер, өйткені бұл медиана мен квартильдер, эмпирикалық үлестірілімнің функциялары ретінде, орташа және стандартты ауытқудан айырмашылығы, барлық үлестірілімдер үшін анықталады; сонымен қатар, квартильдер мен медиана қисық немесе ауыр құйрықты үлестірілімдерге дәстүрлі көрсеткіштерге (орташа және стандартты ауытқуға) қарағанда төзімді. S, S PLUS және R пакеттері қайта іріктеу статистикасын пайдаланатын процедураларды қамтиды, мысалы, Quenouille және Tukey-дің jackknife әдісі мен Efron-ның bootstrap әдісі, бұл параметрлік емес және сенімді (көптеген мәселелер үшін). Зерттеу деректерді талдау, сенімді статистика, параметрлік емес статистика және статистикалық бағдарламалау тілдерін дамыту статистиктердің ғылыми және инженерлік мәселелерді шешу жұмысын жеңілдетті. Мұндай мәселелерге жартылай өткізгіштерді жасау және Bell Labs-ті қызықтырған коммуникациялық желілерді түсіну кірді. Бұл статистикалық дамулардың барлығы Тукидің қолдауымен статистикалық гипотезаларды тестілеудің аналитикалық теориясын толықтыруға арналған, әсіресе Лаплас дәстүрінің экспоненциалдық отбасыларға баса назар аударуын.
Tukey defined data analysis in 1961 as: "Procedures for analyzing data, techniques for interpreting the results of such procedures, ways of planning the gathering of data to make its analysis easier, more precise or more accurate, and all the machinery and results of (mathematical) statistics which apply to analyzing data." Exploratory data analysis is an analysis technique to analyze and investigate the data set and summarize the main characteristics of the dataset. Main advantage of EDA is providing the data visualization of data after conducting the analysis. Tukey's championing of EDA encouraged the development of statistical computing packages, especially S at Bell Labs. The S programming language inspired the systems S PLUS and R. This family of statistical computing environments featured vastly improved dynamic visualization capabilities, which allowed statisticians to identify outliers, trends and patterns in data that merited further study. Tukey's EDA was related to two other developments in statistical theory: robust statistics and nonparametric statistics, both of which tried to reduce the sensitivity of statistical inferences to errors in formulating statistical models. Tukey promoted the use of five number summary of numerical data—the two extremes (maximum and minimum), the median, and the quartiles—because these median and quartiles, being functions of the empirical distribution are defined for all distributions, unlike the mean and standard deviation; moreover, the quartiles and median are more robust to skewed or heavy tailed distributions than traditional summaries (the mean and standard deviation). The packages S, S PLUS, and R included routines using resampling statistics, such as Quenouille and Tukey's jackknife and Efron bootstrap, which are nonparametric and robust (for many problems). Exploratory data analysis, robust statistics, nonparametric statistics, and the development of statistical programming languages facilitated statisticians' work on scientific and engineering problems. Such problems included the fabrication of semiconductors and the understanding of communications networks, which concerned Bell Labs. These statistical developments, all championed by Tukey, were designed to complement the analytic theory of testing statistical hypotheses, particularly the Laplacian tradition's emphasis on exponential families.
Мысал
ЭДА нәтижелері негізгі талдау міндетіне тәуелсіз. Мұны түсіндіру үшін Кук және авторлардың мысалын қарастырайық. Мұнда талдау міндеті – қонақтардың официантқа беретін ұсынысын ең жақсы болжайтын айнымалыларды табу. Бұл міндет үшін жиналған деректердегі айнымалылар: ұсыныс сомасы, жалпы есеп, төлеушінің жынысы, темекі шегушілер/шемемейтіндер бөлімі, күнің уақыты, апта күні және топтың мөлшері. Негізгі талдау міндетіне жауап айнымалысы болып табылатын ұсыныс үлесін регрессиялық модельге сәйкес келтіру арқылы қол жеткізіледі. Орнатылған модель:
Findings from EDA are orthogonal to the primary analysis task. To illustrate, consider an example from Cook et al. where the analysis task is to find the variables which best predict the tip that a dining party will give to the waiter. The variables available in the data collected for this task are: the tip amount, total bill, payer gender, smoking/non smoking section, time of day, day of the week, and size of the party. The primary analysis task is approached by fitting a regression model where the tip rate is the response variable. The fitted model is
(ұсыныс үлесі) = 0,18 + 0,01 × (топтың мөлшері)
(tip rate) = 0.18 0.01 × (party size)
Бұл модельде тамақтану тобының мөлшері бір адамға артқан сайын (есептің жоғарылауына алып келеді), ұсыныс үлесі орташа есеппен 1%-ға төмендейді. Алайда, деректерді зерттеу осы модельде сипатталмаған басқа қызықты ерекшеліктерді ашады. Графиктерден алынған мәліметтер регрессиялық модель көрсеткеннен өзгеше, бірақ эксперимент осы басқа тенденцияларды зерттеу үшін жоспарланбаған. Деректерді зерттеу арқылы табылған үлгілер алдын ала күтпеген ұсыныстарды ұсынады және бұл қызықты жаңа эксперименттерге әкелуі мүмкін, онда гипотезалар ресми түрде айтылып, жаңа деректер жинау арқылы тексеріледі.
which says that as the size of the dining party increases by one person (leading to a higher bill), the tip rate will decrease by 1%, on average. However, exploring the data reveals other interesting features not described by this model. What is learned from the plots is different from what is illustrated by the regression model, even though the experiment was not designed to investigate any of these other trends. The patterns found by exploring the data suggest hypotheses about tipping that may not have been anticipated in advance, and which could lead to interesting follow up experiments where the hypotheses are formally stated and tested by collecting new data.
Бағдарламалық жасақтама
JMP, SAS институтының ЭҚЖ пакеті. KNIME, Konstanz Information Miner – Eclipse-ке негізделген ашық деректерді зерттеу платформасы. Minitab, өнеркәсіптік және корпоративтік ортада кеңінен қолданылатын ЭҚЖ және жалпы статистикалық пакет. Orange, ашық дереккөзді деректерді өндіру және машиналық оқыту бағдарламалық жасақтамасы. Python, деректерді өндіру және машиналық оқытуда кеңінен қолданылатын ашық кодты бағдарламалау тілі. R, статистикалық есептеулер мен графика үшін ашық кодты бағдарламалау тілі. Python-мен бірге дерек ғылымы үшін ең танымал тілдердің бірі. TinkerPlots, жоғарғы сынып және орта мектеп оқушылары үшін ЭҚЖ бағдарламалық жасақтамасы. Weka, мақсатты проекциялық іздеу сияқты визуализациялау және ЭҚЖ құралдарын қамтитын ашық деректерді өндіру пакеті.
JMP, an EDA package from SAS Institute. KNIME, Konstanz Information Miner – Open Source data exploration platform based on Eclipse. Minitab, an EDA and general statistics package widely used in industrial and corporate settings. Orange, an open source data mining and machine learning software suite. Python, an open source programming language widely used in data mining and machine learning. R, an open source programming language for statistical computing and graphics. Together with Python one of the most popular languages for data science. TinkerPlots an EDA software for upper elementary and middle school students. Weka an open source data mining package that includes visualization and EDA tools such as targeted projection pursuit.