Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Деректерді талдауды дұрыс қолданбау
Misuse of data analysis
Деректерді теру (деректерді іздеу немесе p-хакинг деп те аталады) – деректерде статистикалық маңызды болып көрсетілетін үлгілерді табу үшін деректерді талдауды дұрыс қолданбау, бұл жалған оң нәтижелердің тәуекелін күрт арттырады және бағалайды. Бұл деректерге көптеген статистикалық тесттер жүргізу арқылы және маңызды нәтижелерді ғана хабарлау арқылы жасалады. Деректерді теру – көптеген салыстырулар мәселесін елемеудің мысалы. Оның бір түрі – оқырманды қарастырылған кіші топтардың жалпы саны туралы ескертпестен кіші топтарды салыстыру.
Data dredging (also known as data snooping or p hacking) is the misuse of data analysis to find patterns in data that can be presented as statistically significant, thus dramatically increasing and understating the risk of false positives. This is done by performing many statistical tests on the data and only reporting those that come back with significant results. Data dredging is an example of disregarding the multiple comparisons problem. One form is when subgroups are compared without alerting the reader to the total number of subgroup comparisons examined.
Деректерден қорытынды жасау
Жиілік ықтималдығын пайдаланатын дәстүрлі статистикалық гипотезаны тексеру процедурасы – "жоғары әлеуметтік топтағы адамдар ұзақ өмір сүреді" сияқты зерттеу гипотезасын формулировкалау, содан кейін қатысты деректерді жинау. Соңында, нәтижелердің тек қана кездейсоқ болу мүмкіндігін анықтау үшін статистикалық маңыздылық тесті жүргізіледі (бұл нөлдік гипотезаға қарсы тестілеу деп те аталады). Дұрыс статистикалық талдаудың маңызды аспектісі – гипотезаны құру үшін пайдаланылмаған деректермен (дәлелдермен) гипотезаны тексеру. Бұл өте маңызды, себебі әрбір деректер жиынтығында толығымен кездейсоқтыққа байланысты белгілі бір үлгілер болады. Егер гипотеза сол статистикалық популяциядан алынған басқа деректер жиынтығында тексерілмесе, осындай үлгілердің тек қана кездейсоқтықтан пайда болу ықтималдығын бағалау мүмкін емес. Мысалы, монетаны бес рет лақтырғанда 2 сырға және 3 қанатқа нәтиже шықса, монета қанатты 3/5-тен 2/5-ке дейін артық көреді деген гипотеза тууы мүмкін. Егер бұл гипотеза қолданыстағы деректер жиынтығында тексерілсе, ол расталады, бірақ бұл растаудың маңызы жоқ. Дұрыс процедура – қанаттың ықтималдығы туралы алдын ала гипотезаны формулировкалау, содан кейін гипотеза қабылданбаса немесе қабылданса, монетаны бірнеше рет лақтыру. Егер үш қанат және екі сырға нәтиже шықса, қанаттың ықтималдығы 3/5 деген тағы бір гипотеза тууы мүмкін, бірақ оны тек монетаны лақтырудың жаңа жиынтығымен тексеруге болады. Статистикалық маңыздылықтың бұрыс процедурада толығымен жалған екенін түсіну маңызды – маңыздылық тестілері деректерді іздеуден қорғамайды.
The conventional statistical hypothesis testing procedure using frequentist probability is to formulate a research hypothesis, such as "people in higher social classes live longer", then collect relevant data. Lastly, a statistical significance test is carried out to see how likely the results are by chance alone (also called testing against the null hypothesis). A key point in proper statistical analysis is to test a hypothesis with evidence (data) that was not used in constructing the hypothesis. This is critical because every data set contains some patterns due entirely to chance. If the hypothesis is not tested on a different data set from the same statistical population, it is impossible to assess the likelihood that chance alone would produce such patterns. For example, flipping a coin five times with a result of 2 heads and 3 tails might lead one to hypothesize that the coin favors tails by 3/5 to 2/5. If this hypothesis is then tested on the existing data set, it is confirmed, but the confirmation is meaningless. The proper procedure would have been to form in advance a hypothesis of what the tails probability is, and then throw the coin various times to see if the hypothesis is rejected or not. If three tails and two heads are observed, another hypothesis, that the tails probability is 3/5, could be formed, but it could only be tested by a new set of coin tosses. It is important to realize that the statistical significance under the incorrect procedure is completely spurious—significance tests do not protect against data dredging.
Өкілдік емес деректермен ұсынылған гипотеза
Мысалы, кездейсоқ таңдалған адамдардың арасында 7 тамызда туған күні бар екі адам бар делік: Мэри мен Джон. Деректерді теріске салатын адам Мэри мен Джон арасындағы қосымша ұқсастықтарды табуға тырысуы мүмкін. Екеуінің арасындағы жүздеген немесе мыңдаған мүмкін ұқсастықтарды қарастыра отырып, әрқайсысының шындыққа сәйкес болу ықтималдығы төмен болса да, ерекше ұқсастық табылуы мүмкін. Мысалы, Джон мен Мэри зерттеудегі колледж кезеңінде үш рет мамандық ауыстырған жалғыз екі адам болуы мүмкін. Деректерді теріске салу нәтижесінде туындаған болжам: "7 тамызда туған адамдардың колледж кезеңінде екі реттен астам мамандық ауыстыру ықтималдығы жоғары" болуы мүмкін. Контекстен тыс алынған деректер осы корреляцияны күшті қолдайтын сияқты көрінуі мүмкін, себебі басқа туған күніндегі ешкім колледжде үш рет мамандық ауыстырмаған. Дегенмен, егер (әдеттегідей) бұл жалған гипотеза болса, бұл нәтиже көбінесе қайталанбас болады; 7 тамызда туған басқа адамдардың да мамандық ауыстыру деңгейі осыған ұқсас па, жоқ па, оны тексеруге тырыссаңыз, дерлік бірден қайшы нәтижелерге келуі мүмкін.
Suppose that a study of a random sample of people includes exactly two people with a birthday of August 7: Mary and John. Someone engaged in data dredging might try to find additional similarities between Mary and John. By going through hundreds or thousands of potential similarities between the two, each having a low probability of being true, an unusual similarity can almost certainly be found. Perhaps John and Mary are the only two people in the study who switched minors three times in college. A hypothesis, biased by data dredging, could then be "people born on August 7 have a much higher chance of switching minors more than twice in college." The data itself taken out of context might be seen as strongly supporting that correlation, since no one with a different birthday had switched minors three times in college. However, if (as is likely) this is a spurious hypothesis, this result will most likely not be reproducible; any attempt to check if others with an August 7 birthday have a similar rate of changing minors will most likely get contradictory results almost immediately.
Жүйелі теріс қарау
Бұрмалау – талдау жүргізудегі жүйелі қате. Мысалы, дәрігерлер жоғары кардиоваскулярлық тәуекелге ие ЖИТС қызбасына шалдыққан науқастарды нақты ЖИТС-ке қарсы емге, яғни абакавирге, ал тәуекелі төмен науқастарды басқа препараттарға бағыттады, бұл абакавирді басқа емдермен қарапайым салыстыруға кедергі келтірді. Бұл бұрмалауды түзетпеген талдау абакавирді әділетсіз жазалады, себебі оның науқастары жоғары тәуекелге ие болғандықтан, олардың арасында жүрек шабуылына ұшырағандар көп болды. Кемшіктік факторлар, өлшенбеген араласатын факторлар және бақылаудан шығып қалу да бұрмалауға алып келуі мүмкін.
Bias is a systematic error in the analysis. For example, doctors directed HIV patients at high cardiovascular risk to a particular HIV treatment, abacavir, and lower risk patients to other drugs, preventing a simple assessment of abacavir compared to other treatments. An analysis that did not correct for this bias unfairly penalized abacavir, since its patients were more high risk so more of them had heart attacks. Missing factors, unmeasured confounders, and loss to follow up can also lead to bias.
Метеорология және эпидемиология саласында
Метеорологияда гипотезалар көбінесе қазіргі уақытқа дейінгі ауа райы деректерін пайдалана отырып жасалады және болашақ ауа райы деректерімен тексеріледі, бұл тіпті ең болмаса, болашақ деректер гипотезаның жасалуына әсер ете алмайтынын қамтамасыз етеді. Әрине, мұндай әдіс жаңа деректерді күтуді талап етеді, бұл жасалған теорияның нөлдік гипотезаға қарсы болжау күшін көрсетуге мүмкіндік береді. Бұл процесс зерттеушіні қолдағы деректерге сәйкес болжамдық модельді өзгертуге тырысқан деп айыптауға ешкімнің құқығын бермейді, себебі болашақ ауа райы әлі белгілі емес. Мысалы, байқаушылар белгілі бір қалада қатерлі ісік ошағы бар сияқты екенін анықтады, бірақ оның себебін түсіндіретін нақты гипотеза жоқ. Дегенмен, олардың қала және оның төңірегі туралы демографиялық деректердің көп көлеміне қол жеткізімі бар, онда жүздеген немесе мыңдаған әртүрлі айнымалылардың өлшемдері бар, олардың көпшілігі өзара байланысты емес. Осы айнымалылардың барлығы қатерлі ісікке шалдығу деңгейіне тәуелсіз болса да, кем дегенде бір айнымалы аймақ бойынша қатерлі ісік деңгейімен маңызды корреляцияны көрсетуі мүмкін. Бұл гипотезаны ұсынуға мүмкіндік береді, бірақ оны растау үшін бірдей айнымалыларды, бірақ басқа жерден алынған деректерді пайдалана отырып, қосымша тексерулер қажет. Ескеріңіз, p-мәні 0,01 болса, онда кем дегенде осы деңгейдегі нәтиже кездейсоқ түрде 1% жағдайда алынуы мүмкін; егер жүздеген немесе мыңдаған гипотезалар (өзара салыстырмалы түрде байланыссыз тәуелсіз айнымалылармен) тексерілсе, онда көптеген нөлдік гипотезалар үшін p-мәні 0,01-ден кем болуы мүмкін.
In meteorology, hypotheses are often formulated using weather data up to the present and tested against future weather data, which ensures that, even subconsciously, future data could not influence the formulation of the hypothesis. Of course, such a discipline necessitates waiting for new data to come in, to show the formulated theory's predictive power versus the null hypothesis. This process ensures that no one can accuse the researcher of hand tailoring the predictive model to the data on hand, since the upcoming weather is not yet available. As another example, suppose that observers note that a particular town appears to have a cancer cluster, but lack a firm hypothesis of why this is so. However, they have access to a large amount of demographic data about the town and surrounding area, containing measurements for the area of hundreds or thousands of different variables, mostly uncorrelated. Even if all these variables are independent of the cancer incidence rate, it is highly likely that at least one variable correlates significantly with the cancer rate across the area. While this may suggest a hypothesis, further testing using the same variables but with data from a different location is needed to confirm. Note that a p value of 0.01 suggests that 1% of the time a result at least that extreme would be obtained by chance; if hundreds or thousands of hypotheses (with mutually relatively uncorrelated independent variables) are tested, then one is likely to obtain a p value less than 0.01 for many null hypotheses.
Әлеуметтану саласында
P қисығын тегістеудің тағы бір жолы – жынысты ескере отыру. Simonsohn және тағы басқалардың талдауы, Bruns пен Ioannidis-тің (2016) зерттеуінде осыны көрсетеді. Bruns пен Ioannidis жынысты ескере отыруды тоқтатқанда, есептелген t мәні 9.29-дан 0.88-ге дейін төмендеді, бұл бұрынғыда себеп-салдарлық эффект ретінде тіркелген нәрсенің себепсіз екенін көрсетті (3). Бұл маңызды жағдай, себебі t мәндері p мәндеріне кері пропорционал, яғни жоғары t мәндері (2.8-ден жоғары) төмен p мәндерін білдіреді. Жынысты ескере отыру арқылы t мәнін жасанды түрде көтеріп, p мәнін де жасанды түрде төмендетуге болады.
Another way to flatten a p curve is to control for gender. An analysis by Simonsohn et. al. of a study by Bruns and Ioannidis (2016) demonstrates this, as when Bruns and Ioannidis dropped the gender control, this also dropped the reported t value from 9.29 to 0.88, showing a non causal effect where a causal one was previously recorded (3). This is an important finding because t values are inversely proportional to p values, meaning higher t values (above 2.8) indicate lower p values. By controlling for gender, one can artificially inflate the t value, thus artificially deflating the p value as well.
БАҚ-тағы көрінісі
Бір мысал – журналист Джон Боханнон жүргізген шоколадты салмақтан айыру алдауы туралы зерттеу. Ол Gizmodo мақаласында зерттеудің әлеуметтік эксперимент ретінде қасақана жасалғанын жария түрде түсіндірді. Бұл зерттеу 2015 жыл шамасында көптеген БАҚ-та кеңінен таралды, көптеген адамдар күн сайын шоколад жеу олардың салмағын азайтады дегенге, тіпті олардың ақыл-ойына қайшы келіп, сеніп қалды. Бұл зерттеу Diet and Health институтында жарияланды. Боханнонның сөзіне сүйенсек, тестілеу кезінде 18 түрлі айнымалыны ескере отырып, p-мәнін 0,05-тен төмендету өте маңызды болды.
One example is the chocolate weight loss hoax study conducted by journalist John Bohannon, who explained publicly in a Gizmodo article that the study was deliberately conducted fraudulently as a social experiment. This study was widespread in many media outlets around 2015, with many people believing the claim that eating a chocolate bar every day would cause them to lose weight, against their better judgement. This study was published in the Institute of Diet and Health. According to Bohannon, to reduce the p value to below 0.05, taking 18 different variables into consideration when testing was crucial.
Емдеу жолдары
Деректерде үлгілерді іздеу қалыпты жағдай болғанымен, бір деректер жинағына үлгі пайда болғанша статистикалық маңыздылықты немесе гипотезалық сынақты қолдану, теріс пайдалануға бейім. Деректерді теріс пайдаланудан сақтану үшін гипотеза құрудың бір жолы – кездейсоқ үлгілік сынақтар жүргізу. Зерттеуші деректер жинағын жинап, оны екі топқа – А және В – кездейсоқ бөледі. Гипотеза жасау үшін тек бір топ, мысалы, А тобы ғана қарастырылады. Гипотеза жасалғаннан кейін, оны гипотеза құру үшін пайдаланылмаған В тобында тексеру қажет. В тобы да осы гипотезаны қолдаса ғана, гипотезаның дұрыс болуы мүмкін деген тұжырымға келу орынды. (Бұл қарапайым кросс-валидация түрі және көбінесе «оқу сынағы» немесе «жартылай бөлу валидациясы» деп аталады.) Деректерді теріс пайдаланудың тағы бір жолы – зерттеу барысында жүргізілген барлық маңыздылық сынақтарының санын тіркеп, маңыздылық критерийін (альфа) осы санға бөлу, яғни Бонферрони түзетуін қолдану. Дегенмен, бұл өте консервативті әдіс. Мысалы, 0,05 отбасылық альфасын 1000 маңыздылық сынағын ескере отырып 1000-ға бөлу, әр гипотеза үшін өте қатаң 0,00005 альфасын береді. Дисперсиялық талдау және базалық функцияларды қамтитын регрессиялар үшін бір мезгілде сенімділік интервалдарын құру үшін Шеффэ әдісі және зерттеуші тек жұптық салыстыруларды қарастырса, Туки әдісі тиімді. Бонферрони түзетуінің консервативтілігінен аулақ болу үшін, таңдамалы тұжырымдаманың күрделі әдістері бар. Ең көп қолданылатын таңдамалы тұжырымдама әдісі – Бенджамини мен Хохбергтің жалған жаңқа жылдамдығын бақылау процедурасын қолдану: бұл көптеген гипотезалық сынақтарды бақылаудың кең таралған және аз консервативті әдісі. Егер екі тәсіл де қолдануға ыңғайлы болмаса, деректерді растау және зерттеу мақсатындағы талдаулар арасында нақты айырма жасау қажет. Статистикалық тұжырымдама тек растау талдауы үшін ғана қолданылады. European Journal of Personality бұл форматты былай анықтайды: «Тіркелген баяндамада авторлар теориялық және эмпирикалық негіздерді, зерттеу сұрақтарын/гипотезаларын және бар болса, пилоттық деректерді қамтитын зерттеу ұсынысын жасайды. Ұсыныс қабылданған жағдайда, деректерді жинау алдында осы ұсыныс сарапқа салынады және зерттеу нәтижелеріне қарамастан, бұл сарапталған процедураның нәтижесінде алынған мақала жарияланады». Әдістер мен нәтижелер ашық ғылым тәсілі сияқты, көпшілікке қолжетімді етуге болады, бұл деректерді теріс пайдалануды одан әрі қиындатады.
While looking for patterns in data is legitimate, applying a statistical test of significance or hypothesis test to the same data until a pattern emerges is prone to abuse. One way to construct hypotheses while avoiding data dredging is to conduct randomized out of sample tests. The researcher collects a data set, then randomly partitions it into two subsets, A and B. Only one subset—say, subset A—is examined for creating hypotheses. Once a hypothesis is formulated, it must be tested on subset B, which was not used to construct the hypothesis. Only where B also supports such a hypothesis is it reasonable to believe the hypothesis might be valid. (This is a simple type of cross validation and is often termed training test or split half validation.) Another remedy for data dredging is to record the number of all significance tests conducted during the study and simply divide one's criterion for significance (alpha) by this number; this is the Bonferroni correction. However, this is a very conservative metric. A family wise alpha of 0.05, divided in this way by 1,000 to account for 1,000 significance tests, yields a very stringent per hypothesis alpha of 0.00005. Methods particularly useful in analysis of variance, and in constructing simultaneous confidence bands for regressions involving basis functions are Scheffé's method and, if the researcher has in mind only pairwise comparisons, the Tukey method. To avoid the extreme conservativeness of the Bonferroni correction, more sophisticated selective inference methods are available. The most common selective inference method is the use of Benjamini and Hochberg's false discovery rate controlling procedure: it is a less conservative approach that has become a popular method for control of multiple hypothesis tests. When neither approach is practical, one can make a clear distinction between data analyses that are confirmatory and analyses that are exploratory. Statistical inference is appropriate only for the former. The European Journal of Personality defines this format as follows: "In a registered report, authors create a study proposal that includes theoretical and empirical background, research questions/hypotheses, and pilot data (if available). Upon submission, this proposal will then be reviewed prior to data collection, and if accepted, the paper resulting from this peer reviewed procedure will be published, regardless of the study outcomes." Methods and results can also be made publicly available, as in the open science approach, making it yet more difficult for data dredging to take place.