Кіріспе
Статистикалық аргументтерді жалғанды дәлелдеу үшін пайдалану
Статистика, қате пайдаланғанда, қарапайым бақылаушыны деректер көрсетпейтін нәрсеге сендіруі мүмкін. Яғни, статистикалық аргумент жалғанды айтқанда статистиканы дұрыс емес пайдалану орын алады. Кейбір жағдайларда, бұл қателік кездейсоқ болуы мүмкін. Ал кейде ол мақсатты түрде жасалады және одан кінәлі адам пайда көреді. Егер статистикалық негіз жалған болса немесе дұрыс қолданылмаса, бұл статистикалық жаңылыс болып табылады. Мұндай қате түсініктің салдары өте ауыр болуы мүмкін. Мысалы, медицина ғылымында жалғанды түзетуге ондаған жылдар кетіп, адам өміріне қауіп тудыруы мүмкін. Қате пайдалануға оңай түсуге болады. Кәсіби ғалымдар, математиктер және тіпті кәсіби статистиктер де, тіпті олар мұқият тексергенімен, кейбір қарапайым әдістермен жаңылысуы мүмкін. Ғалымдардың ықтималдықтар теориясы туралы білімсіздігі мен сынақтарын стандарттаудың болмауы салдарынан статистикамен өздерін алдағаны белгілі.
a statistical argument asserts a falsehood. In some cases, the misuse may be accidental. In others, it is purposeful and for the gain of the perpetrator. When the statistical reason involved is false or misapplied, this constitutes a statistical fallacy. The consequences of such misinterpretations can be quite severe. For example, in medical science, correcting a falsehood may take decades and cost lives. Misuses can be easy to fall into. Professional scientists, mathematicians and even professional statisticians, can be fooled by even some simple methods, even if they are careful to check everything. Scientists have been known to fool themselves with statistics due to lack of knowledge of probability theory and lack of standardization of their tests.
Жағымсыз ескертулерді жоққа шығару
Бейтарап (пайдасыз) өнімді насихаттау үшін компания, мысалы, 95% сенімділік деңгейімен 40 зерттеуді табуы немесе жүргізуі керек. Егер өнім пайдасыз болса, онда бір зерттеу өнімнің пайдалы екенін, бір зерттеу оның зиянды екенін, ал қалған отыз сегіз зерттеу қорытындысыз болады (38 – 40-тың 95%-ы). Зерттеулер саны артаған сайын бұл тактика тиімдірек болады. Темекі өндіруші компаниялар темекі мен қатерлі ісік арасындағы байланысты жоққа шығарып, темекі тартуға қарсы күресшілер мен БАҚ, темекі тарту мен түрлі аурулар арасындағы байланысты дәлелдеуге тырысатын ұйымдар, сондай-ақ, керемет дәрі сатушылар сияқты, өздері жүргізген барлық зерттеулерін жарияламайтын ұйымдар осы тактиканы қолдануы мүмкін. Рональд Фишер бұл мәселені өзінің әйгілі «әйелінің шайдың дәмін тануы» атты тәжірибесінде қарастырды (оның 1935 жылғы «Эксперименттерді жоспарлау» кітабынан). Ол қайталап жүргізілетін тәжірибелер туралы: «Сәтсіз нәтижелердің барлығын есепке алмаса, бұл заңсыз болып табылады және есептеуіміздің негізін жоққа шығарады» деді. Бұл тұжырымға қатысты тағы бір термин – «қолайлы деректерді іріктеу».
Маңызды белгілерді елемеу
Көп айнымалы деректер жиынтығында екі немесе одан көп белгі/өлшем бар. Егер талдау үшін осы белгілердің жеткіліксіз саны таңдалса (мысалы, егер тек бір белгі таңдалса және көптік сызықтық регрессияның орнына қарапайым сызықтық регрессия қолданылса), нәтижелер жаңылыстырушы болуы мүмкін. Бұл талдаушыны түрлі статистикалық парадокстарға немесе кейбір (барлығы емес) жағдайларда төмендегідей жалған себептілікке сезімтал етеді.
Артық жалпылау
Ашықтан жалпылау – белгілі бір популяция туралы статистиканы, бастапқы популяция өкілдік үлгісі емес топ мүшелеріне қатысты деп мәлімдеген кезде туындайтын қателік. Мысалы, жаздағы алманың 100% қызыл болғаны байқалсын делік. "Барлық алмалар қызыл" деген тұжырым ашықтан жалпылаудың мысалы болар еді, себебі бастапқы статистика тек алмалардың белгілі бір тобына (жазғы алмаларға) ғана қатысты, және бұл алмалардың жалпы популяциясын толыққанды бейнелемейді. Ашықтан жалпылау қателігінің нақты мысалын қазіргі заманғы сауалнама әдістерінен көруге болады, олар телефон арқылы саяси сауалнамалар үшін ұялы телефондарға қоңырау шалуға тыйым салады. Жастар басқа демографиялық топтарға қарағанда дәстүрлі "тұрақты" телефоннан көбінесе айырылғандықтан, тек тұрақты телефондарға қоңырау шалып сауалнама жүргізу, егер басқа шаралар қолданылмаса, сауалнама нәтижелерінде жастардың пікірлері жеткіліксіз көрсетілуіне әкелуі мүмкін. Осылайша, осы әдіспен жастардың дауыс беру бағыттарын зерттейтін сауалнама, жастардың нақты дауыс беру бағыттарын толығымен бейнелемей, ашықтан жалпылауға ұшырауы мүмкін, себебі үлгіде тек ұялы телефонды пайдаланатын жастар қамтылмаған, олардың пікірлері қалғандарынан өзгеше болуы мүмкін. Ақпаратты техникалық емес көздер, әсіресе бұқаралық ақпарат құралдары арқылы таратқанда, ашықтан жалпылау жиі кездеседі.
Бейтараптандырылған үлгілер
Ғалымдар статистикалық талдау үшін сапалы тәжірибелік деректерді жинаудың қанша қиын екенін үлкен шығындарға ұшырағаннан кейін білді. Мысал ретінде: плацебо эффектісі (ақылдың денеге әсері) өте күшті. Қатысушылардың 100% уытты балқарағай деп жалған айтылған зиянсыз затқа ұшырағанда бөртпе пайда болды, ал шынымен уытты балқарағай болған "қаусіз" затқа ұшырағандардың көпшілігінде бөртпе пайда болған жоқ. Зерттеушілер осы әсермен күресу үшін қос соқыр, кездейсоқ салыстыру тәжірибелерін қолданады. Статистиктер көбінесе талдаудан гөрі деректердің дұрыстығы туралы алаңдайды. Бұл статистиканың тәжірибелерді жобалау деп аталатын саласында көрініс береді. Сауалнама жүргізушілер де статистикалық талдау үшін жақсы сауалнама деректерін жинаудың қиын екенін қымбатқа түскен тәжірибелер арқылы білді. Ұялы телефондардың деректерді жинауға селективті әсері (бұл туралы "Шамадан тыс жалпылау" бөлімінде айтылған) – бұл бір мысал ғана; егер дәстүрлі телефондарды пайдаланатын жастар толыққанды өкілдік етпесе, үлгі бұрмаланған болуы мүмкін. Сауалнамалардың көптеген қиындықтары бар және оларды орындау үшін үлкен сақтық қажет. Бір рет 1000 жауап алу үшін шамамен 3000 телефон қоңырауы жасалды. Халықтың қарапайым кездейсоқ үлгісі "қарапайым емес және кездейсоқ болуы мүмкін емес".
Есептелген қате туралы қате хабарлама немесе қате түсінік
Егер зерттеу тобы белгілі бір тақырыпқа 300 миллион адамның қалай қарайтынын білгісі келсе, олардың бәрінен сұрау ыңғайсыз болар еді. Дегенмен, егер топ шамамен 1000 адамнан кездейсоқ үлгі таңдаса, олардың берген нәтижелері үлкен топтың бәріне сұралғанда не айтар еді дегенге сәйкес келетініне сенімді бола алады. Бұл сенімділік шын мәнінде орталық шек теоремасы және басқа математикалық нәтижелер арқылы анықталады. Сенім – нақты нәтиже (үлкен топ үшін) бағалаудың белгілі бір диапазонында (кіші топ үшін көрсеткіш) болуының ықтималдығы ретінде білдіріледі. Бұл статистикалық сараптамаларда жиі айтылатын «плюс немесе минус» көрсеткіші. Сенім деңгейінің ықтималдық бөлігі көбінесе жазылмайды; егер жазылса, ол 95% сияқты стандартты сан деп есептеледі. Екі сан бір-бірімен байланысты. Егер сараптамада 95% сенімділікте ±5% қателік болса, онда 99% сенімділікте ±6,6% қателік болады. ±% 95% сенімділіктегісіндей, қалыпты таралымдағы популяция үшін ±% 99% сенімділікте де болады. Есептелген қателік қаншалықты аз болса, берілген сенімділік деңгейінде үлгінің көлемі соншалықты үлкен болуы керек; мысалы, 95,4% сенімділікте: ±1% үшін 10 000 адам қажет. ±2% үшін 2500 адам қажет. ±3% үшін 1111 адам қажет. ±4% үшін 625 адам қажет. ±5% үшін 400 адам қажет. ±10% үшін 100 адам қажет. ±20% үшін 25 адам қажет. ±25% үшін 16 адам қажет. ±50% үшін 4 адам қажет. Адамдар сенімділік көрсеткіші жоқ болғандықтан, нақты нәтиже болжамды қателік шегінде екендігіне 100% сенімділік бар деп ойлауы мүмкін. Бұл математикалық тұрғыдан дұрыс емес. Көптеген адамдар үлгінің кездейсоқтығының маңызды екенін түсінбейді. Іс жүзінде көптеген сауалнамалар телефон арқылы жүргізіледі, бұл үлгіні бірнеше жолмен бұрмалайды, соның ішінде телефондары жоқ адамдарды алып тастау, бірнеше телефоны бар адамдарды қосуға мүмкіндік беру, телефон арқылы сауалнамаға қатысуға дайын адамдарды қабылдаудан бас тартқандарға қарағанда артықшылық беру және т.б. Кездейсоқ емес үлгі алу бағаланған қателікті сенімсіз етеді. Екінші жағынан, адамдар статистиканың өзі сенімсіз деп санайды, өйткені барлығынан сұрамайды немесе олардың өзі сауалнамаға қатыспайды. Адамдар ондаған миллион адамның пікірін анықтау үшін бірнеше мың адамды сауалнамалау жеткіліксіз деп ойлауы мүмкін. Бұл да дұрыс емес. Кемшіліксіз үлгі алу және шыншыл жауаптар бар сауалнамада қателік шегі математикалық түрде анықталады және ол тек сауалнамаға қатысқан адамдардың санына байланысты. Дегенмен, көбінесе сараптамада бір ғана қателік көрсетіледі. Халықтың кіші топтары үшін нәтижелер жарияланғанда үлкен қателік шегі қолданылады, бірақ бұл нақты көрсетілмеуі мүмкін. Мысалы, 1000 адамнан тұратын сауалнамада белгілі бір этникалық немесе экономикалық топтан 100 адам болуы мүмкін. Бұл топқа қатысты нәтижелер бүкіл халыққа қатысты нәтижелерге қарағанда әлдеқайда сенімсіз болады. Егер толық үлгідегі қателік шегі 4% болса, онда мұндай кіші топтағы қателік шегі шамамен 13% болуы мүмкін. Халықты зерттеуде басқа да көптеген өлшеу проблемалары бар. Жоғарыда аталған проблемалар барлық статистикалық тәжірибелерге қатысты, тек халықты зерттеуге ғана емес.
±1% would require 10,000 people. ±2% would require 2,500 people. ±3% would require 1,111 people. ±4% would require 625 people. ±5% would require 400 people. ±10% would require 100 people. ±20% would require 25 people. ±25% would require 16 people. ±50% would require 4 people. People may assume, because the confidence figure is omitted, that there is a 100% certainty that the true result is within the estimated error. This is not mathematically correct. Many people may not realize that the randomness of the sample is very important. In practice, many opinion polls are conducted by phone, which distorts the sample in several ways, including exclusion of people who do not have phones, favoring the inclusion of people who have more than one phone, favoring the inclusion of people who are willing to participate in a phone survey over those who refuse, etc. Non random sampling makes the estimated error unreliable. On the other hand, people may consider that statistics are inherently unreliable because not everybody is called, or because they themselves are never polled. People may think that it is impossible to get data on the opinion of dozens of millions of people by just polling a few thousands. This is also inaccurate. A poll with perfect unbiased sampling and truthful answers has a mathematically determined margin of error, which only depends on the number of people polled. However, often only one margin of error is reported for a survey. When results are reported for population subgroups, a larger margin of error will apply, but this may not be made clear. For example, a survey of 1000 people may contain 100 people from a certain ethnic or economic group. The results focusing on that group will be much less reliable than results for the full population. If the margin of error for the full sample was 4%, say, then the margin of error for such a subgroup could be around 13%. There are also many other measurement problems in population surveys. The problems mentioned above apply to all statistical experiments, not just population surveys.
Нөлдік гипотезаны дәлелдеу
Статистикалық сынақта нөлдік гипотеза жеткілікті деректер оны бұрыс екенін дәлелдемегенше жарамды деп есептеледі. Содан кейін ол қабылданбайды және баламалы гипотеза дұрыс деп дәлелденді деп саналады. Бұл жағдай мүмкін, бірақ егер нөлдік гипотеза шын болса да, оның қате екенін көрсетуге жеткілікті дәлел табылмай, (маңыздылық деңгейі) ықтималдығымен осы жағдай орын алуы мүмкін. Бұл сот процесіне ұқсас, онда айыпталушы кінәлі екені дәлелденгенше кінәсіз деп есептеледі. Бірақ егер деректер нөлдік гипотезаны жоққа шығаруға жеткілікті дәлел бермесе, бұл автоматты түрде баламалы гипотезаның дұрыс екенін дәлелдемейді. Мысалы, темекі өндіруші өнімдерінің қауіпсіз екенін көрсетуге ниеттенсе, темекі шегушілердің шағын үлгісін темекі тартпайтын адамдардың шағын үлгісімен салыстыратын сынақ жүргізе алады. Олардың ешқайсысында өкпе қатерлі ісігі пайда болуының ықтималдығы төмен (егер пайда болса да, топтар арасындағы айырмашылық нөлдік гипотезаны жоққа шығару үшін өте үлкен болуы керек). Сондықтан, темекі шегу қауіпті болғанымен, сынақ нөлдік гипотезаны жоққа шығармауы мүмкін. Егер нөлдік гипотеза қабылданса, бұл темекі шегудің зиянсыз екенін автоматты түрде дәлелдемейді. Сынақтың нөлдік гипотезаны жоққа шығаруға жеткілікті қуаты жоқ, сондықтан сынақ нәтижесіз және «дәлелдеу» мәні де нөлге тең. Бұл жағдайды жоғарыдағы сот аналогиясын пайдаланып, нақтыда кінәлі болған, бірақ дәлелдер жеткіліксіз болғандықтан босатылған айыпталушымен салыстыруға болады. Бұл айыпталушының кінәсіз екенін дәлелдемейді, тек кінәлі деп тануға жеткілікті дәлел жоқ екенін көрсетеді. «Нөлдік гипотеза ешқашан дәлелденбейді немесе бекітілмейді, бірақ эксперимент барысында оны жоққа шығаруға болады. Кез келген эксперименттің мақсаты – деректерге нөлдік гипотезаны жоққа шығару мүмкіндігін беру болып табылады» (Фишер, «Эксперименттерді жоспарлау»). Сан алуан шатасу себептері бар, оның ішінде қос отрицание логикасының және Фишердің «маңыздылықты тексеруі» (онда нөлдік гипотеза ешқашан қабылданбайды) мен «гипотезаны тексеруі» (онда кейбір гипотеза әрқашан қабылданады) бірігуінен туындаған терминологияның қолданылуы.
But if data does not give us enough proof to reject that , this does not automatically prove that is correct. If, for example, a tobacco producer wishes to demonstrate that its products are safe, it can easily conduct a test with a small sample of smokers versus a small sample of non smokers. It is unlikely that any of them will develop lung cancer (and even if they do, the difference between the groups has to be very big in order to reject ). Therefore, it is likely—even when smoking is dangerous—that our test will not reject If is accepted, it does not automatically follow that smoking is proven harmless. The test has insufficient power to reject , so the test is useless and the value of the "proof" of is also null. This can—using the judicial analogue above—be compared with the truly guilty defendant who is released just because the proof is not enough for a guilty verdict. This does not prove the defendant's innocence, but only that there is not proof enough for a guilty verdict.
" the null hypothesis is never proved or established, but it is possibly disproved, in the course of experimentation. Every experiment may be said to exist only in order to give the facts a chance of disproving the null hypothesis." (Fisher in The Design of Experiments) Many reasons for confusion exist including the use of double negative logic and terminology resulting from the merger of Fisher's "significance testing" (where the null hypothesis is never accepted) with "hypothesis testing" (where some hypothesis is always accepted).
Статистикалық мәнді практикалық мәнмен шатастыру
Статистикалық маңыздылық – бұл ықтималдықтың өлшемі, ал практикалық маңыздылық – әсердің өлшемі. Шаштың түсуіне қарсы ем, бұрынғысынан жалаңаш болған бас терісін жұмсақ өсімдікпен жабу арқылы статистикалық тұрғыдан маңызды болып есептеледі. Ал емнің практикалық маңызы, егер суық ауа райында бас киім қажет болмаса және шаштараз бастан қанша шаш алу керектігін сұраса – сонда ғана байқалады. Шашы жоқ адамдар статистикалық және практикалық тұрғыдан да маңызды емді қалайды; ол тиімді болуы керек, және егер тиімді болса, онда оның айқын әсері болуы тиіс. Ғылыми жарияланымдар көбінесе тек статистикалық маңыздылықты ғана талап етеді. Осының салдарынан (соңғы 50 жылдан бері) статистикалық маңыздылықты тексеру – статистиканы дұрыс емес қолдану деп айтылып келеді.
Деректерді дренаждау
Деректерді қазу – деректерді өндірудің дұрыс емес пайдалануы. Деректерді қазу кезінде, гипотезаны алдын ала белгілеп сынау қажеттілігі болмай, корреляция табу үшін үлкен деректер жиынтықтары зерттеледі. Екі параметр арасындағы байланысты анықтау үшін қажетті сенімділік интервалы әдетте 95% деп таңдалады (яғни, байқалған байланыстың кездейсоқ болу ықтималдығы 5% құрайды), сондықтан кез келген екі толығымен кездейсоқ айнымалылар жиыны арасында 5% мүмкіндікпен корреляция табуға болады. Деректерді қазу жұмыстары көбінесе көптеген айнымалылары бар үлкен деректер жиынтықтарын және одан да көп айнымалылар жұптарын қарастырады, сондықтан мұндай зерттеулерде жалған, бірақ статистикалық тұрғыдан маңызды нәтижелерге тап болу әлде де ықтимал. Деректерді қазу – мүмкін болатын гипотезаны табудың қолданысты тәсілі, бірақ бұл гипотеза бастапқы қазу кезінде қолданылмаған деректермен тексерілуі керек. Бұл әдіс дұрыс емес пайдаланылса, гипотеза нақты дәлелдерсіз факт ретінде жарияланады. "Алғашқы гипотезаны ұсынған деректердің өзінде оны тексеруге құқығыңыз жоқ. Шешім анық: гипотезаңыз болған соң, енді сіздің ойыңызша бар эффектті іздеуге арналған зерттеуді жоспарлаңыз. Егер бұл тесттің нәтижесі статистикалық тұрғыдан маңызды болса, сізде енді нақты дәлелдер бар".
Деректерді өңдеу
Бейресми түрде "деректерді бұрмалау" деп аталатын бұл практика таңдамалы есеп беруді (сондай-ақ, жариялауға қатысты қисылықты ескеріңіз) және тіпті жалған деректерді құрастыруды қамтиды. Іріктеулі есеп берудің көптеген мысалдары бар. Ең оңай және жиі кездесетін мысалдар – қалаулы гипотезаға сәйкес келетін нәтижелер тобын таңдап, гипотезаға қайшы келетін басқа нәтижелерді немесе "деректер тізбектерін" назардан тыс қалдыру. Ғалымдар, әдетте, басқа зерттеушілер қайталай алмайтын зерттеу нәтижелерінің дұрыстығына күдікпен қарайды. Дегенмен, кейбір ғалымдар өз деректері мен әдістемелерін жариялаудан бас тартады. Деректерді манипуляциялау – ең адал статистикалық талдаудың өзінде де маңызды мәселе. Аутсайдерлер, жоғалған деректер және қалыпты емес таралудың барлығы статистикалық талдаудың дұрыстығына кері әсер ете алады. Талдауды бастамас бұрын деректерді зерттеп, нақты проблемаларды түзету дұрыс. "[Меніңше] кез келген шашыраңқы диаграммада бұлттың басты бөлігінен белгілі бір дәрежеде алшақтанған нүктелер болады: мұндай нүктелерді тек қана себеп болған жағдайда ғана жою керек".
Басқа қателіктер
Псевдорепликация – дисперсиялық талдаумен байланысты техникалық қате. Күрделілік статистикалық талдаутың бір ғана үлгіде (N=1) жасалып жатқанын жасырады. Бұл дегенеративті жағдай үшін дисперсияны есептеу мүмкін емес (нөлге бөлу). (N=1) зерттеушіге ниеттің бұрмалануы мен нақты нәтижелер арасындағы ең жоғары статистикалық корреляцияны береді. Құмар ойыншының жаңылысуы болашақтағы ықтималдығын өлшеуге болатын оқиғаның, оқиға болғаннан кейін де сол ықтималдылыққа ие екенін болжайды. Демек, егер біреу 9 монетаны лақтырса және олардың барлығы түс болса, адамдар оныншы лақтырудың да түс болу ықтималдығы 1023-ке 1 қарсы екенін ойлайды (бұл бірінші монета лақтырылғанға дейін болған), ал шын мәнінде оныншы түс болу мүмкіндігі 50% (монета бейтарап деп есептелсе). Прокурордың жаңылысуы қылмыстық сипаттағы оқиғаның кездейсоқ болу ықтималдығы күдіктінің кінәсіз болу ықтималдығына тең деп есептейді. Ұлыбританияда екі ұлын кенеттен сүректің салдарынан (SIDS) қайтыс болғандықтан кінәлі деп айыпталған Салли Кларктың жағдайы белгілі. Сарапшы куәлігінде, қазір сенімсіз деп танылған профессор сэр Рой Медоу, SIDS сирек кездесетін жағдай болғандықтан Кларктың кінәсіздігінің ықтималдығы 73 миллионнан 1-ге тең екенін мәлімдеді. Бұл кейіннен Корольдік статистикалық қоғам тарапынан күмәндануға түсті; егер Медоудың көрсеткіші дұрыс болса, екі баланың түсіндіріле алмайтын өліміне қандай себеп болғанын анықтау үшін барлық мүмкін түсіндірмелерді салыстыру қажет. Қолда бар мәліметтерге сәйкес, екі рет адам өлтіруге қарағанда екі рет SIDS болу ықтималдығы 9 есе жоғары. 73 миллионнан 1 көрсеткіші де бұрмаланған, өйткені ол бай, темекі тартпайтын отбасының баласының SIDS-тан өлу ықтималдығын анықтап, оны квадратқа көтеру арқылы алынған: бұл әрбір өлімді статистикалық тұрғыдан тәуелсіз деп қарастырады, генетика сияқты екі бауырластың SIDS-тан өлу ықтималдығын арттыратын факторлар жоқ деп есептейді. Бұл сонымен қатар экологиялық жаңылысудың мысалы, өйткені ол Кларк отбасындағы SIDS ықтималдығы барлық бай, темекі тартпайтын отбасылардың орташа көрсеткішімен бірдей деп санайды; әлеуметтік жағдай – өте күрделі және көп қырлы ұғым, білім, жұмыс және тағы да басқа көптеген өзгермелілер сияқты көптеген басқа факторларды қамтиды. Жеке тұлғаның белгілі бір топтың қалған бөлігі сияқты бірдей қасиеттеріне ие болады деп есептеу, басқа өзгермелілердің әсерін ескермейді, бұл өз кезегінде жаңылысқа салуы мүмкін. Ойыншының жаңылысуы. Ықтималдықтар нақты (бірақ сирек) мүмкіндіктерді ескермейтін қарапайым модельдерге негізделген. Покер ойыншылары қарсыласының карта емес, қару тартуы мүмкін екенін ескермейді. Сақтандырылғандар (және үкіметтер) сақтандырушылардың төлем қабілеттілігін сақтайтынын есептейді, бірақ AIG және жүйелік тәуекелге назар аударыңыз.
Қате пайдаланудың басқа түрлері
Басқа да қате пайдаланулардың арасында алманы апельсинмен салыстыру, дұрыс емес орташа шаманы қолдану, орташаға қарай регрессия және «қоқыс кіргізілсе, қоқыс шығады» деген жалпылама сөз тіркестері бар. Кейбір статистика мәселеге тікелей қатысы жоқ болуы мүмкін. Мысалы, «100-ден артық 99» деген сияқты жарнамалық фразалар 100% деп түсінілмеуі керек. Анскомб квартеті – бұл қарапайым сипаттамалық статистиканың кемшіліктерін (және сандық талдау жасамас бұрын деректерді график түрінде көрсетудің маңыздылығын) көрсететін арнайы құрастырылған деректер жиынтығы.