Кіріспе
Статистикада әсердің мөлшері – популяциядағы екі айнымалы арасындағы қатынастың күшін өлшейтін шама немесе осы шаманың үлгілік бағасы. Ол деректер үлгісінен есептелген статистикалық шаманың мәнін, гипотетикалық популяция үшін параметрдің мәнін, немесе статистикалық шамалар мен параметрлердің әсер мөлшерінің мәніне қалай келетінін операциялық тұрғыдан сипаттайтын теңдеуді білдіре алады. Әсер мөлшерінің мысалдарына екі айнымалы арасындағы корреляция, регрессиядағы регрессиялық коэффициент, орташа айырмашылық немесе белгілі бір оқиғаның (мысалы, жүрек тақырыбы) пайда болу қаупі жатады. Әсер мөлшері статистикалық гипотезаны тексеруді толықтырады және қуаттылық талдауында, үлгі мөлшерін жоспарлауда және мета-талдауда маңызды рөл атқарады. Әсер мөлшеріне қатысты деректерді талдау әдістерінің жиынтығы бағалау статистикасы деп аталады. Әсер мөлшері статистикалық тұжырымның күшін бағалау кезінде маңызды компонент болып табылады және ол MAGIC критерийлеріндегі бірінші элемент (мөлшері). Әсер мөлшерінің стандартты қатесінің маңыздылығы өте жоғары, себебі ол өлшеуде қаншалықты белгісіздік бар екенін көрсетеді. Тым үлкен стандартты қате өлшеуді мағынасыз етеді. Мета-талдауда, мақсаты бірнеше әсер мөлшерін біріктіру болған жағдайда, әсер мөлшеріндегі белгісіздік әсер мөлшерін салмақтау үшін қолданылады, сондықтан үлгісі үлкен зерттеулер кішкентай зерттеулерге қарағанда маңыздырақ деп есептеледі. Әсер мөлшеріндегі белгісіздік әр түрлі әсер мөлшері үшін әртүрлі есептеледі, бірақ әдетте зерттеудің үлгі мөлшерін (N) немесе әрбір топтағы байқаулар санын (n) білуді қажет етеді. Әсер мөлшерін немесе оның бағалауын (әсер бағасы [EE], әсердің бағасы) көрсету көптеген салаларда эмпирикалық зерттеу нәтижелерін ұсыну кезінде жақсы тәжірибе саналады. Әсер мөлшерін есепке алу зерттеу нәтижесінің маңыздылығын түсіндіруді жеңілдетеді, оны статистикалық маңыздылығынан айырмашылығы бар. Әсер мөлшері әлеуметтік ғылымдарда және медициналық зерттеулерде (емдеу әсерінің мөлшері маңызды болатын жерлерде) ерекше маңызды. Әсер мөлшері салыстырмалы немесе абсолютті түрде өлшенуі мүмкін. Салыстырмалы әсер мөлшерінде екі топ бір-бірімен тікелей салыстырылады, мысалы, қатынастар мен салыстырмалы тәуекелдерде. Абсолютті әсер мөлшері үшін үлкен абсолюттік мән әрқашан күшті әсерді көрсетеді. Көптеген өлшемдер абсолютті немесе салыстырмалы түрде көрсетілуі мүмкін және олар бірге қолданылуы мүмкін, себебі олар әртүрлі ақпаратты жеткізеді. Психологиялық зерттеу қауымдастығының көрнекті жұмыс тобы мынадай ұсыныс жасады:
In statistics, an effect size is a value measuring the strength of the relationship between two variables in a population, or a sample based estimate of that quantity. It can refer to the value of a statistic calculated from a sample of data, the value of a parameter for a hypothetical population, or to the equation that operationalizes how statistics or parameters lead to the effect size value. Examples of effect sizes include the correlation between two variables, the regression coefficient in a regression, the mean difference, or the risk of a particular event (such as a heart attack) happening. Effect sizes complement statistical hypothesis testing, and play an important role in power analyses, sample size planning, and in meta analyses. The cluster of data analysis methods concerning effect sizes is referred to as estimation statistics. Effect size is an essential component when evaluating the strength of a statistical claim, and it is the first item (magnitude) in the MAGIC criteria. The standard deviation of the effect size is of critical importance, since it indicates how much uncertainty is included in the measurement. A standard deviation that is too large will make the measurement nearly meaningless. In meta analysis, where the purpose is to combine multiple effect sizes, the uncertainty in the effect size is used to weigh effect sizes, so that large studies are considered more important than small studies. The uncertainty in the effect size is calculated differently for each type of effect size, but generally only requires knowing the study's sample size (N), or the number of observations (n) in each group. Reporting effect sizes or estimates thereof (effect estimate [EE], estimate of effect) is considered good practice when presenting empirical research findings in many fields. The reporting of effect sizes facilitates the interpretation of the importance of a research result, in contrast to its statistical significance. Effect sizes are particularly prominent in social science and in medical research (where size of treatment effect is important). Effect sizes may be measured in relative or absolute terms. In relative effect sizes, two groups are directly compared with each other, as in odds ratios and relative risks. For absolute effect sizes, a larger absolute value always indicates a stronger effect. Many types of measurements can be expressed as either absolute or relative, and these can be used together because they convey different information. A prominent task force in the psychology research community made the following recommendation:
Quotation|Always present effect sizes for primary outcomes If the units of measurement are meaningful on a practical level (e. g., number of cigarettes smoked per day), then we usually prefer an unstandardized measure (regression coefficient or mean difference) to a standardized measure (r or d). Another example where effect sizes may be distorted is in a multiple trial experiment, where the effect size calculation is based on the averaged or aggregated response across the trials. Smaller studies sometimes show different, often larger, effect sizes than larger studies. This phenomenon is known as the small study effect, which may signal publication bias.
Цитата|Негізгі нәтижелер үшін әсер мөлшерін әрқашан көрсету керек. Егер өлшем бірліктері практикалық тұрғыдан мағыналы болса (мысалы, күніне шегілетін темекі саны), онда біз әдетте стандартталмаған өлшемді (регрессиялық коэффициент немесе орташа айырмашылық) стандартталған өлшемге (r немесе d) артық көреміз. Әсер мөлшері бұрмалануы мүмкін тағы бір мысал – бірнеше сынақтан тұратын эксперимент, онда әсер мөлшерін есептеу сынақтар бойынша орташа немесе жиынтық жауапқа негізделген. Кішкентай зерттеулер кейде үлкен зерттеулерге қарағанда әртүрлі, көбінесе үлкен әсер мөлшерін көрсетеді. Бұл құбылыс кішкентай зерттеу әсері деп аталады, бұл жариялануға қатысты қиындықтарды білдіруі мүмкін.
In statistics, an effect size is a value measuring the strength of the relationship between two variables in a population, or a sample based estimate of that quantity. It can refer to the value of a statistic calculated from a sample of data, the value of a parameter for a hypothetical population, or to the equation that operationalizes how statistics or parameters lead to the effect size value. Examples of effect sizes include the correlation between two variables, the regression coefficient in a regression, the mean difference, or the risk of a particular event (such as a heart attack) happening. Effect sizes complement statistical hypothesis testing, and play an important role in power analyses, sample size planning, and in meta analyses. The cluster of data analysis methods concerning effect sizes is referred to as estimation statistics. Effect size is an essential component when evaluating the strength of a statistical claim, and it is the first item (magnitude) in the MAGIC criteria. The standard deviation of the effect size is of critical importance, since it indicates how much uncertainty is included in the measurement. A standard deviation that is too large will make the measurement nearly meaningless. In meta analysis, where the purpose is to combine multiple effect sizes, the uncertainty in the effect size is used to weigh effect sizes, so that large studies are considered more important than small studies. The uncertainty in the effect size is calculated differently for each type of effect size, but generally only requires knowing the study's sample size (N), or the number of observations (n) in each group. Reporting effect sizes or estimates thereof (effect estimate [EE], estimate of effect) is considered good practice when presenting empirical research findings in many fields. The reporting of effect sizes facilitates the interpretation of the importance of a research result, in contrast to its statistical significance. Effect sizes are particularly prominent in social science and in medical research (where size of treatment effect is important). Effect sizes may be measured in relative or absolute terms. In relative effect sizes, two groups are directly compared with each other, as in odds ratios and relative risks. For absolute effect sizes, a larger absolute value always indicates a stronger effect. Many types of measurements can be expressed as either absolute or relative, and these can be used together because they convey different information. A prominent task force in the psychology research community made the following recommendation:
Quotation|Always present effect sizes for primary outcomes If the units of measurement are meaningful on a practical level (e. g., number of cigarettes smoked per day), then we usually prefer an unstandardized measure (regression coefficient or mean difference) to a standardized measure (r or d). Another example where effect sizes may be distorted is in a multiple trial experiment, where the effect size calculation is based on the averaged or aggregated response across the trials. Smaller studies sometimes show different, often larger, effect sizes than larger studies. This phenomenon is known as the small study effect, which may signal publication bias.
Сынақ статистикасымен байланыс
Үлгіге негізделген әсер өлшемдері гипотеза тексеруде қолданылатын тест статистикасынан өзгеше, себебі олар, мысалы, байқалатын қатынастың күшін (шамасын) бағалайды, ал тест статистикасы осы қатынастың шамасы кездейсоқ болу мүмкіндігін көрсететін маңыздылық деңгейін анықтайды. Әсер өлшемі маңыздылық деңгейін тікелей анықтамайды, немесе керісінше. Егер үлгі көлемі жеткілікті болса, нөлдік гипотеза дұрыс емес екенін көрсететін статистикалық салыстыру әрқашан статистикалық маңызды нәтиже береді, егер популяциядағы әсер мөлшері нақты нөлге тең болмаса (сонда да ол I тип қателік деңгейіне сәйкес статистикалық маңыздылық көрсетеді). Мысалы, 0,01-ге тең үлгідегі Пирсон корреляциялық коэффициенті, егер үлгі көлемі 1000 болса, статистикалық маңызды болып табылады. Алайда, осы талдаудан алынған маңызды p-мәнін ғана көрсету, егер 0,01-ге тең корреляция нақты қолданыста қызығушылық тудырмаса, жаңылысқа салуы мүмкін.
Интерпретация
Эффектінің көлемі кіші, орташа немесе үлкен деп бағалануы оның мазмұндық контексіне және операциялық анықтамасына байланысты. Коэннің дәстүрлі критерийлері "орташа" эффект өлшемі үшін "кіші, орташа немесе үлкен" деп белгіленеді, бірақ "аспаптың дәлдігі мен сенімділігіне, немесе зерттеу нысандарының тарлығы мен әртүрлілігіне қарамастан, сіз бірдей n-ді таңдайсыз. Бұл жерде маңызды факторлар назардан тыс қалған. Зерттеушілер өз нәтижелерінің маңыздылығын мағыналы контекстке негіздеу арқылы немесе білімге олардың қосқан үлесін сандық тұрғыда бағалау арқылы түсіндіруі керек, ал Коэннің эффект өлшемі сипаттамалары бастапқы нүкте ретінде пайдалы болуы мүмкін." Олар "салыстырмалы нәтижелерге бағытталған, салыстырмалы араласулардан алынған эффектілер көлемінің таралуына негізделген нормалар" деп ұсынды. Демек, егер көптеген араласулар өте шағын нәтижелер беретін саладағы зерттеу Коэннің критерийлері бойынша кішкентай эффект көрсетсе, бұл жаңа критерийлер оны "үлкен" деп бағалайды. Осыған қатысты Абельсонның парадоксы мен Савиловскийдің парадоксын қараңыз.
Түрлері
Шамамен 50-ден 100-ге дейін әртүрлі эффект мөлшері өлшемдері белгілі. Көптеген эффект мөлшерлері әртүрлі типтерге айналдырылуы мүмкін, себебі олардың көпшілігі екі таралымның айырмасын бағалайды, сондықтан математикалық тұрғыдан байланысты. Мысалы, корреляция коэффициентін Коэннің d-іне, ал Коэннің d-ін корреляция коэффициентіне айналдыруға болады.
Корреляциялы отбасы: "аңталған ауытқу" негізінде әсерлер мөлшері
Бұл әсер өлшемдері эксперименттегі дисперсияның қанша пайызы эксперимент моделімен "түсіндіріледі" немесе "нақтыланады" екенін бағалайды (түсіндірілген өзгеріс).
Пирсон r немесе корреляциялық коэффициент
Пирсонның корреляциясы, көбінесе r деп белгіленеді және Карл Пирсон енгізген, жұпталған сандық деректер болған кезде әсер мөлшері ретінде кеңінен қолданылады; мысалы, туу салмағы мен ұзақ өмір сүру арасындағы қатынасты зерттегенде. Корреляция коэффициенті деректер екілік болған кезде де қолданылуы мүмкін. Пирсонның r шамасы -1-ден 1-ге дейін өзгеруі мүмкін, мұнда -1 толық теріс сызықтық қатынасты, 1 толық оң сызықтық қатынасты, ал 0 екі айнымалы арасында сызықтық қатынас жоқ екенін көрсетеді. Коэн әлеуметтік ғылымдар үшін келесідей нұсқаулар береді:
Әсер мөлшері r Кішкентай 0,10 Орташа 0,30 Үлкен 0,50
Анықтау коэффициенті (r2 немесе R2)
Байланысты әсердің мөлшері – r², бұл Пирсон корреляциясының квадраты ретінде есептелетін анықтау коэффициенті (R² немесе "r шаршысы" деп те аталады). Жұпталған деректерде бұл екі айнымалының ортақ дисперсиясының үлесін көрсетеді және 0-ден 1-ге дейін өзгереді. Мысалы, r 0,21 болғанда, анықтау коэффициенті 0,0441-ге тең, яғни екі айнымалының біреуінің дисперсиясының 4,4%-ы екіншісімен ортақ. r² әрқашан оң сан болады, сондықтан екі айнымалы арасындағы корреляцияның бағытын көрсетпейді.
Эта-квадрат (η2)
Eta квадраты басқа болжаушыларды ескергенде, бір болжаушының тәуелді айнымалының дисперсиясын қаншалықты түсіндіретінін көрсетеді, бұл оны r²-ге ұқсас етеді. Eta квадраты – популяциядағы модельдің түсіндіретін дисперсиясының бұрмаланған бағалаушысы (ол тек үлгідегі әсердің мөлшерін бағалайды). Бұл бағалаудың r²-мен ортақ кемшілігі бар: әрбір қосымша айнымалы η² мәнін автоматты түрде арттырады. Сонымен қатар, ол популяция емес, үлгідегі түсіндірілген дисперсияны өлшейді, яғни әсердің мөлшерін әрқашан асыра бағалайды, бірақ үлгінің көлемі артқан сайын бұл бұрмалану азаяды.
Шыны Δ
1976 жылы Джин В. Гласс әсер мөлшерін бағалау үшін, тек екінші топтың стандартты қатеуін пайдаланатын әдіс ұсынды. Бұл, басқа стандартталған айырмашылықтарға негізделген өлшемдер сияқты. CRT (Кластерлік кездейсоқталған сынақтар) мектептер немесе сыныптар сияқты кластерлерді әртүрлі жағдайларға кездейсоқ бөліп, білім беру саласындағы зерттеулерде жиі қолданылады.
is like the other measures based on a standardized difference CRTs involve randomising clusters, such as schools or classrooms, to different conditions and are frequently used in education research.
Ψ, орташа квадрат түбірінің стандартталған әсері
Көптеген салыстырулар үшін ұқсас әсер өлшемі бағалаушысы (мысалы, ANOVA) – Ψ түбірлік орташа квадраттық стандартталған әсері болып табылады:
Коэннің омегасы (ω)
Хи-квадрат сынақтары үшін қолданылатын әсердің тағы бір өлшемі – Коэннің омегасы. Ол былай анықталады:
мұндағы p0i – H0 гипотезасы бойынша i-ші ұяшықтың үлесі, p1i – H1 гипотезасы бойынша i-ші ұяшықтың үлесі және m – ұяшықтардың саны. Коэн «Жүріс-тұрыстық ғылымдар үшін статистикалық күш талдауы» (1988, 224-225 беттер) еңбегінде омеганы интерпретациялау үшін келесі жалпы ережелерді келтіреді (төмендегі кестеге қараңыз), бірақ оның «нақты мағыналық контекстте дұрыс болмауы мүмкін екенін» ескертеді және оның орнына контекстке қатысты баға беруге кеңес береді. Әсер мөлшері Кішкентай 0,10 Орташа 0,30 Үлкен 0,50.
Шындықтың арақатынасы
Шанс қатынасы (OR) – тағы бір пайдалы әсер өлшемі. Зерттеу сұрағы екі бинарлық айнымалы арасындағы байланыстың дәрежесіне бағытталған кезде қолданылады. Мысалы, емле жазу қабілетін зерттейік. Бақылау тобында әрбір қате жіберген оқушыға қатысты екі оқушы емтиханды тапсырады, демек тапсыру шансы екіге бір тең (2/1 = 2). Емдеу тобында әрбір қате жіберген оқушыға қатысты алты оқушы емтиханды тапсырады, демек тапсыру шансы алтыға бір тең (6/1 = 6). Әсердің мөлшерін есептеу үшін емдеу тобындағы тапсыру шансы бақылау тобындағыдан үш есе жоғары екенін анықтау жеткілікті (өйткені 6-ны 2-ге бөлгенде 3 шығады). Сондықтан, шанс қатынасы 3-ке тең. Шанс қатынасы статистикасы Коэннің d-сынан өзгеше масштабта есептеледі, сондықтан бұл "3" Коэннің d-3-мен салыстырылмайды.
Салыстырмалы тәуекел
Салыстырмалы тәуекел (RR), сонымен қатар тәуекел коэффициенті деп аталады, бұл жай ғана оқиғаның тәуекелі (әлеуеттілігі) белгілі бір тәуелсіз айнымалыға қатысты. Бұл эффект өлшемі шанстар қатынасынан (odds ratio) айырмашылығы, ол шанстарды емес, ықтималдықтарды салыстырады, бірақ кішкентай ықтималдықтар үшін асимптотикалық түрде соңғысына жақындайды. Жоғарыда келтірілген мысалдан, бақылау тобы мен емдеу тобының емделуден өту ықтималдығы сәйкесінше 2/3 (немесе 0,67) және 6/7 (немесе 0,86) құрайды. Эффект өлшемін жоғарыда көрсетілгендей есептеуге болады, бірақ оның орнына ықтималдықтарды пайдалану керек. Сондықтан, салыстырмалы тәуекел 1,28-ге тең. Өту ықтималдығы жоғары болғандықтан, салыстырмалы тәуекел мен шанстар қатынасы арасында үлкен айырмашылық бар. Егер сәтсіздік (төменгі ықтималдық) оқиға ретінде (өткеннен гөрі) қолданылса, эффект өлшемінің екі көрсеткіші арасындағы айырмашылық осы деңгейде болмас еді. Екі өлшем де пайдалы болғанымен, олардың статистикалық қолданылуы әртүрлі. Медициналық зерттеулерде шанстар қатынасы көбінесе бақылау зерттеулерінде қолданылады, себебі шанстар, бірақ ықтималдықтар емес, әдетте бағаланады. Салыстырмалы тәуекел көбінесе рандомизацияланған бақыланатын сынақтар мен когорттық зерттеулерде қолданылады, бірақ салыстырмалы тәуекел араласулардың тиімділігін асыра бағалауға әкелуі мүмкін.
Орталықсыздық параметрлері арқылы сенімділік аралықтары
Стандартталған әсер өлшемдерінің сенімділік интервалдары, әсіресе Коэннің және басқалары, орталықсыздық параметрлерінің (ncp) сенімділік интервалдарын есептеуге негізделген. Ncp сенімділік интервалын құрудың әдеттегі тәсілі – байқалатын статистиканы α/2 және (1 – α/2) құйрық квантильдеріне сәйкес келетін сындық ncp мәндерін табу болып табылады. SAS және R пакеті MBESS ncp-ның сындық мәндерін табуға арналған функцияларды ұсынады.