Кіріспе
Зерттеу нәтижелерін жалпылау деңгейі Сыртқы жарамдылық – ғылыми зерттеудің қорытындыларын сол зерттеудің аясынан тыс қолданудың жарамдылығы. Басқаша айтқанда, зерттеу нәтижелерінің басқа жағдайларға, адамдарға, стимулдарға және уақытқа қаншалықты жалпылануы немесе ауысуы мүмкін. Жалпылану – бұл алдын ала анықталған сынаманың кеңірек популяцияға қолданылуы, ал ауысу – бір сынаманың басқа мақсатты популяцияға қолданылуы. Сыртқы жарамдылықты анықтауда ғалымдар зерттеудің "көлемін" анықтауға тырысады, ол зерттеудің теориясы немесе аргументінің қолданылуы немесе шектеулеріне қатысты. Көп жағдайда, бір фактордың (яғни тәуелсіз айнымалының) әсері басқа факторларға байланысты болса, жалпылану шектеледі. Сондықтан, сыртқы жарамдылыққа қауіп тудыратын барлық нәрсені статистикалық өзара әрекеттесулер деп сипаттауға болады. Мысалдар:
External validity is the validity of applying the conclusions of a scientific study outside the context of that study. In other words, it is the extent to which the results of a study can generalize or transport to other situations, people, stimuli, and times. Generalizability refers to the applicability of a predefined sample to a broader population while transportability refers to the applicability of one sample to another target population. In establishing external validity, scholars tend to identify the "scope" of the study, which refers to the applicability or limitations of the theory or argument of the study. In most cases, generalizability is limited when the effect of one factor (i. e. the independent variable) depends on other factors. Therefore, all threats to external validity can be described as statistical interactions. Some examples include:
Aptitude by treatment interaction: The sample may have certain features that interact with the independent variable, limiting generalizability. For example, comparative psychotherapy studies often employ specific samples (e. g. volunteers, highly depressed, no comorbidity). If psychotherapy is found effective for these sample patients, will it also be effective for non volunteers or the mildly depressed or patients with concurrent other disorders? If not, the external validity of the study would be limited. Situation by treatment interactions: All situational specifics (e. g. treatment conditions, time, location, lighting, noise, treatment administration, investigator, timing, scope and extent of measurement, etc.) of a study potentially limit generalizability. Pre test by treatment interactions: If cause effect relationships can only be found when pre tests are carried out, then this also limits the generality of the findings. This sometimes goes under the label "sensitization", because the pretest makes people more sensitive to the manipulation of the treatment. Note that a study's external validity is limited by its internal validity. If a causal inference made within a study is invalid, then generalizations of that inference to other contexts will also be invalid. Cook and Campbell made the crucial distinction between generalizing to some population and generalizing across subpopulations defined by different levels of some background factor. Lynch has argued that it is almost never possible to generalize to meaningful populations except as a snapshot of history, but it is possible to test the degree to which the effect of some cause on some dependent variable generalizes across subpopulations that vary in some background factor. That requires a test of whether the treatment effect being investigated is moderated by interactions with one or more background factors.
Тәуелділік пен емдеудің өзара әрекеттесуі: Сынамада тәуелсіз айнымалымен өзара әрекеттесетін белгілі бір ерекшеліктер болуы мүмкін, бұл жалпылануды шектейді. Мысалы, салыстырмалы психотерапиялық зерттеулерде көбінесе нақты сынамалар қолданылады (мысалы, еріктілер, ауыр депрессиясы бар, қосымша аурулары жоқ). Егер психотерапия осы пациенттер үшін тиімді деп табылса, ол ерікті еместерге, жеңіл депрессиясы барларға немесе басқа да аурулары бар пациенттерге де тиімді бола ма? Егер олай болмаса, зерттеудің сыртқы жарамдылығы шектеледі. Жағдай мен емдеудің өзара әрекеттесуі: Зерттеудің барлық ерекшеліктері (мысалы, емдеу жағдайлары, уақыт, орын, жарық, шу, емдеуді жүргізу, зерттеуші, уақыт, өлшеудің ауқымы және көлемі және т.б.) жалпылануды шектеуі мүмкін. Алдын ала тестілеу мен емдеудің өзара әрекеттесуі: Егер себеп-салдар байланысы тек алдын ала тестілеу жүргізілген кезде ғана анықталса, бұл да нәтижелердің жалпылануын шектейді. Бұл кейде "сенсибилизация" деп аталады, өйткені алдын ала тестілеу адамдарды емдеуге сезімтал етеді. Зерттеудің сыртқы жарамдылығы оның ішкі жарамдылығымен шектеледі. Егер зерттеуде жасалған себептік қорытынды жарамсыз болса, онда осы қорытындыны басқа жағдайларға жалпылау да жарамсыз болады. Кук пен Кэмпбелл кейбір популяцияларға жалпылау мен кейбір негізгі факторлардың әртүрлі деңгейлерімен анықталатын субпопуляцияларға жалпылау арасындағы маңызды айырмашылықты көрсетті. Линч мағыналы популяцияларға тарихи тұрғысынан қарағанда жалпылау мүмкін емес деп санайды, бірақ кейбір тәуелді айнымалыға кейбір себептердің әсерінің кейбір негізгі факторларға байланысты субпопуляцияларға жалпылану деңгейін тексеруге болады. Бұл үшін зерттеліп жатқан емдеу әсерінің бір немесе бірнеше негізгі факторлармен өзара әрекеттесу арқылы жеңілдетілетінін тексеру қажет.
External validity is the validity of applying the conclusions of a scientific study outside the context of that study. In other words, it is the extent to which the results of a study can generalize or transport to other situations, people, stimuli, and times. Generalizability refers to the applicability of a predefined sample to a broader population while transportability refers to the applicability of one sample to another target population. In establishing external validity, scholars tend to identify the "scope" of the study, which refers to the applicability or limitations of the theory or argument of the study. In most cases, generalizability is limited when the effect of one factor (i. e. the independent variable) depends on other factors. Therefore, all threats to external validity can be described as statistical interactions. Some examples include:
Aptitude by treatment interaction: The sample may have certain features that interact with the independent variable, limiting generalizability. For example, comparative psychotherapy studies often employ specific samples (e. g. volunteers, highly depressed, no comorbidity). If psychotherapy is found effective for these sample patients, will it also be effective for non volunteers or the mildly depressed or patients with concurrent other disorders? If not, the external validity of the study would be limited. Situation by treatment interactions: All situational specifics (e. g. treatment conditions, time, location, lighting, noise, treatment administration, investigator, timing, scope and extent of measurement, etc.) of a study potentially limit generalizability. Pre test by treatment interactions: If cause effect relationships can only be found when pre tests are carried out, then this also limits the generality of the findings. This sometimes goes under the label "sensitization", because the pretest makes people more sensitive to the manipulation of the treatment. Note that a study's external validity is limited by its internal validity. If a causal inference made within a study is invalid, then generalizations of that inference to other contexts will also be invalid. Cook and Campbell made the crucial distinction between generalizing to some population and generalizing across subpopulations defined by different levels of some background factor. Lynch has argued that it is almost never possible to generalize to meaningful populations except as a snapshot of history, but it is possible to test the degree to which the effect of some cause on some dependent variable generalizes across subpopulations that vary in some background factor. That requires a test of whether the treatment effect being investigated is moderated by interactions with one or more background factors.
Қауіптерді жою
Дұрысқа қауіп-қатерлерді санау зерттеушілерге негізсіз жалпылаулардан сақтануға көмектесе алады, бірақ осы қауіп-қатерлердің көпшілігін жүйелі түрде жоюға немесе бейтараптандыруға болады, осылайша дұрыс жалпылауға қол жеткізуге болады. Атап айтқанда, бір популяциядан алынған тәжірибелік нәтижелерді "қайта өңдеуге" немесе "қайта калибрлеуге" болады, бұл популяциялық айырмашылықтарды еңсеруге және эксперимент жүргізілмейтін екінші популяцияда дұрыс жалпылаулар жасауға мүмкіндік береді. Перл мен Барейнбоим дұрыс жалпылауды қамтамасыз ету үшін проблемалық мысал үшін қажетті және жеткілікті шартты анықтады және мұндай жағдайлар болғанда қажетті қайта калибрлеуді автоматты түрде жасайтын алгоритмдерді жасады. Бұл сыртқы жарамдылық мәселесін граф теориясы саласындағы есепке дейін төмендетіп, кейбір философтардың мәселе шешілген деген қорытындыға келуіне әкелді. Сыртқы жарамдылық мәселесінің маңызды түрі – іріктеу қатесі, сондай-ақ үлгі алу қатесі деп аталады, яғни зерттеулер мақсатты популяцияның өкілдік емес үлгілерінде жүргізілген кезде туындайтын қате. Мысалы, егер клиникалық сынақ студенттер арасында жүргізілсе, зерттеуші нәтижелердің бүкіл халыққа таралатынын білгісі келеді, онда жас, білім және табыс сияқты атрибуттар әдеттегі студенттен айтарлықтай өзгеше болуы мүмкін. Барейнбоим мен Перлдің граф негізіндегі әдісі үлгі алу қатесін еңсеруге болатын жағдайларды анықтайды және бұл шарттар орындалғанда бүкіл популяциядағы орташа себептік әсердің бұрмаланбаған бағалаушысын құрастырады. Дұрыс үлгіленбеген зерттеулерден жасалған жалпылау мен әртүрлі популяцияларға жасалған жалпылау арасындағы басты айырмашылық – популяциялар арасындағы айырмашылықтар көбінесе жас немесе этникалық белгішекті сияқты бұрыннан бар факторларға байланысты болатынымен, ал іріктеу қатесі көбінесе емдеуден кейінгі жағдайларға байланысты болады, мысалы, пациенттер зерттеуден шығып кетуі немесе жарақаттың ауырлығына қарай пациенттерді іріктеу. Іріктеу емдеуден кейінгі факторларға байланысты болған жағдайда, бұрмаланбаған бағалауды қамтамасыз ету үшін дәстүрлі емес қайта калибрлеу әдістері қажет, және бұл әдістер мәселенің графигінен оңай алынады.
graph.
Мысалдар
Егер жас әрбір адамға байланысты емнің әсерінің өзгеруіне маңызды фактор болып саналса, онда сынаққа алынған студенттер мен жалпы халық арасындағы жас айырмашылығы сол халықтағы емнің орташа әсерін дұрыс емес бағалауға әкеледі. Мұндай бұрмалауды қарапайым қайта салмақтау процедурасы арқылы түзетуге болады: студенттердің субпопуляциясындағы жасқа қатысты әсерді алып, оның орташа мәнін жалпы халықтың жас таралуын пайдалану арқылы есептейміз. Бұл халықтағы емнің орташа әсерін бұрмаусыз бағалауға мүмкіндік береді. Егер, керісінше, зерттеу үлгісін жалпы халықтан ерекшелендіретін маңызды фактордың өзі емнің әсеріне ұшыраса, онда басқа салмақтау схемасын қолдану қажет. Бұл факторды Z деп белгілесек, эксперименттік үлгіде X-тің Y-ға қатысты әсерін қайтадан z-ге орташалаймыз, бірақ енді оны X-тің Z-ға тигізетін «себептік әсерімен» салмақтаймыз. Яғни, жаңа салмақ – бұл барлық халыққа X=x емді қолданған жағдайда Z=z деңгейіне жететін бірліктердің үлесі. Бұл интервенциялық ықтималдық, көбінесе жазылатын , кейде жалпы халықты зерттеу арқылы бағалануы мүмкін. Мұндай жағдай Z ем мен нәтиже арасындағы делдал болып табылады. Мысалы, ем холестерин деңгейін төмендететін дәрі болуы мүмкін, Z – холестерин деңгейі, ал Y – өмір сүру ұзақтығы. Мұнда Z емнің әсеріне ұшырайды және нәтижені анықтаудағы маңызды фактор болып табылады, Y. Егер эксперименттік зерттеуге қатысушылардың холестерин деңгейі жалпы халыққа қарағанда жоғары болса деп есептейік. Дәрінің бүкіл халықтың өмір сүруіне тигізетін орташа әсерін бағалау үшін біз алдымен эксперименттік зерттеудегі z-ге қатысты ем әсерін есептейміз, содан кейін оны салмақ функциясы ретінде қолданамыз. Алынған бағалау Z және Y арасындағы байланыс болған кезде де, яғни Z және Y-ге әсер ететін өлшенбеген ортақ фактор болған кезде де бұрмаланбаған болады. Осы және басқа салмақтау схемаларының жарамдылығын қамтамасыз ететін нақты шарттар Bareinboim және Pearl, 2016 жұмысында сипатталған. Ішкі жарамдылықты арттыруға жасалған әрекеттер зерттеу нәтижелерінің жалпылануын шектеуі мүмкін, және керісінше. Бұл жағдай көптеген зерттеушілерді «экологиялық жарамды» эксперименттер жүргізуге шақыруда. Олардың айтуынша, эксперименттік процедуралар «нақты әлемдегі» жағдайларға ұқсас болуы керек. Олар көптеген зертханалық зерттеулердегі жасанды түрде бақыланатын және шектеулі ортаға назар аударуды сынға алады, олардың экологиялық жарамдылығы жеткіліксіз. Кейбір зерттеушілер сыртқы жарамдылық пен экологиялық жарамдылықтың тығыз байланысты екенін санайды, себебі экологиялық жарамды зерттеу жобаларына негізделген себептік тұжырымдар жасанды зертханалық ортада алынғандарға қарағанда жоғары дәрежеде жалпылануға мүмкіндік береді. Алайда, бұл кейбір популяцияға жалпылау (экологиялық жарамдылық туралы алаңдаушылықпен байланысты) және кейбір негізгі факторлар бойынша ерекшеленетін субпопуляцияларға жалпылау арасындағы айырмашылыққа да қатысты. Экологиялық жарамды зерттеулерде алынған кейбір нәтижелердің жалпылануы қиын болуы мүмкін, ал жоғары бақыланатын жағдайларда алынған кейбір нәтижелерге жақындау универсалды сыртқы жарамдылық тән болуы мүмкін. Осылайша, сыртқы және экологиялық жарамдылық тәуелсіз – зерттеу сыртқы жарамдылыққа ие болуы мүмкін, бірақ экологиялық жарамдылығы жоқ, және керісінше.
observational studies in the general population. A typical example of this nature occurs when Z is a mediator between the treatment and outcome, For instance, the treatment may be a cholesterol reducing drug, Z may be cholesterol level, and Y life expectancy. Here, Z is both affected by the treatment and a major factor in determining the outcome, Y. Suppose that subjects selected for the experimental study
tend to have higher cholesterol levels than is typical in the general population. To estimate the average effect of the drug on survival in the entire population, we first compute the z specific treatment effect in the experimental study, and then average it using as a weighting function. The estimate obtained will be bias free even when Z and Y are confounded—that is, when there is an unmeasured common factor that affects both Z and Y. The precise conditions ensuring the validity of this and other weighting schemes are formulated in Bareinboim and Pearl, 2016 Attempts to increase internal validity may also limit the generalizability of the findings, and vice versa. This situation has led many researchers call for "ecologically valid" experiments. By that they mean that experimental procedures should resemble "real world" conditions. They criticize the lack of ecological validity in many laboratory based studies with a focus on artificially controlled and constricted environments. Some researchers think external validity and ecological validity are closely related in the sense that causal inferences based on ecologically valid research designs often allow for higher degrees of generalizability than those obtained in an artificially produced lab environment. However, this again relates to the distinction between generalizing to some population (closely related to concerns about ecological validity) and generalizing across subpopulations that differ on some background factor. Some findings produced in ecologically valid research settings may hardly be generalizable, and some findings produced in highly controlled settings may claim near universal external validity. Thus, external and ecological validity are independent—a study may possess external validity but not ecological validity, and vice versa.
Сапалық зерттеулер
Сапалық зерттеу парадигмасы шеңберінде сыртқы жарамдылық «көшіруге қабілеттілік» түсінігімен алмастырылады. Көшіруге қабілеттілік – зерттеу нәтижелерінің ұқсас параметрлерге, топтарға және ерекшеліктерге ие жағдайларға қолданылу мүмкіндігі.
Көшірмелеу
Эксперименттің сыртқы жарамдылығын тексерудің соңғы тәсілі – зерттеуді қайталау, әдетте әртүрлі қатысушылар тобымен немесе басқа жағдайларда. Зерттеушілер көбінесе әртүрлі әдістерді қолданады, соның нәтижесінде бірдей нәтижелер алына ма деп тексереді. Бір мәселеге қатысты көптеген зерттеулер жүргізілген кезде, нәтижелер әртүрлі болуы мүмкін. Мысалы, бірнеше зерттеулерде көрермендердің санының көмек көрсету мінез-құлқына әсері анықталса, ал кейбіреулерінде олай болмайды. Мұны түсіну үшін мета-талдау деп аталатын статистикалық тәсіл бар, ол тәуелсіз айнымалының әсерінің сенімділігін анықтау үшін екі немесе одан да көп зерттеулердің нәтижелерін орташалайды. Мета-талдау көптеген зерттеулердің нәтижелерінің кездейсоқтыққа байланысты ма әлде тәуелсіз айнымалыға байланысты ма екенін анықтайды. Егер тәуелсіз айнымалы 20 зерттеудің тек біреуінде ғана әсер ететін болса, мета-талдау бұл зерттеудің ерекше жағдай екенін және тәуелсіз айнымалының тәуелді айнымалыға әсер етпейтінін көрсетеді. Егер тәуелсіз айнымалы зерттеулердің көпшілігінде әсер ететін болса, мета-талдау оның тәуелді айнымалыға орташа есеппен әсер ететінін көрсетеді. Лабораториямен ғана шектелмейтін, сенімді құбылыстар да болуы мүмкін. Мысалы, көрермендердің санын арттыру балалар, университет студенттері және болашақ министрлер сияқты түрлі адамдардың көмек көрсету мінез-құлқын тежейтіні анықталды; АҚШ-тың кішкентай және үлкен қалаларында; психологиялық зертханалар, қала көшелері және метрода; сондай-ақ ұстап алу, өрт қаупі, төбелес, апаттар сияқты төтенше жағдайларда және дөңгелек тесілу сияқты аздаған жағдайларда да осылай байқалды. Осы қайталаулардың көп бөлігі нақты өмірде жүргізілді, онда қатысушылар тәжірибе жүргізіліп жатқанын білмеді.