Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Көрінетін, бірақ жалған, себептік байланысы жоқ айнымалылар арасындағы байланыс.
Apparent, but false, correlation between causally independent variables
Статистикада, жалған байланыс немесе жалған өзара байланыс – екі немесе одан көп оқиғаның немесе айнымалының байланысты болуы, бірақ себеп-салдар байланысы болмауы. Бұл кездейсоқтыққа немесе үшінші, көрінбейтін фактордың болуына байланысты (олар "жалпы жауап айнымалысы", "араласушы фактор" немесе "көз жасырын айнымалы" деп аталады).
In statistics, a spurious relationship or spurious correlation is a mathematical relationship in which two or more events or variables are associated but not causally related, due to either coincidence or the presence of a certain third, unseen factor (referred to as a "common response variable", "confounding factor", or "lurking variable").
Мысалдар
Жалған қатынастың мысалын уақыт қатарлары әдебиетінен табуға болады, онда жалған регрессия – тәуелсіз, стационарлық емес айнымалылар арасындағы сызықтық қатынастың бұрмаланған статистикалық дәлелін ұсынатын жағдай. Шындығында, екі стационарлық емес айнымалының әрқайсысында бірлік түбірінің болуы осыған себеп болуы мүмкін. Атап айтқанда, кез келген екі номиналды экономикалық айнымалы бір-бірімен байланысты болуы мүмкін, тіпті егер біреуі екіншісіне себеп болмаса да, себебі олардың әрқайсысы нақты айнымалыны баға деңгейіне көбейтілген шамаға тең, ал екі дерек қатарындағы баға деңгейінің ортақтығы оларға байланыс сыйлайды. (Сондай-ақ, қатынастардың жалған корреляциясын қараңыз.) Жалған қатынастың тағы бір мысалын бір қаланың мұздағы сатуын қарастыру арқылы көруге болады. Сату қалалық бассейндерде суға бату көрсеткіші жоғары болғанда ең жоғары болуы мүмкін. Мұздағы сату суға батуға себеп болады немесе керісінше деген пікірді айту – екеуінің арасындағы жалған қатынасты білдіреді. Шын мәнінде, ыстық толқын осы екеуіне де себеп болуы мүмкін. Ыстық толқын – жасырын немесе көрінбейтін айнымалының мысалы, ол шатастыратын айнымалы деп те аталады. Тағы бір жиі айтылатын мысал – голланд статистикасының деректерінде, көктемде ұя салған сарышаяндар саны мен сол кезде туған нәрестелер саны арасындағы оң корреляция анықталды. Әрине, себеп-салдар байланысы болған жоқ, олар бір-бірімен байланысты болды, себебі олар байқаулардан тоғыз ай бұрынғы ауа-райымен байланысты болды. Сирек жағдайларда, ешқандай шатастыратын айнымалы болмаса да, екі мүлдем байланыссыз айнымалы арасында жалған қатынас туындауы мүмкін, мысалы, әрбір президенттік сайлау алдындағы белгілі бір ойында «Вашингтон Командерс» кәсіби футбол командасының табысы мен сол сайлаудағы президенттің партиясының табысы. 1940 жылдан 2000 жылға дейінгі 16 сайлаудың барлығында «Редскиндер ережесі» президенттік партияның президенттік таққа ие болатынын немесе жоғалтатынын дұрыс болжады. 2000 жылы «Элиас Спорт Бюросы» осы корреляцияны анықтағаннан кейін ереже сәтсіз аяқталды; 2004, 2012 және 2016 жылдары «Командерс» ойынының нәтижелері мен сайлау нәтижелері сәйкес келмеді. Ұлттық футбол лигасына қатысты ұқсас жалған қатынаста 1970-ші жылдары Леонард Коппетт қор нарығының бағыты мен сол жылғы Супер Боулдың жеңімпаз конференциясы арасындағы корреляцияны атап өтті; бұл қатынас 20-шы ғасырдың көп бөлігінде сақталды, бірақ 21-ші ғасырда көбірек кездейсоқ мінез-құлыққа көшті.
An example of a spurious relationship can be found in the time series literature, where a spurious regression is one that provides misleading statistical evidence of a linear relationship between independent non stationary variables. In fact, the non stationarity may be due to the presence of a unit root in both variables. In particular, any two nominal economic variables are likely to be correlated with each other, even when neither has a causal effect on the other, because each equals a real variable times the price level, and the common presence of the price level in the two data series imparts correlation to them. (See also spurious correlation of ratios.) Another example of a spurious relationship can be seen by examining a city's ice cream sales. The sales might be highest when the rate of drownings in city swimming pools is highest. To allege that ice cream sales cause drowning, or vice versa, would be to imply a spurious relationship between the two. In reality, a heat wave may have caused both. The heat wave is an example of a hidden or unseen variable, also known as a confounding variable. Another commonly noted example is a series of Dutch statistics showing a positive correlation between the number of storks nesting in a series of springs and the number of human babies born at that time. Of course there was no causal connection; they were correlated with each other only because they were correlated with the weather nine months before the observations. In rare cases, a spurious relationship can occur between two completely unrelated variables without any confounding variable, as was the case between the success of the Washington Commanders professional football team in a specific game before each presidential election and the success of the incumbent President's political party in said election. For 16 consecutive elections between 1940 and 2000, the Redskins Rule correctly matched whether the incumbent President's political party would retain or lose the Presidency. The rule eventually failed shortly after Elias Sports Bureau discovered the correlation in 2000; in 2004, 2012 and 2016, the results of the Commanders' game and the election did not match. In a similar spurious relationship involving the National Football League, in the 1970s, Leonard Koppett noted a correlation between the direction of the stock market and the winning conference of that year's Super Bowl, the Super Bowl indicator; the relationship maintained itself for most of the 20th century before reverting to more random behavior in the 21st.
Гипотезаларды тексеру
Көбінесе екі айнымалы арасындағы корреляцияның жоқтығын тексету үшін нөлдік гипотеза қолданылады, және егер дерек үлгісінен есептелген корреляция, нөлдік гипотеза дұрыс болған жағдайда, дерек үлгілерінің 5%-дан кемінде ғана кездесетін болса, гипотезаны алдын ала қабылдамауға шешім қабылданады. Нөлдік гипотеза шын болса, ол 95% жағдайда қабылданады, бірақ қалған 5% жағдайда, шын мәнінде корреляция болмаса да, нөлдік гипотеза қате қабылданып, жалған корреляцияға келісім беруге әкеледі (бұл I типтегі қате деп аталады). Мұндағы үлгідегі жалған корреляция, негізгі популяцияның нақты қасиеттерін көрсетпейтін, кездейсоқ түрде таңдалған үлгінің нәтижесі болып табылады.
Often one tests a null hypothesis of no correlation between two variables, and chooses in advance to reject the hypothesis if the correlation computed from a data sample would have occurred in less than (say) 5% of data samples if the null hypothesis were true. While a true null hypothesis will be accepted 95% of the time, the other 5% of the times having a true null of no correlation a zero correlation will be wrongly rejected, causing acceptance of a correlation which is spurious (an event known as Type I error). Here the spurious correlation in the sample resulted from random selection of a sample that did not reflect the true properties of the underlying population.
Жалған қатынастарды анықтау
"Жалған байланыс" термині статистикада және әсіресе эксперименттік зерттеу әдістерінде жиі қолданылады, олардың екеуі де тікелей себеп-салдарлық байланысты түсінуге және болжауға тырысады (X → Y). Себепсіз корреляцияға ортақ алғышарттың (W) X пен Y екеуіне де әсер етуі себеп болуы мүмкін (W → X және W → Y). Егер анықталмаған аралық айнымалылар (X → W → Y) болса, түзету жасалмаған жағдайда олар аралық айнымалы M ескерілмейтін жалпы әсерді бағалайды, ал емес тікелей әсерді. Осы себепті, эксперименттік жолмен анықталған корреляциялар, жалған байланыстар жоққа шығарылмаса, себеп-салдарлық қатынастарды көрсетпейді.
The term "spurious relationship" is commonly used in statistics and in particular in experimental research techniques, both of which attempt to understand and predict direct causal relationships (X → Y). A non causal correlation can be spuriously created by an antecedent which causes both (W → X and W → Y). Mediating variables, (X → W → Y), if undetected, estimate a total effect rather than direct effect without adjustment for the mediating variable M. Because of this, experimentally identified correlations do not represent causal relationships unless spurious relationships can be ruled out.
Тәжірибелер
Эксперименттерде, жалған байланыстарды басқа факторларды бақылау арқылы анықтауға болады, соның ішінде теориялық тұрғыдан мүмкін шатастыратын факторлар ретінде анықталғандарын да. Мысалы, жаңа дәрі бактерияларды өлтіре ме, жоқ па, анықтауға тырысатын зерттеушіні қарастырайық. Зерттеуші дәріні бактериялық культураға қолданғанда, бактериялар өледі. Бірақ, шатастыратын фактордың болуын жоққа шығаруға көмектесу үшін, тағы бір культураны бірінші культураға мүмкіндігінше ұқсас жағдайларға ұшыратады, бірақ екінші культураға дәрі қолданбайды. Егер осы жағдайларда көрінбейтін шатастыратын фактор болса, онда бақылау культурасы да өледі, сондықтан бірінші культураның нәтижелерінен дәрінің тиімділігі туралы ешқандай қорытынды жасауға болмайды. Ал егер бақылау культурасы өлмесе, онда зерттеуші дәрінің тиімділігі туралы гипотезаны жоққа шығара алмайды.
In experiments, spurious relationships can often be identified by controlling for other factors, including those that have been theoretically identified as possible confounding factors. For example, consider a researcher trying to determine whether a new drug kills bacteria; when the researcher applies the drug to a bacterial culture, the bacteria die. But to help in ruling out the presence of a confounding variable, another culture is subjected to conditions that are as nearly identical as possible to those facing the first mentioned culture, but the second culture is not subjected to the drug. If there is an unseen confounding factor in those conditions, this control culture will die as well, so that no conclusion of efficacy of the drug can be drawn from the results of the first culture. On the other hand, if the control culture does not die, then the researcher cannot reject the hypothesis that the drug is efficacious.
Тәжірибелік емес статистикалық талдаулар
Экономика сияқты көбінесе эксперименттік емес деректері бар салалар, себеп-салдарлық байланыстарды орнату үшін әдетте байқау деректерін пайдаланады. Экономикада қолданылатын статистикалық әдістер жиынтығы эконометрия деп аталады. Эконометриядағы негізгі статистикалық әдіс – көп айнымалы регрессиялық талдау. Әдетте, мынадай сызықтық байланыс гипотезаға алынады:
Disciplines whose data are mostly non experimental, such as economics, usually employ observational data to establish causal relationships. The body of statistical techniques used in economics is called econometrics. The main statistical method in econometrics is multivariable regression analysis. Typically a linear relationship such as
мұнда – тәуелді айнымалы (себепті айнымалы деп есептеледі), ал j = 1, …, k – j-інші тәуелсіз айнымалы (себепті айнымалы деп есептеледі), және – қателік шарттысы (барлық басқа себепті айнымалылардың жиынтық әсерін қамтиды, олар кіретін тәуелсіз айнымалылармен корреляцияланбауы керек). Егер s-нің ешқайсысы y-ден туындамайды деп есептеуге негіз болса, онда коэффициенттердің бағалаулары алынады. Егер нөлдік гипотеза жоққа шығарылса, онда y-ге себеп болатын және тиісінше y-ді тудыратын баламалы гипотезаны жоққа шығаруға болмайды. Керісінше, егер нөлдік гипотезаны жоққа шығару мүмкін болмаса, онда y-дің себептік әсері жоқ деген гипотезаны да жоққа шығаруға болмайды. Мұндағы себептілік ұғымы – толық емес себептілік: егер шын мәнінде , болса, онда x-тегі өзгеріс y-тегі өзгеріске әкеледі, егер регрессияға енгізілмеген немесе қателік шарттысында жасырын басқа себептік айнымалылар оның әсерін толығымен өтемейінше; демек, x-тегі өзгеріс y-ді өзгерту үшін жеткіліксіз. Сол сияқты, y-ді өзгерту үшін x-тегі өзгеріс қажет емес, себебі y-тегі өзгеріс қателік шарттысында (немесе үлгіге енгізілген басқа себептік түсіндірме айнымалысында) жасырын жатқан нәрсеге байланысты болуы мүмкін. Регрессиялық талдау басқа да маңызды айнымалыларды регрессорлар (түсіндірме айнымалылар) ретінде қосу арқылы оларды ескереді. Бұл үшінші, жасырын айнымалының болуына байланысты себептілікті қате түсінуді болдырмауға көмектеседі: оның тәуелді айнымалыға әсері тікелей регрессияға қосу арқылы ескеріледі, сондықтан бұл әсер қызығушылық тудыратын себептік айнымалының жалған әсері ретінде қабылданалмайды. Сонымен қатар, көп айнымалы регрессияны қолдану x1-дің (мысалы, x1 → x2 → y) жанама әсерін тікелей әсер (x1 → y) деп қате түсінуді болдырмауға көмектеседі. Тәжірибеші әрбір шатастыратын факторды ескеретін тәжірибелік жобаны қолдануға қатты көңіл бөлгендей, көп регрессияны пайдаланушы да барлық шатастыратын факторларды регрессорлардың қатарына қосу арқылы ескеруге тиіс. Егер шатастыратын фактор регрессиядан алынып тасталса, оның әсері әдепкі бойынша қателік шарттысында қалдырылады, және егер алынған қателік шарттысы кіретін регрессорлардың бірімен (немесе бірнешеуімен) корреляцияланса, онда алынған регрессия бұрмаланған немесе дұрыс емес болуы мүмкін (күші жойылған айнымалының бұрмалануына қараңыз). Регрессиялық талдаудан басқа, деректерді Гренджер себептілігінің бар-жоғын анықтау үшін де тексеруге болады. Гренджер себептілігінің болуы x, y-ден бұрын келеді және x, y туралы бірегей ақпаратты қамтиды екенін көрсетеді.
is hypothesized, in which is the dependent variable (hypothesized to be the caused variable), for j = 1, , k is the jth independent variable (hypothesized to be a causative variable), and is the error term (containing the combined effects of all other causative variables, which must be uncorrelated with the included independent variables). If there is reason to believe that none of the s is caused by y, then estimates of the coefficients are obtained. If the null hypothesis that is rejected, then the alternative hypothesis that and equivalently that causes y cannot be rejected. On the other hand, if the null hypothesis that cannot be rejected, then equivalently the hypothesis of no causal effect of on y cannot be rejected. Here the notion of causality is one of contributory causality: If the true value , then a change in will result in a change in y unless some other causative variable(s), either included in the regression or implicit in the error term, change in such a way as to exactly offset its effect; thus a change in is not sufficient to change y. Likewise, a change in is not necessary to change y, because a change in y could be caused by something implicit in the error term (or by some other causative explanatory variable included in the model). Regression analysis controls for other relevant variables by including them as regressors (explanatory variables). This helps to avoid mistaken inference of causality due to the presence of a third, underlying, variable that influences both the potentially causative variable and the potentially caused variable: its effect on the potentially caused variable is captured by directly including it in the regression, so that effect will not be picked up as a spurious effect of the potentially causative variable of interest. In addition, the use of multivariate regression helps to avoid wrongly inferring that an indirect effect of, say x1 (e. g., x1 → x2 → y) is a direct effect (x1 → y). Just as an experimenter must be careful to employ an experimental design that controls for every confounding factor, so also must the user of multiple regression be careful to control for all confounding factors by including them among the regressors. If a confounding factor is omitted from the regression, its effect is captured in the error term by default, and if the resulting error term is correlated with one (or more) of the included regressors, then the estimated regression may be biased or inconsistent (see omitted variable bias). In addition to regression analysis, the data can be examined to determine if Granger causality exists. The presence of Granger causality indicates both that x precedes y, and that x contains unique information about y.