Статистикада орташаға регрессия құбылысы – кездейсоқ айнымалының ең жоғары немесе төменгі көрсеткіштері келесі өлшемдерде орташаға жақындауы. Зерттеулерде маңызды!
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Статистикалық құбылыс
Statistical phenomenon
Статистикада орташаға қарай регрессия (сонымен қатар орташаға оралу және орташалыққа оралу деп те аталады) – кездейсоқ айнымалының бір үлгісі ең шекті мәнге ие болса, сол айнымалының келесі үлгісі орташа мәніне жақындау ықтималдығы бар құбылыс. Бұдан әрі, көптеген кездейсоқ айнымалылар іріктеліп, ең шекті нәтижелер қасақана таңдалған жағдайда, бұл (көп жағдайда) таңдалған айнымалылардың екінші іріктеуі барлық айнымалылардың бастапқы орташасына жақын, "кем шекті" нәтижелерге әкеледі. Математикалық тұрғыдан алғанда, осы "регрессия" әсерінің күші барлық кездейсоқ айнымалылар бірдей таралымнан алынған-алмағандығына, немесе әрбір кездейсоқ айнымалы үшін негізгі таралымдарда нақты айырмашылықтар бар-жоғына байланысты. Бірінші жағдайда "регрессия" әсері статистикалық тұрғыдан пайда болуы мүмкін, ал екінші жағдайда ол нашаррақ болуы немесе мүлдем болмауы мүмкін. Осылайша, орташаға қарай регрессия – кез келген ғылыми эксперимент, деректерді талдау немесе сынақ жүргізу кезінде ескеруге болатын пайдалы түсінік, ол қасақана ең шекті оқиғаларды таңдайды. Бұл осы оқиғалар туралы қателігі бар қорытындыларға ұшырамау үшін қосымша тексерулер қажет болуы мүмкін екенін көрсетеді; олар нақты шекті оқиғалар, статистикалық шуға байланысты мүлдем мағынасыз таңдау немесе екі жағдайдың аралас болуы мүмкін.
In statistics, regression toward the mean (also called reversion to the mean, and reversion to mediocrity) is the phenomenon where if one sample of a random variable is extreme, the next sampling of the same random variable is likely to be closer to its mean. Furthermore, when many random variables are sampled and the most extreme results are intentionally picked out, it refers to the fact that (in many cases) a second sampling of these picked out variables will result in "less extreme" results, closer to the initial mean of all of the variables. Mathematically, the strength of this "regression" effect is dependent on whether or not all of the random variables are drawn from the same distribution, or if there are genuine differences in the underlying distributions for each random variable. In the first case, the "regression" effect is statistically likely to occur, but in the second case, it may occur less strongly or not at all. Regression toward the mean is thus a useful concept to consider when designing any scientific experiment, data analysis, or test, which intentionally selects the most extreme events it indicates that follow up checks may be useful in order to avoid jumping to false conclusions about these events; they may be genuine extreme events, a completely meaningless selection due to statistical noise, or a mix of the two cases.
Қарапайым мысал: студенттер тест тапсырады
Бір сыныпта 100 сұрақтан тұратын дұрыс/жалған тест тапсырылып жатыр делік. Барлық студенттер әр сұраққа кездейсоқ жауап берсе, әр студенттің ұпайы тәуелсіз және бірдей үлестірілген кездейсоқ шамалар жиынтығының бір мәнін көрсетеді, оның күтілетін орташасы 50 болады. Әрине, кейбір студенттер 50-ден жоғары, ал кейбіреулері 50-ден төмен ұпай алады, бұл тек қана тағдырдың салдарынан болады. Егер студенттердің ең жоғары ұпай алған 10% жақсыларын ғана таңдап, оларға тағы бір тест тапсырсақ, онда олардың да барлық сұрақтарға кездейсоқ жауап беруі күтіледі, орташа ұпай тағы да 50-ге жуық болады. Осылайша, осы студенттердің орташа көрсеткіші бастапқы тест тапсырған барлық студенттердің орташа көрсеткішіне дейін «регрессиялайды». Студенттің бастапқы тестте алған ұпайына қарамастан, екінші тестте алған ұпайының ең жақсы болжамы – 50. Егер тест сұрақтарына жауаптарды таңдау кездейсоқ болмаса – яғни студенттердің берген жауаптарында сәттілік (жақсы немесе жаман) немесе кездейсоқ болжау болмаса – онда барлық студенттердің екінші тестте бастапқы тестте алған ұпайларымен бірдей ұпай жинауы күтіледі және орташа көрсеткішке кері регрессия болмайды. Көптеген нақты жағдайлар осы екі шектің арасында болады: мысалы, емтихан ұпайларын дағды мен сәттіліктің үйлесімі деп қарастыруға болады. Бұл жағдайда, орташадан жоғары ұпай алған студенттердің кіші тобы дағдылы және аса бақытсыз болмағандардан, сондай-ақ дағдысы жоқ, бірақ өте сәтті болғандардан құралады. Бұл топты қайта сынағанда, дағдысы жоқ студенттер өздерінің сәттілік сәтін қайталамауы мүмкін, ал дағдылы студенттерге екінші рет сәттілік келуі мүмкін. Сондықтан, бұрын жақсы нәтиже көрсеткендер екінші тестте де, тіпті алғашқы тестті қайталай алмаса да, жақсы нәтижеге қол жеткізе алмайды. Келесісі – орташаға қарай регрессияның екінші түрі. Бір сынып студенттері екі күн қатарынан бір сынақты екі рет тапсырады. Көп жағдайда, бірінші күні ең нашар нәтиже көрсеткендер екінші күні өздерінің көрсеткіштерін жақсартады, ал бірінші күні ең жақсы нәтиже көрсеткендер екінші күні нашарлайды. Бұл құбылыс студенттердің ұпайлары бір жағынан қабілетке, бір жағынан тағдырға байланысты болуынан туындайды. Бірінші тестте кейбіреулері сәттілікке ие болып, өздерінің қабілеттерінен артық ұпай алады, ал кейбіреулері бақытсыздыққа ұшырап, өздерінің қабілеттерінен төмен ұпай алады. Бірінші тестте сәттілікке ие болған студенттердің кейбірі екінші тестте де сәттілікке ие болады, бірақ олардың көпшілігі (олар үшін) орташа немесе орташадан төмен ұпай алады. Сондықтан, сәттілікке ие болып, бірінші тестте өз қабілетін асыра орындаған студенттің екінші тестте жақсы баллдан гөрі нашар балл алу ықтималдығы жоғары. Сол сияқты, бірінші тестте өздерінің қабілеттеріне қарағанда төмен балл жинаған студенттер екінші тестте өздерінің баллдарын көтереді. Тағдырдың экстремалды оқиғаға әсері қаншалықты үлкен болса, тағдырдың бірнеше оқиғаларда қайталану ықтималдығы соншалықты төмен болады.
Consider a class of students taking a 100 item true/false test on a subject. Suppose that all students choose randomly on all questions. Then, each student's score would be a realization of one of a set of independent and identically distributed random variables, with an expected mean of 50. Naturally, some students will score substantially above 50 and some substantially below 50 just by chance. If one selects only the top scoring 10% of the students and gives them a second test on which they again choose randomly on all items, the mean score would again be expected to be close to 50. Thus the mean of these students would "regress" all the way back to the mean of all students who took the original test. No matter what a student scores on the original test, the best prediction of their score on the second test is 50. If choosing answers to the test questions was not random – i. e. if there were no luck (good or bad) or random guessing involved in the answers supplied by the students – then all students would be expected to score the same on the second test as they scored on the original test, and there would be no regression toward the mean. Most realistic situations fall between these two extremes: for example, one might consider exam scores as a combination of skill and luck. In this case, the subset of students scoring above average would be composed of those who were skilled and had not especially bad luck, together with those who were unskilled, but were extremely lucky. On a retest of this subset, the unskilled will be unlikely to repeat their lucky break, while the skilled will have a second chance to have bad luck. Hence, those who did well previously are unlikely to do quite as well in the second test even if the original cannot be replicated. The following is an example of this second kind of regression toward the mean. A class of students takes two editions of the same test on two successive days. It has frequently been observed that the worst performers on the first day will tend to improve their scores on the second day, and the best performers on the first day will tend to do worse on the second day. The phenomenon occurs because student scores are determined in part by underlying ability and in part by chance. For the first test, some will be lucky, and score more than their ability, and some will be unlucky and score less than their ability. Some of the lucky students on the first test will be lucky again on the second test, but more of them will have (for them) average or below average scores. Therefore, a student who was lucky and over performed their ability on the first test is more likely to have a worse score on the second test than a better score. Similarly, students who unluckily score less than their ability on the first test will tend to see their scores increase on the second test. The larger the influence of luck in producing an extreme event, the less likely the luck will repeat itself in multiple events.
Басқа мысалдар
Егер сіздің сүйікті спорт командаңыз өткен жылы чемпионатты жеңіп алса, келесі маусымда жеңіске жету мүмкіндігіне бұл қандай әсер етеді? Егер бұл нәтиже команданың шеберлігіне байланысты болса (команда жақсы күйде, мыкты жаттықтырушысы бар және т.б.), онда олардың жеңісі келесі жылы да жеңіске жететінін көрсетеді. Бірақ егер бұл сәттілікке байланысты болса (басқа командалардың есірткі скандалына ұшырауы, қолайлы турнир жеребесі, дұрыс таңдалған ойыншылардың өнімді болғаны және т.б.), онда келесі жылы жеңіске жету мүмкіндігі азаяды. Егер кәсіпорынның тоқсандық табысы жоғары болса, бірақ оның негізгі себептері өзгермеген болса, келесі тоқсанда нәтижесі нашарлауы мүмкін. Бейсболшылардың бірінші маусымында жақсы ойнағандары, екінші маусымында нашар ойнауы ықтимал – бұл «екінші жылдық құлдырау» деп аталады. Сол сияқты, орташаға қарай регрессия Sports Illustrated журналының мұқабасындағы «нашарлық» құбылысын түсіндіреді – ерекше жетістікке жеткен кезеңдер, әдетте, орташа жетістікке жеткен кезеңдермен ауысады, бұл мұқабада пайда болу спортшының өнімділігінің төмендеуіне себеп болады деген ой тудырады.
If your favourite sports team won the championship last year, what does that mean for their chances for winning next season? To the extent this result is due to skill (the team is in good condition, with a top coach, etc. ), their win signals that it is more likely they will win again next year. But the greater the extent this is due to luck (other teams embroiled in a drug scandal, favourable draw, draft picks turned out to be productive, etc. ), the less likely it is they will win again next year. If a business organisation has a highly profitable quarter, despite the underlying reasons for its performance being unchanged, it is likely to do less well the next quarter. Baseball players who hit well in their rookie season are likely to do worse their second; the "sophomore slump". Similarly, regression toward the mean is an explanation for the Sports Illustrated cover jinx — periods of exceptional performance which results in a cover feature are likely to be followed by periods of more mediocre performance, giving the impression that appearing on the cover causes an athlete's decline.
Ашылу
Франсис Галтонның 1886 жылғы суреті ересектер мен олардың ата-аналарының бойы арасындағы байланысты көрсетеді. Галтон ата-ананың ерекше қасиеттерінің (мысалы, бойының) толығымен балаларына берілмейтінін байқады. Керісінше, балалардағы қасиеттер орташа деңгейге қарай төмендейді (кейіннен орташа деп анықталған нүкте). Жүздеген адамның бойын өлшегеннен кейін, ол орташаға регрессияны анықтап, оның әсерін бағалай алды. Галтон «ұрпақтың орташа регрессиясы – ата-анасының орташа алшақтығының тұрақты үлесі» деп жазды. Бұл бала мен ата-анасы арасындағы кейбір қасиеттердің айырмашылығы ата-анасының халықтың қалыпты ерекшеліктерінен алшақтығына пропорционалды дегенді білдіреді. Егер оның ата-анасы ерлер мен әйелдердің орташа бойынан екі дюйм артық болса, онда орташа есеп бойынша бала ата-анасынан белгілі бір коэффициентпен (қазір біз бұл коэффициентті бір минус регрессия коэффициенті деп атаймыз) екі дюймге кем болады. Галтон биіктік үшін бұл коэффициентті шамамен 2/3 деп есептеді: адамның бойы ата-анасының халықтың орташа бойынан алшақтығының үштен екісіне тең орташа нүктеде өлшенеді. Галтон осы нәтижелерді Галтон тақтасы арқылы құлайтын дөңгелектердің қарапайым мысалымен де жариялады, олар кіретін жерінің тікелей астында орналасқан қалыпты таралымды құрайды. Бұл дөңгелектер екінші өлшемге сәйкес екінші галереяға жіберілуі мүмкін. Содан кейін Галтон кері сұрақ қойды: «Бұл дөңгелектер қайдан келді?» Жауап орташадан жоғары емес еді. Керісінше, олар орташаға қарай, себебі орташадан жоғарыда солға қарай жылдам жылжи алатын дөңгелектер оң жақтағы дөңгелектерге қарағанда көп болды.
[[File:Galton's correlation diagram 1875. jpg|thumb|upright=2|Francis Galton's 1886 illustration of the correlation between the heights of adults and their parents. Galton observed that extreme characteristics (e. g., height) in parents are not passed on completely to their offspring. Rather, the characteristics in the offspring regress toward a mediocre point (a point which has since been identified as the mean). By measuring the heights of hundreds of people, he was able to quantify regression to the mean, and estimate the size of the effect. Galton wrote that, "the average regression of the offspring is a constant fraction of their respective mid parental deviations". This means that the difference between a child and its parents for some characteristic is proportional to its parents' deviation from typical people in the population. If its parents are each two inches taller than the averages for men and women, then, on average, the offspring will be shorter than its parents by some factor (which, today, we would call one minus the regression coefficient) times two inches. For height, Galton estimated this coefficient to be about 2/3: the height of an individual will measure around a midpoint that is two thirds of the parents' deviation from the population average. Galton also published these results using the simpler example of pellets falling through a Galton board to form a normal distribution centred directly under their entrance point. These pellets might then be released down into a second gallery corresponding to a second measurement. Galton then asked the reverse question: "From where did these pellets come?" The answer was not on average directly above. Rather it was on average, more towards the middle, for the simple reason that there were more pellets above it towards the middle that could wander left than there were in the left extreme that could wander to the right, inwards.
Терминнің қолданылуының өзгеруі
Гальтон "регрессия" терминін көпфакторлы сандық генетикалық белгілердің мұрагерлігінде байқалатын фактіні сипаттау үшін енгізді: атап айтқанда, таралымның шегіндегі ата-аналардың ұрпақтарының белгілері көбінесе таралымның ортасына, яғни орташа мәніне жақындайды. Ол осы тенденцияны сандық тұрғыдан анықтап, сызықтық регрессиялық талдауды ойлап тапты, осылайша қазіргі заманғы статистикалық модельдеудің негізін қалады. Содан бері "регрессия" термині басқа контекстерде де қолданылып келеді, және қазіргі статистиктер оны Гальтонның генетика саласындағы бастапқы байқауларымен тікелей қатысы жоқ, мысалы, сынамалық қателік сияқты құбылыстарды сипаттау үшін пайдаланады. Гальтон биологияда байқаған регрессия құбылысын былай түсіндірді: "Бала ата-анасынан да, ата-бабасынан да мұра алады. Жалпы алғанда, оның шежіресі неғұрлым алысқа созса, оның ата-бабалары да соғұрлым көп және әртүрлі болады, нәсілдің кездейсоқ алынған үлгісінен ешқандай айырмашылығы қалмайды". Бұл шешім қате болды, себебі орташаға қарай регрессия себеп-салдар байланысына емес, орташа мәнге айналатын табиғи таралымдағы кездейсоқ қателікке негізделген. Егер ең жоғары көрсеткіштер орташаға жақындаса да, екінші сынаманың нәтижелері біріншісінен орташаға жақын болмайды. Мысалы, студенттерді қарастырайық. Егер шекті жағдайлардағы адамдардың тенденциясы 80-нің орташа көрсеткішіне қарай 10% кері оралу болса, бірінші күні 100 ұпай алған студент екінші күні 98 ұпай алады деп күтіледі, ал бірінші күні 70 ұпай алған студент екінші күні 71 ұпай алады деп күтіледі. Бұл күтулер бірінші күнгі нәтижелерге қарағанда орташа мәнге жақын. Бірақ екінші күнгі нәтижелер күтілгеннен ауытқуы мүмкін, кейбіреулері жоғары, ал кейбіреулері төмен болады. Шекті жағдайлардағы студенттер үшін екінші нәтиже бірінші нәтижеге қарағанда орташаға жақын болады деп күтеміз, бірақ барлық студенттер үшін орташадан алшақтықтың екі сынақта да бірдей болады деп күтеміз. Жоғарыда айтылғанға байланысты, орташаға қарай регрессия екі бағытта да бірдей тиімді. Біз екінші күні ең жоғары балл алған студенттің бірінші күні нашар нәтиже көрсеткенін күтеміз. Егер бірінші күнгі үздік студентті екінші күнгі үздік студентпен салыстырсақ, бір адам болса да, болмаса да, екі бағытта да орташаға қарай регрессияның тенденциясы байқалмайды. Екі күнгі үздік нәтижелердің орташа мәннен бірдей алшақтықта болады деп күтеміз.
Galton coined the term "regression" to describe an observable fact in the inheritance of multi factorial quantitative genetic traits: namely that traits of the offspring of parents who lie at the tails of the distribution often tend to lie closer to the centre, the mean, of the distribution. He quantified this trend, and in doing so invented linear regression analysis, thus laying the groundwork for much of modern statistical modelling. Since then, the term "regression" has been used in other contexts, and it may be used by modern statisticians to describe phenomena such as sampling bias which have little to do with Galton's original observations in the field of genetics. Galton's explanation for the regression phenomenon he observed in biology was stated as follows: "A child inherits partly from his parents, partly from his ancestors. Speaking generally, the further his genealogy goes back, the more numerous and varied will his ancestry become, until they cease to differ from any equally numerous sample taken at haphazard from the race at large." Such a decision was a mistake, because regression toward the mean is not based on cause and effect, but rather on random error in a natural distribution around a mean. Although extreme individual measurements regress toward the mean, the second sample of measurements will be no closer to the mean than the first. Consider the students again. Suppose the tendency of extreme individuals is to regress 10% of the way toward the mean of 80, so a student who scored 100 the first day is expected to score 98 the second day, and a student who scored 70 the first day is expected to score 71 the second day. Those expectations are closer to the mean than the first day scores. But the second day scores will vary around their expectations; some will be higher and some will be lower. For extreme individuals, we expect the second score to be closer to the mean than the first score, but for all individuals, we expect the distribution of distances from the mean to be the same on both sets of measurements. Related to the point above, regression toward the mean works equally well in both directions. We expect the student with the highest test score on the second day to have done worse on the first day. And if we compare the best student on the first day to the best student on the second day, regardless of whether it is the same individual or not, there is no tendency to regress toward the mean going in either direction. We expect the best scores on both days to be equally far from the mean.
Регрессиялық қателіктер
Көптеген құбылыстар орташаға кері қайту ескерілмеген кезде дұрыс емес себептерге байланыстырылады. Экстремалды мысал ретінде Хорас Секристтің 1933 жылғы «Бизнестегі орташалықтың жеңісі» кітабын келтіруге болады. Онда статистика профессоры бәсекеге қабілетті бизнестің пайдасы уақыт өте келе орташа деңгейге жақындайтынын дәлелдеу үшін көптеген деректер жинады. Бірақ шын мәнінде мұндай эффект жоқ; пайда деңгейінің ауытқуы уақыт өте келе тұрақты болып қалады. Секрист жай ғана орташаға кері регрессияны сипаттаған. Бір ашуланған сыншы, Харольд Хотеллинг, кітапты «пиілдерді қатар-қатар тізіп, содан кейін басқа да көптеген жануар түрлерін де солай тізіп, көбейту кестесін дәлелдеумен» салыстырды. Массачусетс штатындағы білім беру тесттеріндегі «жетістік балдарын» есептеу және түсіндіру де, регрессиялық жаңылыстың тағы бір мысалы болуы мүмкін. 1999 жылы мектептерге жетістік мақсаттары қойылды. Білім департаменті әр мектептің 1999 және 2000 жылдардағы оқушылардың орташа баллдарының айырмашылығын тізімдеді. Көптеген нашар нәтиже көрсеткен мектептер өз мақсаттарына жеткені тез байқалды, бұл Білім департаменті өз саясатының дұрыстығын растады. Алайда, сондай-ақ, мемлекеттегі ең жақсы мектептердің көпшілігі, мысалы, Бруклин орта мектебі (18 Ұлттық Merit стипендиясының финалистері бар) сәтсіз деп жарияланды. Статистика және мемлекеттік саясатқа қатысты көптеген жағдайларда сияқты, бұл мәселе де талқыланып жатыр, бірақ «жетістік балдары» кейінгі жылдары жарияланбады және нәтижелері орташаға кері регрессияның көрінісі сияқты көрінеді. 2002 жылы Экономика ғылымдары саласындағы Нобель сыйлығын алған психолог Дэниел Канеман, орташаға кері регрессияның сөгіске жауап ретінде нәтижелерді жақсартуға, ал мақтаудың кері әсер беруіне себеп болуы мүмкін екенін атап өтті. Регрессиялық қателік Рольф Добеллидің «Ақылмен ойлау өнері» кітабында да түсіндірілген. Ұлыбританияның құқық қорғау органдары апаттар жиі болатын жерлерде жылжымалы немесе стационарлық жылдамдық камераларын орналастыруды қолдады. Бұл саясат камера орнатылғаннан кейін жол-көлік оқиғаларының азаюымен негізделді. Алайда, статистиктер, өмірді сақтап қалудың жалпы пайдасы болғанымен, орташаға кері регрессияның әсерін ескермеу пайдалы әсерлерді асыра бағалауға әкеледі деп көрсетті. Статистикалық сарапшылар спорттағы орташаға кері регрессияның әсерін ұзақтан бері мойындады және тіпті оған арнайы атау берді: «екінші курс құлдырауы». Мысалы, 2004 жылы NBA-ның «Денвер Наггетс» командасының ойыншысы Кармело Энтони өте жарқын дебюттік маусымын өткізді. Ол соншалықты жарқын болды, оны қайталауды күтуге болмады: 2005 жылы Энтонинің көрсеткіштері дебюттік маусымынан төмендеді. «Екінші курс құлдырауының» себептері көп, өйткені спорт жақсарту мен қарсы жақсартуға негізделген, бірақ дебютте сәттілікке негізделген өте жақсы көрсеткіш те себеп болуы мүмкін. Спорттағы орташаға кері регрессия «Sports Illustrated» журналының мұқабасындағы «нашарлық» және «Madden Curse» сияқты құбылыстарды да түсіндіруі мүмкін. Джон Холлинджер орташаға кері регрессия құбылысы үшін балама атауға ие: «кездейсоқ ереже», ал Билл Джеймс оны «плексиглас принципі» деп атайды. Халық арасындағы аңыздарда спортшылардың бір маусымнан екіншісіне қарай төмендеуін түсіндіретін орташаға кері регрессияға назар аударылғандықтан, мұндай регрессияның өнімділікті жақсартуға да себеп бола алатыны көбінесе естен шығарылады. Мысалы, егер біз Басты лига бейсбол ойыншыларының бір маусымдағы соққы орташасын қарасақ, олардың соққы орташасы лиганың орташа көрсеткішінен жоғары болғандары келесі жылы төмендеп, орташаға жақындасады, ал орташа көрсеткіші төмен болғандары келесі жылы жоғарылап, орташаға жақындайды.
Many phenomena tend to be attributed to the wrong causes when regression to the mean is not taken into account. An extreme example is Horace Secrist's 1933 book The Triumph of Mediocrity in Business, in which the statistics professor collected mountains of data to prove that the profit rates of competitive businesses tend toward the average over time. In fact, there is no such effect; the variability of profit rates is almost constant over time. Secrist had only described the common regression toward the mean. One exasperated reviewer, Harold Hotelling, likened the book to "proving the multiplication table by arranging elephants in rows and columns, and then doing the same for numerous other kinds of animals". The calculation and interpretation of "improvement scores" on standardized educational tests in Massachusetts probably provides another example of the regression fallacy. In 1999, schools were given improvement goals. For each school, the Department of Education tabulated the difference in the average score achieved by students in 1999 and in 2000. It was quickly noted that most of the worst performing schools had met their goals, which the Department of Education took as confirmation of the soundness of their policies. However, it was also noted that many of the supposedly best schools in the Commonwealth, such as Brookline High School (with 18 National Merit Scholarship finalists) were declared to have failed. As in many cases involving statistics and public policy, the issue is debated, but "improvement scores" were not announced in subsequent years and the findings appear to be a case of regression to the mean. The psychologist Daniel Kahneman, winner of the 2002 Nobel Memorial Prize in Economic Sciences, pointed out that regression to the mean might explain why rebukes can seem to improve performance, while praise seems to backfire. The regression fallacy is also explained in Rolf Dobelli's The Art of Thinking Clearly. UK law enforcement policies have encouraged the visible siting of static or mobile speed cameras at accident blackspots. This policy was justified by a perception that there is a corresponding reduction in serious road traffic accidents after a camera is set up. However, statisticians have pointed out that, although there is a net benefit in lives saved, failure to take into account the effects of regression to the mean results in the beneficial effects being overstated. Statistical analysts have long recognized the effect of regression to the mean in sports; they even have a special name for it: the "sophomore slump". For example, Carmelo Anthony of the NBA's Denver Nuggets had an outstanding rookie season in 2004. It was so outstanding that he could not be expected to repeat it: in 2005, Anthony's numbers had dropped from his rookie season. The reasons for the "sophomore slump" abound, as sports rely on adjustment and counter adjustment, but luck based excellence as a rookie is as good a reason as any. Regression to the mean in sports performance may also explain the apparent "Sports Illustrated cover jinx" and the "Madden Curse". John Hollinger has an alternative name for the phenomenon of regression to the mean: the "fluke rule", while Bill James calls it the "Plexiglas Principle". Because popular lore has focused on regression toward the mean as an account of declining performance of athletes from one season to the next, it has usually overlooked the fact that such regression can also account for improved performance. For example, if one looks at the batting average of Major League Baseball players in one season, those whose batting average was above the league mean tend to regress downward toward the mean the following year, while those whose batting average was below the mean tend to progress upward toward the mean the following year.
Басқа статистикалық құбылыстар
Орташаға қарай регрессия тек қана ерекше кездейсоқ оқиғадан кейін келесі кездейсоқ оқиғаның экстремалдығы азаятынын көрсетеді. Болашақ оқиға бұрынғы оқиғаны "толықтырмайды" немесе "теңестірмейді", бірақ бұл ойыншының жаңылысында (және орташа есеп заңының түрінде) қабылданады. Сол сияқты, үлкен сандар заңы ұзақ мерзімде орташаның күтілетін мәнге жақындасатынын айтады, бірақ жекелеген тәжірибелер туралы ешқандай мәлімдеме жасамайды. Мысалы, бес тілік тастағанда 10 рет қатарынан сырға түскен жағдай (сирек, ерекше оқиға), орташаға қарай регрессия келесі сырға түсу саны 10-нан кем болуы мүмкін екенін көрсетеді, ал үлкен сандар заңы ұзақ мерзімде бұл оқиғаның орташа көрсеткішіне жақындасатынын, сырға түсу үлесінің шамамен 1/2-ге тең болатынын айтады. Керісінше, ойыншының жаңылысы бұл жағдайда тиенің қатарына түсудің қажеттілігін дұрыс емес деп есептейді. Құйрыққа қарай регрессия деген кері әсер, шексіздікке қарай ықтималдық тығыздығы жоғалып кетпейтін таралымнан туындайды.
Regression toward the mean simply says that, following an extreme random event, the next random event is likely to be less extreme. In no sense does the future event "compensate for" or "even out" the previous event, though this is assumed in the gambler's fallacy (and the variant law of averages). Similarly, the law of large numbers states that in the long term, the average will tend toward the expected value, but makes no statement about individual trials. For example, following a run of 10 heads on a flip of a fair coin (a rare, extreme event), regression to the mean states that the next run of heads will likely be less than 10, while the law of large numbers states that in the long term, this event will likely average out, and the average fraction of heads will tend to 1/2. By contrast, the gambler's fallacy incorrectly assumes that the coin is now "due" for a run of tails to balance out. The opposite effect is regression to the tail, resulting from a distribution with non vanishing probability density toward infinity.
Деректер нүктелерінің қарапайым сызықтық регрессиясының анықтамасы
Бұл сэр Фрэнсис Гальтонның бастапқы қолданысын тығыз ұстанатын орташаға қарай регрессияның анықтамасы. Төменде жоғарыда көрсетілген анықтаманың бейресми сипаттамасы берілген. Виджеттер популяциясын қарастырайық. Әр виджетте екі сан бар, X1 және X2 (мысалы, оның сол жақтан өлшенген ұзындығы (X1) және оң жақтан өлшенген ұзындығы (X2)). X1 және X2 ықтималдықтарының таралуы популяцияда бірдей және X1 мен X2-нің орташа мәндері екеуі де μ-ға тең болсын. Енді популяциядан кездейсоқ виджетті алып, оның X1 мәнін c деп белгілейміз. (c μ-дан үлкен, тең немесе кіші болуы мүмкін.) Бізде әлі осы виджеттің X2 мәніне қол жеткізуге мүмкіндік жоқ. d осы виджеттің X2-нің күтілетін мәнін білдірсін. (яғни, d – X1 = c болатын популяциядағы барлық виджеттердің X2 орташа мәнін білдірсін.) Егер келесі шарт орындалса:
c-нің мәніне қарамастан, d μ мен c аралығында жатса (яғни, d, c-ден μ-ға жақын болса),
This is the definition of regression toward the mean that closely follows Sir Francis Galton's original usage. The following is an informal description of the above definition. Consider a population of widgets. Each widget has two numbers, X1 and X2 (say, its left span (X1 ) and right span (X2)). Suppose that the probability distributions of X1 and X2 in the population are identical, and that the means of X1 and X2 are both μ. We now take a random widget from the population, and denote its X1 value by c. (c may be greater than, equal to, or smaller than μ.) We have no access to the value of this widget's X2 yet. Let d denote the expected value of X2 of this particular widget. (i. e. Let d denote the average value of X2 of all widgets in the population with X1=c.) If the following condition is true:
Whatever the value c is, d lies between μ and c (i. e. d is closer to μ than c is),
онда X1 және X2 орташаға қарай регрессияны көрсетеді дейміз. Бұл анықтама қазіргі кездегі қолданыспен, Гальтонның бастапқы қолданысынан пайда болған "орташаға қарай регрессия" терминімен үлкен сәйкестікке ие. Бұл "шектелген" мағынасында, себебі бірдей жиектері бар екіаймалы таралымдардың барлығы да орташаға қарай регрессияны көрсетпейді (осы анықтама бойынша). Сондықтан, егер 0 ≤ r < 1 болса, онда (X, Y) орташаға қарай регрессияны көрсетеді (осы анықтама бойынша).
then we say that X1 and X2 show regression toward the mean. This definition accords closely with the current common usage, evolved from Galton's original usage, of the term "regression toward the mean". It is "restrictive" in the sense that not every bivariate distribution with identical marginal distributions exhibits regression toward the mean (under this definition). Hence, if 0 ≤ r < 1, then (X, Y) shows regression toward the mean (by this definition).
Жалпы анықтама
Самуэльс орташаға қарай кері бұрудың келесі анықтамасын жоғарыдағы орташаға қарай регрессияның шектеулі анықтамасына балама ретінде ұсынды.
The following definition of reversion toward the mean has been proposed by Samuels as an alternative to the more restrictive definition of regression toward the mean above.