Қайта сынама алу әдістері: Статистикалық талдау құралдары
Resampling (statistics)
Статистикада қайта сынама алу әдістері:Permutation, Bootstrap, кросс-валидация. Деректерді қайта пайдаланып, нәтижелердің сенімділігін арттыруға көмектеседі.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Қолда бар деректерді іріктеуге негізделген статистикалық әдістер жиынтығы. Статистикада қайта іріктеу – бір байқалған үлгіден жаңа үлгілер жасау. Қайта іріктеу әдістері:
Пермутациялық тесттер (сондай-ақ қайта рандомизациялық тесттер)
Бутстрап
Кросс-валидация
Жеккөңіш әдісі
Family of statistical methods based on sampling of available data
In statistics, resampling is the creation of new samples based on one observed sample. Resampling methods are:
Permutation tests (also re randomization tests)
Bootstrapping
Cross validation
Jackknife
Пермутация сынақтары
Пермутациялық сынақтар нөлдік гипотеза дұрыс деп есептеліп, бастапқы деректерді қайта сынауға негізделеді. Қайта сынау нәтижелері бойынша, нөлдік гипотеза жағдайында бастапқы деректердің қаншалықты болу ықтималдығы туралы қорытынды жасауға болады.
Permutation tests rely on resampling the original data assuming the null hypothesis. Based on the resampled data it can be concluded how likely the original data is to occur under the null hypothesis.
Bootstrap-пен жұмыс істеу
Бутстрапинг – бастапқы үлгіден қайталап үлгі алу арқылы бағалаушының үлгілік таралуын бағалаудың статистикалық әдісі. Көбінесе, бұл әдіс орташа, медиана, үлес, қатынас шансы, корреляциялық коэффициент немесе регрессиялық коэффициент сияқты популяциялық параметрлердің стандартты қателіктері мен сенімділік интервалдарын еңбектеп бағалау үшін қолданылады. Бұл әдіс «қосымша принцип» деп те аталады, себебі ол популяциялық таралудың функционалдарын бағалау үшін, үлгіге негізделген эмпирикалық таралуда сол функционалдарды бағалау арқылы жүзеге асырылады. Мысалы, осы контексте бутстрап эмпирикалық салмақталған ықтималдық шараларын эмпирикалық шаралармен алмастыру үшін пайдаланылады. Бутстрап аз салмаққа ие үлгілерді жоғары салмаққа ие үлгілердің көшірмелерімен алмастыруға мүмкіндік береді.
Bootstrapping is a statistical method for estimating the sampling distribution of an estimator by sampling with replacement from the original sample, most often with the purpose of deriving robust estimates of standard errors and confidence intervals of a population parameter like a mean, median, proportion, odds ratio, correlation coefficient or regression coefficient. It has been called the plug in principle, as it is the method of estimation of functionals of a population distribution by evaluating the same functionals at the empirical distribution based on a sample. For example, In this context, the bootstrap is used to replace sequentially empirical weighted probability measures by empirical measures. The bootstrap allows to replace the samples with low weights by copies of the samples with high weights.
Крестік валидациялау
Кроссты растау – болжамдық модельді тексерудің статистикалық әдісі. Деректердің ішкі жиынтықтары тексеру жиынтықтары ретінде қолданылады; модель қалған деректерге (оқу жиынтығы) сәйкестендіріледі және тексеру жиынтығы үшін болжамдар жасау үшін пайдаланылады. Тексеру жиынтықтары бойынша болжамдар сапасының орташасы – болжамның жалпы дәлдігін көрсетеді. Кроссты растау шешім ағаштарын құру кезінде жиі қолданылады. Кроссты растаудың бір түрі бір уақытта бір ғана дерек нүсқасын (бақылауды) қалдырады; бұл соқпақ әдісіне ұқсас. Тағы бір түрі – K-қатты кросс-растау, деректерді K ішкі жиынтыққа бөледі; олардың әрқайсысы кезекпен тексеру жиынтығы ретінде қолданылады. Бұл «өздік әсер етуден» сақтайды. Салыстыру үшін, сызықтық регрессия сияқты регрессиялық талдау әдістерінде әр y мәні регрессия сызығын өзіне қарай тартып, сол мәннің болжамын нақты болғаннан дәл көрінеді. Сызықтық регрессияға қолданылатын кросс-растау әр дерек нүсқасының y мәнін сол нүсқаны пайдаланбастан болжайды. Бұл регрессияда қанша болжаушы айнымалы қолдану керектігін анықтау үшін жиі қолданылады. Кроссты растаусыз, болжаушыларды қосу әрқашан қалдықтардың квадратын азайтады (немесе өзгеріссіз қалдырады). Керісінше, құнды болжаушылар қосылса, кросс-растау арқылы алынған орташа квадраттық қате азаяды, ал құнды емес болжаушылар қосылса, көбейеді.
Cross validation is a statistical method for validating a predictive model. Subsets of the data are held out for use as validating sets; a model is fit to the remaining data (a training set) and used to predict for the validation set. Averaging the quality of the predictions across the validation sets yields an overall measure of prediction accuracy. Cross validation is employed repeatedly in building decision trees. One form of cross validation leaves out a single observation at a time; this is similar to the jackknife. Another, K fold cross validation, splits the data into K subsets; each is held out in turn as the validation set. This avoids "self influence". For comparison, in regression analysis methods such as linear regression, each y value draws the regression line toward itself, making the prediction of that value appear more accurate than it really is. Cross validation applied to linear regression predicts the y value for each observation without using that observation. This is often used for deciding how many predictor variables to use in regression. Without cross validation, adding predictors always reduces the residual sum of squares (or possibly leaves it unchanged). In contrast, the cross validated mean square error will tend to decrease if valuable predictors are added, but increase if worthless predictors are added.
Жақсылықпен тексеру
Jackknifing (jackknife cross validation) статистикалық қорытындыда статистиканың теріс және стандартты қатесін (дисперсиясын) бағалау үшін қолданылады, оны есептеу үшін байқаулардың кездейсоқ үлгісі пайдаланылады. Тарихи тұрғыдан алғанда, бұл әдіс 1949 жылы Quenouille осы әдісті ойлап тапқан және 1958 жылы Tukey оны кеңейткенге дейін, bootstrap әдісінің пайда болуына дейін болды. Бұл әдіс 1946 жылы Махаланобиспен көрегендік танытты, ол қызығушылық тудырған статистиканы бағалауды қайталап жасауды ұсынды, үлгінің жартысы кездейсоқ түрде таңдалды. Ол осы әдіске «бір-бірімен араласатын үлгілер» деген ат қойды. Quenouille осы әдісті үлгі бағасының терістігін азайту мақсатымен ойлап тапты. Tukey бұл әдісті кеңейтіп, егер репликалар бірдей және тәуелсіз таралымға ие болса, үлгі параметрінің дисперсиясын бағалауға болады және ол шамамен n-1 еркіндік дәрежесімен t-таралымға ұқсас болады (mұнда n – үлгінің көлемі). Jackknife дисперсиялық бағалаушының негізгі идеясы – статистикалық бағалауды жүйелі түрде қайта есептеу, үлгі жиынтығынан бір немесе бірнеше байқауларды әр жолы алып тастау. Статистиканың осы жаңа репликалар жиынтығынан статистиканың терістігіне және дисперсиясына бағалаулар есептелуі мүмкін. Дисперсияны бағалау үшін jackknife-ты пайдаланудың орнына, оны дисперсияның логарифміне қолдануға болады. Бұл түрлендіру, әсіресе дисперсияның өзі қалыпты емес таралымға ие болғанда, жақсырақ бағалауларға әкелуі мүмкін. Көптеген статистикалық параметрлер үшін jackknife дисперсиясының бағасы асимптотикалық түрде нақты мәнге жақындайды. Техникалық тұрғыдан алғанда, jackknife бағасы консистентті (сәйкес) дейміз. Jackknife үлгі орташасы, үлгі дисперсиясы, орталық және орталық емес t-статистикасы (мүмкін қалыпты емес популяциялар үшін), үлгі коэффициентінің өзгеруі, максималды ықтималдық бағалаушылары, ең кіші квадраттар бағалаушылары, корреляциялық және регрессиялық коэффициенттері үшін консистентті. Ол үлгі медианасы үшін консистентті емес. Бірмодальды вариация жағдайында, jackknife дисперсиясының үлгі дисперсиясына қатынасы екі еркіндік дәрежесі бар хи-квадрат таралымының жартысы квадратына таралады. Jackknife, бастапқы bootstrap сияқты, деректердің тәуелсіздігіне байланысты. Деректердегі тәуелділікті ескеретін jackknife-тың кеңейтулері ұсынылған. Тағы бір кеңейту – Poisson үлгілемесімен байланысты қолданылатын топты жою әдісі. Jackknife, кездейсоқ (субсамплинг) бір элементті жою кросс-валидациясына тең, олар тек мақсатымен ғана ерекшеленеді.
Jackknifing (jackknife cross validation), is used in statistical inference to estimate the bias and standard error (variance) of a statistic, when a random sample of observations is used to calculate it. Historically, this method preceded the invention of the bootstrap with Quenouille inventing this method in 1949 and Tukey extending it in 1958. This method was foreshadowed by Mahalanobis who in 1946 suggested repeated estimates of the statistic of interest with half the sample chosen at random. He coined the name 'interpenetrating samples' for this method. Quenouille invented this method with the intention of reducing the bias of the sample estimate. Tukey extended this method by assuming that if the replicates could be considered identically and independently distributed, then an estimate of the variance of the sample parameter could be made and that it would be approximately distributed as a t variate with n−1 degrees of freedom (n being the sample size). The basic idea behind the jackknife variance estimator lies in systematically recomputing the statistic estimate, leaving out one or more observations at a time from the sample set. From this new set of replicates of the statistic, an estimate for the bias and an estimate for the variance of the statistic can be calculated. Instead of using the jackknife to estimate the variance, it may instead be applied to the log of the variance. This transformation may result in better estimates particularly when the distribution of the variance itself may be non normal. For many statistical parameters the jackknife estimate of variance tends asymptotically to the true value almost surely. In technical terms one says that the jackknife estimate is consistent. The jackknife is consistent for the sample means, sample variances, central and non central t statistics (with possibly non normal populations), sample coefficient of variation, maximum likelihood estimators, least squares estimators, correlation coefficients and regression coefficients. It is not consistent for the sample median. In the case of a unimodal variate the ratio of the jackknife variance to the sample variance tends to be distributed as one half the square of a chi square distribution with two degrees of freedom. The jackknife, like the original bootstrap, is dependent on the independence of the data. Extensions of the jackknife to allow for dependence in the data have been proposed. Another extension is the delete a group method used in association with Poisson sampling. Jackknife is equivalent to the random (subsampling) leave one out cross validation, it only differs in the goal.
Бутстрап пен джак-қанатты салыстыру
Екі әдіс те – Bootstrap және Jackknife – параметрлік болжамдарға емес, статистикалық көрсеткіштердің субнақтылар арасындағы өзгеруіне негізделіп, статистикалық көрсеткіштің өзгеруін бағалайды. Көбірек жалпы жағдайда, m бақылауды жою арқылы жасалатын Jackknife үшін, Bootstrap оны кездейсоқ жуықтама ретінде қарастыруға болады. Екеуі де ұқсас сандық нәтижелер береді, сондықтан әрқайсысын екіншісіне жуықтама ретінде қарастыруға болады. Олардың математикалық түсініктерінде үлкен теориялық айырмашылықтар болғанымен, статистика қолданушылары үшін негізгі практикалық айырмашылық – бір деректер жиынымен жұмыс істегенде Bootstrap әрқашан әртүрлі нәтижелер береді, ал Jackknife әрқашан бірдей нәтиже береді. Осы себепті, егер бағалауды жариялау алдында бірнеше рет тексеру қажет болса (мысалы, ресми статистика агенттіктері), Jackknife көбірек қолданылады. Ал егер бұл тексеру қажет болмаса және сандық мәннен гөрі оның таралуы туралы түсінік маңызды болса, Bootstrap артық көріледі (мысалы, физика, экономика, биология ғылымдарында). Bootstrap немесе Jackknife таңдауы зерттеудің статистикалық емес, операциялық аспектілеріне көбірек байланысты болуы мүмкін. Бастапқыда қисайдылықты азайту үшін қолданылатын Jackknife – арнайы әдіс және тек нүктелік бағалаушының дисперсиясын бағалайды. Бұл негізгі статистикалық қорытындылар үшін жеткілікті (мысалы, гипотезаны тексеру, сенімділік интервалдары). Ал Bootstrap алдымен нүктелік бағалаушының бүкіл таралуын бағалайды, содан кейін осыдан дисперсияны есептейді. Бұл қуатты және оңай болғанымен, есептеулерге көп уақыт қажет етеді. "Bootstrap дисперсияны және таралуды бағалау мәселелеріне қолданылуы мүмкін. Дегенмен, Bootstrap дисперсиялық бағалауы эмпирикалық нәтижелер бойынша Jackknife немесе теңгерілген қайталама репликация (BRR) дисперсиялық бағалауынан нашар. Сонымен қатар, Bootstrap дисперсиялық бағалауы көбінесе Jackknife немесе BRR-ге қарағанда көбірек есептеулерді қажет етеді. Сондықтан Bootstrap негізінен таралуды бағалау үшін ұсынылады." Jackknife-ты қолданғанда, әсіресе бір бақылауды жою арқылы жасалатын Jackknife-та ерекше назар қажет. Оны тек тегіс, дифференциалданатын статистикамен ғана қолдану керек (мысалы, қосындылар, орташалар, пропорциялар, қатынастар, тақ қатынастар, регрессия коэффициенттері және т.б.; медианалар немесе квантильдер емес). Бұл практикалық кемшілік болуы мүмкін. Осы кемшілік көбінесе Bootstrap-ты Jackknife-тан артық көруге себеп болады. Бір бақылауды жоюдан гөрі жалпы Jackknife, мысалы, m бақылауды жою немесе Hodges–Lehmann бағалаушысын қолдану, медианалар мен квантильдер үшін бірқалыпты дисперсияны бағалау үшін тегіс талаптарды жеңілдету арқылы бұл мәселені шешеді. Күрделі үлгі алу схемаларына Bootstrap-тан гөрі Jackknife-ты қолдану әдетте оңай. Күрделі үлгі алу схемалары стратификацияны, көп сатылы (кластерлеуді), әртүрлі үлгі алу салмақтарын (жауапсыздық түзетулерін, калибрлеуді, стратификациядан кейінгі түзетулерді) және тең емес ықтималдық үлгі алу жобаларын қамтуы мүмкін. Bootstrap және Jackknife-тың теориялық аспектілерін Шао және Тудың (1995) еңбегінен табуға болады, ал негізгі кіріспе Уолтердің (2007) еңбегінде келтірілген. Сызықтық дискриминантты функция немесе көп регрессия сияқты сызықтық модельдерде модельдік болжамның қатесін бағалауда Bootstrap бағасы Jackknife бағасынан дәл.
Both methods, the bootstrap and the jackknife, estimate the variability of a statistic from the variability of that statistic between subsamples, rather than from parametric assumptions. For the more general jackknife, the delete m observations jackknife, the bootstrap can be seen as a random approximation of it. Both yield similar numerical results, which is why each can be seen as approximation to the other. Although there are huge theoretical differences in their mathematical insights, the main practical difference for statistics users is that the bootstrap gives different results when repeated on the same data, whereas the jackknife gives exactly the same result each time. Because of this, the jackknife is popular when the estimates need to be verified several times before publishing (e. g., official statistics agencies). On the other hand, when this verification feature is not crucial and it is of interest not to have a number but just an idea of its distribution, the bootstrap is preferred (e. g., studies in physics, economics, biological sciences). Whether to use the bootstrap or the jackknife may depend more on operational aspects than on statistical concerns of a survey. The jackknife, originally used for bias reduction, is more of a specialized method and only estimates the variance of the point estimator. This can be enough for basic statistical inference (e. g., hypothesis testing, confidence intervals). The bootstrap, on the other hand, first estimates the whole distribution (of the point estimator) and then computes the variance from that. While powerful and easy, this can become highly computationally intensive. "The bootstrap can be applied to both variance and distribution estimation problems. However, the bootstrap variance estimator is not as good as the jackknife or the balanced repeated replication (BRR) variance estimator in terms of the empirical results. Furthermore, the bootstrap variance estimator usually requires more computations than the jackknife or the BRR. Thus, the bootstrap is mainly recommended for distribution estimation." There is a special consideration with the jackknife, particularly with the delete 1 observation jackknife. It should only be used with smooth, differentiable statistics (e. g., totals, means, proportions, ratios, odd ratios, regression coefficients, etc. ; not with medians or quantiles). This could become a practical disadvantage. This disadvantage is usually the argument favoring bootstrapping over jackknifing. More general jackknifes than the delete 1, such as the delete m jackknife or the delete all but 2 Hodges–Lehmann estimator, overcome this problem for the medians and quantiles by relaxing the smoothness requirements for consistent variance estimation. Usually the jackknife is easier to apply to complex sampling schemes than the bootstrap. Complex sampling schemes may involve stratification, multiple stages (clustering), varying sampling weights (non response adjustments, calibration, post stratification) and under unequal probability sampling designs. Theoretical aspects of both the bootstrap and the jackknife can be found in Shao and Tu (1995), whereas a basic introduction is accounted in Wolter (2007). The bootstrap estimate of model prediction bias is more precise than jackknife estimates with linear models such as linear discriminant function or multiple regression.