Кіріспе
Статистикалық есептеулердің соңғы нәтижесінде еркін өзгеріп отыруға болатын мәндердің саны. Статистикада еркіндік дәрежесінің саны – статистикалық мәліметтердің соңғы есептеуінде еркін өзгеріп отыруға болатын мәндердің саны. Статистикалық параметрлерді бағалау әртүрлі ақпарат немесе деректерге негізделуі мүмкін. Параметрдің бағасына кіретін тәуелсіз ақпарат мөлшері еркіндік дәрежесі деп аталады. Жалпы, параметрді бағалаудағы еркіндік дәрежесі, бағалауға кіретін тәуелсіз мәндердің саны мен параметрді бағалаудың аралық қадамдары ретінде қолданылатын параметрлер санының айырмасына тең. Мысалы, егер дисперсия тәуелсіз мәндердің кездейсоқ үлгісінен есептелсе, онда еркіндік дәрежесі тәуелсіз мәндердің санына (N) минус аралық қадамдар ретінде бағаланған параметрлер санына (бір, атап айтқанда, үлгі орташасы) тең болады. Математикалық тұрғыдан алғанда, еркіндік дәрежесі – кездейсоқ вектордың доменінің өлшемдерінің саны, яғни вектор толық анықталғанша қанша компонентті білу қажет екенін көрсетеді. Бұл термин көбінесе сызықтық модельдер (сызықтық регрессия, дисперсиялық талдау) контекстінде қолданылады, онда кейбір кездейсоқ векторлар сызықтық ішкі кеңістіктерде шектеледі, ал еркіндік дәрежесінің саны – ішкі кеңістіктің өлшемдеріне тең. Еркіндік дәрежесі сондай-ақ мұндай векторлардың ұзындығының квадратына (немесе координаттардың "квадраттарының қосындысына") және осыған байланысты статистикалық тестілеулерде туындайтын хи-квадрат және басқа да үлестірулердің параметрлерімен де байланысты. Бастауыш оқулықтарда еркіндік дәрежесі үлестіру параметрлері ретінде немесе гипотезаларды тексеру арқылы ұсынылуы мүмкін, бірақ еркіндік дәрежесін анықтайтын негізгі геометрия, осы ұғымды дұрыс түсіну үшін өте маңызды.
In statistics, the number of degrees of freedom is the number of values in the final calculation of a statistic that are free to vary. Estimates of statistical parameters can be based upon different amounts of information or data. The number of independent pieces of information that go into the estimate of a parameter is called the degrees of freedom. In general, the degrees of freedom of an estimate of a parameter are equal to the number of independent scores that go into the estimate minus the number of parameters used as intermediate steps in the estimation of the parameter itself. For example, if the variance is to be estimated from a random sample of independent scores, then the degrees of freedom is equal to the number of independent scores (N) minus the number of parameters estimated as intermediate steps (one, namely, the sample mean) and is therefore equal to
Mathematically, degrees of freedom is the number of dimensions of the domain of a random vector, or essentially the number of "free" components (how many components need to be known before the vector is fully determined). The term is most often used in the context of linear models (linear regression, analysis of variance), where certain random vectors are constrained to lie in linear subspaces, and the number of degrees of freedom is the dimension of the subspace. The degrees of freedom are also commonly associated with the squared lengths (or "sum of squares" of the coordinates) of such vectors, and the parameters of chi squared and other distributions that arise in associated statistical testing problems. While introductory textbooks may introduce degrees of freedom as distribution parameters or through hypothesis testing, it is the underlying geometry that defines degrees of freedom, and is critical to a proper understanding of the concept.
Тарих
Еркіндік дәрежесінің негізгі түсінігі 1821 жылы неміс астрономы және математигі Карл Фридрих Гаусс еңбегінде мойндалғанмен, оның қазіргі анықтамасы мен қолданылуын алғаш рет ағылшын статистигі Уильям Сили Госс 1908 жылы "Студент" атты псевдониммен жариялаған "Орташаның ықтимал қатесі" атты "Биометрика" мақаласында толықтай жазбаға алды. Госс "еркіндік дәрежесі" терминін пайдаланбаса да, ол осы ұғымды Студенттің t-үлестірімі деп белгілі болған нәрсені әзірлеу процесінде түсіндірді. Ағылшын статистигі және биологы Рональд Фишер бұл терминді 1922 жылы хи-квадраттар туралы жұмысынан бастап кеңінен танымал етті.
Нөмірлік
Теңдеулерде еркіндік дәрежесін белгілеу үшін әдетте ν (кіші грек әрпі ню) таңбасы қолданылады. Мәтін мен кестелерде "d. f." деген қысқарту жиі пайдаланылады. Р. А. Фишер еркіндік дәрежесін n арқылы белгілеген, бірақ қазіргі қолданыста n көбінесе сынама көлемі үшін резервтеліп қойылған.
Құрылымдық теңдеулер үлгілерінде
Құрылымдық теңдеу модельдерінің (SEM) нәтижелері ұсынылған кезде, олар әдетте жалпы модельге сәйкестіктің бір немесе бірнеше индекстерін қамтиды, олардың ең көп таралғандары χ2 статистикасы болып табылады. Бұл басқа да жиі есептелетін индекстердің негізін құрайды. Бұл басқа статистикалар ең жиі түсіндірілетін болса да, χ2 еркіндік дәрежесі модельдің сәйкестігін және модельдің өзінің сипатын түсіну үшін маңызды. SEM-дегі еркіндік дәрежесі талдауға кірістірілетін бірегей ақпарат мөлшері мен бірегей түрде бағаланатын параметрлер саны арасындағы айырмашылық ретінде есептеледі, бірегей ақпарат кейде «белгілі», ал параметрлер «белгісіз» деп аталады. Мысалы, 4 сұрақтан тұратын бір факторлы растаушы факторлық талдауда 2 еркіндік дәрежесі үшін 10 белгілі (төрт сұрақ арасындағы алты бірегей ковариация және төрт сұрақ дисперсиясы) және 8 белгісіз (4 факторлық жүктеме және 4 қате дисперсиясы) болады. Еркіндік дәрежесі модельдің сәйкестігін түсіну үшін маңызды, себебі басқа шарттар тең болса, еркіндік дәрежесі аз болған сайын, χ2 сияқты көрсеткіштер жақсы болады. СЭМ қолданылған зерттемелерді оқитын адамдар еркіндік дәрежесі арқылы мақала авторлары дұрыс модельге сәйкес келетін статистиканы ұсынып отыр ма екенін анықтай алады. Ұйымдық ғылымдарда, мысалы, жоғары рейтингті журналдарда жарияланған мақалалардың шамамен жартысы сол мақалаларда сипатталған модельдермен сәйкес келмейтін еркіндік дәрежесі туралы хабарлайды, бұл оқырманға қандай модельдер нақты тексерілгенін ойлануға мүмкіндік береді.
Қалдықтар
Еркіндік дәрежесін қарастырудың ең көп таралған жолы – басқа бір мәліметті бағалауға қолжетімді тәуелсіз мәліметтер мөлшері. Нақтырақ айтқанда, еркіндік дәрежесінің саны – сол үлгі алынған популяцияның параметрін бағалау үшін қолжетімді деректер үлгісіндегі тәуелсіз байқаулардың саны. Мысалы, егер екі байқау болса, орташа есептегенде екі тәуелсіз байқау болады; бірақ дисперсияны есептегенде, тек бір тәуелсіз байқау ғана болады, себебі екі байқау үлгідегі орташа мәннен бірдей қашықтықта орналасқан. Статистикалық модельдерді деректерге бейімдеу кезінде, қалдық векторлары вектордағы компоненттер санынан кіші өлшемді кеңістікте болуға міндетті. Осы кіші өлшем – қателік үшін еркіндік дәрежесінің саны, сондай-ақ қалдық еркіндік дәрежесі деп те аталады.
Диапазонды талдау (ANOVA)
Статистикалық тестілеу мәселелерінде, әдетте компоненттік векторлардың өзіне емес, олардың ұзындығының квадратына немесе Квадраттардың қосындысына қызығушылық танытылады. Квадраттар қосындысының еркіндік дәрежесі – сәйкес компоненттік векторлардың еркіндік дәрежесі. Жоғарыдағы үш популяциялық мысал – бір жолды дисперсиялық талдаудың (ANOVA) мысалы. Модель немесе емдеуге қатысты квадраттар қосындысы – бұл 2 еркіндік дәрежесі бар екінші вектордың квадрат ұзындығы. Қалдық немесе қателік квадраттар қосындысы – 3(n–1) еркіндік дәрежесімен. Әрине, ANOVA бойынша кіріспе оқулықтарында векторларды көрсетпей формулалар келтіріледі, бірақ осы SS формулаларын тудыратын негізгі геометрия осы және кез келген жағдайда еркіндік дәрежесін анық анықтауға мүмкіндік береді. Халықтың орташа мәндері арасында айырмашылық жоқ деген нөлдік гипотеза бойынша (және стандартты ANOVA-ның тұрақтылық шарттары орындалса) квадраттар қосындысы тиісті еркіндік дәрежесімен масштабталған хи-квадраттық үлестірімге ие болады. F-тест статистикасы – еркіндік дәрежесімен масштабталғаннан кейін алынған қатынас. Егер популяциялық орташа мәндер арасында айырмашылық болмаса, бұл қатынас 2 және 3n–3 еркіндік дәрежесімен хи-квадраттық үлестірілімге сәйкес келеді. Кейбір күрделі жағдайларда, мысалы, теңгерімсіз бөлінген сюжеттік жоспарларда, квадраттар қосындысы енді масштабталған хи-квадраттық үлестірімге ие болмайды. Квадраттар қосындысын еркіндік дәрежесімен салыстыру мағынасыз болады, және бұл жағдайларда бағдарламалық құралдар белгілі бір бөлшек "еркіндік дәрежесін" көрсете алады. Мұндай сандар нақты еркіндік дәрежесін білдірмейді, бірақ сәйкес квадраттар қосындысы үшін хи-квадраттық үлестірімнің жуық шамасын ғана ұсынады. Мұндай жуықтаулардың егжей-тегжейлі сипаттамасы осы беттің аясынан тыс.
with 2 degrees of freedom. The residual, or error, sum of squares is
with 3(n−1) degrees of freedom. Of course, introductory books on ANOVA usually state formulae without showing the vectors, but it is this underlying geometry that gives rise to SS formulae, and shows how to unambiguously determine the degrees of freedom in any given situation. Under the null hypothesis of no difference between population means (and assuming that standard ANOVA regularity assumptions are satisfied) the sums of squares have scaled chi squared distributions, with the corresponding degrees of freedom. The F test statistic is the ratio, after scaling by the degrees of freedom. If there is no difference between population means this ratio follows an F distribution with 2 and 3n − 3 degrees of freedom. In some complicated settings, such as unbalanced split plot designs, the sums of squares no longer have scaled chi squared distributions. Comparison of sum of squares with degrees of freedom is no longer meaningful, and software may report certain fractional 'degrees of freedom' in these cases. Such numbers have no genuine degrees of freedom interpretation, but are simply providing an approximate chi squared distribution for the corresponding sum of squares. The details of such approximations are beyond the scope of this page.
Ықтималдық үлестірілімдерінде
Бірнеше жиі кездесетін статистикалық үлестірулер (Студенттің t, хи-квадрат, F) параметрлері бар, олар көбінесе еркіндік дәрежесі деп аталады. Бұл терминология, осы үлестірулер көптеген қолданыстарда пайда болғанда, параметрдің алдыңғы ANOVA мысалындағыдай, жатқызушы кездейсоқ вектордың еркіндік дәрежесіне сәйкес келетінін көрсетеді. Тағы бір қарапайым мысал: егер тәуелсіз қалыпты кездейсоқ айнымалылар болса, статистика n-1 еркіндік дәрежесімен хи-квадраттық үлестірілімді ұстанады. Мұнда еркіндік дәрежесі сандардың қалдықтарының қосындысынан туындайды, ал өз кезегінде n-1 негізгі қалдық вектордың еркіндік дәрежесі болып табылады. Бұл үлестірулерді сызықтық модельдерге қолданғанда, еркіндік дәрежесі параметрлері тек бүтін сандық мәндерді ғана қабылдайды. Үлестірулердің негізгі отбасылары еркіндік дәрежесі параметрлерінің бөлшек мәндеріне мүмкіндік береді, олар күрделірек қолданыстарда пайда болуы мүмкін. Мысалдардың бірі – тиімді еркіндік дәрежесіне негізделген хи-квадраттық жуықтаулар қолданылатын мәселелер. Басқа қолданыстарда, мысалы, ауыр құйрықты деректерді модельдеуде, t немесе F үлестірілімі эмпирикалық модель ретінде қолданылуы мүмкін. Бұл жағдайларда, терминология қолданыла берсе де, үлестіру параметрлеріне ерекше еркіндік дәрежесінің интерпретациясы жоқ.
follows a chi squared distribution with n − 1 degrees of freedom. Here, the degrees of freedom arises from the residual sum of squares in the numerator, and in turn the n − 1 degrees of freedom of the underlying residual vector
In the application of these distributions to linear models, the degrees of freedom parameters can take only integer values. The underlying families of distributions allow fractional values for the degrees of freedom parameters, which can arise in more sophisticated uses. One set of examples is problems where chi squared approximations based on effective degrees of freedom are used. In other applications, such as modelling heavy tailed data, a t or F distribution may be used as an empirical model. In these cases, there is no particular degrees of freedom interpretation to the distribution parameters, even though the terminology may continue to be used.
Стандартты емес регрессияда
Көптеген стандартты емес регрессия әдістері, соның ішінде реттелген ең кіші квадраттар (мысалы, қырқа регрессиясы), сызықтық тегістегіштер, тегістеу шплиндары және жартылай параметрлік регрессия, қарапайым ең кіші квадраттар проекцияларына негізделмейді, керісінше, реттелген (жалпыланған және/немесе жазаланған) ең кіші квадраттарға негізделген. Сондықтан, өлшемділік тұрғысынан анықталған еркіндік дәрежесі мұндай процедуралар үшін көбінесе пайдалы емес. Дегенмен, бұл процедуралар әлі де бақылаулар бойынша сызықтық болып табылады, ал регрессияның сәйкес келетін мәндерін модельдегі бастапқы ковариаттардың әр мәні үшін сәйкес келетін мәндердің векторы арқылы көрсетуге болады, мұнда y – бастапқы жауаптар векторы, ал H – шапқыштар матрицасы немесе, жалпы алғанда, тегістеу матрицасы. Статистикалық қорытынды жасау үшін квадраттардың қосындысын есептеуге болады: модельдің квадраттар қосындысы ; қалдықтардың квадраттар қосындысы . Алайда, H қарапайым ең кіші квадраттарға сәйкес келмейтіндіктен (яғни, ортогональды проекция емес), бұл квадраттардың қосындылары енді (масштабталған, орталық емес) хи-квадраттық үлестірілімге ие емес, және өлшемдік түрде анықталған еркіндік дәрежесінің маңызы жоқ. Модельдің сәйкестігін бағау, кросс-валидация және басқа да статистикалық қорытынды жасау процедураларын жүзеге асыру үшін тиімді еркіндік дәрежесін әр түрлі жолдармен анықтауға болады. Мұнда регрессияның тиімді еркіндік дәрежесі мен қалдықтардың тиімді еркіндік дәрежесін ажырату қажет.
where is the vector of fitted values at each of the original covariate values from the fitted model, y is the original vector of responses, and H is the hat matrix or, more generally, smoother matrix. For statistical inference, sums of squares can still be formed: the model sum of squares is ; the residual sum of squares is However, because H does not correspond to an ordinary least squares fit (i. e. is not an orthogonal projection), these sums of squares no longer have (scaled, non central) chi squared distributions, and dimensionally defined degrees of freedom are not useful. The effective degrees of freedom of the fit can be defined in various ways to implement goodness of fit tests, cross validation, and other statistical inference procedures. Here one can distinguish between regression effective degrees of freedom and residual effective degrees of freedom.