Кіріспе

Деректер нүктелерінің түзу немесе қисық сызыққа қаншалықты жақын екенін көрсететін көрсеткіш. Статистикада R² немесе r² деп белгіленетін және "R шаршы" деп аталатын анықтау коэффициенті – тәуелсіз айнымалы(лар) арқылы болжауға болатын тәуелді айнымалының өзгеруінің үлесін көрсетеді. Бұл статистикалық модельдер контекстінде қолданылатын статистикалық өлшем, оның басты мақсаты – басқа да байланысты ақпарат негізінде болашақ нәтижелерді болжау немесе гипотезаларды тексеру болып табылады. Ол модель арқылы түсіндірілген нәтижелердің жалпы өзгеруінің үлесіне сүйене отырып, модельдің байқалған нәтижелерді қаншалықты жақсы қайталайтынын өлшейді. R²-нің бірнеше анықтамасы бар, олар кейде ғана сәйкес келеді. Мұндай жағдайлардың біріне – R² орнына r² қолданылатын қарапайым сызықтық регрессия жатады. Тек қиылыс нүктесі ғана ескерілгенде, r² – байқалған нәтижелер мен байқалған болжамдық мәндер арасындағы корреляция коэффициентінің (яғни r) квадраты болып табылады. Егер қосымша регрессорлар енгізілсе, R² – көптік корреляция коэффициентінің квадраты. Мұндай екі жағдайда да анықтау коэффициенті әдетте 0-ден 1-ге дейін өзгереді. R² теріс мән беруі мүмкін жағдайлар да бар. Бұл, егер осы деректерді пайдалана отырып, тиісті нәтижелермен салыстырылатын болжамдар модельге сәйкес келтіру процедурасы арқылы алынбаған жағдайда болуы мүмкін. Модельге сәйкес келтіру процедурасы қолданылған жағдайда да R² теріс болуы мүмкін, мысалы, сызықтық регрессия қиылыс нүктесінсіз жүргізілгенде немесе деректерге сәйкес келтіру үшін сызықтық емес функция қолданылғанда. Теріс мәндер пайда болған жағдайда, осы критерий бойынша, деректердің орташа мәні нәтижелерге модельдің сәйкес келетін функциялық мәндерінен гөрі жақсырақ сәйкес келеді. Регрессиялық талдауды бағалауда анықтау коэффициенті MAE, MAPE, MSE және RMSE-ден (түсініктірек) көбірек ақпарат бере алады, себебі біріншісін пайыздық көрсеткіш ретінде беруге болады, ал соңғы өлшемдердің диапазоны шектеулі емес. Сондай-ақ, мақаладағы тест деректерінде нашар сәйкестік болған жағдайда SMAPE-ге қарағанда тиімдірек болып шықты. Симуляцияланған (Ypred) және өлшенген (Yobs) мәндердің сәйкестігін бағалау кезінде оны сызықтық регрессияның R² негізінде (яғни, Yobs = m·Ypred + b) негізге алу дұрыс емес. R² – Yobs пен Ypred арасындағы кез келген сызықтық байланыстың дәрежесін көрсетеді, ал сәйкестікті бағалау үшін тек бір нақты сызықтық байланысты ескеру керек: Yobs = 1·Ypred + 0 (яғни 1:1 сызық).

Аңталған ауытқу

R2-нің жоғары мәні табысты регрессия моделін көрсетеді. Бұл қолданыс "анықтама коэффициенті" терминінің нақты анықтамасы болып табылады: екі (көп мағыналы) айнымалы арасындағы корреляцияның квадраты.

Интерпретация

R2 – модельдің сәйкестік деңгейін өлшеу шамасы. Регрессияда R2 анықтау коэффициенті – регрессиялық болжамдардың нақты деректер нүктелеріне қаншалықты жақын екенін көрсететін статистикалық өлшем. R2 1-ге тең болса, регрессиялық болжамдар деректерге толық сәйкес келеді дегенді білдіреді. R2 мәндері 0-ден 1-ге дейінгі аралықтан тыс жағдайларда модель деректерге ең нашар жайлысымдылықты қамтамасыз ететін ең кіші квадраттардың болжаушысынан нашар сәйкес келсе (байқалған деректердің орташа мәніне тең биіктіктегі көлденең гипержазыққа тең). Мұндай жағдай қате модель таңдалғанда немесе қателікпен мағынасыз шектеулер қойылғанда туындауы мүмкін. Kvålseth-тің 1-теңдеуі қолданылса (бұл ең көп қолданылатын теңдеу), R2 нөлден кем болуы мүмкін. Kvålseth-тің 2-теңдеуі қолданылса, R2 бірден артық болуы мүмкін. R2 қолданылатын барлық жағдайларда болжаушылар қалыпты ең кіші квадраттар регрессиясы арқылы есептеледі, яғни SSres-ті азайту арқылы. Бұл жағдайда R2 модельдегі айнымалылар санының артуымен өседі (R2 айнымалылар санының өсуімен монотонды түрде өседі – ол ешқашан кемімейді). Бұл R2 мәнін арттыру үшін айнымалыларды (барлық мүмкін айнымалыларды қосу) үнемі қосып отырудың бір кемшілігін көрсетеді. Мысалы, егер автомобильдің жанармай шығыны, бағасы және қозғалтқыш қуаты бойынша автомобиль моделінің сатылымын болжауға тырысса, модель атауының бірінші әрпі немесе автомобильді жобалаған бас инженердің бойы сияқты маңызсыз факторларды қосуға болады, себебі R2 өзгермелілер қосылғанда ешқашан кемімейді және тек қана кездейсоқтықтан туындаған өсімді сезінуі мүмкін. Бұл түзетілген R2-ге қараудың баламалы тәсіліне әкеледі. Бұл статистиканың түсіндірмесі R2 сияқты, бірақ модельге қосымша айнымалылар енгізілгендіктен, статистиканы төмендетеді. Кәдімгі ең кіші квадраттар арқылы сәйкестендіруден басқа жағдайларда R2 статистикасы жоғарыда көрсетілгендей есептелуі мүмкін және ол әлі де пайдалы өлшем болуы мүмкін. Егер сәйкестендіру салмақталған ең кіші квадраттар немесе жалпыланған ең кіші квадраттар арқылы жүргізілсе, осы статистикалық жүйелерге сәйкес R2-нің баламалы нұсқаларын есептеуге болады, ал "нақты" R2 оны оңай түсіндіру үшін пайдалы болуы мүмкін. R2 мәндерін кез келген типтегі болжамдық модель үшін есептеуге болады, олар міндетті түрде статистикалық негізге ие болуы қажет емес.

Тарих

Анықтама коэффициентінің жасалуы генетик Сеуолл Райтқа байланысты және алғаш рет 1921 жылы жарияланды.