Кіріспе
Деректер нүктелерінің түзу немесе қисық сызыққа қаншалықты жақын екенін көрсететін көрсеткіш. Статистикада R² немесе r² деп белгіленетін және "R шаршы" деп аталатын анықтау коэффициенті – тәуелсіз айнымалы(лар) арқылы болжауға болатын тәуелді айнымалының өзгеруінің үлесін көрсетеді. Бұл статистикалық модельдер контекстінде қолданылатын статистикалық өлшем, оның басты мақсаты – басқа да байланысты ақпарат негізінде болашақ нәтижелерді болжау немесе гипотезаларды тексеру болып табылады. Ол модель арқылы түсіндірілген нәтижелердің жалпы өзгеруінің үлесіне сүйене отырып, модельдің байқалған нәтижелерді қаншалықты жақсы қайталайтынын өлшейді. R²-нің бірнеше анықтамасы бар, олар кейде ғана сәйкес келеді. Мұндай жағдайлардың біріне – R² орнына r² қолданылатын қарапайым сызықтық регрессия жатады. Тек қиылыс нүктесі ғана ескерілгенде, r² – байқалған нәтижелер мен байқалған болжамдық мәндер арасындағы корреляция коэффициентінің (яғни r) квадраты болып табылады. Егер қосымша регрессорлар енгізілсе, R² – көптік корреляция коэффициентінің квадраты. Мұндай екі жағдайда да анықтау коэффициенті әдетте 0-ден 1-ге дейін өзгереді. R² теріс мән беруі мүмкін жағдайлар да бар. Бұл, егер осы деректерді пайдалана отырып, тиісті нәтижелермен салыстырылатын болжамдар модельге сәйкес келтіру процедурасы арқылы алынбаған жағдайда болуы мүмкін. Модельге сәйкес келтіру процедурасы қолданылған жағдайда да R² теріс болуы мүмкін, мысалы, сызықтық регрессия қиылыс нүктесінсіз жүргізілгенде немесе деректерге сәйкес келтіру үшін сызықтық емес функция қолданылғанда. Теріс мәндер пайда болған жағдайда, осы критерий бойынша, деректердің орташа мәні нәтижелерге модельдің сәйкес келетін функциялық мәндерінен гөрі жақсырақ сәйкес келеді. Регрессиялық талдауды бағалауда анықтау коэффициенті MAE, MAPE, MSE және RMSE-ден (түсініктірек) көбірек ақпарат бере алады, себебі біріншісін пайыздық көрсеткіш ретінде беруге болады, ал соңғы өлшемдердің диапазоны шектеулі емес. Сондай-ақ, мақаладағы тест деректерінде нашар сәйкестік болған жағдайда SMAPE-ге қарағанда тиімдірек болып шықты. Симуляцияланған (Ypred) және өлшенген (Yobs) мәндердің сәйкестігін бағалау кезінде оны сызықтық регрессияның R² негізінде (яғни, Yobs = m·Ypred + b) негізге алу дұрыс емес. R² – Yobs пен Ypred арасындағы кез келген сызықтық байланыстың дәрежесін көрсетеді, ал сәйкестікті бағалау үшін тек бір нақты сызықтық байланысты ескеру керек: Yobs = 1·Ypred + 0 (яғни 1:1 сызық).
In statistics, the coefficient of determination, denoted R2 or r2 and pronounced "R squared", is the proportion of the variation in the dependent variable that is predictable from the independent variable(s). It is a statistic used in the context of statistical models whose main purpose is either the prediction of future outcomes or the testing of hypotheses, on the basis of other related information. It provides a measure of how well observed outcomes are replicated by the model, based on the proportion of total variation of outcomes explained by the model. There are several definitions of R2 that are only sometimes equivalent. One class of such cases includes that of simple linear regression where r2 is used instead of R2. When only an intercept is included, then r2 is simply the square of the sample correlation coefficient (i. e., r) between the observed outcomes and the observed predictor values. If additional regressors are included, R2 is the square of the coefficient of multiple correlation. In both such cases, the coefficient of determination normally ranges from 0 to 1. There are cases where R2 can yield negative values. This can arise when the predictions that are being compared to the corresponding outcomes have not been derived from a model fitting procedure using those data. Even if a model fitting procedure has been used, R2 may still be negative, for example when linear regression is conducted without including an intercept, or when a non linear function is used to fit the data. In cases where negative values arise, the mean of the data provides a better fit to the outcomes than do the fitted function values, according to this particular criterion. The coefficient of determination can be more (intuitively) informative than MAE, MAPE, MSE, and RMSE in regression analysis evaluation, as the former can be expressed as a percentage, whereas the latter measures have arbitrary ranges. It also proved more robust for poor fits compared to SMAPE on the test datasets in the article. When evaluating the goodness of fit of simulated (Ypred) vs. measured (Yobs) values, it is not appropriate to base this on the R2 of the linear regression (i. e., Yobs= m·Ypred + b). The R2 quantifies the degree of any linear correlation between Yobs and Ypred, while for the goodness of fit evaluation only one specific linear correlation should be taken into consideration: Yobs = 1·Ypred + 0 (i. e., the 1:1 line).
Аңталған ауытқу
R2-нің жоғары мәні табысты регрессия моделін көрсетеді. Бұл қолданыс "анықтама коэффициенті" терминінің нақты анықтамасы болып табылады: екі (көп мағыналы) айнымалы арасындағы корреляцияның квадраты.
Интерпретация
R2 – модельдің сәйкестік деңгейін өлшеу шамасы. Регрессияда R2 анықтау коэффициенті – регрессиялық болжамдардың нақты деректер нүктелеріне қаншалықты жақын екенін көрсететін статистикалық өлшем. R2 1-ге тең болса, регрессиялық болжамдар деректерге толық сәйкес келеді дегенді білдіреді. R2 мәндері 0-ден 1-ге дейінгі аралықтан тыс жағдайларда модель деректерге ең нашар жайлысымдылықты қамтамасыз ететін ең кіші квадраттардың болжаушысынан нашар сәйкес келсе (байқалған деректердің орташа мәніне тең биіктіктегі көлденең гипержазыққа тең). Мұндай жағдай қате модель таңдалғанда немесе қателікпен мағынасыз шектеулер қойылғанда туындауы мүмкін. Kvålseth-тің 1-теңдеуі қолданылса (бұл ең көп қолданылатын теңдеу), R2 нөлден кем болуы мүмкін. Kvålseth-тің 2-теңдеуі қолданылса, R2 бірден артық болуы мүмкін. R2 қолданылатын барлық жағдайларда болжаушылар қалыпты ең кіші квадраттар регрессиясы арқылы есептеледі, яғни SSres-ті азайту арқылы. Бұл жағдайда R2 модельдегі айнымалылар санының артуымен өседі (R2 айнымалылар санының өсуімен монотонды түрде өседі – ол ешқашан кемімейді). Бұл R2 мәнін арттыру үшін айнымалыларды (барлық мүмкін айнымалыларды қосу) үнемі қосып отырудың бір кемшілігін көрсетеді. Мысалы, егер автомобильдің жанармай шығыны, бағасы және қозғалтқыш қуаты бойынша автомобиль моделінің сатылымын болжауға тырысса, модель атауының бірінші әрпі немесе автомобильді жобалаған бас инженердің бойы сияқты маңызсыз факторларды қосуға болады, себебі R2 өзгермелілер қосылғанда ешқашан кемімейді және тек қана кездейсоқтықтан туындаған өсімді сезінуі мүмкін. Бұл түзетілген R2-ге қараудың баламалы тәсіліне әкеледі. Бұл статистиканың түсіндірмесі R2 сияқты, бірақ модельге қосымша айнымалылар енгізілгендіктен, статистиканы төмендетеді. Кәдімгі ең кіші квадраттар арқылы сәйкестендіруден басқа жағдайларда R2 статистикасы жоғарыда көрсетілгендей есептелуі мүмкін және ол әлі де пайдалы өлшем болуы мүмкін. Егер сәйкестендіру салмақталған ең кіші квадраттар немесе жалпыланған ең кіші квадраттар арқылы жүргізілсе, осы статистикалық жүйелерге сәйкес R2-нің баламалы нұсқаларын есептеуге болады, ал "нақты" R2 оны оңай түсіндіру үшін пайдалы болуы мүмкін. R2 мәндерін кез келген типтегі болжамдық модель үшін есептеуге болады, олар міндетті түрде статистикалық негізге ие болуы қажет емес.
Тарих
Анықтама коэффициентінің жасалуы генетик Сеуолл Райтқа байланысты және алғаш рет 1921 жылы жарияланды.