Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Показатель того, насколько хорошо точки данных соответствуют линии или кривой.
Indicator for how well data points fit a line or curve
В статистике коэффициент детерминации, обозначаемый R2 или r2 и произносимый "R в квадрате", представляет собой долю дисперсии зависимой переменной, которая может быть предсказана на основе независимой (ых) переменной (ых). Это статистическая мера, используемая в контексте статистических моделей, основной целью которых является либо прогнозирование будущих результатов, либо проверка гипотез на основе сопутствующей информации. Она показывает, насколько хорошо наблюдаемые результаты воспроизводятся моделью, исходя из доли общей дисперсии результатов, объясняемой моделью. Существует несколько определений R2, которые не всегда эквивалентны. Один из таких случаев – простая линейная регрессия, где вместо R2 используется r2. Если в модели присутствует только пересечение с осью Y, то r2 является просто квадратом коэффициента корреляции выборки (т.е. r) между наблюдаемыми результатами и наблюдаемыми значениями предиктора. При включении дополнительных регрессоров R2 представляет собой квадрат коэффициента множественной корреляции. В обоих случаях коэффициент детерминации обычно изменяется в пределах от 0 до 1. Однако существуют ситуации, когда R2 может принимать отрицательные значения. Это может произойти, если прогнозы, сравниваемые с соответствующими результатами, не были получены с использованием процедуры подгонки модели к этим данным. Даже если процедура подгонки модели была использована, R2 все равно может быть отрицательным, например, при проведении линейной регрессии без учета пересечения с осью Y или при использовании нелинейной функции для подгонки данных. В случаях, когда возникают отрицательные значения, среднее значение данных обеспечивает лучшее соответствие результатам, чем значения, полученные с помощью подобранной функции, согласно данному критерию. Коэффициент детерминации может быть более (интуитивно) информативным, чем MAE, MAPE, MSE и RMSE при оценке регрессионного анализа, поскольку его можно выразить в процентах, в то время как у последних мер произвольные диапазоны. Он также оказался более устойчивым к плохой подгонке по сравнению с SMAPE на тестовых наборах данных в статье. При оценке соответствия смоделированных (Ypred) и измеренных (Yobs) значений не следует основываться на R2 линейной регрессии (т.е. Yobs = m·Ypred + b). R2 количественно определяет степень любой линейной корреляции между Yobs и Ypred, в то время как для оценки соответствия следует учитывать только одну конкретную линейную корреляцию: Yobs = 1·Ypred + 0 (т.е. прямая 1:1).
In statistics, the coefficient of determination, denoted R2 or r2 and pronounced "R squared", is the proportion of the variation in the dependent variable that is predictable from the independent variable(s). It is a statistic used in the context of statistical models whose main purpose is either the prediction of future outcomes or the testing of hypotheses, on the basis of other related information. It provides a measure of how well observed outcomes are replicated by the model, based on the proportion of total variation of outcomes explained by the model. There are several definitions of R2 that are only sometimes equivalent. One class of such cases includes that of simple linear regression where r2 is used instead of R2. When only an intercept is included, then r2 is simply the square of the sample correlation coefficient (i. e., r) between the observed outcomes and the observed predictor values. If additional regressors are included, R2 is the square of the coefficient of multiple correlation. In both such cases, the coefficient of determination normally ranges from 0 to 1. There are cases where R2 can yield negative values. This can arise when the predictions that are being compared to the corresponding outcomes have not been derived from a model fitting procedure using those data. Even if a model fitting procedure has been used, R2 may still be negative, for example when linear regression is conducted without including an intercept, or when a non linear function is used to fit the data. In cases where negative values arise, the mean of the data provides a better fit to the outcomes than do the fitted function values, according to this particular criterion. The coefficient of determination can be more (intuitively) informative than MAE, MAPE, MSE, and RMSE in regression analysis evaluation, as the former can be expressed as a percentage, whereas the latter measures have arbitrary ranges. It also proved more robust for poor fits compared to SMAPE on the test datasets in the article. When evaluating the goodness of fit of simulated (Ypred) vs. measured (Yobs) values, it is not appropriate to base this on the R2 of the linear regression (i. e., Yobs= m·Ypred + b). The R2 quantifies the degree of any linear correlation between Yobs and Ypred, while for the goodness of fit evaluation only one specific linear correlation should be taken into consideration: Yobs = 1·Ypred + 0 (i. e., the 1:1 line).
Как объясняется дисперсия
Большее значение R² указывает на более успешную модель регрессии. Это употребление является конкретным определением термина "коэффициент детерминации": квадрат корреляции между двумя (общими) переменными.
A larger value of R2 implies a more successful regression model. this usage is specifically the definition of the term "coefficient of determination": the square of the correlation between two (general) variables.
Интерпретация
R2 — это мера качества подгонки модели. В регрессии коэффициент детерминации R2 является статистической мерой того, насколько хорошо прогнозы регрессии приближают реальные точки данных. Значение R2, равное 1, указывает на то, что прогнозы регрессии идеально соответствуют данным. Значения R2, выходящие за пределы диапазона от 0 до 1, возникают, когда модель подгоняется к данным хуже, чем наихудший возможный предиктор методом наименьших квадратов (что эквивалентно горизонтальной гиперплоскости на высоте, равной среднему значению наблюдаемых данных). Это происходит, когда выбрана неверная модель или по ошибке применены бессмысленные ограничения. Если используется уравнение 1 Квелсета (это наиболее часто используемое уравнение), R2 может быть меньше нуля. Если используется уравнение 2 Квелсета, R2 может быть больше единицы. Во всех случаях использования R2 предикторы рассчитываются с помощью обычной регрессии методом наименьших квадратов, то есть путем минимизации SSres. В этом случае R2 увеличивается с увеличением числа переменных в модели (R2 монотонно возрастает с количеством включенных переменных — он никогда не уменьшается). Это иллюстрирует недостаток одного из возможных применений R2, когда можно продолжать добавлять переменные (регрессия «всего и вся»), чтобы увеличить значение R2. Например, если кто-то пытается предсказать продажи модели автомобиля на основе расхода топлива, цены и мощности двигателя, можно включить такие нерелевантные факторы, как первая буква названия модели или рост ведущего инженера, проектирующего автомобиль, поскольку R2 никогда не уменьшится при добавлении переменных и, вероятно, увеличится только за счет случайности. Это приводит к альтернативному подходу — рассмотрению скорректированного R2. Объяснение этой статистики почти такое же, как и для R2, но она снижает значение статистики при включении дополнительных переменных в модель. В случаях, отличных от подгонки методом наименьших квадратов, статистический показатель R2 может быть рассчитан, как описано выше, и все еще может быть полезной мерой. Если подгонка выполняется с использованием взвешенных наименьших квадратов или обобщенных наименьших квадратов, можно рассчитать альтернативные версии R2, соответствующие этим статистическим фреймворкам, в то время как «сырой» R2 может быть полезен, если его легче интерпретировать. Значения R2 могут быть рассчитаны для любого типа прогностической модели, которая не обязательно должна иметь статистическую основу.
R2 is a measure of the goodness of fit of a model. In regression, the R2 coefficient of determination is a statistical measure of how well the regression predictions approximate the real data points. An R2 of 1 indicates that the regression predictions perfectly fit the data. Values of R2 outside the range 0 to 1 occur when the model fits the data worse than the worst possible least squares predictor (equivalent to a horizontal hyperplane at a height equal to the mean of the observed data). This occurs when a wrong model was chosen, or nonsensical constraints were applied by mistake. If equation 1 of Kvålseth is used (this is the equation used most often), R2 can be less than zero. If equation 2 of Kvålseth is used, R2 can be greater than one. In all instances where R2 is used, the predictors are calculated by ordinary least squares regression: that is, by minimizing SSres. In this case, R2 increases as the number of variables in the model is increased (R2 is monotone increasing with the number of variables included—it will never decrease). This illustrates a drawback to one possible use of R2, where one might keep adding variables (kitchen sink regression) to increase the R2 value. For example, if one is trying to predict the sales of a model of car from the car's gas mileage, price, and engine power, one can include such irrelevant factors as the first letter of the model's name or the height of the lead engineer designing the car because the R2 will never decrease as variables are added and will likely experience an increase due to chance alone. This leads to the alternative approach of looking at the adjusted R2. The explanation of this statistic is almost the same as R2 but it penalizes the statistic as extra variables are included in the model. For cases other than fitting by ordinary least squares, the R2 statistic can be calculated as above and may still be a useful measure. If fitting is by weighted least squares or generalized least squares, alternative versions of R2 can be calculated appropriate to those statistical frameworks, while the "raw" R2 may still be useful if it is more easily interpreted. Values for R2 can be calculated for any type of predictive model, which need not have a statistical basis.
История
Создание коэффициента детерминации приписывают генетику Сеуоллу Райту, а впервые оно было опубликовано в 1921 году.
The creation of the coefficient of determination has been attributed to the geneticist Sewall Wright and was first published in 1921.