Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Модель линейной регрессии с одной объясняющей переменной
Linear regression model with a single explanatory variable
В статистике простая линейная регрессия (SLR) – это модель линейной регрессии с одной объясняющей переменной. То есть, она рассматривает двухмерные точки выборки с одной независимой переменной и одной зависимой переменной (обычно, координаты x и y в декартовой системе координат) и находит линейную функцию (невертикальную прямую), которая как можно точнее предсказывает значения зависимой переменной как функцию независимой переменной. Прилагательное "простая" указывает на то, что выходная переменная связана с одним предиктором. Обычно дополнительно оговаривается, что следует использовать метод наименьших квадратов (OLS): точность каждого прогнозируемого значения измеряется квадратом его остатка (вертикальное расстояние между точкой данных и построенной линией), и цель состоит в том, чтобы минимизировать сумму этих квадратичных отклонений. В этом случае наклон построенной прямой равен корреляции между y и x, скорректированной отношением стандартных отклонений этих переменных. Пересечение построенной прямой определяется таким образом, чтобы она проходила через центр масс точек данных.
In statistics, simple linear regression (SLR) is a linear regression model with a single explanatory variable. That is, it concerns two dimensional sample points with one independent variable and one dependent variable (conventionally, the x and y coordinates in a Cartesian coordinate system) and finds a linear function (a non vertical straight line) that, as accurately as possible, predicts the dependent variable values as a function of the independent variable. The adjective simple refers to the fact that the outcome variable is related to a single predictor. It is common to make the additional stipulation that the ordinary least squares (OLS) method should be used: the accuracy of each predicted value is measured by its squared residual (vertical distance between the point of the data set and the fitted line), and the goal is to make the sum of these squared deviations as small as possible. In this case, the slope of the fitted line is equal to the correlation between y and x corrected by the ratio of standard deviations of these variables. The intercept of the fitted line is such that the line passes through the center of mass of the data points.
Расширенные формулы
Вышеуказанные уравнения удобны в использовании, если известны средние значения переменных x и y. Если средние значения неизвестны на момент вычисления, то может оказаться более эффективным использовать развернутый вариант уравнений. Эти развернутые уравнения можно получить из более общих уравнений полиномиальной регрессии, задав порядок регрессионного полинома равным 1, следующим образом. Вышеуказанную систему линейных уравнений можно решить напрямую, либо можно вывести отдельные уравнения для , раскрыв матричные уравнения, представленные выше. Полученные уравнения алгебраически эквивалентны уравнениям, приведенным в предыдущем абзаце, и представлены ниже без доказательства.
The above equations are efficient to use if the mean of the x and y variables are known. If the means are not known at the time of calculation, it may be more efficient to use the expanded version of the equations. These expanded equations may be derived from the more general polynomial regression equations by defining the regression polynomial to be of order 1, as follows. The above system of linear equations may be solved directly, or stand alone equations for may be derived by expanding the matrix equations above. The resultant equations are algebraically equivalent to the ones shown in the prior paragraph, and are shown below without proof.
Интерпретация корреляции
В приведенной выше формулировке обратите внимание, что каждое является постоянной ("известной заранее") величиной, в то время как – случайные переменные, зависящие от линейной функции и случайного члена. Это предположение используется при выводе стандартной ошибки наклона и доказательстве её несмещённости. В таком подходе, если на самом деле не является случайной переменной, какой тип параметра оценивает эмпирическая корреляция? Проблема заключается в том, что для каждого значения i мы получим: и возможная интерпретация состоит в том, чтобы представить, что определяет случайную переменную, взятую из эмпирического распределения значений x в нашей выборке. Например, если x имеет 10 значений из натуральных чисел: [1, 2, 3, 10], то можно представить x как дискретное равномерное распределение. При такой интерпретации все имеют одинаковое математическое ожидание и некоторую положительную дисперсию. С этой интерпретацией мы можем рассматривать как оценку корреляции Пирсона между случайной переменной y и случайной переменной x (в том виде, как мы её только что определили).
In the above formulation, notice that each is a constant ("known upfront") value, while the are random variables that depend on the linear function of and the random term This assumption is used when deriving the standard error of the slope and showing that it is unbiased. In this framing, when is not actually a random variable, what type of parameter does the empirical correlation estimate? The issue is that for each value i we'll have: and A possible interpretation of is to imagine that defines a random variable drawn from the empirical distribution of the x values in our sample. For example, if x had 10 values from the natural numbers: [1,2,3 ,10], then we can imagine x to be a Discrete uniform distribution. Under this interpretation all have the same expectation and some positive variance. With this interpretation we can think of as the estimator of the Pearson's correlation between the random variable y and the random variable x (as we just defined it).
Статистические свойства
Описание статистических свойств оценок, полученных в результате простой линейной регрессии, требует использования статистической модели. Дальнейшее изложение основано на предположении о справедливости модели, при которой оценки являются наилучшими. Оценка свойств при других допущениях, например, неоднородности, также возможна, но рассматривается в другом месте.
Description of the statistical properties of estimators from the simple linear regression estimates requires the use of a statistical model. The following is based on assuming the validity of a model under which the estimates are optimal. It is also possible to evaluate the properties under other assumptions, such as inhomogeneity, but this is discussed elsewhere.
Непредвзятость
Оценки и являются несмещенными. Чтобы формализовать это утверждение, необходимо определить структуру, в которой эти оценки рассматриваются как случайные величины. Мы рассматриваем остатки εi как случайные величины, независимо выбранные из некоторого распределения со средним значением, равным нулю. Иными словами, для каждого значения x соответствующее значение y генерируется как средний отклик α + βx плюс дополнительная случайная величина ε, называемая ошибкой, имеющая среднее значение, равное нулю. При такой интерпретации оценки методом наименьших квадратов и сами будут случайными величинами, математическое ожидание которых равно "истинным значениям" α и β. Это и есть определение несмещенной оценки.
The estimators and are unbiased. To formalize this assertion we must define a framework in which these estimators are random variables. We consider the residuals εi as random variables drawn independently from some distribution with mean zero. In other words, for each value of x, the corresponding value of y is generated as a mean response α + βx plus an additional random variable ε called the error term, equal to zero on average. Under such interpretation, the least squares estimators and will themselves be random variables whose means will equal the "true values" α and β. This is the definition of an unbiased estimator.
Асимптотическое предположение
Второе предположение утверждает, что когда число точек в наборе данных "достаточно велико", начинают действовать закон больших чисел и центральная предельная теорема, и тогда распределение оценок приближается к нормальному. При этом предположении все формулы, выведенные в предыдущем разделе, остаются в силе, за исключением того, что квантиль t*n−2 распределения Стьюдента заменяется квантилем q* стандартного нормального распределения. Иногда дробь заменяется на . При больших n такое изменение несущественно влияет на результаты.
The alternative second assumption states that when the number of points in the dataset is "large enough", the law of large numbers and the central limit theorem become applicable, and then the distribution of the estimators is approximately normal. Under this assumption all formulas derived in the previous section remain valid, with the only exception that the quantile t*n−2 of Student's t distribution is replaced with the quantile q* of the standard normal distribution. Occasionally the fraction is replaced with When n is large such a change does not alter the results appreciably.
Альтернативы
В модели ОЛС существует базовое предположение, что ошибка измерения содержится только в зависимой переменной; если объясняющая переменная также измерена с ошибкой, то простая регрессия не подходит для оценки истинной взаимосвязи, поскольку она будет смещена из-за регрессионного затухания. Альтернативные методы оценки вместо метода наименьших квадратов включают метод наименьших абсолютных отклонений (минимизирующий сумму абсолютных значений остатков) и оценку Тейла-Сена (выбирающую линию, наклон которой является медианой наклонов, рассчитанных по парам точек выборки). Регрессия Деминга (метод наименьших квадратов в обеих переменных) также находит линию, наилучшим образом аппроксимирующую набор двухмерных точек выборки, но (в отличие от метода наименьших квадратов, метода наименьших абсолютных отклонений и регрессии медианного наклона) фактически не является примером простой линейной регрессии, поскольку не разделяет координаты на зависимую и независимую переменные и потенциально может возвращать вертикальную линию в качестве результата. Это может привести к модели, которая больше ориентирована на подгонку выбросов, чем на данные в целом.
In SLR, there is an underlying assumption that only the dependent variable contains measurement error; if the explanatory variable is also measured with error, then simple regression is not appropriate for estimating the underlying relationship because it will be biased due to regression dilution. Other estimation methods that can be used in place of ordinary least squares include least absolute deviations (minimizing the sum of absolute values of residuals) and the Theil–Sen estimator (which chooses a line whose slope is the median of the slopes determined by pairs of sample points). Deming regression (total least squares) also finds a line that fits a set of two dimensional sample points, but (unlike ordinary least squares, least absolute deviations, and median slope regression) it is not really an instance of simple linear regression, because it does not separate the coordinates into one dependent and one independent variable and could potentially return a vertical line as its fit. can lead to a model that attempts to fit the outliers more than the data.