Введение

Модель линейной регрессии с одной объясняющей переменной

В статистике простая линейная регрессия (SLR) – это модель линейной регрессии с одной объясняющей переменной. То есть, она рассматривает двухмерные точки выборки с одной независимой переменной и одной зависимой переменной (обычно, координаты x и y в декартовой системе координат) и находит линейную функцию (невертикальную прямую), которая как можно точнее предсказывает значения зависимой переменной как функцию независимой переменной. Прилагательное "простая" указывает на то, что выходная переменная связана с одним предиктором. Обычно дополнительно оговаривается, что следует использовать метод наименьших квадратов (OLS): точность каждого прогнозируемого значения измеряется квадратом его остатка (вертикальное расстояние между точкой данных и построенной линией), и цель состоит в том, чтобы минимизировать сумму этих квадратичных отклонений. В этом случае наклон построенной прямой равен корреляции между y и x, скорректированной отношением стандартных отклонений этих переменных. Пересечение построенной прямой определяется таким образом, чтобы она проходила через центр масс точек данных.

Расширенные формулы

Вышеуказанные уравнения удобны в использовании, если известны средние значения переменных x и y. Если средние значения неизвестны на момент вычисления, то может оказаться более эффективным использовать развернутый вариант уравнений. Эти развернутые уравнения можно получить из более общих уравнений полиномиальной регрессии, задав порядок регрессионного полинома равным 1, следующим образом. Вышеуказанную систему линейных уравнений можно решить напрямую, либо можно вывести отдельные уравнения для , раскрыв матричные уравнения, представленные выше. Полученные уравнения алгебраически эквивалентны уравнениям, приведенным в предыдущем абзаце, и представлены ниже без доказательства.

Интерпретация корреляции

В приведенной выше формулировке обратите внимание, что каждое является постоянной ("известной заранее") величиной, в то время как – случайные переменные, зависящие от линейной функции и случайного члена. Это предположение используется при выводе стандартной ошибки наклона и доказательстве её несмещённости. В таком подходе, если на самом деле не является случайной переменной, какой тип параметра оценивает эмпирическая корреляция? Проблема заключается в том, что для каждого значения i мы получим: и возможная интерпретация состоит в том, чтобы представить, что определяет случайную переменную, взятую из эмпирического распределения значений x в нашей выборке. Например, если x имеет 10 значений из натуральных чисел: [1, 2, 3, 10], то можно представить x как дискретное равномерное распределение. При такой интерпретации все имеют одинаковое математическое ожидание и некоторую положительную дисперсию. С этой интерпретацией мы можем рассматривать как оценку корреляции Пирсона между случайной переменной y и случайной переменной x (в том виде, как мы её только что определили).

Статистические свойства

Описание статистических свойств оценок, полученных в результате простой линейной регрессии, требует использования статистической модели. Дальнейшее изложение основано на предположении о справедливости модели, при которой оценки являются наилучшими. Оценка свойств при других допущениях, например, неоднородности, также возможна, но рассматривается в другом месте.

Непредвзятость

Оценки и являются несмещенными. Чтобы формализовать это утверждение, необходимо определить структуру, в которой эти оценки рассматриваются как случайные величины. Мы рассматриваем остатки εi как случайные величины, независимо выбранные из некоторого распределения со средним значением, равным нулю. Иными словами, для каждого значения x соответствующее значение y генерируется как средний отклик α + βx плюс дополнительная случайная величина ε, называемая ошибкой, имеющая среднее значение, равное нулю. При такой интерпретации оценки методом наименьших квадратов и сами будут случайными величинами, математическое ожидание которых равно "истинным значениям" α и β. Это и есть определение несмещенной оценки.

Асимптотическое предположение

Второе предположение утверждает, что когда число точек в наборе данных "достаточно велико", начинают действовать закон больших чисел и центральная предельная теорема, и тогда распределение оценок приближается к нормальному. При этом предположении все формулы, выведенные в предыдущем разделе, остаются в силе, за исключением того, что квантиль t*n−2 распределения Стьюдента заменяется квантилем q* стандартного нормального распределения. Иногда дробь заменяется на . При больших n такое изменение несущественно влияет на результаты.

Альтернативы

В модели ОЛС существует базовое предположение, что ошибка измерения содержится только в зависимой переменной; если объясняющая переменная также измерена с ошибкой, то простая регрессия не подходит для оценки истинной взаимосвязи, поскольку она будет смещена из-за регрессионного затухания. Альтернативные методы оценки вместо метода наименьших квадратов включают метод наименьших абсолютных отклонений (минимизирующий сумму абсолютных значений остатков) и оценку Тейла-Сена (выбирающую линию, наклон которой является медианой наклонов, рассчитанных по парам точек выборки). Регрессия Деминга (метод наименьших квадратов в обеих переменных) также находит линию, наилучшим образом аппроксимирующую набор двухмерных точек выборки, но (в отличие от метода наименьших квадратов, метода наименьших абсолютных отклонений и регрессии медианного наклона) фактически не является примером простой линейной регрессии, поскольку не разделяет координаты на зависимую и независимую переменные и потенциально может возвращать вертикальную линию в качестве результата. Это может привести к модели, которая больше ориентирована на подгонку выбросов, чем на данные в целом.