Введение

В статистике и оптимизации ошибки и остатки – это две тесно связанные и легко путаемые меры отклонения наблюдаемого значения элемента статистической выборки от его "истинного значения" (не обязательно наблюдаемого). Ошибка наблюдения – это отклонение наблюдаемого значения от истинного значения интересующей величины (например, генеральной средней). Остаток – это разница между наблюдаемым значением и оцененным значением интересующей величины (например, выборочной средней). Это различие особенно важно в регрессионном анализе, где эти понятия иногда называют регрессионными ошибками и регрессионными остатками, и где они приводят к понятию студентизированных остатков. В эконометрике "ошибки" также называют возмущениями.

Введение

Предположим, что существует ряд наблюдений из унивариантного распределения, и мы хотим оценить среднее значение этого распределения (так называемая модель местоположения). В этом случае ошибками являются отклонения наблюдений от генерального среднего, а остатками – отклонения наблюдений от выборочного среднего. Статистическая ошибка (или возмущение) – это величина, на которую наблюдение отличается от своего ожидаемого значения, которое, в свою очередь, основано на всей генеральной совокупности, из которой статистическая единица была выбрана случайным образом. Например, если средний рост мужчин в возрасте 21 года составляет 1,75 метра, а рост случайно выбранного мужчины равен 1,80 метра, то "ошибка" составляет 0,05 метра; если рост случайно выбранного мужчины равен 1,70 метра, то "ошибка" составляет -0,05 метра. Ожидаемое значение, будучи средним для всей генеральной совокупности, как правило, не наблюдается, и, следовательно, статистическую ошибку также нельзя наблюдать. Остаток (или отклонение от подгонки), с другой стороны, является наблюдаемой оценкой ненаблюдаемой статистической ошибки. Рассмотрим предыдущий пример с ростом мужчин и предположим, что у нас есть случайная выборка из n человек. Выборочное среднее может служить хорошей оценкой генерального среднего. Тогда: разница между ростом каждого мужчины в выборке и ненаблюдаемым генеральным средним является статистической ошибкой, в то время как разница между ростом каждого мужчины в выборке и наблюдаемым выборочным средним является остатком. Следует отметить, что в силу определения выборочного среднего сумма остатков в случайной выборке обязательно равна нулю, и, следовательно, остатки не являются независимыми. Статистические ошибки, напротив, независимы, и их сумма в случайной выборке почти наверняка не равна нулю. Статистические ошибки (особенно нормального распределения) можно стандартизировать в z-оценку (или "стандартную оценку"), а остатки – в t-статистику или, в более общем случае, в студентизированные остатки.

Регрессии

В регрессионном анализе различие между ошибками и остатками тонкое, но важное, и приводит к понятию студентизированных остатков. Если задана ненаблюдаемая функция, связывающая независимую переменную с зависимой – например, прямая – отклонения наблюдений зависимой переменной от этой функции являются ненаблюдаемыми ошибками. Если выполняется регрессия на каких-либо данных, то отклонения наблюдений зависимой переменной от подогнанной функции являются остатками. Если применима линейная модель, то график остатков, построенный относительно независимой переменной, должен быть случайным относительно нуля, без какой-либо тенденции в остатках. Другой способ вычисления среднеквадратичной ошибки при анализе дисперсии линейной регрессии с использованием метода, аналогичного используемому в ANOVA (они идентичны, поскольку ANOVA является типом регрессии), заключается в делении суммы квадратов остатков (также известной как сумма квадратов ошибки) на степени свободы (где степени свободы равны n − p − 1, где p – количество параметров, оцененных в модели – по одному на каждую переменную в уравнении регрессии, не считая пересечения). Затем можно также вычислить среднеквадратичную величину модели, разделив сумму квадратов модели на число параметров (степени свободы). Далее значение F можно вычислить, разделив среднеквадратичную величину модели на среднеквадратичную ошибку, и на этой основе определить значимость (поэтому и нужны среднеквадратичные величины). Однако из-за особенностей процесса регрессии распределения остатков в разных точках данных (значениях входной переменной) могут различаться, даже если сами ошибки распределены одинаково. В частности, при линейной регрессии с одинаково распределенными ошибками изменчивость остатков для входных значений в середине области будет выше, чем изменчивость остатков на концах области: линейные регрессии лучше соответствуют конечным точкам, чем середине. Это также отражается в функциях влияния различных точек данных на коэффициенты регрессии: конечные точки оказывают большее влияние. Таким образом, для сравнения остатков при разных входных значениях необходимо скорректировать остатки с учетом ожидаемой изменчивости остатков, что называется студентизацией. Это особенно важно при выявлении выбросов, когда рассматриваемый случай каким-то образом отличается от остальных в наборе данных. Например, большой остаток может быть ожидаемым в середине области, но считаться выбросом на конце области.

Другие значения слова "ошибка" в статистике

Использование термина "ошибка", как обсуждалось в вышеприведенных разделах, понимается как отклонение значения от гипотетической ненаблюдаемой величины. В статистике также встречаются как минимум два других применения этого термина, оба относящиеся к наблюдаемым ошибкам прогнозирования:

Среднеквадратичная ошибка (MSE) отражает величину расхождения между значениями, предсказанными оценщиком, и оцениваемыми величинами (как правило, вне выборки, на которой модель была оценена). Корень из среднеквадратичной ошибки (RMSE) – это квадратный корень из MSE. Сумма квадратов ошибок (SSE) равна MSE, умноженной на размер выборки. Сумма квадратов отклонений (SSR) – это сумма квадратов разностей между фактическими и предсказанными значениями, рассчитанная на выборке, использованной для оценки. Она является основой метода наименьших квадратов, при котором коэффициенты регрессии выбираются таким образом, чтобы SSR была минимальной (то есть ее производная равна нулю). Аналогично, сумма абсолютных отклонений (SAE) – это сумма абсолютных значений отклонений, которая минимизируется в подходе к регрессии с наименьшими абсолютными отклонениями. Средняя ошибка (ME) – это смещение. Среднее отклонение (MR) всегда равно нулю для оценок, полученных методом наименьших квадратов.