Введение
Метод скользящей средней и полиномиальной регрессии для сглаживания данных.
Локальная регрессия или локальная полиномиальная регрессия, также известная как скользящая регрессия, является обобщением метода скользящей средней и полиномиальной регрессии. Наиболее распространенными методами, первоначально разработанными для сглаживания диаграмм рассеяния, являются LOESS (локально оцениваемое сглаживание диаграммы рассеяния) и LOWESS (локально взвешенное сглаживание диаграммы рассеяния), оба произносятся как '/l//oʊ//ɛ//s/ LOHess'. Это два тесно связанных непараметрических метода регрессии, которые объединяют несколько моделей регрессии в метамодель, основанную на k ближайших соседях. В некоторых областях LOESS известен и обычно называется фильтром Савицкого – Голея (предложенным за 15 лет до LOESS). Таким образом, LOESS и LOWESS опираются на «классические» методы, такие как линейная и нелинейная регрессия наименьших квадратов. Они применяются в ситуациях, когда классические процедуры работают недостаточно хорошо или не могут быть эффективно применены без чрезмерных усилий. LOESS сочетает в себе простоту линейной регрессии наименьших квадратов с гибкостью нелинейной регрессии. Это достигается путем подгонки простых моделей к локализованным подмножествам данных для построения функции, описывающей детерминированную часть изменчивости данных точка за точкой. Фактически, одно из главных преимуществ этого метода заключается в том, что аналитику данных не требуется задавать глобальную функцию какой-либо формы для подгонки модели к данным, а только подгонять сегменты данных. Ценой этих возможностей является увеличение вычислительной нагрузки. Из-за своей высокой вычислительной интенсивности LOESS было бы практически невозможно использовать в эпоху разработки регрессии наименьших квадратов. Большинство других современных методов моделирования процессов аналогичны LOESS в этом отношении. Эти методы были сознательно разработаны для максимально эффективного использования наших текущих вычислительных возможностей для достижения целей, которые трудно достичь традиционными подходами. Гладкая кривая, проходящая через набор точек данных, полученных с помощью этой статистической техники, называется кривой Лоэсса, особенно когда каждое сглаженное значение определяется взвешенной квадратичной регрессией наименьших квадратов в диапазоне значений критериальной переменной диаграммы рассеяния по оси y. Когда каждое сглаженное значение определяется взвешенной линейной регрессией наименьших квадратов в диапазоне, это известно как кривая Лоуэсса; однако некоторые специалисты рассматривают Лоуэсс и Лоэсс как синонимы. Поскольку полином степени k требует как минимум k + 1 точки для подгонки, параметр сглаживания должен быть между 0 и 1, где 0 обозначает степень локального полинома. Этот параметр называется параметром сглаживания, поскольку он контролирует гибкость регрессионной функции LOESS. Большие значения параметра производят самые гладкие функции, которые наименее подвержены колебаниям в ответ на флуктуации данных. Чем меньше параметр, тем ближе регрессионная функция будет соответствовать данным. Однако использование слишком малого значения параметра сглаживания нежелательно, поскольку регрессионная функция в конечном итоге начнет захватывать случайную ошибку в данных.
Степень локальных многочленов
Локальные полиномы, построенные для каждого подмножества данных, почти всегда имеют первую или вторую степень, то есть являются либо локально линейными (в смысле прямой линии), либо локально квадратичными. Использование полинома нулевой степени превращает LOESS в взвешенное скользящее среднее. Полиномы более высокой степени теоретически могли бы работать, но приводят к моделям, которые не соответствуют принципам LOESS. LOESS основан на идеях о том, что любую функцию можно хорошо аппроксимировать в небольшой окрестности полиномом низкого порядка и что простые модели легко подстраиваются под данные. Полиномы высокой степени склонны к переобучению на каждом подмножестве данных и численно неустойчивы, что затрудняет проведение точных вычислений.
Преимущества
Как обсуждалось выше, самое большое преимущество LOESS перед многими другими методами заключается в том, что процесс подгонки модели к данным выборки не начинается с задания функции. Вместо этого аналитику необходимо лишь указать значение параметра сглаживания и степень локального полинома. Кроме того, LOESS обладает высокой гибкостью, что делает его идеальным для моделирования сложных процессов, для которых не существует теоретических моделей. Эти два преимущества, в сочетании с простотой метода, делают LOESS одним из наиболее привлекательных современных методов регрессии для задач, соответствующих общей структуре регрессии наименьших квадратов, но имеющих сложную детерминированную структуру. Хотя это и менее очевидно, чем для некоторых других методов, связанных с линейной регрессией наименьших квадратов, LOESS также наследует большинство преимуществ, обычно присущих этим процедурам. Наиболее важным из них является теория вычисления неопределенностей при прогнозировании и калибровке. Многие другие тесты и процедуры, используемые для валидации моделей наименьших квадратов, также могут быть применены к моделям LOESS.
Недостатки
LOESS использует данные менее эффективно, чем другие методы наименьших квадратов. Для построения хороших моделей требуются достаточно большие и плотно дискретизированные наборы данных. Это связано с тем, что LOESS опирается на локальную структуру данных при локальном подгонянии. Таким образом, LOESS обеспечивает менее сложный анализ данных в обмен на более высокие экспериментальные затраты. Другим недостатком LOESS является то, что он не формирует регрессионную функцию, которую легко представить в виде математической формулы. Это может затруднить передачу результатов анализа другим исследователям. Чтобы передать регрессионную функцию другому человеку, ему потребуются исходные данные и программное обеспечение для вычислений LOESS. В отличие от этого, в нелинейной регрессии достаточно записать функциональную форму, чтобы получить оценки неизвестных параметров и оценку их неопределенности. В зависимости от задачи, это может быть как существенным, так и незначительным недостатком использования LOESS. В частности, простая форма LOESS неприменима для механистического моделирования, где подгоняемые параметры определяют конкретные физические свойства системы. Наконец, как упоминалось выше, LOESS является вычислительно затратным методом (за исключением случаев равномерно распределенных данных, когда регрессия может быть представлена в виде некаузального фильтра с конечным импульсным откликом). LOESS также чувствителен к выбросам в данных, как и другие методы наименьших квадратов. Существует итеративная, устойчивая версия LOESS [Cleveland (1979)], которая может быть использована для снижения чувствительности LOESS к выбросам, но слишком большое количество экстремальных выбросов все равно может нивелировать эффект устойчивого метода.