Введение
В статистике обобщенная аддитивная модель (GAM) — это обобщенная линейная модель, в которой линейная зависимая переменная зависит линейно от неизвестных гладких функций некоторых предикторных переменных, и интерес сосредоточен на выводе относительно этих гладких функций. GAM были первоначально разработаны Тревором Хэсти и Робертом Тибширани для объединения свойств обобщенных линейных моделей и аддитивных моделей. Их можно интерпретировать как дискриминационное обобщение наивной генеративной модели Байеса. Модель связывает унивариатную зависимую переменную Y с некоторыми предикторами xi. Для Y задается распределение из экспоненциального семейства (например, нормальное, биномиальное или распределение Пуассона) вместе с функцией связи g (например, тождественная или логарифмическая функции), связывающей математическое ожидание Y с предикторами посредством структуры вида:
Функции fi могут быть функциями с заданной параметрической формой (например, полиномом или нерегулируемым регрессионным сплайном переменной) или могут быть заданы непараметрически или полупараметрически, просто как «гладкие функции», которые должны быть оценены непараметрическими методами. Таким образом, типичный GAM может использовать функцию сглаживания диаграммы рассеяния, такую как локально взвешенное среднее, для f1(x1), а затем использовать факторную модель для f2(x2). Эта гибкость, позволяющая использовать непараметрические подгонки с ослабленными предположениями о фактической связи между зависимой и предикторными переменными, обеспечивает потенциал для лучшей подгонки данных, чем чисто параметрические модели, но, возможно, с некоторой потерей интерпретируемости.
Методы монтажа GAM
Первоначальный метод подгонки GAM оценивал гладкие компоненты модели, используя непараметрические сглаживатели (например, сглаживающие сплайны или сглаживатели локальной линейной регрессии) посредством алгоритма обратной подгонки. Затем степень гладкости можно оценить как часть подгонки модели, используя обобщенную перекрестную проверку или с помощью ограниченного максимального правдоподобия (REML, иногда известного как "GML"), которое использует двойственность между сплайн-сглаживателями и гауссовскими случайными эффектами. Этот полный сплайн-подход сопряжен с вычислительной стоимостью, где – число наблюдений для зависимой переменной, что делает его несколько непрактичным для умеренно больших наборов данных. Более поздние методы решают эту вычислительную проблему либо путем предварительного уменьшения размера базиса, используемого для сглаживания (уменьшение ранга), либо путем поиска разреженных представлений сглаживаний, используя марковские случайные поля, которые позволяют применять методы разреженных матриц для вычислений. Эти более вычислительно эффективные методы используют GCV (или AIC или аналогичные) или REML, или применяют полностью байесовский подход для оценки степени гладкости компонентов модели. Оценка степени гладкости с помощью REML может рассматриваться как эмпирический байесовский метод. Альтернативный подход, обладающий особыми преимуществами в задачах высокой размерности, – это использование бустинга, хотя это обычно требует бутстрэпа для оценки неопределенности. Было обнаружено, что GAM, подогнанные с использованием бэггинга и бустинга, как правило, превосходят GAM, подогнанные с использованием сплайн-методов.
Рамочная система с пониженным рангом
Многие современные реализации GAM и их расширений построены на основе подхода сглаживания с пониженным рангом, поскольку он позволяет обоснованно оценивать гладкость компонентных сглаживаний при сравнительно небольших вычислительных затратах, а также упрощает реализацию ряда расширений модели, что сложнее сделать другими методами. В простейшем случае идея заключается в замене неизвестных гладких функций в модели базисными разложениями:
where the are known basis functions, usually chosen for good approximation theoretic properties (for example B splines or reduced rank thin plate splines), and the are coefficients to be estimated as part of model fitting. The basis dimension is chosen to be sufficiently large that we expect it to overfit the data to hand (thereby avoiding bias from model over simplification), but small enough to retain computational efficiency. If then the computational cost of model estimation this way will be
Notice that the are only identifiable to within an intercept term (we could add any constant to while subtracting it from without changing the model predictions at all), so identifiability constraints have to be imposed on the smooth terms to remove this ambiguity. Sharpest inference about the is generally obtained by using the sum to zero constraints
i. e. by insisting that the sum of each the evaluated at its observed covariate values should be zero. Such linear constraints can most easily be imposed by reparametrization at the basis setup stage, Understanding this Bayesian view of smoothing also helps to understand the REML and full Bayes approaches to smoothing parameter estimation. At some level smoothing penalties are imposed because we believe smooth functions to be more probable than wiggly ones, and if that is true then we might as well formalize this notion by placing a prior on model wiggliness. A very simple prior might be
(where is the GLM scale parameter introduced only for later convenience), but we can immediately recognize this as a multivariate normal prior with mean and precision matrix Since the penalty allows some functions through unpenalized (straight lines, given the example penalties), is rank deficient, and the prior is actually improper, with a covariance matrix given by the Moore–Penrose pseudoinverse of (the impropriety corresponds to ascribing infinite variance to the unpenalized components of a smooth). that are essentially empirical Bayes methods.
где – известные базисные функции, обычно выбираемые с учетом хороших теоретико-приближенческих свойств (например, B-сплайны или сплайны тонких пластин пониженного ранга), а – коэффициенты, которые необходимо оценить в процессе подгонки модели. Размерность базиса выбирается достаточно большой, чтобы можно было ожидать переобучения на имеющихся данных (тем самым избегая смещения из-за чрезмерного упрощения модели), но достаточно малой для сохранения вычислительной эффективности. Если , то вычислительные затраты на оценку модели таким образом составят . Следует отметить, что коэффициенты определены только с точностью до аддитивной константы (можно добавить любую константу к и вычесть ее из , не изменяя при этом прогнозы модели), поэтому на гладкие члены необходимо наложить ограничения идентифицируемости, чтобы устранить эту неоднозначность. Наиболее точные оценки получаются при использовании ограничений, суммирующих до нуля, то есть при требовании, чтобы сумма каждого по наблюдаемым значениям ковариаты была равна нулю. Такие линейные ограничения проще всего наложить путем перепараметризации на этапе построения базиса. Понимание этого байесовского взгляда на сглаживание также помогает понять подходы REML и полного Байеса к оценке параметров сглаживания. На определенном уровне штрафы за сглаживание вводятся, поскольку мы считаем гладкие функции более вероятными, чем извилистые, и если это так, то мы можем формализовать это понятие, задав априорное распределение на извилистость модели. Очень простым априорным распределением может быть
where the are known basis functions, usually chosen for good approximation theoretic properties (for example B splines or reduced rank thin plate splines), and the are coefficients to be estimated as part of model fitting. The basis dimension is chosen to be sufficiently large that we expect it to overfit the data to hand (thereby avoiding bias from model over simplification), but small enough to retain computational efficiency. If then the computational cost of model estimation this way will be
Notice that the are only identifiable to within an intercept term (we could add any constant to while subtracting it from without changing the model predictions at all), so identifiability constraints have to be imposed on the smooth terms to remove this ambiguity. Sharpest inference about the is generally obtained by using the sum to zero constraints
i. e. by insisting that the sum of each the evaluated at its observed covariate values should be zero. Such linear constraints can most easily be imposed by reparametrization at the basis setup stage, Understanding this Bayesian view of smoothing also helps to understand the REML and full Bayes approaches to smoothing parameter estimation. At some level smoothing penalties are imposed because we believe smooth functions to be more probable than wiggly ones, and if that is true then we might as well formalize this notion by placing a prior on model wiggliness. A very simple prior might be
(where is the GLM scale parameter introduced only for later convenience), but we can immediately recognize this as a multivariate normal prior with mean and precision matrix Since the penalty allows some functions through unpenalized (straight lines, given the example penalties), is rank deficient, and the prior is actually improper, with a covariance matrix given by the Moore–Penrose pseudoinverse of (the impropriety corresponds to ascribing infinite variance to the unpenalized components of a smooth). that are essentially empirical Bayes methods.
(где – параметр масштаба GLM, введенный только для удобства в дальнейшем), но мы сразу же узнаем его как многомерное нормальное априорное распределение со средним и матрицей точности. Поскольку штраф позволяет некоторым функциям проходить без штрафа (прямые линии, учитывая примеры штрафов), является вырожденной по рангу, и априорное распределение фактически является несобственным, с ковариационной матрицей, заданной псевдообратной Мура — Пенроуза (несобственность соответствует приписыванию бесконечной дисперсии нештрафуемым компонентам сглаживания). Это, по сути, эмпирические байесовские методы.
where the are known basis functions, usually chosen for good approximation theoretic properties (for example B splines or reduced rank thin plate splines), and the are coefficients to be estimated as part of model fitting. The basis dimension is chosen to be sufficiently large that we expect it to overfit the data to hand (thereby avoiding bias from model over simplification), but small enough to retain computational efficiency. If then the computational cost of model estimation this way will be
Notice that the are only identifiable to within an intercept term (we could add any constant to while subtracting it from without changing the model predictions at all), so identifiability constraints have to be imposed on the smooth terms to remove this ambiguity. Sharpest inference about the is generally obtained by using the sum to zero constraints
i. e. by insisting that the sum of each the evaluated at its observed covariate values should be zero. Such linear constraints can most easily be imposed by reparametrization at the basis setup stage, Understanding this Bayesian view of smoothing also helps to understand the REML and full Bayes approaches to smoothing parameter estimation. At some level smoothing penalties are imposed because we believe smooth functions to be more probable than wiggly ones, and if that is true then we might as well formalize this notion by placing a prior on model wiggliness. A very simple prior might be
(where is the GLM scale parameter introduced only for later convenience), but we can immediately recognize this as a multivariate normal prior with mean and precision matrix Since the penalty allows some functions through unpenalized (straight lines, given the example penalties), is rank deficient, and the prior is actually improper, with a covariance matrix given by the Moore–Penrose pseudoinverse of (the impropriety corresponds to ascribing infinite variance to the unpenalized components of a smooth). that are essentially empirical Bayes methods.
Оценка параметров сглаживания
До сих пор мы рассматривали оценку и статистический вывод при заданных параметрах сглаживания, но и их необходимо оценивать. Один из подходов – использование полностью байесовского подхода, определяя априорные распределения для (логарифмов) параметров сглаживания и применяя стохастическое моделирование или методы аппроксимации высокого порядка для получения информации о постериорном распределении коэффициентов модели. В конечном итоге мы можем выбрать максимизацию предельной функции правдоподобия (REML), полученной путем интегрирования коэффициентов модели из совместного распределения . Поскольку это просто функция правдоподобия , мы можем рассматривать это как выбор , максимизирующий среднюю функцию правдоподобия для случайных выборок из априорного распределения. Указанный интеграл обычно не имеет аналитического решения, но может быть аппроксимирован с достаточно высокой точностью с помощью метода Лапласа. Сейчас этот метод реализован в языке R в пакете gam. SAS proc GAM также предоставляет GAM с подгонкой по остаткам. Рекомендуемый пакет в R для GAM – mgcv (Mixed GAM Computational Vehicle – вычислительное средство для смешанных GAM). Существует множество альтернативных пакетов, например, R-пакеты mboost и VGAM, предоставляющий векторные GAM. Программное обеспечение INLA реализует полностью байесовский подход, основанный на представлениях марковских случайных полей, использующих методы разреженных матриц. Дополнительная проверка, которую вносят GAM, – необходимость убедиться, что выбранные степени свободы являются подходящими. Это особенно важно при использовании методов, которые не оценивают гладкость компонентов модели автоматически. При использовании методов с автоматическим выбором параметров сглаживания все равно необходимо проверить, не был ли выбранный размер базиса чрезмерно мал, хотя если эффективные степени свободы оценки члена комфортно ниже его размерности базиса, то это маловероятно. В любом случае, проверка основана на изучении закономерностей в остатках относительно . Это можно сделать, наложив частичные остатки на график , или используя перестановки остатков для построения тестов на наличие закономерностей в остатках.
Выбор модели
Когда параметры сглаживания оцениваются в процессе подгонки модели, значительная часть того, что традиционно рассматривалось бы как выбор модели, включается в сам процесс подгонки: оценка параметров сглаживания уже осуществляет выбор между широким семейством моделей различной функциональной сложности. Однако, оценка параметров сглаживания обычно не исключает гладкий член из модели полностью, поскольку большинство штрафов оставляют некоторые функции без штрафных санкций (например, прямые линии не штрафуются при использовании вышеупомянутого штрафа на производную сплайна). Таким образом, вопрос о том, следует ли вообще включать член в модель, остаётся открытым. Одним из простых подходов к решению этой проблемы является добавление дополнительного штрафа к каждому гладкому члену в GAM, который штрафует те компоненты гладкого члена, которые в противном случае не были бы оштрафованы (и только их). Каждый дополнительный штраф имеет свой собственный параметр сглаживания, и оценка продолжается как прежде, но теперь с возможностью полного снижения члена до нуля. В задачах высокой размерности может быть более целесообразно решать эту задачу с использованием регуляризации LASSO или Elastic Net. Бустинг также автоматически выполняет отбор членов в процессе подгонки. Однако, корректировка эффективных степеней свободы для этой проблемы восстанавливает приемлемую производительность, и программное обеспечение часто позволяет увеличить уровень штрафования для получения более гладких результатов. Оценка очень большого количества параметров сглаживания также может быть статистически сложной, и известно, что критерии оценки ошибки прогнозирования (GCV, AIC и т.д.) иногда приводят к существенному недосглаживанию, особенно при умеренных размерах выборки, при этом REML в этом отношении является несколько менее проблематичным. Там, где это уместно, более простые модели, такие как GLM, могут быть предпочтительнее GAM, если только GAM не демонстрируют существенное улучшение прогностической способности (на проверочных выборках) для конкретной задачи.