Введение

Метод статистического факторного анализа В статистике пошаговая регрессия - это метод адаптации регрессионных моделей, в которых выбор прогнозных переменных осуществляется автоматической процедурой. На каждом этапе переменная рассматривается для добавления или вычитания из набора объяснительных переменных на основе некоторых заранее определенных критериев. Обычно это происходит в виде последовательности F-тестов или t-тестов вперед, назад или в комбинации. Частая практика установки окончательной выбранной модели, сопровождаемая отчетностью о оценках и доверительных интервалах без корректировки их с учетом процесса создания модели, привела к призывам прекратить использование пошагового создания модели или, по крайней мере, убедиться, что неопределенность модели правильно отражена с использованием заранее определенных автоматических критериев вместе с более сложными оценками стандартной ошибки, которые остаются непредвзятыми.

Альтернативы

Широко используемый алгоритм был впервые предложен Эфроймсоном (1960). Это автоматическая процедура выбора статистической модели в случаях, когда существует большое количество потенциальных объяснительных переменных, а нет основополагающей теории, на которой можно было бы основывать выбор модели. Процедура используется в основном в регрессионном анализе, хотя базовый подход применим во многих формах выбора модели. Это вариация на выбор вперед. На каждом этапе процесса, после добавления новой переменной, проводится тест, чтобы проверить, можно ли удалить некоторые переменные без значительного увеличения остаточной суммы квадратов (RSS). Процедура заканчивается, когда мера (локально) максимализирована или когда доступное улучшение падает ниже некоторого критического значения. Одна из основных проблем пошаговой регрессии заключается в том, что она ищет большое пространство возможных моделей. Поэтому он склонен переустановить данные. Другими словами, пошаговая регрессия часто будет лучше подходить к образцу, чем к новым данным из образца. Были отмечены крайние случаи, когда модели достигли статистической значимости, работая с случайными числами. Эта проблема может быть смягчена, если критерий для добавления (или удаления) переменной достаточно жесткий. Ключевая линия в песке находится в том, что можно считать точкой Бонферрони: а именно, насколько значительна лучшая поддельная переменная, основанная только на случайности. В статистической шкале t это происходит примерно при , где p - количество предсказателей. К сожалению, это означает, что многие переменные, которые фактически несут сигнал, не будут включены. Этот забор оказался правильным компромиссом между перегрузкой и отсутствием сигнала. Если мы посмотрим на риск различных отрезков, то использование этой границы будет в пределах фактора наилучшего возможного риска. Любой другой отрезок в конечном итоге будет иметь более высокий риск инфляции.

Точность модели

Способ тестирования на наличие ошибок в моделях, созданных пошаговой регрессией, заключается в том, чтобы не полагаться на статистику F, значимость или множественное R модели, а вместо этого оценивать модель по сравнению с набором данных, которые не использовались для создания модели. Это часто делается путем создания модели на основе выборки из имеющегося набора данных (например, 70%) обучающий набор и использования остальной части набора данных (например, 30%) в качестве набора валидации для оценки точности модели. Точность часто измеряется как фактическая стандартная ошибка (SE), MAPE (средняя абсолютная процентная ошибка) или средняя ошибка между прогнозируемым значением и фактическим значением в выдержанной выборке. Этот метод особенно ценен, когда данные собираются в разных условиях (например, в разное время, в социальных и одиноких ситуациях) или когда предполагается, что модели обобщаются.

Критика

Процедуры пошаговой регрессии используются в добыче данных, но являются спорными. Было высказано несколько критических замечаний. Тесты сами по себе предвзяты, поскольку они основаны на одних и тех же данных. Уилкинсон и Даллал (1981) вычислили процентные пункты коэффициента множественной корреляции путем моделирования и показали, что окончательная регрессия, полученная путем выбора вперед, которая, по процедуре F, была значительной при 0,1%, на самом деле была значительной только при 5%. При оценке степеней свободы число независимых переменных-кандидатов из выбранного наилучшего соответствия может быть меньше, чем общее количество конечных переменных модели, в результате чего соответствие выглядит лучше, чем при корректировке значения r2 на количество степеней свободы. Важно учитывать, сколько степеней свободы было использовано в всей модели, а не просто подсчитывать количество независимых переменных в полученном соответствии. Созданные модели могут быть упрощенными реальными моделями данных. Такие критические замечания, основанные на ограничениях отношений между моделью и процедурой и набором данных, используемых для ее адаптации, обычно решаются путем проверки модели на независимом наборе данных, как в процедуре PRESS. Критики рассматривают процедуру как парадигматический пример дноуглубления данных, интенсивные вычисления часто являются неадекватным заменителем знаний в предметной области. Кроме того, результаты пошаговой регрессии часто используются неправильно, не корректируя их для выбора модели. Особенно практика подбора окончательной выбранной модели, как если бы выбор модели не имел место, и отчетность о оценках и доверительных интервалах, как если бы теория наименьших квадратов была для них действительна, была описана как скандал. Широкое неправильное использование и наличие альтернатив, таких как ансамбльное обучение, оставление всех переменных в модели или использование экспертного суждения для определения соответствующих переменных, привели к призывам полностью избегать пошагового выбора модели.