Кіріспе

Статистикалық факторлық талдау әдісі Статистикада сатылы регрессия - бұл болжамды айнымалыларды таңдау автоматты түрде жүргізілетін регрессиялық модельдерді орналастыру әдісі. Әрбір қадамда алдын ала белгіленген критерийге негізделген түсіндірмелі айнымалылар жиынтығына қосу немесе алу үшін айнымалы қарастырылады. Әдетте бұл F-тест немесе t-тесттердің алдыңғы, артқа немесе біріктірілген реті болып табылады. Соңғы таңдалған модельге сәйкес келетін, содан кейін оларды модель жасау процесін есепке алу үшін түзетусіз бағалаулар мен сенімділік аралықтарын есеп берудің жиі практикасы кезең-кезеңмен модель жасауды мүлдем тоқтатуға немесе кем дегенде модельдің белгісіздіктері алдын ала белгіленген, автоматты критерийлерді пайдалану арқылы дұрыс көрсетілетініне көз жеткізуге шақырады.

Баламалар

Кең таралған алгоритмді алғаш рет Эфроймсон (1960 ж.) ұсынды. Бұл статистикалық модельді таңдау үшін автоматты процедура, онда көптеген ықтимал түсіндірмелі айнымалылар бар және модельді таңдау үшін негіз болатын негізгі теория жоқ. Бұл әдіс негізінен регрессиялық талдауда қолданылады, бірақ негізгі тәсіл модельдерді таңдаудың көптеген түрлерінде қолданылады. Бұл алдыңғы таңдаудың өзгеруі. Процесстің әрбір кезеңінде жаңа айнымалы қосылғаннан кейін, кейбір айнымалыларды квадраттардың қалдық қосындысын (RSS) айтарлықтай арттырмай жою мүмкіндігін тексеру үшін сынақ жүргізіледі. Іс-қимыл шара (жергілікті деңгейде) максималдық деңгейге жеткенде немесе қол жетімді жақсарту белгілі бір маңызды мәннен төмен болған кезде аяқталады. Степендік регрессияның басты мәселелерінің бірі - ол мүмкін модельдердің үлкен кеңістігін іздеу. Сондықтан ол деректерді асырып тастауға бейім. Басқаша айтқанда, қадамдық регрессия көбінесе жаңа үлгідегіге қарағанда үлгіде жақсырақ болады. Үлгілер кездейсоқ сандар бойынша жұмыс істегенде статистикалық маңыздылыққа қол жеткізген экстремалды жағдайлар байқалады. Бұл мәселені, егер айнымалыны қосу (немесе алып тастау) критерийлері жеткілікті қатаң болса, жеңілдетуге болады. Құмдағы негізгі сызық - Бонферрони нүктесі деп санауға болады: ең жақсы жалған айнымалы тек қана кездейсоқ жағдайға негізделуі керек. t статистикалық шкалада бұл шамамен , мұндағы p - болжаушылардың саны. Өкінішке орай, бұл шын мәнінде сигнал тасымалдайтын көптеген айнымалылар кіргізілмейді дегенді білдіреді. Бұл қоршау артық орнату мен сигналдың жоғалуы арасындағы дұрыс сауда-саттық болып шығады. Егер біз әртүрлі кесулердің тәуекелін қарастырсақ, онда осы шекті пайдалану мүмкін болатын ең жақсы тәуекел факторының ішінде болады. Басқа кез келген кесілген бағаның инфляция тәуекелі жоғары болады.

Үлгілік дәлдік

Степендік регрессия арқылы жасалған модельдерде қателерді тексерудің бір жолы модельдің F статистикасына, маңыздылығына немесе бірнеше R-ге сүйену емес, оның орнына модельді құру үшін пайдаланылмаған деректер жиынтығына сәйкес бағалау. Бұл көбінесе қол жетімді дерек жиынтығының үлгісіне негізделген модель құру арқылы (мысалы, 70%) оқыту жиынтығы және дерек жиынтығының қалған бөлігін (мысалы, 30%) модельдің дәлдігін бағалау үшін жарамдылық жиынтығы ретінде пайдалану арқылы жүзеге асырылады. Дұрысдық көбінесе нақты стандартты қате (SE), MAPE (орташа абсолюттік пайыздық қате) немесе болжалған мән мен нақты мән арасындағы орташа қате ретінде өлшенеді. Бұл әдіс, әсіресе, деректер әр түрлі жағдайларда (мысалы, әр түрлі уақытта, әлеуметтік және жалғыз жағдайларда) жиналғанда немесе модельдер жалпылана алады деп есептелетін кезде өте құнды.

Сын

Деректер қазуда қадамдық регрессия процедуралары қолданылады, бірақ олар даулы. Бірнеше сын-пікірлер айтылды. Сынақтардың өзінде бір жақтылық бар, өйткені олар бірдей деректерге негізделген. Уилкинсон мен Даллал (1981) симуляция арқылы бірнеше кореляция коэффициентінің пайыздық нүктелерін есептеп, F процедурасы бойынша 0,1% -да маңызды деп көрсетілген, алдын ала таңдау арқылы алынған соңғы регрессияның шын мәнінде 5% -да ғана маңызды екенін көрсетті. Еркіндік дәрежесін бағалау кезінде таңдалған ең жақсы сәйкестіктен үміткер тәуелсіз айнымалылардың саны соңғы модельдің айнымалыларының жалпы санынан аз болуы мүмкін, бұл r2 мәнін еркіндік дәрежесінің санына түзету кезінде сәйкестікті жақсырақ етіп көрсетуге себеп болады. Бұл модельде қанша еркіндік дәрежесі қолданылғанын қарастыру маңызды, тек қана сәйкес келетін тәуелсіз айнымалылардың санын санау емес. Жасалған модельдер деректердің нақты модельдерін жеңілдетуі мүмкін. Мұндай сын-пікірлер, модель мен процедура мен оны сәйкес келтіруге арналған деректер жиынтығы арасындағы байланыстың шектеулеріне негізделген, әдетте PRESS процедурасында сияқты тәуелсіз деректер жиынтығында модельді тексеру арқылы қарастырылады. Сыншылар бұл процедураны деректерді дренаждаудың парадигмалық мысалы деп санайды, өйткені қарқынды есептеулер көбінесе тақырыптық саладағы тәжірибеге жеткіліксіз орын алады. Сонымен қатар, қадамдық регрессияның нәтижелері модельді таңдаудың пайда болуына сәйкес реттелместен жиі дұрыс пайдаланылмайды. Әсіресе, соңғы таңдалған модельді модельді таңдау болмағандай етіп орнату және бағалаулар мен сенімділік аралықтарын есеп беру, егер олар үшін ең кіші квадраттар теориясы жарамды болса, бұл арамшөп ретінде сипатталды. Бұған қоса, модельдерді дұрыс қолданбау, барлық айнымалыларды модельде қалдыру немесе тиісті айнымалыларды анықтау үшін сарапшылардың пікірін пайдалану сияқты баламалардың болуы, модельдерді кезең-кезеңмен таңдаудан мүлдем аулақ болуға шақырады.