Кіріспе

Жоғалған деректерді алмастырылған мәндермен ауыстыру процесі. Статистикада импутация – бұл жетіспейтін деректерді алмастырылған мәндермен ауыстыру процесі. Дерек нүктесін алмастырған кезде ол "бірлік импутациясы" деп аталады; дерек нүктесінің құраушы бөлігін алмастырған кезде ол "элементтік импутациясы" деп аталады. Жоғалған деректер үш негізгі проблема тудырады: жоғалған деректер айтарлықтай мөлшерде қателіктерге (bias) әкелуі мүмкін, деректерді өңдеу мен талдауды қиындатады және тиімділікті төмендетеді. Жоғалған деректер деректерді талдау үшін проблемалар туғызатындықтан, импутация жоғалған мәндері бар жағдайларды тізім бойынша жоюмен байланысты қиындықтарды болдырмаудың бір жолы ретінде қарастырылады. Яғни, бір немесе бірнеше мәндер жоғалған жағдайда, көптеген статистикалық пакеттер жоғалған мәні бар кез келген жағдайды жоюға бейім, бұл қателіктерге (bias) әкелуі немесе нәтижелердің нақтылығына (representativeness) әсер етуі мүмкін. Импутация барлық жағдайларды сақтайды, жоғалған деректерді басқа қолжетімді ақпарат негізінде бағаланған мәнмен алмастыру арқылы. Барлық жетіспейтін мәндер есептелгеннен кейін, деректер жиынтығы толық деректер үшін стандартты әдістерді қолдана отырып талдануы мүмкін. Ғалымдар жоғалған деректерді түсіндіру үшін көптеген теорияларды қабылдады, бірақ олардың көпшілігі қателіктерге (bias) әкеледі. Жоғалған деректерді өңдеуге арналған белгілі әрекеттердің кейбірі: ыстық палуба және суық палуба импутациясы; тізім бойынша және жұп бойынша жою; орташа мәнмен импутация; теріс емес матрицалық факторлау; регрессиялық импутация; соңғы бақылауды алға жылжыту; стохастикалық импутация; және көптеген импутация.

Тізім бойынша (толық кейс) өшіру

Жоқ деректерді жоюдың ең көп таралған тәсілі тізім бойынша жою (толық жағдай деп те аталады), яғни жоғалған мәні бар барлық жағдайлар жойылады. Егер деректер толығымен кездейсоқ жоғалған болса, тізім бойынша жою ешқандай бұрмалаушылыққа алып келмейді, бірақ тиімді үлгі мөлшерін азайту арқылы талдаудың қуатын төмендетеді. Мысалы, 1000 жағдай жиналған, бірақ 80-інің мәліметтері жоқ болса, тізім бойынша жоюдан кейін тиімді үлгі көлемі 920-ге тең болады. Егер жағдайлар толығымен кездейсоқ жоғалмаса, тізім бойынша жою бұрмалаушылыққа әкеледі, себебі жоғалған деректермен ұсынылған жағдайлардың кіші үлгісі бастапқы үлгіні дұрыс көрсетпейді (егер бастапқы үлгі халықтың өкілдік үлгісі болса, толық жағдайлар да сол халықты дұрыс көрсетпейді). Жоғалған деректер толығымен кездейсоқ жоғалған жағдайда тізім бойынша жою бейтарап болғанымен, бұл шындықта сирек кездеседі. Жұптық жою (немесе «бар жағдайды талдау») белгілі бір талдау үшін қажетті айнымалысы жоқ жағдайды жоюды, бірақ барлық қажетті айнымалылары бар талдауларда сол жағдайды қамтуды білдіреді. Жұптық жою қолданылғанда, талдау үшін N жалпы саны параметрлерді бағалау бойынша үйлесімді болмайды. Кейбір сәттерде N-нің толық емес мәндері болуы мүмкін, бірақ басқа параметрлер үшін толық жағдайды салыстыру сақталғандықтан, жұптық жою 100%-дан асып түсетін корреляциялар сияқты мүмкін емес математикалық жағдайларды тудыруы мүмкін. Толық жағдайды жоюдың басқа әдістерге қарағанда бір артықшылығы – оның қарапайымдылығы мен оңай орындалуы. Осы себепті толық жағдай, көптеген кемшіліктеріне қарамастан, жоқ деректерді өңдеудің ең танымал әдісі болып табылады.

Ыстық палуба

Бір кезде кең таралған импутация әдісі – ыстық палуба импутациясы, онда жоғалған мән кездейсоқ таңдалған ұқсас жазбадан алынады. "Ыстық палуба" термині деректерді перфокарталарда сақтау дәуіріне дейін барып тұрады және ақпарат көзінің (донор) және оны алушының бір деректер жиынтығынан екенін көрсетеді. Карталар жиынтығы "ыстық" деп аталды, себебі ол сол кезде өңделіп жатқан болатын. Ыстық палуба импутациясының бір түрі – "соңғы бақылау алға жылжытылады" (немесе қысқаша LOCF) деп аталады, ол деректер жиынтығын бірнеше айнымалылар бойынша сұрыптауды қамтиды, нәтижесінде реттелген деректер жиынтығы құрылады. Содан кейін әдіс алғашқы жоғалған мәнді анықтап, жоғалған мәнді есептеу үшін жоғалған деректерге дейін орналасқан мәнді пайдаланады. Барлық жоғалған мәндер есептелгенше, бұл процесс жоғалған мәні бар келесі жасуша үшін қайталанады. Көптеген жағдайларда бұл әдіс бір адам немесе басқа да объектіге қатысты айнымалының бірнеше рет өлшенуін білдіреді, яғни өлшем болмаған жағдайда, оның соңғы өлшенгеннен өзгермегендігі туралы болжам жасалады. Бұл әдіс жасайтын нәтижелерге қатысты бұрмалаушылыққа және қателігі бар қорытындыларға әкелуі мүмкін екені белгілі. Осы себепті LOCF қолдану ұсынылмайды.

Салқын палуба

Ал салқын палуба импутациясы, керісінше, донорларды басқа деректер жиынтығынан таңдайды. Компьютерлік қуаттың артуына байланысты, импутацияның күрделі әдістері көбінесе бастапқы кездейсоқ және реттелген ыстық палуба импутациясы техникаларын ескірді. Бұл – бұрынғы сауалнамалардағы ұқсас жағдайлардың жауаптарымен ауыстыру әдісі. Ол уақыт аралықтарын өлшейтін сауалнамаларда қолданылады.

Орташа ауыстыру

Тағы бір жорамалдау әдісі кез келген жоғалған мәнді басқа барлық жағдайлар бойынша сол айнымалының орташа мәнімен алмастыруды қамтиды, бұл осы айнымалының үлгідегі орташа мәнін өзгертпеу артықшылығына ие. Дегенмен, орташа мәнмен толтыру сол айнымалыға қатысты кез келген корреляцияны әлсіретеді. Себебі, жорамалдау жасалған жағдайларда, жорамалдау жасалған айнымалы мен басқа өлшенген айнымалылар арасында ешқандай байланыс болмайтыны кепілдігі беріледі. Осылайша, орташа мәнмен толтыру біржақты талдау үшін тартымды қасиеттерге ие, бірақ көп өлшемді талдау үшін қиындық тудырады. Орташа мәнмен толтыру сыныптар ішінде (яғни, жыныс сияқты санаттар) жүргізілуі мүмкін және былай көрсетілуі мүмкін, мұнда – жорамалдау жасалған мән, ал – белгілі бір сыныптағы жауап берушілер дерегінің үлгілік орташасы. Бұл жалпыланған регрессиялық жорамалдаудың ерекше жағдайы: Мұнда мәндер жорамалдау жасалмаған деректерде регрессия арқылы бағаланады, – сыныпқа жататындығын көрсететін индикаторлық айнымалы, ал деректер жауап берушілерге және жоғалған мәндерге бөлінеді.

Теріс емес матрицаны факторлау

Теріс емес матрицалық факторлау (ТМФ) шығын функциясын ең аздету арқылы жоғалған деректерді өңдей алады, осылайша жоғалған деректерді бұрмалауға әкелетін нөлдер ретінде қарастырудан аулақ болады. Бұл оны деректерді толықтырудың математикалық тұрғыдан дәлелденген әдісіне айналдырады. ТМФ шығын функциясында жоғалған деректерді назарға алмауға болады, ал жоғалған деректердің ықпалы екінші дәрежелі эффектіге жуық болуы мүмкін.

Регрессия

Регрессиялық импутация орташа импутацияның кері проблемасына ие. Регрессиялық модель басқа айнымалыларға сүйенген айнымалының байқалған мәндерін болжау үшін есептеледі, содан кейін бұл модель сол айнымалының мәні жоқ жағдайларда мәндерді толтыру үшін қолданылады. Басқаша айтқанда, толық және толық емес деректер үшін қолжетімді ақпарат белгілі бір айнымалының мәнін болжау үшін пайдаланылады. Регрессиялық модельден алынған сәйкес келетін мәндер жоғалған мәндерді толтыру үшін қолданылады. Проблема – толтырылған деректерде олардың есептелуі кезінде қателік мүшесі болмайды, сондықтан есептемелер қалдық дисперсиясыз регрессиялық сызық бойынша мінсіз сәйкес келеді. Бұл қатынастардың артық анықталуына және толтырылған мәндердің қажетті дәлдіктен жоғары болуына әкеледі. Регрессиялық модель жоғалған деректердің ең мүмкін мәнін болжайды, бірақ бұл мәнге қатысты белгісіздікті қамтамасыз етпейді. Стохастикалық регрессия – регрессиялық импутациядағы қателік мүшесінің жоқтығын түзетуге жасалған сәтті әрекет, оған регрессиялық импутацияларға орташа регрессиялық дисперсияны қосу арқылы қателік енгізілді. Стохастикалық регрессия жоғарыда аталған техникалардан гөрі аз бейімділік көрсетеді, бірақ ол бір нәрсені қалыптастырды – деректер толтырылса, интуитивті түрде қарапайым қалдық дисперсиядан гөрі проблемаға көбірек шу енгізілуі керек. Осы үшін толтырылған бірнеше дерек жиынтықтарының орташасын есептеу әдісі әзірленді. Барлық көптік импутация әдістері үш қадамды қамтиды. немесе әрбір жеке модельден симуляцияларды біріктіру арқылы. Көптік импутация деректердің толығымен кездейсоқ, кездейсоқ және толығымен кездейсоқ емес жоғалған жағдайларда қолданылуы мүмкін, бірақ соңғы жағдайда ол бұрмаланған болуы мүмкін. Бір тәсіл – тізбектелген теңдеулер арқылы көптік импутация (MICE), сонымен қатар «толық шартты спецификация» және «тізбекті регрессиялық көптік импутация» деп те аталады. MICE кездейсоқ деректерден айырылу үшін жасалған, бірақ жеткілікті көлемде қосалқы айнымалылар болса, кездейсоқ емес деректерден айырылған деректерде де жұмыс істей алатынын көрсететін симуляциялық дәлелдер бар. Алайда, MICE бақылау саны көп және деректерде сызықтық емес және жоғары өлшемділік сияқты күрделі ерекшеліктер болған кезде орындалуында қиындықтар туындауы мүмкін. Көптік импутацияның жақындағы тәсілдері оның өнімділігін жақсарту үшін машиналық оқыту әдістерін қолданады. Мысалы, MIDAS (Denoising Autoencoders арқылы көптік импутация) байқалатын деректердің ұсақ түйіршікті жасырын бейнелерін оқыту үшін қадағалаусыз нейрондық желі түріндегі denoising autoencoders-ті қолданады. MIDAS дәстүрлі көптік импутация стратегияларына қарағанда дәлдік және тиімділік артықшылықтарын қамтамасыз етеді. Алдыңғы бөлімде айтылғандай, бір реттік импутация импутациядағы белгісіздікті ескермейді. Импутациядан кейін деректер бір рет есептелгенде нақты мәндер ретінде қарастырылады. Импутациядағы белгісіздікті ескермеу артық дәл нәтижелерге және кез келген қорытындылардағы қателерге әкелуі мүмкін. Көп рет есептеу арқылы көптік импутация нақты мәннің қабылдауы мүмкін мәндердің белгісіздігі мен ауқымын ескереді. Күтілгендей, белгісіздікті бағалау және импутация үшін терең оқытудың біріктірілуі ең жақсы стратегиялардың бірі болып табылады және ол дәрі-дәрмектерді табудың гетерогендік деректерін модельдеу үшін қолданылды. Сонымен қатар, бір реттік импутация және толық жағдайды іске асыру оңай болса, көптік импутацияны іске асыру қиын емес. Статистикалық бағдарламалық жасақтамада көптік импутацияны оңай орындайтын статистикалық бағдарламалардың кең ауқымы бар. Мысалы, MICE пакеті R пайдаланушыларына MICE әдісін қолдана отырып, көптік импутация жүргізуге мүмкіндік береді. MIDAS R-де rMIDAS пакетімен және Python-да MIDASpy пакетімен іске асырылуы мүмкін.