Кіріспе

Физикадағы деректердің қарастырылатын кездейсоқ айнымалыларының санын азайту процесі – өлшемді азайту.

Өлшемді азайту, немесе деректерді жоғары өлшемді кеңістіктен төмен өлшемді кеңістікке түрлендіру, осылайша төмен өлшемді бейнелеу бастапқы деректердің мағыналы қасиеттерін сақтайды, идеалды жағдайда оның ішкі өлшеміне жақын болады. Жоғары өлшемді кеңістіктерде жұмыс істеу көптеген себептермен тиімсіз болуы мүмкін; бастапқы деректер көбінесе өлшемдік қарғыстың салдарынан сирек кездеседі, ал деректерді талдау көбінесе есептеу жағынан қиын (басқару немесе онымен жұмыс істеу қиын). Өлшемді азайту үлкен көлемдегі байқаулармен және/немесе үлкен санымен жұмыс істейтін салаларда, мысалы, сигналды өңдеу, сөйлеуді тану, нейроинформатика және биоинформатикада кеңінен қолданылады. Әдістер әдетте сызықтық және сызықтық емес түрлерге бөлінеді. Өлшемді азайту шуды азайту, деректерді визуализациялау, кластерлік талдау немесе басқа талдауларды жеңілдету үшін аралық қадам ретінде қолданылуы мүмкін.

Құралды таңдау

Белгілерді таңдау әдістері кіріс айнымалыларының (белгілер немесе атрибуттар деп те аталады) ішкі жиынтығын табуға тырысады. Үш стратегия бар: сүзгі стратегиясы (мысалы, ақпараттық пайда), орама стратегиясы (мысалы, дәлдікпен басқарылатын іздеу) және енгізілген стратегия (таңдалған белгілер модель құрылғанда болжам қателіктеріне сүйене отырып қосылады немесе алынып тасталады). Регрессия немесе жіктеу сияқты деректерді талдау бастапқы кеңістікке қарағанда қысқартылған кеңістікте дәлірек жүргізілуі мүмкін.

Белгілер проекциясы

Фигуралық проекция (немесе ерекшеліктерді бөліп алу) деректерді жоғары өлшемді кеңістіктен төмен өлшемді кеңістікке түрлендіреді. Деректерді түрлендіру негізгі компоненттерді талдау (PCA) сияқты сызықтық болуы мүмкін, бірақ сызықтық емес өлшемді азайту әдістері де көптеген. Көпөлшемді деректер үшін тензорлық өрнектеуді көп сызықтық ішкі кеңістікті үйрену арқылы өлшемді азайту үшін пайдалануға болады.

Негізгі компонентті талдау (PCA)

Өлшемді азайтудың негізгі сызықтық әдісі – негізгі компоненттік талдау, деректерді төмен өлшемді кеңістікке сызықтық түрлендіруді жүзеге асырады, осылайша төмен өлшемді ұсынылымдағы деректердің дисперсиясы максималды болады. Іс жүзінде, деректердің ковариациялық (және кейде корреляциялық) матрицасы құрастырылады және осы матрицаның өзіндік векторлары есептеледі. Ең үлкен өзіндік мәндерге (негізгі компоненттерге) сәйкес келетін өзіндік векторларды бастапқы деректердің дисперсиясының үлкен бөлігін қайта құру үшін қолдануға болады. Бұдан әрі, алғашқы бірнеше өзіндік векторларды жүйенің ірі масштабты физикалық қасиеттері тұрғысынан түсіндіруге болады, себебі олар жүйенің энергиясының көп бөлігіне үлес қосады, әсіресе төмен өлшемді жүйелерде. Алайда, мұны әрбір жағдай бойынша жеке-жеке дәлелдеу қажет, өйткені барлық жүйелер осы қасиетті көрсетпейді. Бастапқы кеңістік (нүктелер санының өлшемімен) бірнеше өзіндік векторлармен құрылған кеңістікке дейін қысқартылды (деректердің жоғалуымен, бірақ маңызды дисперсияны сақтап қалуға тырыса отырып).

Теріс емес матрицаны факторлау (NMF)

NMF теріс емес матрицаны екі теріс емес матрицаның көбейтіндісіне жіктейді, бұл астрономия сияқты тек теріс емес сигналдар бар салаларда перспективалы құрал болып табылады. NMF Ли және Сынның көбейту арқылы жаңарту ережесі, құрылым құру кезіндегі тұрақты компоненттік база, тізбекті құрылым және сызықтық модельдеу процесі арқылы белгілі. Бұл тізбекті NMF Hessian LLE, Лапластың өзіндік карталары және тангенциалдық кеңістік талдау әдістерін қамтиды. Бұл техникалар деректердің жергілікті қасиеттерін сақтайтын шығын функциясын қолдана отырып, төмен өлшемді деректерді ұсынуды құрастырады және ядролық PCA үшін график негізіндегі ядроны анықтау ретінде қарастырылуы мүмкін. Жақында ғана, белгілі бір ядроны анықтаудың орнына, жартылай анықталған бағдарламалау арқылы ядроны үйренуге тырысатын әдістер ұсынылды. Мұндай техниканың ең көрнекті мысалы – максималды дисперсияны ашу (MVU). MVU-дың негізгі идеясы – ең жақын көршілер арасындағы барлық жұптық қашықтықты (ішкі өнім кеңістігінде) дәл сақтау, ал ең жақын көрші емес нүктелер арасындағы қашықтықты барынша арттыру. Көршіліктерді сақтаудың баламалы тәсілі – кіріс және шығыс кеңістіктеріндегі қашықтықтар арасындағы айырмашылықты өлшейтін шығын функциясын азайту болып табылады. Мұндай техникалардың маңызды мысалдары: классикалық көпөлшемді масштабтау, ол PCA-мен сәйкес келеді; Isomap, дерек кеңістігіндегі геодезиялық қашықтықты пайдаланады; дерек кеңістігіндегі диффузиялық қашықтықты пайдаланатын диффузиялық карталар; t-үлестірілген стохастикалық көршілік енгізу (t-SNE), нүктелер жұбы үшін үлестірімдер арасындағы айырмашылықты азайтады; және қисық сызықты компоненттік талдау. Сызықтық емес өлшемді азайтуға тағы бір көзқарас – автокодерлерді қолдану, яғни тұйықталған жасырын қабаты бар ерекше нейрондық желілер. Терең кодерлерді оқыту әдетте ашкөз қабатты алдын ала оқыту арқылы жүзеге асырылады (мысалы, шектелген Болцман машиналарының тізбегін пайдалану), содан кейін кері таратуға негізделген нақтылап баптау кезеңі жүргізіледі.

Сызықтық дискриминантты талдау (LDA)

Сызықтық дискриминантты талдау (СДА) – Фишердің сызықтық дискриминантының жалпыланған түрі. Бұл әдіс статистика, үлгілерді тану және машиналық оқыту салаларында қолданылады. Ол екі немесе одан көп объектілер немесе құбылыстар кластарын ерекшелейтін немесе сипаттайтын белгілердің сызықтық комбинациясын табуға мүмкіндік береді.

Жалпыланған дискриминантты талдау (GDA)

GDA ядролық функция операторын қолдана отырып, сызықтық емес дискриминантты талдаумен айналысады. Теориялық негізі қолдау векторлық машиналарға (SVM) жақын, себебі GDA әдісі кіріс векторларын жоғары өлшемді ерекшелік кеңістігіне бейімдейді. LDA сияқты, GDA-ның мақсаты – кластар аралық шашыраудың кластар ішіндегі шашырауға қатынасын максималдау арқылы ерекшеліктерді төмен өлшемді кеңістікке проекциялау болып табылады.

Автокодерлеу

Автокодерлерді сызықтық емес өлшемді азайту функцияларын және кодтамаларды, сонымен қатар кодтамадан бастапқы өрнекке кері функцияны бірге үйрену үшін қолдануға болады.

t-SNE

T үлестірілген стохастикалық көршілерді ендіру (t SNE) – жоғары өлшемді деректер жиынтығын визуализациялауға арналған сызықтық емес өлшемді азайту әдісі. Ол тығыздықтарды немесе қашықтықтарды жақсы сақтамайтындықтан, кластерлеу немесе аномалияларды анықтау сияқты талдауларда қолдануға ұсынылмайды.

UMAP

Бірыңғай көпқырлы жақындау және проекциялау (UMAP) — сызықтық емес өлшемділік азайту әдісі. Көрнеу жағынан ол t-SNE-ге ұқсас, бірақ деректер жергілікті байланысты Риман көпқырлысында біркелкі таралып, Риман метрикасы жергілікті тұрақты немесе шамамен жергілікті тұрақты деп есептеледі.

ПаCMAp

PaCMAp (Жұптық бақыланатын манифольд жақындауы) – визуализация үшін қолданылатын сызықтық емес өлшемділік азайту әдісі. Бес компонентті (жергілікті құрылымды сақтау, жаһандық құрылымды сақтау, параметрлерге сезімталдық, алдын ала өңдеуге сезімталдық және есептеу тиімділігі) ескере отырып, өлшемділікті азайту әдістерін жүйелі түрде бағалау, PaCMAp-тың жаһандық және жергілікті құрылымдарды жақсырақ сақтайтынын, сонымен қатар алдын ала өңдеуге азырақ сезімтал екенін көрсетті.

Өлшемін азайту

Жоғары өлшемді деректер жиынтықтары үшін (яғни, өлшемдер саны 10-нан асып кеткен жағдайда) K ең жақын көршілер алгоритмін (k NN) қолдану алдында өлшемді азайту, өлшемдік қарғыстың зиянды әсерінен сақтану үшін әдетте жасалады. Белгілерді іздеу және өлшемді азайту бір қадамда негізгі компоненттік талдау (PCA), сызықтық дискриминанттық талдау (LDA), каноникалық корреляциялық талдау (CCA) немесе теріс емес матрицалық факторлау (NMF) сияқты әдістерді алдын ала өңдеу ретінде біріктірілуі мүмкін, одан кейін азайтылған өлшемдік кеңістіктегі белгілер векторларында K NN арқылы кластерлеу жүргізіледі. Машиналық оқытуда бұл процесс төмен өлшемді енгізу деп те аталады. Өте жоғары өлшемді деректер жиынтықтары үшін (мысалы, тікелей бейне ағындары, ДНК деректері немесе жоғары өлшемді уақыт қатарларында ұқсастық іздеу кезінде) жергілікті сезімтал хэштеу, кездейсоқ проекция, "эскиздер" немесе VLDB конференциясының құралдар жинағынан басқа жоғары өлшемді ұқсастық іздеу әдістерін пайдаланып, жылдам шамамен K NN іздеуін жүргізу – жалғыз мүмкін шешім болуы мүмкін.

Қолданбалар

Нейробиологияда кейде қолданылатын өлшемді азайту әдісі – максималды ақпараттық өлшемдер, ол деректер жиынтығының бастапқы деректер туралы мүмкіндігінше көп ақпаратты сақтайтын төмен өлшемді ұсынысын табуға мүмкіндік береді.