Кіріспе

Функционалдық деректерді талдау (ФДТА) – қисықтар, беттер немесе үздіріссіз өзгеретін кез келген нәрсе туралы ақпарат беретін статистика саласы. ФДТА аясында функционалдық деректердің әрбір элементі кездейсоқ функция деп қарастырылады. Бұл функциялар анықталатын физикалық континуум көбінесе уақыт, бірақ сондай-ақ кеңістіктік орналасқан жер, толқын ұзындығы, ықтималдық сияқты да болуы мүмкін. Ішкі мәні бойынша функционалдық деректер шексіз өлшемді. Бұл деректердің жоғары ішкі өлшемділігі теория және есептеулер үшін қиындықтар тудырады, бұл қиындықтар функционалдық деректердің қалай алынғанына байланысты өзгереді. Алайда, деректердің жоғары немесе шексіз өлшемді құрылымы – ақпараттың бай көзі және зерттеулер мен деректерді талдау үшін көптеген қызықты мәселелер бар.

Тарих

Функционалдық деректерді талдаудың тамыры 1940-1950 жылдарға, Гренандер мен Кархуненнің жұмысына дейін жетеді. Олар квадраттық интегралданатын үздіксіз уақыттық стохастикалық процестің өзіндік компоненттерге жіктелуін қарастырды, бұл қазір Кархунен-Лоев жіктелуі деп аталады. Функционалдық бас компоненттерді талдаудың қатаң талдауы 1970-ші жылдары Клефф, Доксои және Пусс жасады, олар өздік мәндердің асимптотикалық таралуы туралы нәтижелерді де қамтыды. Жақында, 1990-шы және 2000-ші жылдары, бұл сала тығыз және сирек бақылау схемаларының әсерін түсінуге және қолдануға көбірек назар аударды. "Функционалдық деректерді талдау" терминін Джеймс О. Рамсей енгізді.

Математикалық формализм

Кездейсоқ функцияларды гильберт кеңістігіндегі мәндерді қабылдайтын кездейсоқ элементтер ретінде немесе стохастикалық процесс ретінде қарастыруға болады. Біріншісі математикалық жағынан ыңғайлырақ, ал екіншісі қолданбалы тұрғыдан көбірек қолайлы. Егер кездейсоқ функциялар үздіксіз болса және орташа квадраттық үздіксіздік шарты орындалса, осы екі тәсіл сәйкес келеді.

Хилберттік кездейсоқ айнымалылар

Гильберт кеңістігі тұрғысынан, мәнді кездейсоқ элемент қарастырылады, мұнда – квадраттық интегралданатын функциялар кеңістігі сияқты бөлінетін Гильберт кеңістігі. интегралдану шарты орындалғанда, ортасы элементі ретінде анықталады, ол келесі теңдеуді қанағаттандырады:

Бұл формулировка Петис интегралы болып табылады, бірақ ортасы Бохнер интегралы ретінде де анықталуы мүмкін. шектеулі болғанда, кездейсоқ элементтің ковариация операторы – келесі қатынас бойынша бірегей түрде анықталатын сызықтық оператор:

немесе, тензорлық формада, . Спектрлік теорема келесідей Карунен-Лоэве декомпозициясы арқылы жіктеуге мүмкіндік береді:

мұнда – операторының өзіндік векторлары, олар операторының оң және теріс емес өзіндік мәндеріне сәйкес келеді және кемімейтін тәртіппен орналасқан. Бұл шексіз қатарды шекті ретке дейін қысқарту функционалдық негізгі компоненттерді талдаудың негізін құрайды.

Функционалдық деректер жобалары

Функционалдық деректер – орташа функциясы және ковариациялық функциясы бар, шектелген және жабық аралықтағы стохастикалық процестің іске асырылуы ретінде қарастырылады. І-ші қатысушы үшін процестің іске асырылуы , ал сынама тәуелсіз қатысушылардан тұрады деп есептеледі. Сынама алу кестесі қатысушылар арасында өзгеруі мүмкін, бұл І-ші қатысушы үшін деп белгіленеді. Сәйкес І-ші өлшем деп белгіленеді, мұндағы . Бұған қоса, өлшемдеріндегі қателіктер деп қарастырылады, мұндағы және , олар бір-бірінен тәуелсіз.

Функционалдық негізгі компонентті талдау

Функционалдық негізгі компоненттік талдау (ФНКТ) – FDA-да ең көп қолданылатын құрал, себебі ФНКТ мұндай шексіз өлшемді функционалдық деректерді ұпайлардың шекті өлшемді кездейсоқ векторына дейін азайтуға мүмкіндік береді. Нақтырақ айтқанда, өлшемді азайту, байқалатын кездейсоқ траекторияларды функционалдық негізде кеңейту арқылы жүзеге асырылады, бұл негіз Хилберт кеңістігіндегі компакт оператор болып табылатын ковариация операторының өзіндік функцияларынан тұрады. Ковариация операторын қарастырайық, ол Мерсер теоремасы бойынша, ковариация функциясының ядросы спектрлік жіктелуге ие, мұнда қатарлардың жуықтасуы абсолютті және біркелкі, ал – сәйкес ортонормалды өзіндік функциялары бар, кему ретімен орналасқан нақты, теріс емес өзіндік мәндер. Кархунен-Лоев теоремасы бойынша, жатқан кездейсоқ траекторияның ФНКТ кеңейтімі , мұнда – функционалдық негізгі компоненттер (ФНК), кейде ұпайлар деп те аталады. Кархунен-Лоев кеңейтімі өлшемді азайтуға көмектеседі, себебі ішінара қосынды біркелкі жуықтасады, яғни, жеткілікті үлкен болғанда, ішінара қосынды шексіз қосындыға жақын мән береді. Осылайша, ақпараты шексіз өлшемнен өлшемдік векторға дейін азайтылады, ал жуықталған процесс мынадай болады: Басқа танымал негіздерге сплайн, Фурье қатарлары және толқындық негіздер жатады. ФНКТ-ның маңызды қолданыстары – өзгеріс режимдері және функционалдық негізгі компоненттік регрессия.

Функционалдық сызықтық регрессия модельдері

Функционалдық сызықтық модельдерді векторлық жауаптарды векторлық ковариаттармен байланыстыратын дәстүрлі көпөлшемді сызықтық модельдердің кеңейтілген түрі деп қарастыруға болады. Скалярлық жауап және векторлық ковариаты бар дәстүрлі сызықтық модельді былай жазуға болады: , мұнда Евклид кеңістігіндегі ішкі көбейтуді, – регрессия коэффициенттерін, ал – нөлдік орташасы және шекті дисперсиясы бар кездейсоқ қателік (шу) белгілейді. Жауаптарына қарай функционалдық сызықтық модельдерді екі түрге бөлуге болады.

Скалярлық жауаппен функционалдық регрессия модельдері

Векторлық ковариата мен коэффициент векторын модельде орталықтандырылған функционалдық ковариатамен және Хилберт кеңістігіндегі коэффициент функциясымен алмастырып, Эвклид кеңістігіндегі ішкі көбейтіндіні Хилберт кеңістігіндегіге ауыстырса, функционалдық сызықтық модельге келіп тірелесіз. Жақсырақ функционалдық сызықтық модельді бірнеше функционалдық ковариаталарға, сондай-ақ қосымша векторлық ковариаталарға, мұнда , кеңейтуге болады, онда - ковариаталардың регрессиялық коэффициенті, -нің домені , - орталықтандырылған функционалдық ковариата болып табылады, ал - ковариаталар үшін регрессиялық коэффициент функциясы. Модельдер мен кеңінен зерттелді.

Функционалдық жауаппен функционалдық регрессия модельдері

Функционалдық жауапты және бірнеше функционалдық ковариаттарды –ті қарастырайық. Бұл жағдайда екі маңызды модель қарастырылды.

Скалярлық функция бойынша регрессия

Әсіресе, тұрақты функция ретінде қарастырса, функционалдық жауаптар мен скалярлық ковариаттарға ие функционалдық сызықтық модельдің ерекше жағдайы пайда болады.

Бір мезгілдегі регрессиялық модельдер

Бұл модель мына түрде беріледі, мұнда – функциялық ковариаттар, – сол интервалда анықталған коэффициенттік функциялар, ал – әдетте орташасы нөл және шекті дисперсиясы бар кездейсоқ процесс деп есептеледі.

Функционалдық сызықтық емес регрессия модельдері

Классикалық функционалдық сызықтық регрессия модельдерінің (FLM) тікелей сызықтық емес кеңейтулері әлі де сызықтық болжамды қамтиды, бірақ оны сызықтық емес байланыс функциясымен біріктіреді, бұл дәстүрлі сызықтық модельдің жалпыланған сызықтық моделі идеясына ұқсас. Функционалдық деректер үшін толық бейпараметрлік регрессиялық модельдерді дамыту өлшемділік қарғысы сияқты проблемаларға кезеседi. "Қарғысты" және метрикалық таңдау проблемасын айналып өту үшін біз кейбір құрылымдық шектеулерге бағынған, бірақ икемділікті шектен тыс бұзбаған сызықтық емес функционалдық регрессия модельдерін қарастыруға бейімбіз. Конвергенцияның полиномдық деңгейін сақтайтын, сонымен қатар функционалдық сызықтық модельдерге қарағанда икемдірек модельдер қажет. Мұндай модельдер функционалдық сызықтық модельдің диагностикасы нашар сәйкестікті көрсеткенде, яғни нақты өмірде жиі кездесетін жағдайларда ерекше пайдалы. Атап айтқанда, функционалдық полиномдық модельдер, функционалдық бір және көп индекстік модельдер, сондай-ақ функционалдық аддитивті модельдер – функционалдық сызықтық емес регрессия модельдерінің үш арнайы түрі болып табылады.

Функционалдық полиномиалдық регрессия модельдері

Функционалдық полиномиялық регрессия модельдерін скалярлық жауаптары бар функционалдық сызықтық модельдердің (FLM) табиғи кеңейтілуі ретінде қарастыруға болады, бұл сызықтық регрессия моделін полиномиялық регрессия моделіне кеңейтуге ұқсас. Скалярлық жауап пен функционалдық ковариант үшін, доменімен және сәйкес ортақталған болжау процестері үшін, функционалдық полиномиялық регрессия модельдері отбасының ең қарапайым және ең маңызды мүшесі квадраттық функционалдық регрессия болып табылады, ол келесідей берілген, мұнда – ортақталған функционалдық ковариант, – скалярлық коэффициент, ал – домендері мен болатын коэффициенттік функциялар. Жоғарыда көрсетілген функционалдық квадраттық регрессия моделі FLM-мен ортақ β параметрлік функциядан басқа, γ параметрлік бетін де қамтиды. Скалярлық жауаптары бар FLM-ге ұқсастығы бойынша, функционалдық полиномиялық модельдерді бағалау үшін ортақталған ковариантты және коэффициенттік функцияларды ортонормальды негізде кеңейту қолданылады.

Функционалдық бір және бірнеше индекстік модельдер

Функционалдық бірнеше индекс моделі төменде көрсетілген, символдар бұрын сипатталғандай қалыпты мағыналарын сақтайды. Мұнда g – p өлшемді доменде анықталған (белгісіз) жалпы тегіс функцияны білдіреді. жағдайы функционалдық бір индекстік модельге алып келеді, ал бірнеше индекстік модельдер жағдайға сәйкес келеді. Дегенмен, , өлшемдік қарғыстың салдарынан бұл модель қиындықтар тудырады. және үлгілердің салыстырмалы түрде шағын саны болғанда, осы модельден алынған бағалаушы көбінесе жоғары дисперсияға ие болады.

Функционалдық қосымша модельдер (ФАМ)

Берілген ортонормальдық негізде , біз доменде кеңейте аламыз. Скалярлық жауаптары бар функционалдық сызықтық модель (қараңыз) мына түрде жазылуы мүмкін: FAM-нің бір түрі жоғарыдағы өрнектегі -тің сызықтық функциясын (яғни, ) жалпы тегіс функциямен ауыстыру арқылы алынады, бұл көптік сызықтық регрессия модельдерінің қосымша модельдерге кеңейтілуіне ұқсас, және былай өрнектеледі: мұнда , үшін қанағаттандырады, яғни, екі айнымалы тегіс қосымша бет үшін, сәйкестікті қамтамасыз ету үшін барлық үшін қанағаттандыруы керек.

Функционалдық деректерді кластерлеу және жіктеу

Векторлық бағаланған көпөлшемді деректер үшін k-бөлу әдістері және иерархиялық кластерлеу – екі негізгі тәсіл. Векторлық бағаланған көпөлшемді деректерге арналған кластерлеудің классикалық ұғымдары функционалдық деректерге дейін кеңейтілді. Функционалдық деректерді кластерлеу үшін k-кластерлеу әдістері иерархиялық кластерлеу әдістерінен гөрі жиі қолданылады. k-кластерлеуде функционалдық деректерде орташа функциялар әдетте кластер орталықтары ретінде қарастырылады. Ковариациялық құрылымдар да ескеріледі. k-түріндегі кластерлеуден басқа, аралас модельдерге негізделген функционалдық кластерлеу векторлық бағаланған көпөлшемді деректерді кластерлеуде де кеңінен қолданылады және функционалдық деректерді кластерлеуге дейін кеңейтілді. Сонымен қатар, Байестік иерархиялық кластерлеу модельге негізделген функционалдық кластерлеуді дамытуда маңызды рөл атқарады. Функционалдық жіктеу жаңа дерек нысанына функционалдық регрессия немесе функционалдық дискриминанттық талдау негізінде топқа жататындығын анықтайды. Функционалдық регрессиялық модельдерге негізделген функционалдық деректерді жіктеу әдістері жауап ретінде сынып деңгейлерін, ал болжаушы ретінде байқалған функционалдық деректерді және басқа ковариаттарды пайдаланады. Регрессияға негізделген функционалдық жіктеу модельдері үшін функционалдық жалпыланған сызықтық модельдер немесе нақтырақ айтқанда, функционалдық бинарлық регрессия, мысалы, екілік жауаптар үшін функционалдық логистикалық регрессия, жиі қолданылатын жіктеу тәсілдері болып табылады. Жалпы алғанда, FPCA әдісіне негізделген жалпыланған функционалдық сызықтық регрессия моделі қолданылады. Функционалдық сызықтық дискриминанттық талдау (FLDA) функционалдық деректерді жіктеу әдісі ретінде қарастырылды. Тығыздық қатынастарын қолданатын функционалдық деректерді жіктеу де ұсынылған. Ұсынылған жіктеуіштердің үлкен үлгідегі асимптотикалық мінез-құлқын зерттеу көрсеткендей, белгілі бір шарттарда қате жіктеу деңгейі нөлге жақындайды, бұл құбылыс «мүкемел жіктеу» деп аталады.

Көңіл көтеру

Амплитуданың өзгеруінен басқа, функционалдық деректерде уақыттың өзгеруі де болуы мүмкін. Уақыттың өзгеруі белгілі бір қызығушылық тудыратын оқиғалардың субъектіге тән уақыты субъектілер арасында өзгеше болғанда пайда болады. Классикалық мысал – Беркли өсу зерттеу деректері, онда амплитуданың өзгеруі – өсу жылдамдығы, ал уақыттың өзгеруі балалардың жасөспірімдікке және жасөспірімдікке дейінгі өсу қарқынына жететін биологиялық жасының айырмашылығын түсіндіреді. Уақыттың өзгеруі болған жағдайда, қималық орташа функция тиімді бағалау болып табылмайды, себебі шыңдар мен төмендіктер кездейсоқ орналасқандықтан мағыналы сигналдар бұрмаланып немесе жасырылуы мүмкін. Уақытты бүкілдету, сондай-ақ қисықтарды тіркеу, қисықтарды сәйкестендіру немесе уақытты синхрондау деп те аталады, амплитуданың және уақыттың өзгеруін анықтау және бөлу мақсатын қояды. Егер уақыт пен амплитуданың өзгеруі болса, байқалатын функционалдық деректерді былай модельдеуге болады , мұнда – жасырын амплитуда функциясы, ал – жиынтық үлестіру функциясына сәйкес келетін жасырын уақытты бүкілдету функциясы. Уақытты бүкілдету функциялары инвертирленеді және келесі шартты қанағаттандырады деп есептеледі. Фазалық өзгеруді көрсету үшін бүкілдету функцияларының отбасының ең қарапайым жағдайы – сызықтық түрлендіру, яғни , ол негізгі үлгі функциясының уақытын субъектіге тән ығысу мен масштабқа ұшыратады. Бүкілдету функцияларының жалпы класына доменнің өзіне диффеоморфизмдері кіреді, яғни, кең мағынада айтқанда, компакт доменді өзіне бейнелейтін инвертирленеді функциялар класы, сондықтан функция да, оның кері функциясы да тегіс болады. Сызықтық түрлендірулер жиынтығы диффеоморфизмдер жиынтығына кіреді. Уақытты бүкілдетудегі бір қиындық – амплитуда мен фазалық өзгеруді анықтау. Бұл анықталмауды жою үшін нақты болжамдар қажет.

Әдістер

Бұрынғы тәсілдердің қатарында динамикалық уақыт бүгілу (DTW) бар, ол сөйлеуді тану сияқты қолданыстарда қолданылады. Уақытты бүгілудің тағы бір дәстүрлі әдісі – ерекше нүктелерді тіркеу, ол ең биік нүктелер сияқты ерекше белгілерді орташа нүктеге сәйкестендіреді. Басқа да тиісті бүгілу әдістеріне жұптық бүгілу және қашықтықты қолдана отырып тіркеу кіреді.

Динамикалық уақыт бүгілуі

Үлгі функциясы итерациялық процесс арқылы анықталады, қиманың орташа мәнінен басталып, тіркеу жасалып, деформацияланған қисықтар үшін қиманың орташа мәні қайта есептелінеді. Бірнеше итерациядан кейін сәйкестік күтіледі. DTW динамикалық бағдарламалау арқылы шығын функциясын азайтады. DTW-дегі тегіс емес дифференциалданатын деформациялар немесе ашкөз есептеу мәселелері шығын функциясына реттеу мүшесін қосу арқылы шешілуі мүмкін.

Белгілерді тіркеу

Белгілерді тіркеу (немесе ерекшеліктерді сәйкестендіру) барлық үлгі қисықтарында анық көрінетін ерекшеліктер бар екенін болжайды және мұндай ерекшеліктердің орналасуын «алтын стандарт» ретінде пайдаланады. Функциялардың немесе туындыларының жоғары нүктелері немесе төмен нүктелері сияқты арнайы ерекшеліктер үлгі функциясындағы орташа орналасуларымен сәйкестендіріледі.