Кіріспе
Телесериалдар
Уақыт бойынша дерек нүктелерінің тізбегі
Математикада, уақыт тізбегі – уақыт ретімен индекстелген (немесе тізімделген немесе графикте көрсетілген) дерек нүктелерінің тізбегі. Көбінесе, уақыт тізбегі – уақыт аралығында тең интервалмен алынған тізбек болып табылады. Осылайша, ол дискретті уақыт деректерінің тізбегі. Уақыт тізбегінің мысалдары – мұхит толқындарының биіктігі, күн дақтарының саны және Dow Jones Industrial Average индексінің күн сайынғы жабылу құны. Уақыт тізбегі көбінесе жүгіру графигі (уақыт бойынша сызық графигі) арқылы бейнеленеді. Уақыт тізбектері статистикада, сигналдарды өңдеуде, үлгілерді тануда, эконометрияда, математикалық қаржыда, ауа райын болжауда, жер сілкінісін болжауда, электроэнцефалографияда, басқару инженериясында, астрономияда, байланыс инженериясында және, жалпы алғанда, қолданбалы ғылым мен инженерияның кез келген саласында қолданылады, онда уақыт бойынша өлшемдер қатысты. Уақыт тізбегін талдау – деректердің мағыналы статистикалық көрсеткіштерін және басқа да сипаттамаларын алу үшін уақыт тізбегін талдау әдістерін қамтиды. Уақыт тізбегін болжау – бұрынғы байқауларға негізделген болашақ мәндерді болжау үшін модельді пайдалану. Регрессиялық талдау көбінесе бір немесе бірнеше уақыт тізбектері арасындағы байланыстарды тексеру үшін қолданылады, бірақ бұл талдау түрі әдетте «уақыт тізбегін талдау» деп аталмайды, ол бір тізбектегі әртүрлі уақыт нүктелері арасындағы байланыстарды білдіреді. Уақыт тізбегі деректерінің табиғи уақыт реті болады. Бұл уақыт тізбегін талдауды қималық зерттеулерден ерекшелендіреді, онда байқаулардың табиғи реті болмайды (мысалы, адамдардың жалақысын олардың білім деңгейімен байланысты түсіндіру, онда жеке тұлғалардың деректері кез келген тәртіппен енгізілуі мүмкін). Уақыт тізбегін талдау кеңістіктік деректерді талдаудан да ерекшеленеді, онда байқаулар әдетте географиялық орналасуларға қатысты (мысалы, үйлердің орналасуын және олардың ішкі сипаттамаларын ескере отырып үй бағаларын анықтау). Уақыт тізбегі үшін стохастикалық модель, әдетте, уақыт бойынша жақын орналасқан байқаулардың алыс орналасқан байқауларға қарағанда тығыз байланысты екенін көрсетеді. Сонымен қатар, уақыт тізбегі модельдері көбінесе уақыттың табиғи бір бағытты ретін пайдаланады, сондықтан белгілі бір кезеңдегі мәндер болашақ мәндерден гөрі өткен мәндерден туындайтын ретінде көрсетіледі (уақыттың кері қайтымдылығы). Уақыт тізбегін талдау нақты сандық, үздіксіз деректерге, дискретті сандық деректерге немесе дискретті символдық деректерге (яғни әріптер тізбегіне, мысалы, ағылшын тіліндегі әріптер мен сөздерге) қолданылуы мүмкін.
Талдау әдістері
Уақыт тізбектерін талдау әдістерін екі классқа бөлуге болады: жиілік доменді әдістер және уақыт доменді әдістер. Алғашқыларына спектрлік талдау және толқындық талдау жатады; соңғыларына автокорреляция және кросс-корреляциялық талдау жатады. Уақыт доменінде корреляциялық талдауды масштабталған корреляцияны қолдана отырып, сүзгіге ұқсас әдіспен жүргізуге болады, осы арқылы жиілік доменінде жұмыс істеу қажеттілігін азайтуға болады. Бұдан өзге, уақыт тізбектерін талдау техникаларын параметрлік және параметрлік емес әдістерге де бөлуге болады. Параметрлік тәсілдер негізгі тұрақты стохастикалық процестің белгілі бір құрылымы бар екенін қабылдайды, оны аз ғана параметрлерді пайдаланып сипаттауға болады (мысалы, авторегрессиялық немесе жылжымалы орташа модельді қолдану арқылы). Осы тәсілдердегі міндет – стохастикалық процесті сипаттайтын модельдің параметрлерін анықтау. Керісінше, параметрлік емес тәсілдер процесске ешқандай нақты құрылым тән емес деп есептей отырып, процесс ковариациясын немесе спектрін тікелей бағалайды. Уақыт тізбектерін талдау әдістерін сызықтық және сызықтық емес, сондай-ақ бір өзгермалы және көп өзгермалы түрлерге де бөлуге болады.
Панельдің деректері
Уақыт сериясы – панельдік деректердің бір түрі. Панельдік деректер – жалпы класс, көп өлшемді деректер жиынтығы, ал уақыт сериясы деректер жиынтығы – бір өлшемді панель (кесіндік деректер жиынтығы сияқты). Деректер жиынтығы панельдік деректер мен уақыт сериясы деректерінің ерекшеліктерін бірдей көрсетуі мүмкін. Бір дерек жазбасын екіншісінен ерекшелендіретін факторды анықтау қажет. Егер жауап уақыт деректері болса, онда бұл уақыт сериясы деректері жиынтығының үміткері. Егер бірегей жазбаны анықтау үшін уақыт деректері және уақытпен байланысы жоқ қосымша идентификатор қажет болса (мысалы, студенттік билет нөмірі, акция таңбасы, ел коды), онда бұл панельдік деректерге үміткер. Егер ерекшелендіру уақыт емес идентификаторға байланысты болса, онда деректер жиынтығы кесіндік деректер жиынтығының үміткері болып табылады.
Талдау
Уақыт қатарлары үшін бірнеше түрлі мотивация және деректерді талдау әдістері бар, олардың әрқайсысы әртүрлі мақсаттарға қолданылады.
Мотивация
Статистика, эконометрия, сандық қаржы, сейсмология, метеорология және геофизика салаларында уақыт қатарларын талдаудың басты мақсаты – болжам жасау. Сигналды өңдеу, басқару инженериясы және коммуникация инженериясы салаларында ол сигналды анықтау үшін қолданылады. Басқа қолданыстар деректерді өндіру, үлгілерді тану және машиналық оқыту салаларында кездеседі, онда уақыт қатарларын талдау топтастыру, жіктеу, мазмұны бойынша іздеу, аномалияларды анықтау, сондай-ақ болжам жасау үшін пайдаланылуы мүмкін.
Бұрыштық орнату
Көгерісті сәйкестендіру – бұл қисық немесе математикалық функция құру процесі, ол деректер тізбегіне ең жақсы сәйкес келеді, мүмкін шектеулерге бағынады. Көгерісті сәйкестендіру интерполяцияны қамтиды, онда деректерге нақты сәйкес келу қажет, немесе тегістеуді, онда деректерге шамамен сәйкес келетін «тегіс» функция құрылады. Бұл тақырыпқа байланысты регрессиялық талдау, ол деректердегі қисықтың қаншалықты белгісіз екендігі сияқты статистикалық қорытындыларға көбірек назар аударады, бұл деректер кездейсоқ қателермен байқалғанда. Сәйкестендірілген қисықтар деректерді визуализациялауға көмектеседі, деректер жоқ жерде функцияның мәнін болжауға және екі немесе одан көп айнымалы арасындағы байланысты анықтауға пайдалы. Экстраполяция – бұл байқалған деректердің шегінен тыс қолданылатын қисықтарды пайдалану, ол белгілі бір дәрежеде белгісіздікке ұшырайды, себебі ол қисықты құру әдісін де, байқалған деректерді де көрсете алады. Көлемі үлкейетін процестер үшін, оң жақтағы суреттегі қисықтардың бірі (және тағы басқалары) олардың параметрлерін бағалау арқылы сәйкестендірілуі мүмкін. Экономикалық уақыт тізбегін құру алдыңғы және кейінгі мерзімдердегі мәндер («эталондық көрсеткіштер») арасында интерполяция арқылы кейбір компоненттерді бағалауды қамтиды. Интерполяция – екі белгілі шаманың арасындағы белгісіз шаманы бағалау (тарихи деректер) немесе қолда бар ақпараттан жоқ ақпарат туралы қорытынды жасау («қатарлар арасында оқу»). Интерполяция, егер деректердің жоқ бөлігінің айналасындағы деректер бар болса және оның тенденциясы, маусымдығы және ұзақ мерзімді циклдары белгілі болса, пайдалы. Бұл көбінесе барлық қажетті күндер үшін белгілі байланысты тізбектерді пайдалану арқылы жасалады. Полиномдық интерполяция немесе сплайндық интерполяция қолданылады, егер бөліктелген полиномдық функциялар уақыт аралықтарына сәйкес келсе және олар бір-біріне тегіс түйіскен болса. Интерполяциямен тығыз байланысты басқа да мәселе – күрделі функцияны қарапайым функциямен (сонымен қатар регрессия деп те аталады) жуықтау. Регрессия мен интерполяцияның басты айырмашылығы – полиномдық регрессия бүкіл деректер жиынтығын модельдейтін жалғыз полиномды береді. Ал сплайндық интерполяция деректер жиынтығын модельдеу үшін көптеген полиномдардан тұратын бөліктелген үздіксіз функцияны береді. Экстраполяция – бұл бастапқы бақылау шегінен тыс, екінші айнымалымен байланысы негізінде айнымалының мәнін бағалау процесі. Бұл интерполяцияға ұқсас, ол белгілі бақылаулар арасындағы бағалауларды жасайды, бірақ экстраполяция үлкен белгісіздікке және мағынасыз нәтижелерді тудыру қаупіне ұшырайды.
Функцияның шамалауы
Жалпы, функцияны шамалау мәселесі бізден белгілі бір тапсырма бойынша мақсатты функцияға жақын ("шамалайтын") жақсы анықталған сыныптан функцияны таңдауды талап етеді. Функцияны шамалау мәселелерінің екі негізгі класын ажыратуға болады: Біріншіден, белгілі мақсатты функциялар үшін, шамалау теориясы – сандық талдаудың бір саласы болып табылады, ол белгілі функциялардың (мысалы, арнайы функциялар) функцияның белгілі бір класы (мысалы, полиномдар немесе рационалды функциялар) арқылы қалай шамаланатынын зерттейді, олар көбінесе қажетті қасиеттерге ие (арзан есептеу, үздіксіздік, интеграл және лимит мәндері және т.б.). Екіншіден, мақсатты функция, оны g деп атайық, белгісіз болуы мүмкін; нақты формуланың орнына (x, g(x)) түріндегі нүктелер жиынтығы (уақыт қатары) ғана беріледі. g доменінің және кодоменінің құрылысына байланысты, g-ні шамалау үшін бірнеше техника қолданылуы мүмкін. Мысалы, егер g нақты сандардағы операция болса, интерполяция, экстраполяция, регрессиялық талдау және қисыққа сәйкестендіру техникаларын қолдануға болады. Егер g кодоменасы (аймағы немесе мақсатты жиынтығы) шекті жиын болса, онда классификация мәселесі қарастырылады. Онлайн уақыт қатарын шамалаумен байланысты мәселе – деректерді бір рет қарап шығып, ең нашар жағдайдағы қателік шегімен уақыт қатары сұраныстарын қолдайтын шамалауды құру. Біршама көлемде, әртүрлі мәселелер (регрессия, классификация, сәйкестік шамалау) статистикалық оқыту теориясында біртұтас қарастырылады, онда олар қадағаланған оқу мәселелері ретінде қарастырылады.
Жіктеу
Уақыт сериясының үлгісін нақты бір санатқа жатқызу, мысалы, қол қимылының тізбегі арқылы есімдер тіліндегі сөзді анықтау.
Сигналды бағалау
Бұл тәсіл гармоникалық талдауға және жиілік доменіндегі сигналдарды Фурье трансформациясын қолданып сүзгілеуге, сондай-ақ спектралдық тығыздықты бағалауға негізделген. Бұл әдісті математик Норберт Винер, электр инженерлері Рудольф Э. Кальман, Денис Габор және тағы басқалар екінші дүниежүзілік соғыс кезінде шудан сигналдарды сүзгілеу және белгілі бір уақытта сигнал мәндерін болжау мақсатында едәуір дамытты. Калман сүзгісі, Бағалау теориясы және Цифрлық сигнал өңдеу туралы көріңіз.
Сегменттеу
Уақыт тізбесін сегменттер тізбегіне бөлу. Көп жағдайда уақыт тізбесін әрқайсысының өзіндік ерекшеліктері бар жеке сегменттердің тізбегі ретінде бейнелеуге болады. Мысалы, конференция қоңырауынан алынған аудиосигналды әр адам сөйлеген сәттерге сәйкес келетін бөліктерге бөлуге болады. Уақыт тізбесін сегментациялаудың мақсаты – уақыт тізбесіндегі сегмент шекараларын анықтау және әр сегментке тән динамикалық қасиеттерді сипаттау болып табылады. Бұл мәселені өзгеріс нүктелерін анықтау арқылы немесе уақыт тізбесін Марков секірулі сызықтық жүйе сияқты күрделі жүйе ретінде модельдеу арқылы шешуге болады.
Келесі уақыт сериясын кластерлеу
Кейінгі уақыт сериясын кластерлеу, жылжымалы терезелермен бөліктеу арқылы ерекшеліктерді іздеу нәтижесінде тұрақсыз (кездейсоқ) кластерлерге алып келді. Кластер орталықтарының (кластердегі уақыт серияларының орташасы, өзі де уақыт сериясы) кез келген ығысқан синусоидалық үлгіні (деректер жиынтығына қарамастан, тіпті кездейсоқ серуеннің іске асырылуында да) қабылдайтыны анықталды. Бұл табылған кластер орталықтары деректер жиынтығын сипаттамайтынын білдіреді, себебі кластер орталықтары әрқашан өкілдік емес синусоидалық толқындар болып табылады.
Модельдер
Уақыт сериясы деректерінің модельдері көптеген формаларға ие болуы мүмкін және әр түрлі стохастикалық процестерді көрсетеді. Процесс деңгейіндегі өзгерістерді модельдеу кезінде үш маңызды класс – авторегрессивті (AR) модельдер, интеграцияланған (I) модельдер және жылжымалы орташа (MA) модельдер. Бұл үш класс алдыңғы деректер нүктелеріне сызықтық түрде тәуелді. Осы идеялардың үйлесімі авторегрессивті жылжымалы орташа (ARMA) және авторегрессивті интеграцияланған жылжымалы орташа (ARIMA) модельдерін тудырады. Авторегрессивті фракциялық интеграцияланған жылжымалы орташа (ARFIMA) моделі бұл үш модельді жалпылайды. Векторлық мәнді деректерді өңдеуге арналған осы класс модельдерінің кеңейтімдері көпөлшемді уақыт сериясы модельдері ретінде қолжетімді, ал кейде бұрынғы аббревиатуралар «вектор» деген мағынаны білдіретін бастапқы «V» әрпімен толықтырылады, мысалы, VAR – векторлық авторегрессия үшін. Бұл модельдердің қосымша кеңейтімдері байқалатын уақыт сериясы кейбір «күш түсіретін» уақыт сериясымен (байқалатын серияға себептік әсері болмауы мүмкін) басқарылатын жағдайларда қолдануға болады: көпөлшемді жағдайдан айырмашылығы – күш түсіретін серия детерминистік немесе тәжірибешінің бақылауында болуы мүмкін. Мұндай модельдер үшін аббревиатуралар «сыртқы» деген мағынаны білдіретін соңғы «X» әрпімен толықтырылады. Серия деңгейінің алдыңғы деректер нүктелеріне сызықтық емес тәуелділігі қызығушылық тудырады, әсіресе хаотикалық уақыт сериясын жасау мүмкіндігіне байланысты. Алайда, одан да маңыздысы, эмпирикалық зерттеулер сызықтық емес модельдерден алынған болжамдардың сызықтық модельдерден алынған болжамдардан артық екенін көрсетуі мүмкін, мысалы, сызықтық емес авторегрессивті сыртқы модельдерде. Сызықтық емес уақыт сериясын талдау бойынша қосымша сілтемелер: (Кантц және Шрайбер) және (Абарбанел). Сызықтық емес уақыт сериясы модельдерінің басқа түрлерінің арасында уақыт өте келе дисперсияның өзгеруін көрсететін модельдер де бар (гетероскедастичность). Бұл модельдер авторегрессивті шартты гетероскедастикалық (ARCH) модельдерін және олардың кең ауқымын қамтиды (GARCH, TARCH, EGARCH, FIGARCH, CGARCH және т.б.). Мұнда өзгермеліліктің өзгеруі байқалатын тізбектің соңғы өткен мәндерімен байланысты немесе олармен болжанады. Бұл жергілікті өзгермеліліктің басқа да мүмкін бейнелеулерінен өзгеше, онда өзгермелілік екі есе стохастикалық модельдегідей, бөлек уақыт өзгермелі процесспен басқарылатын ретінде модельденеді. Модельсіз талдаулар бойынша жақындағы жұмыстарда толқындық трансформацияға негізделген әдістер (мысалы, жергілікті стационарлық толқындықтар және толқындық бөлшектенген нейрондық желілер) кең таралды. Көп масштабты (көбінесе көп ажыратымдылық деп аталады) әдістер белгілі бір уақыт сериясын бөлшектейді, уақыт тәуелділігін бірнеше масштабта көрсетуге тырысады. Тұрақсыздықтың эволюциясын модельдеу үшін Марковтың көпфракталды ауысу (MSMF) әдістерін де қараңыз. Жасырын Марков моделі (ЖММ) – модельделетін жүйе байқалмаған (жасырын) күйлері бар Марков процесі деп есептелетін статистикалық Марков моделі. ЖММ ең қарапайым динамикалық Байес желісі ретінде қарастырылуы мүмкін. ЖММ модельдері сөйлеуді тануда, айтылған сөздердің уақыт сериясын мәтінге аудару үшін кеңінен қолданылады. Бұл модельдердің көптеген түрлері sktime Python пакетіне жинақталған.
Among other types of non linear time series models, there are models to represent the changes of variance over time (heteroskedasticity). These models represent autoregressive conditional heteroskedasticity (ARCH) and the collection comprises a wide variety of representation (GARCH, TARCH, EGARCH, FIGARCH, CGARCH, etc.). Here changes in variability are related to, or predicted by, recent past values of the observed series. This is in contrast to other possible representations of locally varying variability, where the variability might be modelled as being driven by a separate time varying process, as in a doubly stochastic model. In recent work on model free analyses, wavelet transform based methods (for example locally stationary wavelets and wavelet decomposed neural networks) have gained favor. Multiscale (often referred to as multiresolution) techniques decompose a given time series, attempting to illustrate time dependence at multiple scales. See also Markov switching multifractal (MSMF) techniques for modeling volatility evolution. A hidden Markov model (HMM) is a statistical Markov model in which the system being modeled is assumed to be a Markov process with unobserved (hidden) states. An HMM can be considered as the simplest dynamic Bayesian network. HMM models are widely used in speech recognition, for translating a time series of spoken words into text. Many of these models are collected in the python package sktime.