Введение

Временные ряды

Последовательность точек данных во времени

В математике временной ряд — это последовательность точек данных, индексированных (или перечисленных, или представленных графически) в хронологическом порядке. Чаще всего временной ряд представляет собой последовательность, полученную в последовательные моменты времени с равными интервалами. Таким образом, это последовательность дискретных временных данных. Примерами временных рядов служат высоты океанских приливов, количество солнечных пятен и ежедневное значение закрытия индекса Dow Jones Industrial Average. Временные ряды очень часто отображаются с помощью линейных графиков (временных диаграмм). Временные ряды используются в статистике, обработке сигналов, распознавании образов, эконометрике, математических финансах, прогнозировании погоды, прогнозировании землетрясений, электроэнцефалографии, управлении техническими системами, астрономии, коммуникационной инженерии и, в целом, в любой области прикладной науки и инженерии, связанной с измерениями, зависящими от времени. Анализ временных рядов включает методы анализа данных временных рядов для извлечения значимой статистики и других характеристик данных. Прогнозирование временных рядов — это использование модели для предсказания будущих значений на основе ранее наблюдаемых значений. Хотя регрессионный анализ часто применяется для проверки взаимосвязей между одним или несколькими различными временными рядами, этот тип анализа обычно не называется «анализом временных рядов», который относится, в частности, к взаимосвязям между различными моментами времени в рамках одного ряда. Данные временных рядов имеют естественный временной порядок. Это отличает анализ временных рядов от поперечных исследований, в которых отсутствует естественная упорядоченность наблюдений (например, объяснение заработной платы людей в зависимости от их уровня образования, где данные об отдельных людях могут быть введены в любом порядке). Анализ временных рядов также отличается от пространственного анализа данных, где наблюдения обычно относятся к географическим местоположениям (например, учет цен на жилье с учетом местоположения и внутренних характеристик домов). Стохастическая модель для временного ряда обычно отражает тот факт, что наблюдения, близкие по времени, будут более тесно связаны, чем наблюдения, расположенные на большем расстоянии друг от друга. Кроме того, модели временных рядов часто используют естественный однонаправленный порядок времени, так что значения для данного периода будут определяться, в той или иной степени, прошлыми значениями, а не будущими (см. обратимость во времени). Анализ временных рядов может применяться к данным вещественных чисел, непрерывным данным, дискретным числовым данным или дискретным символическим данным (то есть к последовательностям символов, таким как буквы и слова в английском языке).

Методы анализа

Методы анализа временных рядов можно разделить на два класса: методы частотной области и методы временной области. Первые включают спектральный анализ и вейвлет-анализ, а вторые – автокорреляцию и кросс-корреляционный анализ. Во временной области корреляционный анализ может выполняться подобно фильтрации с использованием масштабированной корреляции, что снижает необходимость перехода в частотную область. Кроме того, методы анализа временных рядов можно разделить на параметрические и непараметрические. Параметрические подходы исходят из предположения, что лежащий в основе стационарный стохастический процесс имеет определенную структуру, которую можно описать небольшим количеством параметров (например, с помощью авторегрессионной или модели скользящего среднего). В этих подходах задача состоит в оценке параметров модели, описывающей стохастический процесс. В отличие от них, непараметрические подходы явно оценивают ковариацию или спектр процесса, не предполагая при этом какой-либо конкретной структуры процесса. Методы анализа временных рядов также можно классифицировать как линейные и нелинейные, а также как унивариантные и многовариантные.

Данные панели

Временной ряд – один из видов панельных данных. Панельные данные представляют собой общий класс, многомерный набор данных, в то время как набор данных временного ряда – это одномерная панель (как и поперечные данные). Набор данных может обладать характеристиками как панельных, так и временных рядов. Один из способов определить это – спросить, что делает каждую запись данных уникальной по сравнению с другими. Если ответ – поле данных о времени, то это потенциальный набор временных рядов. Если для определения уникальной записи требуется поле данных о времени и дополнительный идентификатор, не связанный со временем (например, идентификатор студента, тикер акции, код страны), то это потенциальный набор панельных данных. Если различие основано на идентификаторе, не связанном со временем, то набор данных является потенциальным набором поперечных данных.

Анализ

Для временных рядов существует несколько типов моделей и методов анализа данных, подходящих для различных задач.

Мотивация

В контексте статистики, эконометрики, количественных финансов, сейсмологии, метеорологии и геофизики основная цель анализа временных рядов – прогнозирование. В контексте обработки сигналов, инженерии управления и коммуникационных технологий он применяется для обнаружения сигналов. Другие области применения включают в себя интеллектуальный анализ данных, распознавание образов и машинное обучение, где анализ временных рядов может использоваться для кластеризации, классификации, поиска по содержанию, выявления аномалий, а также прогнозирования.

Устройство по кривой

Подгонка кривой — это процесс построения кривой или математической функции, наилучшим образом соответствующей ряду точек данных, возможно, с учетом ограничений. Подгонка кривой может включать интерполяцию, требующую точного соответствия данным, или сглаживание, при котором строится «гладкая» функция, приближенно соответствующая данным. Регрессионный анализ — смежная область, которая больше ориентирована на вопросы статистического вывода, такие как степень неопределенности в кривой, построенной на основе данных, полученных с учетом случайных ошибок. Подходящие кривые могут использоваться для визуализации данных, для определения значений функции в точках, где данные отсутствуют, и для обобщения взаимосвязей между двумя или более переменными. Экстраполяция — это использование подходящей кривой за пределами диапазона наблюдаемых данных, что сопряжено с определенной степенью неопределенности, поскольку она может отражать как метод построения кривой, так и наблюдаемые данные. Для процессов, которые, как ожидается, в целом будут увеличиваться, можно подобрать одну из кривых на графике справа (и многие другие), оценив их параметры. Построение экономических временных рядов включает в себя оценку некоторых компонентов на определенные даты путем интерполяции между значениями («опорными точками») для более ранних и более поздних дат. Интерполяция — это оценка неизвестной величины между двумя известными величинами (историческими данными) или получение выводов об отсутствующей информации на основе имеющихся данных («чтение между строк»). Интерполяция полезна, когда доступны данные, окружающие отсутствующие данные, и известны их тенденция, сезонность и долгосрочные циклы. Это часто делается с использованием связанных рядов, известных для всех соответствующих дат. В качестве альтернативы используется полиномиальная интерполяция или сплайн-интерполяция, при которых кусочно-полиномиальные функции подгоняются к временным интервалам так, чтобы они плавно соединялись друг с другом. Другая тесно связанная с интерполяцией задача — приближение сложной функции простой функцией (также называемой регрессией). Основное различие между регрессией и интерполяцией заключается в том, что полиномиальная регрессия дает один полином, моделирующий весь набор данных. Однако сплайн-интерполяция дает кусочно-непрерывную функцию, состоящую из множества полиномов, для моделирования набора данных. Экстраполяция — это процесс оценки значения переменной за пределами исходного диапазона наблюдений на основе ее взаимосвязи с другой переменной. Она аналогична интерполяции, которая дает оценки между известными наблюдениями, но экстраполяция сопряжена с большей неопределенностью и более высоким риском получения бессмысленных результатов.

Приближение функции

В общем, задача аппроксимации функции требует от нас выбора функции из хорошо определенного класса, которая тесно соответствует ("аппроксимирует") целевой функции специфическим для задачи образом. Можно выделить два основных класса задач аппроксимации функций: во-первых, для известных целевых функций, теория аппроксимации является отраслью численного анализа, которая исследует, как определенные известные функции (например, специальные функции) могут быть аппроксимированы конкретным классом функций (например, полиномами или рациональными функциями), которые часто обладают желательными свойствами (недорогие вычисления, непрерывность, интегральные и предельные значения и т.д.). Во-вторых, целевая функция, назовем ее g, может быть неизвестна; вместо явной формулы предоставляется только набор точек (временной ряд) вида (x, g(x)). В зависимости от структуры области определения и области значений g, могут быть применимы различные методы для аппроксимации g. Например, если g является операцией над действительными числами, можно использовать методы интерполяции, экстраполяции, регрессионного анализа и подгонки кривой. Если область значений (диапазон или целевое множество) g является конечным множеством, то речь идет о задаче классификации. Связанная задача онлайн-аппроксимации временных рядов заключается в обобщении данных за один проход и построении приближенного представления, которое может поддерживать различные запросы к временным рядам с ограничениями на максимальную ошибку. В некоторой степени различные задачи (регрессия, классификация, аппроксимация соответствия) получили унифицированный подход в теории статистического обучения, где они рассматриваются как задачи обучения с учителем.

Классификация

Присвоение шаблона временного ряда определенной категории, например, определение слова по последовательности движений рук в языке жестов.

Оценка сигнала

Этот подход основан на гармоническом анализе и фильтрации сигналов в частотной области с использованием преобразования Фурье и оценки спектральной плотности, развитие которой значительно ускорилось во время Второй мировой войны благодаря работам математика Норберта Винера, инженеров-электриков Рудольфа Э. Кальмана, Денниса Габора и других, направленным на фильтрацию сигналов от шума и прогнозирование значений сигнала в определенный момент времени. См. фильтр Калмана, теория оценки и цифровая обработка сигналов.

Сегментация

Разделение временного ряда на последовательность сегментов. Зачастую временной ряд можно представить как последовательность отдельных сегментов, каждый из которых обладает своими характерными свойствами. Например, аудиосигнал с конференц-звонка можно разбить на фрагменты, соответствующие времени, когда говорил каждый участник. Задача сегментации временных рядов заключается в выявлении границ сегментов во временном ряду и описании динамических свойств, присущих каждому сегменту. Для решения этой задачи можно использовать обнаружение точек изменения или моделировать временной ряд как более сложную систему, например, линейную систему с переключениями Маркова.

Кластеризация последовательностей временных рядов

Последующее кластерирование временных рядов привело к нестабильным (случайным) кластерам, обусловленным извлечением признаков методом разбиения на фрагменты с использованием скользящих окон. Было обнаружено, что центры кластеров (среднее значение временных рядов в кластере, которое также является временным рядом) следуют произвольно сдвинутой синусоиде (независимо от набора данных, даже для реализаций случайного блуждания). Это означает, что найденные центры кластеров не отражают особенности набора данных, поскольку центры кластеров всегда представляют собой нерепрезентативные синусоидальные волны.

Модели

Модели для данных временных рядов могут иметь множество форм и представлять различные стохастические процессы. При моделировании изменений уровня процесса три широких класса практической важности — авторегрессионные (AR) модели, интегрированные (I) модели и модели скользящей средней (MA). Эти три класса линейно зависят от предыдущих точек данных. Комбинации этих идей приводят к моделям авторегрессии скользящей средней (ARMA) и авторегрессии интегрированной скользящей средней (ARIMA). Авторегрессионная фракционно интегрированная модель скользящей средней (ARFIMA) обобщает первые три. Расширения этих классов для работы с векторными данными доступны под заголовком «модели многомерных временных рядов», и иногда предыдущие аббревиатуры расширяются путем добавления начальной буквы «V» для обозначения «вектора», как в VAR для векторной авторегрессии. Дополнительный набор расширений этих моделей доступен для использования, когда наблюдаемый временной ряд обусловлен некоторым «возмущающим» временным рядом (который может не оказывать причинного влияния на наблюдаемый ряд): отличие от многомерного случая заключается в том, что возмущающий ряд может быть детерминированным или находиться под контролем экспериментатора. Для этих моделей аббревиатуры расширяются добавлением в конце буквы «X» для обозначения «экзогенного». Нелинейная зависимость уровня ряда от предыдущих точек данных представляет интерес, отчасти из-за возможности получения хаотичного временного ряда. Однако, что более важно, эмпирические исследования могут указывать на преимущество использования прогнозов, полученных из нелинейных моделей, по сравнению с прогнозами из линейных моделей, например, в нелинейных авторегрессионных экзогенных моделях. Дополнительные ссылки по анализу нелинейных временных рядов: (Канц и Шрайбер) и (Абарбанель).

Среди других типов нелинейных моделей временных рядов есть модели, представляющие изменения дисперсии во времени (гетероскедастичность). Эти модели представляют авторегрессионную условную гетероскедастичность (ARCH), и коллекция включает в себя широкий спектр представлений (GARCH, TARCH, EGARCH, FIGARCH, CGARCH и т. д.). Здесь изменения изменчивости связаны с недавними прошлыми значениями наблюдаемого ряда или предсказываются ими. Это отличается от других возможных представлений локально изменяющейся изменчивости, где изменчивость может быть смоделирована как обусловленная отдельным процессом, изменяющимся во времени, как в модели двойной стохастичности. В недавних работах по анализу без использования моделей методы, основанные на вейвлет-преобразованиях (например, локально стационарные вейвлеты и вейвлет-декомпозированные нейронные сети), получили признание. Многомасштабные (часто называемые многоразрешающими) методы декомпозируют данный временной ряд, стремясь проиллюстрировать временную зависимость в нескольких масштабах. См. также методы переключения мультифрактала Маркова (MSMF) для моделирования эволюции волатильности. Скрытая марковская модель (СММ) — это статистическая марковская модель, в которой моделируемая система считается марковским процессом со скрытыми состояниями. СММ можно рассматривать как простейшую динамическую байесовскую сеть. Модели СММ широко используются в распознавании речи для преобразования временного ряда произносимых слов в текст. Многие из этих моделей собраны в пакете Python sktime.