Введение
Функциональный анализ данных (ФАД) — это раздел статистики, который анализирует данные, предоставляющие информацию о кривых, поверхностях или любых других величинах, изменяющихся в континууме. В наиболее общем виде, в рамках ФАД, каждый элемент выборки функциональных данных рассматривается как случайная функция. Физический континуум, на котором определены эти функции, часто представляет собой время, но также может быть пространственным положением, длиной волны, вероятностью и т. д. По своей сути, функциональные данные имеют бесконечную размерность. Высокая внутренняя размерность этих данных создает трудности как для теоретических исследований, так и для вычислений, причем характер этих трудностей зависит от способа выборки функциональных данных. Однако такая высокая или бесконечная размерность данных является богатым источником информации и представляет собой множество интересных задач для исследований и анализа данных.
История
Функциональный анализ данных своими корнями уходит в работы Гренандера и Кархунена 1940-х и 1950-х годов. Они рассматривали разложение квадратично интегрируемого непрерывного во времени стохастического процесса на собственные компоненты, которое сейчас известно как разложение Кархунена — Лоева. Строгий анализ функционального анализа главных компонент был проведен в 1970-х годах Клеффе, Доксуа и Пуссе, включая результаты об асимптотическом распределении собственных значений. В последнее время, в 1990-х и 2000-х годах, область исследований сосредоточилась больше на приложениях и понимании влияния плотных и разреженных схем наблюдений. Термин "функциональный анализ данных" был введен Джеймсом О. Рамси.
Математический формализм
Случайные функции можно рассматривать как случайные элементы, принимающие значения в гильбертовом пространстве, или как стохастический процесс. Первый подход математически удобен, а второй – более подходит для практического применения. Эти два подхода совпадают, если случайные функции непрерывны и выполняется условие среднеквадратичной непрерывности.
Гильбертовские случайные переменные
В гильбертовом пространстве рассматривается случайно́й элемент со значениями в , где – сепара́бильное гильбертово пространство, например, пространство квадрати́чно интегрируемых функци́й . При условии интегрируемости , среднее значение можно определить как единственный элемент , удовлетворяющий
Эта формулировка – интеграл Петтиса, но среднее значение также можно определить как интеграл Бохнера. При условии интегрируемости, то есть конечности , оператор ковариа́ции является лине́йным оператором, однозначно определяемым соотношением
или, в тензорной форме, . Спектральная теорема позволяет разложить в разложение Каруне́на — Лоэ́ва:
где – собственные векторы , соответствующие неотрицательным собственным значениям , упорядоченным по убыванию. Усечение этой бесконечной суммы́ до конечного порядка является основой функционального анализа главных компонент.
Дизайн функциональных данных
Функциональные данные рассматриваются как реализации стохастического процесса, являющегося процессом на ограниченном и замкнутом интервале со средней функцией и функцией ковариации. Реализация процесса для i-го субъекта равна , а выборка состоит из независимых субъектов. Расписание измерений может различаться для разных субъектов и обозначается как для i-го субъекта. Соответствующее i-е наблюдение обозначается как , где, кроме того, измерение подвержено случайному шуму с и , которые независимы друг от друга и от .
Анализ основных функциональных компонентов
Функциональный анализ главных компонент (FPCA) является наиболее распространенным инструментом в FDA, отчасти потому, что FPCA облегчает снижение размерности присущих бесконечной размерности функциональных данных до конечной размерности случайного вектора оценок. В частности, снижение размерности достигается путем разложения базовых наблюдаемых случайных траекторий в функциональной основе, состоящей из собственных функций оператора ковариации на . Рассмотрим оператор ковариации , который является компактным оператором в гильбертовом пространстве. Согласно теореме Мерсера, ядро , то есть ковариационная функция , имеет спектральное разложение , где сходимость ряда абсолютная и равномерная, а – вещественные неотрицательные собственные значения, упорядоченные по убыванию, с соответствующими ортонормальными собственными функциями . Согласно теореме Кархунена — Лоева, разложение FPCA базовой случайной траектории имеет вид , где – функциональные главные компоненты (FPC), иногда называемые оценками. Разложение Кархунена — Лоева облегчает снижение размерности в том смысле, что частичная сумма сходится равномерно, то есть при и, следовательно, частичная сумма с достаточно большим дает хорошее приближение к бесконечной сумме. Таким образом, информация в снижается с бесконечномерной до -мерного вектора с приближенным процессом: Другие популярные базисы включают сплайны, ряды Фурье и вейвлеты. Важными приложениями FPCA являются моды вариации и регрессия функциональных главных компонент.
Модели функциональной линейной регрессии
Функциональные линейные модели можно рассматривать как расширение традиционных многовариантных линейных моделей, связывающих векторные отклики с векторными ковариатами. Традиционная линейная модель со скалярным откликом и векторной ковариатой может быть выражена как , где обозначает внутреннее произведение в евклидовом пространстве, а и обозначают коэффициенты регрессии, а — случайную ошибку (шум) с нулевым средним и конечной дисперсией. Функциональные линейные модели можно разделить на два типа в зависимости от откликов.
Функциональные регрессионные модели со скалярным ответом
Заменяя вектор ковариат и вектор коэффициентов в модели на центрированный функциональный ковариат и коэффициент-функцию для и заменяя внутреннее произведение в евклидовом пространстве на внутреннее произведение в гильбертовом пространстве, мы приходим к функциональной линейной модели. Простая функциональная линейная модель может быть расширена на несколько функциональных ковариат, , также включая дополнительные векторные ковариаты , где , где является коэффициентом регрессии для , область определения которого – , является центрированным функциональным ковариатом, заданным как , а является функцией коэффициента регрессии для . Модели и были широко изучены.
Функциональные регрессионные модели с функциональным ответом
Рассмотрим функциональный отклик на и множественные функциональные ковариаты , . В данной постановке были рассмотрены две основные модели.
Регрессия по функции на скалярном
В частности, выбор в качестве постоянной функции приводит к особому случаю модели, который представляет собой функциональную линейную модель с функциональными откликами и скалярными ковариатами.
Модели регрессии
Эта модель задается выражением, где – функциональные ковариаты на , – коэффициентные функции, определенные на том же интервале, а – обычно предполагается случайным процессом со средним значением, равным нулю, и конечной дисперсией.
Функциональные модели нелинейной регрессии
Прямые нелинейные расширения классических функциональных линейных регрессионных моделей (FLM) по-прежнему включают линейный предиктор, но сочетают его с нелинейной связующей функцией, аналогично идее обобщенной линейной модели в традиционной линейной модели. Разработка полностью непараметрических моделей регрессии для функциональных данных сталкивается с проблемами, такими как "проклятие размерности". Чтобы обойти "проклятие" и проблему выбора метрики, мы стремимся рассмотреть нелинейные модели функциональной регрессии, которые подчиняются определенным структурным ограничениям, но не чрезмерно ограничивают гибкость. Желательно, чтобы модели сохраняли полиномиальные скорости сходимости, будучи при этом более гибкими, чем, например, функциональные линейные модели. Такие модели особенно полезны, когда диагностика функциональной линейной модели указывает на недостаточное соответствие данным, что часто встречается на практике. В частности, функциональные полиномиальные модели, функциональные модели с одним и несколькими индексами и функциональные аддитивные модели являются тремя частными случаями функциональных нелинейных регрессионных моделей.
Функциональные модели регрессии полиномов
Функциональные полиномиальные модели регрессии можно рассматривать как естественное расширение функциональных линейных моделей (FLM) со скалярными откликами, аналогично расширению модели линейной регрессии до полиномиальной модели регрессии. Для скалярного отклика и функционального ковариата с областью определения и соответствующих центрированных процессов предикторов, простейшим и наиболее известным членом в семействе функциональных полиномиальных моделей регрессии является квадратичная функциональная регрессия, задаваемая следующим образом, где – центрированный функциональный ковариат, – скалярный коэффициент, а – коэффициентные функции с областями определения и , соответственно. В дополнение к параметрической функции β, которую вышеуказанная функциональная квадратичная модель регрессии разделяет с FLM, она также включает параметрическую поверхность γ. По аналогии с FLM со скалярными откликами, оценка функциональных полиномиальных моделей может быть получена путем разложения как центрированной ковариаты, так и коэффициентных функций и в ортонормальном базисе.
Функциональные модели с одним и несколькими индексами
Функциональная модель множественных индексов приведена ниже, где символы имеют общепринятые значения, как описано ранее. Здесь g представляет собой (неизвестную) общую гладкую функцию, определенную на p-мерной области. Случай соответствует функциональной модели с одним индексом, а множественные модели индексов соответствуют случаю . Однако при , эта модель становится проблематичной из-за "проклятия размерности". При и относительно небольших объемах выборки, оценка, полученная с помощью этой модели, часто имеет большую дисперсию.
Функциональные аддитивные модели (ФАМ)
Для данной ортонормальной основы на , мы можем разложить функцию на области . Функциональная линейная модель со скалярными ответами (см. ) может быть записана следующим образом: Один из вариантов функциональных аддитивных моделей (FAM) получается заменой линейной функции от в вышеуказанном выражении (т.е. ) на общую гладкую функцию , аналогично расширению моделей множественной линейной регрессии до аддитивных моделей, и выражается как , где удовлетворяет условию для выраженного в виде , для двухмерной гладкой аддитивной поверхности, которая должна удовлетворять условию для всех , чтобы обеспечить идентифицируемость.
A functional linear model with scalar responses (see ) can thus be written as follows,One form of FAMs is obtained by replacing the linear function of in the above expression ( i. e., ) by a general smooth function , analogous to the extension of multiple linear regression models to additive models and is expressed as,where satisfies for expressed as,for a bivariate smooth additive surface which is required to satisfy for all , in order to ensure identifiability.
Кластеризация и классификация функциональных данных
Для векторных многомерных данных методы k-средних и иерархическое кластерирование являются двумя основными подходами. Эти классические концепции кластеризации для векторных многомерных данных были расширены на функциональные данные. Для кластеризации функциональных данных методы k-средних более популярны, чем методы иерархического кластерирования. При k-средней кластеризации функциональных данных средние функции обычно рассматриваются как центры кластеров. Также учитываются ковариационные структуры. Помимо кластеризации типа k-средних, функциональная кластеризация на основе смешанных моделей также широко используется для кластеризации векторно-значных многомерных данных и была расширена на кластеризацию функциональных данных. Более того, байесовское иерархическое кластерирование также играет важную роль в развитии моделируемого функционального кластерирования. Функциональная классификация присваивает принадлежность к группе новому объекту данных на основе функциональной регрессии или функционального дискриминантного анализа. Методы классификации функциональных данных, основанные на функциональных регрессионных моделях, используют уровни классов в качестве откликов, а наблюдаемые функциональные данные и другие ковариаты – в качестве предикторов. Для моделей функциональной классификации, основанных на регрессии, обычно используются функциональные обобщенные линейные модели или, конкретнее, функциональная бинарная регрессия, такая как функциональная логистическая регрессия для бинарных откликов. В более общем случае используется обобщенная функциональная модель линейной регрессии, основанная на подходе FPCA. Функциональный линейный дискриминантный анализ (FLDA) также рассматривается как метод классификации функциональных данных. Также была предложена функциональная классификация данных с использованием отношений плотностей. Исследование асимптотического поведения предложенных классификаторов при больших объемах выборки показывает, что при определенных условиях частота неправильной классификации стремится к нулю, явление, которое называют «идеальной классификацией».
Мотивация
В дополнение к изменению амплитуды, можно также предположить наличие временной вариации в функциональных данных. Временная вариация возникает, когда индивидуальное время наступления определенных интересующих событий различается у разных субъектов. Классическим примером является исследование роста в Беркли, где изменение амплитуды представляет собой скорость роста, а временная вариация объясняет разницу в биологическом возрасте детей, в котором наблюдается пубертатный и препубертатный скачок роста. При наличии временной вариации, поперечное среднее значение функции может оказаться неэффективной оценкой, поскольку пики и впадины располагаются случайным образом, что может исказить или скрыть значимые сигналы. Временное искажение, также известное как регистрация кривых, выравнивание кривых или синхронизация по времени, направлено на выявление и разделение вариаций амплитуды и времени. Если присутствуют как временная, так и амплитудная вариации, то наблюдаемые функциональные данные можно смоделировать как , где – скрытая амплитудная функция, а – скрытая функция временного искажения, соответствующая кумулятивной функции распределения. Предполагается, что функции временного искажения обратимы и удовлетворяют условию . Наиболее простым случаем семейства функций искажения для описания фазовой вариации является линейное преобразование, то есть , которое искажает время базовой шаблонной функции посредством индивидуального сдвига и масштабирования. Более общий класс функций искажения включает диффеоморфизмы домена на себя, то есть, говоря простым языком, класс обратимых функций, отображающих компактный домен на себя таким образом, что и сама функция, и ее обратная функция гладкие. Множество линейных преобразований содержится в множестве диффеоморфизмов. Одной из проблем временного искажения является идентификация амплитудной и фазовой вариаций. Для преодоления этой неидентифицируемости требуются определенные предположения.
The simplest case of a family of warping functions to specify phase variation is linear transformation, that is , which warps the time of an underlying template function by subjected specific shift and scale. More general class of warping functions includes diffeomorphisms of the domain to itself, that is, loosely speaking, a class of invertible functions that maps the compact domain to itself such that both the function and its inverse are smooth. The set of linear transformation is contained in the set of diffeomorphisms. One challenge in time warping is identifiability of amplitude and phase variation. Specific assumptions are required to break this non identifiability.
Методы
Ранние подходы включают динамическое искажение времени (DTW), используемое в таких приложениях, как распознавание речи. Другой традиционный метод временного искажения — регистрация опорных точек, которая выравнивает особые признаки, такие как положения максимумов, относительно среднего положения. Другие релевантные методы искажения включают парное искажение и регистрацию на основе расстояния.
Динамическое искажение времени
Функция шаблона определяется итерационным процессом, начиная с вычисления среднего поперечного сечения, затем выполняется регистрация и пересчет среднего поперечного сечения для деформированных кривых, при этом ожидается сходимость после нескольких итераций. DTW минимизирует функцию стоимости посредством динамического программирования. Проблемы, связанные с недифференцируемыми деформациями или жадными алгоритмами в DTW, могут быть решены путем добавления регуляризирующего члена к функции стоимости.
Регистрация знака
Регистрация ориентиров (или выравнивание признаков) предполагает наличие чётко выраженных признаков во всех образцах кривых и использует их местоположение в качестве эталонного. Особые признаки, такие как точки максимума или минимума в функциях или их производных, выравниваются по их среднему положению на шаблонной функции.