Введение

Процесс замены пропущенных данных замещающими значениями

В статистике импутация – это процесс замены пропущенных данных замещающими значениями. Замена отдельной единицы наблюдения называется "импутацией единицы", а замена компонента единицы наблюдения – "импутацией элемента". Пропущенные данные создают три основные проблемы: они могут вносить существенные искажения, усложнять обработку и анализ данных, а также снижать эффективность. Поскольку пропущенные данные могут создавать проблемы при анализе, импутация рассматривается как способ избежать ошибок, связанных с удалением случаев, содержащих пропущенные значения. То есть, когда для случая отсутствует одно или несколько значений, большинство статистических пакетов по умолчанию отбрасывают этот случай, что может привести к смещению или повлиять на репрезентативность результатов. Импутация сохраняет все случаи, заменяя пропущенные данные оценкой, основанной на другой доступной информации. После импутации всех пропущенных значений набор данных можно анализировать стандартными методами для полных данных. Существует множество теорий, объясняющих причины пропущенных данных, но большинство из них вносят смещение. К известным методам работы с пропущенными данными относятся: импутация "горячей" и "холодной" колоды, списочное и парное удаление, импутация средним значением, неотрицательная матричная факторизация, регрессионная импутация, перенос последнего наблюдения, стохастическая импутация и множественная импутация.

Удаление по списку (полный случай)

Самым распространенным способом обработки пропущенных данных является списочное удаление (также известное как метод полных случаев), при котором удаляются все наблюдения, содержащие хотя бы одно пропущенное значение. Если данные пропущены совершенно случайно, то списочное удаление не вносит систематической ошибки, но снижает мощность анализа за счет уменьшения эффективного размера выборки. Например, если собрано 1000 наблюдений, но в 80 из них имеются пропущенные значения, то эффективный размер выборки после списочного удаления составит 920. Если же данные пропущены не совершенно случайно, то списочное удаление приведет к систематической ошибке, поскольку подвыборка наблюдений с пропущенными данными не будет репрезентативной для исходной выборки (а если исходная выборка сама была репрезентативной для генеральной совокупности, то наблюдения с полными данными также не будут репрезентативными для этой совокупности). Хотя списочное удаление непредвзято при совершенно случайных пропущенных данных, на практике это встречается редко. Попарное удаление (или анализ доступных случаев) предполагает удаление наблюдения только при отсутствии переменной, необходимой для конкретного анализа, но включение этого наблюдения в анализы, где все необходимые переменные присутствуют. При использовании попарного удаления, общий объем выборки (N) для анализа будет различаться в зависимости от оцениваемого параметра. Из-за неполного объема выборки в некоторые моменты времени, при сохранении сравнения по полным случаям для других параметров, попарное удаление может приводить к математически невозможным ситуациям, например, к коэффициентам корреляции, превышающим 1. Единственным преимуществом метода полных случаев перед другими методами является его простота и легкость реализации. Это является одной из основных причин, по которой метод полных случаев остается самым популярным способом обработки пропущенных данных, несмотря на его многочисленные недостатки.

Горячая палуба

Когда-то распространенным методом импутации была импутация методом "горячей колоды", при котором пропущенное значение заменялось случайным образом выбранной аналогичной записью. Термин "горячая колода" восходит к практике хранения данных на перфокартах и указывает на то, что доноры информации взяты из того же набора данных, что и записи с пропущенными значениями. "Горячей" называлась колода карт, находящаяся в текущей обработке. Одной из форм импутации методом "горячей колоды" является метод "последнего наблюдения, перенесенного вперед" (или LOCF), который заключается в сортировке набора данных по одному или нескольким признакам, создавая упорядоченный набор данных. Затем метод находит первое пропущенное значение и использует значение ячейки, непосредственно предшествующее пропущенному, для его импутации. Процесс повторяется для каждой следующей ячейки с пропущенным значением, пока все пропуски не будут заполнены. В типичном сценарии, когда данные представляют собой повторные измерения переменной для одного и того же субъекта или объекта, этот метод основан на предположении, что если измерение отсутствует, наиболее вероятным является то, что оно не изменилось с момента последнего измерения. Известно, что этот метод повышает риск внесения систематической ошибки и получения потенциально неверных выводов. Поэтому использование LOCF не рекомендуется.

Холодная палуба

В отличие от этого, импутация с использованием "холодной колоды" отбирает доноры из другого набора данных. Благодаря увеличению вычислительной мощности, более сложные методы импутации в целом заменили исходные методы импутации случайной и упорядоченной "горячей колоды". Это метод замены значений ответами схожих элементов из предыдущих обследований. Он применяется в обследованиях, измеряющих временные интервалы.

Средняя замещение

Другой метод импутации заключается в замене любого пропущенного значения средним значением этой переменной по всем остальным наблюдениям, что имеет преимущество – не изменять среднее значение выборки для данной переменной. Однако импутация средним значением ослабляет любые корреляции, включающие импутируемую переменную (или переменные). Это происходит потому, что в случаях с импутацией гарантированно отсутствует связь между импутированной переменной и любыми другими измеренными переменными. Таким образом, импутация средним значением обладает некоторыми привлекательными свойствами для унивариантного анализа, но становится проблематичной для многовариантного анализа. Импутацию средним значением можно проводить внутри классов (то есть категорий, таких как пол), и она может быть выражена как , где – импутированное значение для наблюдения , а – среднее значение выборки данных респондентов внутри некоторого класса. Это частный случай обобщенной регрессионной импутации: здесь значения оцениваются путем регрессии на в неимпутированных данных, – фиктивная переменная, указывающая принадлежность к классу, а данные разделены на данные респондентов и пропущенные данные .

Факторизация неотрицательной матрицы

Неотрицательная матричная факторизация (НМФ) способна обрабатывать пропущенные данные, минимизируя свою целевую функцию, а не заменять их нулями, что может приводить к искажениям. Это делает НМФ математически обоснованным методом для восстановления данных. НМФ может игнорировать пропущенные данные при вычислении целевой функции, и влияние пропущенных данных может быть незначительным, как эффект второго порядка.

Регрессия

Импутация регрессией имеет проблему, обратную средней импутации. Регрессионная модель оценивается для предсказания наблюдаемых значений переменной на основе других переменных, и затем эта модель используется для заполнения пропущенных значений в тех случаях, когда значение этой переменной отсутствует. Иными словами, доступная информация для полных и неполных случаев используется для предсказания значения конкретной переменной. Соответствующие значения, полученные из регрессионной модели, затем используются для импутации недостающих данных. Проблема заключается в том, что импутированные данные не включают в свою оценку член ошибки, поэтому оценки идеально соответствуют регрессионной линии без какой-либо остаточной дисперсии. Это приводит к избыточной идентификации взаимосвязей и предполагает большую точность в импутированных значениях, чем оправдано. Регрессионная модель предсказывает наиболее вероятное значение пропущенных данных, но не предоставляет информацию о неопределенности этого значения. Стохастическая регрессия была достаточно успешной попыткой исправить отсутствие члена ошибки в импутации регрессией путем добавления средней дисперсии регрессии к импутированным значениям, чтобы ввести ошибку. Стохастическая регрессия демонстрирует значительно меньшее смещение, чем вышеупомянутые методы, но все же упускает один момент: если данные импутируются, то интуитивно можно предположить, что в проблему следует ввести больше шума, чем просто остаточная дисперсия. Разработан метод усреднения результатов по нескольким импутированным наборам данных для учета этого. Все методы множественной импутации включают три шага или объединение симуляций из каждой отдельной модели. Множественная импутация может использоваться в случаях, когда данные отсутствуют полностью случайным образом, отсутствуют случайным образом и отсутствуют неслучайным образом, хотя в последнем случае она может быть смещенной. Один из подходов – множественная импутация с помощью цепных уравнений (MICE), также известная как «полностью условная спецификация» и «последовательная регрессионная множественная импутация». MICE предназначена для данных, отсутствующих случайным образом, хотя существуют результаты моделирования, которые показывают, что при достаточном количестве вспомогательных переменных она также может работать с данными, отсутствующими неслучайным образом. Однако MICE может испытывать проблемы с производительностью, когда количество наблюдений велико, а данные имеют сложные характеристики, такие как нелинейность и высокая размерность. Более современные подходы к множественной импутации используют методы машинного обучения для повышения ее производительности. Например, MIDAS (Multiple Imputation with Denoising Autoencoders) использует шумоподавляющие автокодировщики, тип неконтролируемой нейронной сети, для изучения детализированных скрытых представлений наблюдаемых данных. Показано, что MIDAS обеспечивает преимущества в точности и эффективности по сравнению с традиционными стратегиями множественной импутации. Как упоминалось в предыдущем разделе, одинарная импутация не учитывает неопределенность в импутированных значениях. После импутации данные рассматриваются как фактические реальные значения при одинарной импутации. Игнорирование неопределенности в импутации может привести к чрезмерно точным результатам и ошибкам в любых сделанных выводах. Импутируя несколько раз, множественная импутация учитывает неопределенность и диапазон значений, которые могло принять истинное значение. Как и ожидалось, сочетание оценки неопределенности и глубокого обучения для импутации является одной из лучших стратегий и используется для моделирования гетерогенных данных об открытии лекарственных средств. Кроме того, хотя одинарная импутация и метод полного случая проще в реализации, множественная импутация не очень сложна в реализации. Существует широкий спектр статистических пакетов в различных статистических программах, которые легко выполняют множественную импутацию. Например, пакет MICE позволяет пользователям в R выполнять множественную импутацию с использованием метода MICE. MIDAS может быть реализован в R с помощью пакета rMIDAS и в Python с помощью пакета MIDASpy.