Введение
Подход к анализу наборов данных в статистике
В статистике исследовательский анализ данных (EDA) — это подход к анализу наборов данных для обобщения их основных характеристик, часто с использованием статистической графики и других методов визуализации данных. Статистическая модель может использоваться или не использоваться, но прежде всего EDA позволяет увидеть, что данные могут рассказать нам помимо формального моделирования, и тем самым противопоставляется традиционному проверке гипотез. Исследовательский анализ данных был популяризирован Джоном Тьюки с 1970 года, чтобы побудить статистиков исследовать данные и, возможно, сформулировать гипотезы, которые могли бы привести к сбору новых данных и проведению экспериментов. EDA отличается от предварительного анализа данных (IDA), который более узко фокусируется на проверке предположений, необходимых для построения моделей и проверки гипотез, а также на обработке пропущенных значений и преобразовании переменных по мере необходимости. EDA включает в себя IDA.
Обзор
Туки в 1961 году определил анализ данных как: "Процедуры анализа данных, методы интерпретации результатов этих процедур, способы планирования сбора данных для облегчения анализа, повышения его точности или достоверности, а также все механизмы и результаты (математической) статистики, применяемые к анализу данных". Исследовательский анализ данных (EDA) – это техника анализа, используемая для изучения набора данных и обобщения его основных характеристик. Главным преимуществом EDA является возможность визуализации данных после проведения анализа. Поддержка EDA со стороны Туки способствовала развитию пакетов статистических вычислений, особенно S в Bell Labs. Язык программирования S послужил основой для систем S PLUS и R. Это семейство статистических вычислительных сред обладало значительно улучшенными возможностями динамической визуализации, что позволило статистикам выявлять выбросы, тенденции и закономерности в данных, требующие дальнейшего изучения. EDA, предложенная Туки, была связана с двумя другими направлениями в теории статистики: робастной статистикой и непараметрической статистикой, обе из которых стремились снизить чувствительность статистических выводов к ошибкам при построении статистических моделей. Туки продвигал использование пятичислового резюме для численных данных – двух крайних значений (максимального и минимального), медианы и квартилей, поскольку эти медиана и квартили, будучи функциями эмпирического распределения, определены для всех распределений, в отличие от среднего и стандартного отклонения; кроме того, квартили и медиана более устойчивы к скошенным или тяжелым распределениям, чем традиционные характеристики (среднее и стандартное отклонение). Пакеты S, S PLUS и R включали процедуры, использующие методы перевыборки, такие как нож Quenouille и Tukey и бутстрэп Efron, которые являются непараметрическими и робастными (для многих задач). Исследовательский анализ данных, робастная статистика, непараметрическая статистика и разработка языков статистического программирования облегчили работу статистиков над научными и инженерными проблемами. К таким проблемам относились производство полупроводников и исследование сетей связи, которыми занималась Bell Labs. Все эти статистические разработки, поддерживаемые Туки, были направлены на дополнение аналитической теории проверки статистических гипотез, особенно акцента лапласовской традиции на экспоненциальных семействах распределений.
Пример
Результаты разведочного анализа данных (EDA) не связаны с основной задачей анализа. Для иллюстрации рассмотрим пример из Cook et al., где задача анализа состоит в том, чтобы найти переменные, которые наилучшим образом предсказывают размер чаевых, которые посетители ресторана оставят официанту. Переменные, доступные в собранных для этой задачи данных, включают: сумму чаевых, общий счет, пол плательщика, наличие курящих/некурящих в группе, время суток, день недели и размер компании. Основная задача анализа решается путем построения регрессионной модели, в которой процент чаевых является зависимой переменной. Полученная модель выглядит следующим образом:
(процент чаевых) = 0,18 – 0,01 × (размер компании),
что означает, что с увеличением размера компании на одного человека (и, следовательно, увеличением общего счета), процент чаевых в среднем уменьшается на 1%. Однако, исследование данных выявляет другие интересные закономерности, не описанные этой моделью. Информация, полученная из графиков, отличается от той, что демонстрирует регрессионная модель, хотя эксперимент не был разработан для изучения этих тенденций. Закономерности, обнаруженные в ходе разведочного анализа данных, позволяют выдвинуть гипотезы о размере чаевых, которые могли быть не предсказаны заранее, и которые могут послужить основой для дальнейших экспериментов, в которых эти гипотезы будут сформулированы и проверены путем сбора новых данных.
Программное обеспечение
JMP, пакет EDA от SAS Institute. KNIME, Konstanz Information Miner – платформа для исследования данных с открытым исходным кодом, основанная на Eclipse. Minitab, пакет EDA и общей статистики, широко используемый в промышленных и корпоративных условиях. Orange, программный пакет с открытым исходным кодом для интеллектуального анализа данных и машинного обучения. Python, язык программирования с открытым исходным кодом, широко используемый в интеллектуальном анализе данных и машинном обучении. R, язык программирования с открытым исходным кодом для статистических вычислений и графики. Вместе с Python – один из самых популярных языков для анализа данных. TinkerPlots – программное обеспечение EDA для учеников старших классов начальной и средней школы. Weka – пакет для интеллектуального анализа данных с открытым исходным кодом, включающий инструменты визуализации и EDA, такие как направленный поиск проекций.