Введение

Процесс извлечения и обнаружения закономерностей в больших наборах данных

Добыча данных – это процесс извлечения и обнаружения закономерностей в больших наборах данных, включающий методы на стыке машинного обучения, статистики и систем баз данных. Добыча данных является этапом анализа в процессе "открытия знаний в базах данных", или KDD. Это также популярный термин, который часто применяется к любой форме крупномасштабной обработки данных или информации (сбор, извлечение, хранение, анализ и статистика), а также к любому применению компьютерной системы поддержки принятия решений, включая искусственный интеллект (например, машинное обучение) и бизнес-аналитику. Зачастую более уместны более общие термины – анализ данных и аналитика (в крупном масштабе), или, применительно к конкретным методам, искусственный интеллект и машинное обучение. Фактическая задача добычи данных – это полуавтоматический или автоматический анализ больших объемов данных для выявления ранее неизвестных, интересных закономерностей, таких как группы записей данных (кластерный анализ), необычные записи (обнаружение аномалий) и зависимости (поиск ассоциативных правил, поиск последовательных закономерностей). Обычно это предполагает использование методов баз данных, таких как пространственные индексы. Эти закономерности можно рассматривать как своего рода обобщение входных данных и использовать для дальнейшего анализа или, например, в машинном обучении и прогнозной аналитике. Например, этап добычи данных может выявить несколько групп в данных, которые затем можно использовать для получения более точных результатов прогнозирования системой поддержки принятия решений. Сбор данных, подготовка данных, интерпретация результатов и составление отчетов не входят в этап добычи данных, хотя они являются частью общего процесса KDD как дополнительные этапы. Отличие анализа данных от добычи данных заключается в том, что анализ данных используется для проверки моделей и гипотез на наборе данных, например, для анализа эффективности маркетинговой кампании, независимо от объема данных. В отличие от этого, добыча данных использует методы машинного обучения и статистические модели для выявления скрытых закономерностей в большом объеме данных. Связанные термины – "копание в данных", "рытье данных" и "зондирование данных" – относятся к использованию методов добычи данных для выборки частей более крупного набора данных о популяции, которые слишком малы (или могут быть) для получения надежных статистических выводов о достоверности обнаруженных закономерностей. Однако эти методы могут быть использованы для формирования новых гипотез для проверки на основе более крупных данных.

Этимология

В 1960-х годах статистики и экономисты использовали такие термины, как "рыбалка в данных" или "промысел данных", чтобы обозначить практику, которую они считали некорректной – анализ данных без заранее сформулированной гипотезы. Термин "добыча данных" экономист Майкл Ловелл использовал в аналогично критическом ключе в статье, опубликованной в журнале Review of Economic Studies в 1983 году. Ловелл отмечает, что эта практика "маскируется под разными названиями, от "экспериментирования" (в положительном смысле) до "рыбалки" или "подглядывания" (в отрицательном)". Термин "добыча данных" появился около 1990 года в сообществе специалистов по базам данных, как правило, с положительной коннотацией. Некоторое время в 1980-х годах использовалась фраза "добыча из баз данных"™, но поскольку она была зарегистрирована как торговая марка компанией HNC из Сан-Диего для продвижения их рабочей станции Database Mining Workstation, исследователи перешли к использованию термина "добыча данных". Также использовались такие термины, как археология данных, сбор информации, обнаружение информации, извлечение знаний и другие. Грегори Пятецкий-Шапиро ввел термин "открытие знаний в базах данных" для первого семинара по этой теме (KDD 1989), и этот термин стал более популярным в сообществах искусственного интеллекта и машинного обучения. Однако термин "добыча данных" получил большее распространение в деловых кругах и прессе. В настоящее время термины "добыча данных" и "открытие знаний" используются как синонимы.

Предыстория

Ручное извлечение закономерностей из данных происходит на протяжении веков. Ранние методы выявления закономерностей в данных включают теорему Байеса (1700-е годы) и регрессионный анализ (1800-е годы). Распространение, повсеместность и возрастающая мощность компьютерных технологий резко увеличили возможности сбора, хранения и обработки данных. По мере роста объёма и сложности наборов данных прямой, непосредственный анализ данных всё чаще дополняется косвенной, автоматизированной обработкой данных, чему способствовали и другие открытия в информатике, особенно в области машинного обучения, такие как нейронные сети, кластерный анализ, генетические алгоритмы (1950-е годы), деревья решений и правила принятия решений (1960-е годы) и машины опорных векторов (1990-е годы). Интеллектуальный анализ данных – это процесс применения этих методов с целью выявления скрытых закономерностей в больших наборах данных. Он объединяет прикладную статистику и искусственный интеллект (которые обычно предоставляют математическую основу) с управлением базами данных, используя способы хранения и индексации данных в базах данных для более эффективного выполнения алгоритмов обучения и обнаружения, что позволяет применять эти методы к всё более крупным наборам данных.

Предварительная обработка

Перед тем, как можно будет использовать алгоритмы интеллектуального анализа данных, необходимо сформировать целевой набор данных. Поскольку интеллектуальный анализ данных может выявить только закономерности, реально существующие в данных, целевой набор данных должен быть достаточно большим, чтобы содержать эти закономерности, и при этом достаточно компактным, чтобы его анализ занимал приемлемое время. Распространенными источниками данных являются хранилища данных (data mart) или дата-склады (data warehouse). Предварительная обработка необходима для анализа многомерных наборов данных перед проведением интеллектуального анализа. Затем целевой набор данных очищается. Очистка данных удаляет наблюдения, содержащие помехи, и те, в которых имеются пропущенные значения.

Валидация результатов

Добыча данных может быть непреднамеренно использована не по назначению, приводя к результатам, которые кажутся значимыми, но на самом деле не предсказывают будущее поведение и не могут быть воспроизведены на новой выборке данных, а значит, имеют мало практической ценности. Это иногда происходит из-за проверки слишком большого количества гипотез и отсутствия надлежащего статистического тестирования гипотез. Простой вариант этой проблемы в машинном обучении известен как переобучение, но та же проблема может возникать на различных этапах процесса, и поэтому разделение на обучающую и тестовую выборки, если оно вообще применимо, может оказаться недостаточным для её предотвращения. Заключительный этап процесса обнаружения знаний в данных – проверка того, что закономерности, выявленные алгоритмами добычи данных, сохраняются в более широком наборе данных. Не все закономерности, обнаруженные алгоритмами, обязательно являются достоверными. Алгоритмы добычи данных часто находят закономерности в обучающей выборке, которые отсутствуют в генеральной выборке. Это называется переобучением. Чтобы избежать этого, для оценки используется тестовая выборка данных, на которой алгоритм добычи данных не обучался. Выученные закономерности применяются к этой тестовой выборке, а полученный результат сравнивается с ожидаемым. Например, алгоритм добычи данных, предназначенный для различения "спама" и "легитимных" электронных писем, обучается на наборе образцов электронных писем. После обучения выученные закономерности применяются к тестовой выборке электронных писем, на которой он не обучался. Точность закономерностей можно оценить по количеству правильно классифицированных электронных писем. Для оценки алгоритма можно использовать различные статистические методы, такие как ROC-кривые. Если выученные закономерности не соответствуют заданным стандартам, необходимо пересмотреть и изменить этапы предварительной обработки и добычи данных. Если же выученные закономерности соответствуют заданным стандартам, то последним этапом является интерпретация этих закономерностей и преобразование их в знания.

Стандарты

Были предприняты некоторые усилия по определению стандартов для процесса интеллектуального анализа данных, например, Европейский межотраслевой стандартный процесс интеллектуального анализа данных 1999 года (CRISP DM 1.0) и стандарт Java Data Mining 2004 года (JDM 1.0). Разработка преемников этих процессов (CRISP DM 2.0 и JDM 2.0) активно велась в 2006 году, но затем остановилась. JDM 2.0 был отозван, не достигнув финальной версии. Для обмена полученными моделями – в частности, для использования в предиктивной аналитике – ключевым стандартом является язык разметки прогнозных моделей (PMML), XML-основанный язык, разработанный Data Mining Group (DMG) и поддерживаемый многими приложениями для интеллектуального анализа данных в качестве формата обмена. Как следует из названия, он охватывает только модели прогнозирования, конкретную задачу интеллектуального анализа данных, имеющую большое значение для бизнес-приложений. Однако расширения, охватывающие, например, кластеризацию подпространств, были предложены независимо от DMG.

Примечательные применения

Добыча данных используется везде, где имеются цифровые данные. Заметные примеры применения добычи данных можно встретить в бизнесе, медицине, науке, финансах, строительстве и сфере наблюдения.

Ситуация в Европе

В Европе действуют достаточно строгие законы о защите персональных данных, и прилагаются усилия для дальнейшего укрепления прав потребителей. Однако, действующие с 1998 по 2000 год принципы «Безопасной гавани» между США и ЕС в настоящее время фактически подвергают европейских пользователей риску нарушения конфиденциальности со стороны американских компаний. В результате разоблачений Эдварда Сноудена о глобальной слежке, усилились дискуссии об отмене этого соглашения, поскольку данные оказываются полностью доступны Агентству национальной безопасности, а попытки достичь договоренности с Соединенными Штатами не увенчались успехом. В частности, в Соединенном Королевстве были зафиксированы случаи, когда корпорации использовали сбор данных для таргетирования определенных групп клиентов, вынуждая их платить неоправданно высокие цены. Эти группы, как правило, состоят из людей с низким социально-экономическим статусом, недостаточно осведомленных о способах манипулирования ими на цифровых рынках.

Ситуация в Соединенных Штатах

В Соединенных Штатах вопросы конфиденциальности были рассмотрены Конгрессом США посредством принятия нормативных актов, таких как Закон о переносимости и подотчетности медицинского страхования (HIPAA). HIPAA требует от лиц давать "информированное согласие" в отношении предоставляемой ими информации и ее предполагаемого использования в настоящем и будущем. Согласно статье в Biotech Business Week, "на практике HIPAA может не обеспечивать большей защиты, чем существующие давным-давно правила в сфере исследований", – заявляет AAHC. Более того, цель защиты посредством информированного согласия приближается к уровню непонятности для обычного человека. Это подчеркивает необходимость анонимизации данных при агрегации и анализе данных. Законодательство США о защите информации, такое как HIPAA и Закон о правах и конфиденциальности обучающихся (FERPA), применяется только к конкретным областям, регулируемым каждым из этих законов. Использование методов анализа данных большинством компаний в США не регулируется каким-либо законодательством.

Ситуация в Европе

Согласно европейским законам об авторском праве, извлечение данных из охраняемых авторским правом произведений (например, веб-майнинг) без разрешения правообладателя не является законным. Если база данных в Европе представляет собой исключительно данные, то авторское право на нее может отсутствовать, однако могут существовать права на базу данных, в связи с чем извлечение данных становится предметом прав интеллектуальной собственности, охраняемых Директивой о базах данных. По рекомендации обзора Харгривза, это привело к внесению изменений правительством Великобритании в закон об авторском праве в 2014 году, разрешающих контент-майнинг как ограничение и исключение. Великобритания стала второй страной в мире, сделавшей это после Японии, которая ввела исключение для извлечения данных в 2009 году. Однако, из-за ограничений Директивы об информационном обществе (2001), британское исключение разрешает контент-майнинг только в некоммерческих целях. Законодательство Великобритании об авторском праве также не позволяет отменять данное положение посредством договорных условий. С 2020 года Швейцария также регулирует извлечение данных, разрешая его в сфере научных исследований при определенных условиях, установленных статьей 24d швейцарского закона об авторском праве. Эта новая статья вступила в силу 1 апреля 2020 года. Европейская комиссия содействовала обсуждению с заинтересованными сторонами вопросов текстовой и информационной разработки в 2013 году под названием «Лицензии для Европы». Акцент на решении этого правового вопроса, таком как лицензирование, а не ограничения и исключения, привел к тому, что представители университетов, исследователей, библиотек, общественных организаций и издателей открытого доступа покинули диалог с заинтересованными сторонами в мае 2013 года.

Ситуация в Соединенных Штатах

Закон об авторском праве США, и в особенности его положение о добросовестном использовании, подтверждает законность интеллектуальной добычи данных в Америке и других странах, допускающих добросовестное использование, таких как Израиль, Тайвань и Южная Корея. Поскольку интеллектуальная добыча данных носит преобразующий характер, то есть не заменяет исходное произведение, она считается правомерной в рамках добросовестного использования. Например, в рамках соглашения по делу Google Book председательствующий судья постановил, что проект Google по оцифровке книг, защищенных авторским правом, был законным, отчасти благодаря преобразующим возможностям, продемонстрированным в ходе оцифровки, одной из которых является интеллектуальная добыча текста и данных.