Введение

Профилирование данных — это процесс изучения данных, доступных из существующего источника информации (например, базы данных или файла), и сбора статистики или информативных сводок об этих данных. Целью этой статистики может быть:

Выяснить, насколько легко существующие данные могут быть использованы для других целей.
Улучшить возможности поиска данных путем присвоения им ключевых слов, описаний или отнесения к определенной категории.
Оценить качество данных, включая их соответствие определенным стандартам или шаблонам.
Оценить риски, связанные с интеграцией данных в новые приложения, включая сложности при объединении данных.
Выявить метаданные исходной базы данных, включая шаблоны и распределения значений, потенциальные первичные ключи, потенциальные внешние ключи и функциональные зависимости.
Оценить, насколько точно известные метаданные описывают фактические значения в исходной базе данных.
Понимание проблем с данными на ранних этапах любого проекта, связанного с интенсивной работой с данными, чтобы избежать неожиданностей в конце проекта. Выявление проблем с данными на поздних этапах проекта может привести к задержкам и увеличению затрат. Обеспечить общекорпоративный обзор всех данных для таких задач, как управление основными данными, где требуются ключевые данные, или управление данными для повышения их качества.

Введение

Профилирование данных — это анализ информации, предназначенной для использования в хранилище данных, с целью уточнения структуры, содержания, взаимосвязей и правил вывода данных. Профилирование помогает не только выявлять аномалии и оценивать качество данных, но и обнаруживать, регистрировать и оценивать корпоративные метаданные. Результаты анализа используются для определения пригодности потенциальных исходных систем, обычно служа основой для принятия предварительного решения о целесообразности продолжения работы, а также для выявления проблем, которые необходимо будет решить на этапе проектирования. Метаданные затем могут быть использованы для обнаружения таких проблем, как недопустимые значения, опечатки, отсутствующие значения, неоднородное представление значений и дубликаты. Для различных структурных уровней выполняются различные виды анализа. Например, отдельные столбцы могут быть профилированы независимо друг от друга для понимания частотного распределения значений, типа данных и назначения каждого столбца. Внутренние зависимости между значениями могут быть выявлены при анализе столбцов в связке. Наконец, перекрывающиеся наборы значений, потенциально представляющие собой внешние ключи, связывающие сущности, могут быть исследованы при межтабличном анализе. Вычислительная сложность возрастает при переходе от профилирования отдельных столбцов к профилированию отдельных таблиц и, далее, к перекрестному структурному профилированию таблиц. Поэтому производительность является важным критерием оценки инструментов профилирования.

Когда проводится профилирование данных?

По словам Кимбалла, профилирование данных выполняется несколько раз с разной степенью детализации на протяжении всего процесса разработки хранилища данных. Первоначальная, обзорная оценка профилирования должна проводиться сразу после определения потенциальных исходных систем и подтверждения бизнес-требований к хранилищу данных и системам бизнес-аналитики (DW/BI). Цель этого предварительного анализа – как можно раньше выяснить, доступны ли необходимые данные с требуемым уровнем детализации и можно ли обработать обнаруженные аномалии. Если это не так, проект может быть закрыт. Кроме того, более глубокое профилирование проводится перед проектированием многомерной модели, чтобы оценить, что необходимо для преобразования данных в размерную модель. Детальное профилирование продолжается в процессе проектирования ETL-системы для определения данных, подлежащих извлечению, и фильтров, которые следует применить к набору данных. Помимо этого, профилирование данных может выполняться в процессе разработки хранилища данных после загрузки данных во временные таблицы, в марты данных и т.п. Проведение профилирования на этих этапах помогает убедиться, что очистка и преобразование данных выполнены корректно и в соответствии с требованиями.

Преимущества и примеры

Преимущества профилирования данных – повышение качества данных, сокращение сроков реализации крупных проектов и улучшение понимания данных пользователями. Обнаружение бизнес-знаний, скрытых в самих данных, является одним из значительных преимуществ профилирования данных. Профилирование данных – одна из наиболее эффективных технологий для повышения точности данных в корпоративных базах данных.