Введение
Профилирование данных — это процесс изучения данных, доступных из существующего источника информации (например, базы данных или файла), и сбора статистики или информативных сводок об этих данных. Целью этой статистики может быть:
Find out whether existing data can be easily used for other purposes
Improve the ability to search data by tagging it with keywords, descriptions, or assigning it to a category
Assess data quality, including whether the data conforms to particular standards or patterns
Assess the risk involved in integrating data in new applications, including the challenges of joins
Discover metadata of the source database, including value patterns and distributions, key candidates, foreign key candidates, and functional dependencies
Assess whether known metadata accurately describes the actual values in the source database
Understanding data challenges early in any data intensive project, so that late project surprises are avoided. Finding data problems late in the project can lead to delays and cost overruns. Have an enterprise view of all data, for uses such as master data management, where key data is needed, or data governance for improving data quality.
Выяснить, насколько легко существующие данные могут быть использованы для других целей.
Улучшить возможности поиска данных путем присвоения им ключевых слов, описаний или отнесения к определенной категории.
Оценить качество данных, включая их соответствие определенным стандартам или шаблонам.
Оценить риски, связанные с интеграцией данных в новые приложения, включая сложности при объединении данных.
Выявить метаданные исходной базы данных, включая шаблоны и распределения значений, потенциальные первичные ключи, потенциальные внешние ключи и функциональные зависимости.
Оценить, насколько точно известные метаданные описывают фактические значения в исходной базе данных.
Понимание проблем с данными на ранних этапах любого проекта, связанного с интенсивной работой с данными, чтобы избежать неожиданностей в конце проекта. Выявление проблем с данными на поздних этапах проекта может привести к задержкам и увеличению затрат. Обеспечить общекорпоративный обзор всех данных для таких задач, как управление основными данными, где требуются ключевые данные, или управление данными для повышения их качества.
Find out whether existing data can be easily used for other purposes
Improve the ability to search data by tagging it with keywords, descriptions, or assigning it to a category
Assess data quality, including whether the data conforms to particular standards or patterns
Assess the risk involved in integrating data in new applications, including the challenges of joins
Discover metadata of the source database, including value patterns and distributions, key candidates, foreign key candidates, and functional dependencies
Assess whether known metadata accurately describes the actual values in the source database
Understanding data challenges early in any data intensive project, so that late project surprises are avoided. Finding data problems late in the project can lead to delays and cost overruns. Have an enterprise view of all data, for uses such as master data management, where key data is needed, or data governance for improving data quality.
Введение
Профилирование данных — это анализ информации, предназначенной для использования в хранилище данных, с целью уточнения структуры, содержания, взаимосвязей и правил вывода данных. Профилирование помогает не только выявлять аномалии и оценивать качество данных, но и обнаруживать, регистрировать и оценивать корпоративные метаданные. Результаты анализа используются для определения пригодности потенциальных исходных систем, обычно служа основой для принятия предварительного решения о целесообразности продолжения работы, а также для выявления проблем, которые необходимо будет решить на этапе проектирования. Метаданные затем могут быть использованы для обнаружения таких проблем, как недопустимые значения, опечатки, отсутствующие значения, неоднородное представление значений и дубликаты. Для различных структурных уровней выполняются различные виды анализа. Например, отдельные столбцы могут быть профилированы независимо друг от друга для понимания частотного распределения значений, типа данных и назначения каждого столбца. Внутренние зависимости между значениями могут быть выявлены при анализе столбцов в связке. Наконец, перекрывающиеся наборы значений, потенциально представляющие собой внешние ключи, связывающие сущности, могут быть исследованы при межтабличном анализе. Вычислительная сложность возрастает при переходе от профилирования отдельных столбцов к профилированию отдельных таблиц и, далее, к перекрестному структурному профилированию таблиц. Поэтому производительность является важным критерием оценки инструментов профилирования.
Когда проводится профилирование данных?
По словам Кимбалла, профилирование данных выполняется несколько раз с разной степенью детализации на протяжении всего процесса разработки хранилища данных. Первоначальная, обзорная оценка профилирования должна проводиться сразу после определения потенциальных исходных систем и подтверждения бизнес-требований к хранилищу данных и системам бизнес-аналитики (DW/BI). Цель этого предварительного анализа – как можно раньше выяснить, доступны ли необходимые данные с требуемым уровнем детализации и можно ли обработать обнаруженные аномалии. Если это не так, проект может быть закрыт. Кроме того, более глубокое профилирование проводится перед проектированием многомерной модели, чтобы оценить, что необходимо для преобразования данных в размерную модель. Детальное профилирование продолжается в процессе проектирования ETL-системы для определения данных, подлежащих извлечению, и фильтров, которые следует применить к набору данных. Помимо этого, профилирование данных может выполняться в процессе разработки хранилища данных после загрузки данных во временные таблицы, в марты данных и т.п. Проведение профилирования на этих этапах помогает убедиться, что очистка и преобразование данных выполнены корректно и в соответствии с требованиями.
Преимущества и примеры
Преимущества профилирования данных – повышение качества данных, сокращение сроков реализации крупных проектов и улучшение понимания данных пользователями. Обнаружение бизнес-знаний, скрытых в самих данных, является одним из значительных преимуществ профилирования данных. Профилирование данных – одна из наиболее эффективных технологий для повышения точности данных в корпоративных базах данных.