Введение

В вычислительной технике и управлении данными, сопоставление данных — это процесс установления соответствия между элементами данных в двух различных моделях данных. Сопоставление данных используется как первый шаг для широкого спектра задач интеграции данных, включая:

Преобразование данных или посредничество между источником данных и целевым назначением.
Определение взаимосвязей данных в рамках анализа происхождения данных.
Выявление скрытых конфиденциальных данных, таких как последние четыре цифры номера социального страхования, замаскированных в другом идентификаторе пользователя, в рамках проекта маскировки или деидентификации данных.
Консолидация нескольких баз данных в единую базу данных и выявление избыточных столбцов данных для консолидации или удаления.

Например, компания, желающая обмениваться информацией о покупках и счетах-фактурах с другими компаниями, может использовать сопоставление данных для создания схем сопоставления данных из корпоративных данных в стандартизированные сообщения ANSI ASC X12 для таких элементов, как заказы на покупку и счета-фактуры.

Стандарты

X12 стандарты – это универсальные стандарты электронного обмена данными (EDI), разработанные для обеспечения возможности обмена данными между компаниями, независимо от сферы их деятельности. Поддержкой стандартов занимается Аккредитованный комитет по стандартам X12 (ASC X12), а Американский национальный институт стандартов (ANSI) уполномочен устанавливать стандарты для EDI. Стандарты X12 часто называют стандартами ANSI ASC X12. W3C представил R2RML как стандарт для сопоставления данных из реляционной базы данных с данными, представленными в терминах Resource Description Framework (RDF). В будущем инструменты, основанные на семантических веб-технологиях, таких как RDF, Web Ontology Language (OWL) и стандартизированный реестр метаданных, сделают сопоставление данных более автоматизированным. Этот процесс ускорится, если каждое приложение будет осуществлять публикацию метаданных. Полная автоматизация сопоставления данных – очень сложная задача (см. семантический перевод).

Ручной графический код

Картографирование данных может выполняться различными способами, включая использование процедурного кода, создание XSLT-преобразований или применение графических инструментов, которые автоматически генерируют исполняемые программы преобразования. Это графические инструменты, позволяющие пользователю "проводить" линии от полей в одном наборе данных к полям в другом. Некоторые графические инструменты для картографирования данных позволяют пользователям "автоматически соединять" источник и назначение. Эта функция зависит от совпадения имен элементов исходных и целевых данных. Программы преобразования автоматически создаются на SQL, XSLT, Java или C++. Подобные графические инструменты обычно входят в состав большинства ETL (извлечение, преобразование и загрузка) инструментов и служат основным способом ввода карт данных для поддержки перемещения данных. Примерами являются SAP BODS и Informatica PowerCenter.

Картирование на основе данных

Это новейший подход к сопоставлению данных, который предполагает одновременную оценку реальных значений данных в двух источниках с использованием эвристических методов и статистики для автоматического выявления сложных соответствий между двумя наборами данных. Этот подход применяется для поиска преобразований между двумя наборами данных, включая обнаружение подстрок, конкатенаций, арифметических операций, условных операторов, а также других видов логики преобразования. Кроме того, этот подход позволяет выявлять аномалии в данных, которые не соответствуют выявленной логике преобразования.

Семантическое отображение

Семантическое сопоставление аналогично функции автоматического соединения в картографирующих инструментах данных, за исключением того, что для поиска синонимов элементов данных можно обратиться к реестру метаданных. Например, если в исходной системе поле называется FirstName, а в целевой – PersonGivenName, сопоставление все равно будет выполнено, если эти элементы данных указаны как синонимы в реестре метаданных. Семантическое сопоставление способно обнаруживать только точные соответствия между столбцами данных и не выявляет никакой логики преобразования или исключения между столбцами. Отслеживание происхождения данных – это запись жизненного цикла каждого элемента данных по мере его загрузки, обработки и вывода аналитической системой. Это обеспечивает прозрачность аналитического конвейера и упрощает отслеживание ошибок до их первопричин. Оно также позволяет воспроизводить определенные участки или входные данные потока данных для пошаговой отладки или восстановления потерянных результатов. Фактически, системы баз данных уже используют подобную информацию, называемую происхождением данных, для решения аналогичных задач проверки и отладки.