Введение
В метаданных, обнаружение метаданных (также сбор метаданных) — это процесс использования автоматизированных инструментов для выявления семантики элемента данных в наборах данных. Этот процесс обычно завершается созданием набора соответствий между элементами исходных данных и централизованным реестром метаданных. Обнаружение метаданных также известно как сканирование метаданных.
Лексическое совпадение
Точное совпадение – это установление связи между элементами данных на основе точного соответствия имени столбца в базе данных, имени элемента XML или метки на экране. Например, если столбец базы данных имеет имя "PersonBirthDate", а элемент данных в реестре метаданных также имеет имя "PersonBirthDate", автоматизированные инструменты могут сделать вывод, что столбец базы данных имеет ту же семантику (значение), что и элемент данных в реестре метаданных. Совпадение по синонимам – это когда инструменту обнаружения предоставляется не одно имя, а набор синонимов. Совпадение по шаблону – в этом случае инструменту предоставляется набор лексических шаблонов для сопоставления. Например, инструмент может искать "*пол*" или "*sex*".
Семантическое совпадение
Семантическое сопоставление – это попытка использовать семантику для сопоставления целевых данных с зарегистрированными элементами данных. Семантическое сходство достигается с помощью алгоритма, основанного на базе данных, определяющей концептуальную близость слов. Например, система WordNet может ранжировать, насколько близко слова связаны по смыслу. Так, термины "личность", "индивид" и "человек" могут представлять собой высокопохожие концепции.
Статистическое сопоставление
Статистическое сопоставление использует статистические данные об источниках данных для определения сходства с зарегистрированными элементами данных. Анализ уникальных значений – путем анализа всех уникальных значений в столбце можно установить сходство с зарегистрированным элементом данных. Например, если столбец содержит только два уникальных значения: «мужской» и «женский», его можно сопоставить с элементом «PersonGenderCode». Анализ распределения данных – путем анализа распределения значений в одном столбце и сравнения этого распределения с известными элементами данных можно установить семантическую связь.