Введение
Поиск и извлечение информации из полуструктурированных наборов данных Структурный майнинг или добыча структурированных данных - это процесс поиска и извлечения полезной информации из полуструктурированных наборов данных. Графический майнинг, последовательный майнинг паттернов и молекулярный майнинг являются особыми случаями структурированного майнинга данных.
Structure mining or structured data mining is the process of finding and extracting useful information from semi structured data sets. Graph mining, sequential pattern mining and molecule mining are special cases of structured data mining.
Описание
Рост использования полуструктурированных данных создал новые возможности для добычи данных, которая традиционно была связана с табличными наборами данных, что отражает сильную связь между добычей данных и реляционными базами данных. Большая часть интересных и добываемых данных в мире не легко складывается в реляционные базы данных, хотя поколение инженеров-программистов было обучено полагать, что это единственный способ обработки данных, и алгоритмы добычи данных, как правило, разрабатывались только для обработки табличных данных. XML, являясь наиболее распространенным способом представления полуструктурированных данных, способен представлять как табличные данные, так и произвольные деревья. Любое конкретное представление данных, которые должны быть обменены между двумя приложениями в XML, обычно описывается схемой, часто написанной в XSD. Практические примеры таких схем, например NewsML, обычно очень сложные, содержащие несколько дополнительных поддеревьев, используемых для представления данных специальных случаев. Обычно около 90% схемы касается определения этих необязательных элементов данных и подделок. Поэтому сообщения и данные, которые передаются или кодируются с использованием XML и соответствуют одной и той же схеме, могут содержать очень разные данные в зависимости от того, что передается. Такие данные представляют большие проблемы для обычного добычи данных. Два сообщения, соответствующие одной и той же схеме, могут иметь мало общего в данных. Создание учебного набора из таких данных означает, что если бы кто-то попытался отформатировать его в виде табличных данных для обычного добычи данных, большие разделы таблиц были бы или могли быть пустыми. В разработке большинства алгоритмов добычи данных существует молчаливое предположение, что представленные данные будут полными. Другая необходимость заключается в том, что фактические алгоритмы добычи, используемые, будь то контролируемые или не контролируемые, должны иметь возможность обрабатывать скудные данные. Например, алгоритмы машинного обучения плохо работают с неполными наборами данных, где предоставляется только часть информации. Например, методы, основанные на нейронных сетях. или алгоритм ID3 Росса Куинлана. высокой точности при использовании хороших и репрезентативных образцов проблемы, но плохо работают с предвзятыми данными. В большинстве случаев достаточно более качественной презентации модели с более тщательным и объективным представлением входных и выходных данных. Особенно важной областью, где поиск соответствующей структуры и модели является ключевым вопросом, является текстовое майнинг. XPath - это стандартный механизм, используемый для ссылки на узлы и элементы данных в XML. Он имеет сходство со стандартными методами навигации по иерархии каталогов, используемыми в пользовательских интерфейсах операционных систем. Для добычи и структурирования XML-данных любой формы требуется как минимум два расширения для обычного добычи данных. Это возможность ассоциировать инструкцию XPath с любым паттерном данных и подзаявлениями с каждым узлом данных в паттерне данных, а также возможность извлекать наличие и количество любого узла или набора узлов в документе. Например, если кто-то должен был представлять генеалогическое дерево в XML, используя эти расширения, можно создать набор данных, содержащий все отдельные узлы в дереве, элементы данных, такие как имя и возраст при смерти, и количество связанных узлов, таких как количество детей. Более сложные поиски могут получить данные, такие как продолжительность жизни бабушки и дедушки и т. д. Добавление этих типов данных, связанных со структурой документа или сообщения, облегчает извлечение структур.