Введение

Поиск и извлечение информации из полуструктурированных наборов данных Структурный майнинг или добыча структурированных данных - это процесс поиска и извлечения полезной информации из полуструктурированных наборов данных. Графический майнинг, последовательный майнинг паттернов и молекулярный майнинг являются особыми случаями структурированного майнинга данных.

Описание

Рост использования полуструктурированных данных создал новые возможности для добычи данных, которая традиционно была связана с табличными наборами данных, что отражает сильную связь между добычей данных и реляционными базами данных. Большая часть интересных и добываемых данных в мире не легко складывается в реляционные базы данных, хотя поколение инженеров-программистов было обучено полагать, что это единственный способ обработки данных, и алгоритмы добычи данных, как правило, разрабатывались только для обработки табличных данных. XML, являясь наиболее распространенным способом представления полуструктурированных данных, способен представлять как табличные данные, так и произвольные деревья. Любое конкретное представление данных, которые должны быть обменены между двумя приложениями в XML, обычно описывается схемой, часто написанной в XSD. Практические примеры таких схем, например NewsML, обычно очень сложные, содержащие несколько дополнительных поддеревьев, используемых для представления данных специальных случаев. Обычно около 90% схемы касается определения этих необязательных элементов данных и подделок. Поэтому сообщения и данные, которые передаются или кодируются с использованием XML и соответствуют одной и той же схеме, могут содержать очень разные данные в зависимости от того, что передается. Такие данные представляют большие проблемы для обычного добычи данных. Два сообщения, соответствующие одной и той же схеме, могут иметь мало общего в данных. Создание учебного набора из таких данных означает, что если бы кто-то попытался отформатировать его в виде табличных данных для обычного добычи данных, большие разделы таблиц были бы или могли быть пустыми. В разработке большинства алгоритмов добычи данных существует молчаливое предположение, что представленные данные будут полными. Другая необходимость заключается в том, что фактические алгоритмы добычи, используемые, будь то контролируемые или не контролируемые, должны иметь возможность обрабатывать скудные данные. Например, алгоритмы машинного обучения плохо работают с неполными наборами данных, где предоставляется только часть информации. Например, методы, основанные на нейронных сетях. или алгоритм ID3 Росса Куинлана. высокой точности при использовании хороших и репрезентативных образцов проблемы, но плохо работают с предвзятыми данными. В большинстве случаев достаточно более качественной презентации модели с более тщательным и объективным представлением входных и выходных данных. Особенно важной областью, где поиск соответствующей структуры и модели является ключевым вопросом, является текстовое майнинг. XPath - это стандартный механизм, используемый для ссылки на узлы и элементы данных в XML. Он имеет сходство со стандартными методами навигации по иерархии каталогов, используемыми в пользовательских интерфейсах операционных систем. Для добычи и структурирования XML-данных любой формы требуется как минимум два расширения для обычного добычи данных. Это возможность ассоциировать инструкцию XPath с любым паттерном данных и подзаявлениями с каждым узлом данных в паттерне данных, а также возможность извлекать наличие и количество любого узла или набора узлов в документе. Например, если кто-то должен был представлять генеалогическое дерево в XML, используя эти расширения, можно создать набор данных, содержащий все отдельные узлы в дереве, элементы данных, такие как имя и возраст при смерти, и количество связанных узлов, таких как количество детей. Более сложные поиски могут получить данные, такие как продолжительность жизни бабушки и дедушки и т. д. Добавление этих типов данных, связанных со структурой документа или сообщения, облегчает извлечение структур.