Кіріспе
Құрылымдық қазба немесе құрылымды деректерді қазба - жартылай құрылымды дерек жиынтығынан пайдалы ақпаратты табу және алу процесі. Графиктік, ретті модельдік және молекулалық тау-кен өндіру - құрылымдалған деректер тау-кенінің ерекше жағдайлары.
Structure mining or structured data mining is the process of finding and extracting useful information from semi structured data sets. Graph mining, sequential pattern mining and molecule mining are special cases of structured data mining.
Сипаттама
Жартылай құрылымдалған деректерді қолданудың өсуі дәстүрлі түрде кестелік деректер жиынтығына қатысты деректерді өндірудің жаңа мүмкіндіктерін жасады, бұл деректерді өндіру мен реляциялық деректер қорлары арасындағы тығыз байланысты көрсетеді. Әлемдегі қызықты және пайдалы деректердің көп бөлігі реляциялық деректер қорына оңай бүктелмейді, дегенмен бағдарламалық жасақтама инженерлерінің ұрпағы деректерді өңдеудің жалғыз жолы екеніне сену үшін оқытылған, ал деректерді өндіру алгоритмдері әдетте кестелік деректерді өңдеу үшін ғана әзірленген. XML жартылай құрылымдалған деректерді бейнелеудің ең жиі қолданылатын тәсілі болып табылады, ол кестелік деректерді де, кездейсоқ ағаштарды да бейнелей алады. XML-де екі қолданба арасында алмасатын деректердің кез келген белгілі бір бейнелеуі әдетте XSD-де жазылған схемамен сипатталады. Мұндай схемалардың практикалық мысалдары, мысалы NewsML, әдетте өте күрделі, онда арнайы жағдай деректерін көрсетуге арналған бірнеше ерікті кіші ағаштар бар. Жиі схеманың шамамен 90%-ы осы ерікті деректер элементтері мен кіші ағаштардың анықталуына қатысты. Сондықтан, XML-ті қолдана отырып жіберілетін немесе кодталатын және бірдей схемаға сәйкес келетін хабарламалар мен деректер, жіберілетін нәрсеге байланысты, әртүрлі деректерді қамтуы мүмкін. Мұндай деректер дәстүрлі деректер өндіруде үлкен проблемалар тудырады. Бір схемаға сәйкес келетін екі хабарламада ортақ деректер аз болуы мүмкін. Мұндай деректерден оқу жиынтығын құру дегеніміз, егер оны әдеттегі деректер қазу үшін кестелік деректер ретінде пішімдеуге тырысса, кестелердің үлкен бөліктері бос болады немесе бос болуы мүмкін. Деректер қазбасының көпшілігінде ұсынылған деректер толық болады деген тұжырым жасалады. Басқа қажеттілік - бақылаумен немесе бақылаусыз пайдаланылатын нақты тау-кен алгоритмдері аз деректерді өңдеуге қабілетті болуы керек. Яғни, машиналық оқыту алгоритмдері ақпараттың тек бір бөлігі ғана берілген толық емес деректер жиынтығымен нашар жұмыс істейді. Мысалы, нейрондық желілерге негізделген әдістер. немесе Росс Квинланның ID3 алгоритмі. проблеманың жақсы және өкілді үлгілерімен өте дәл, бірақ жағымсыз деректермен нашар орындалады. Көбінесе кіріс пен шығыстың мұқият және бейтарап бейнеленуімен бірге модельдің жақсы ұсынылуы жеткілікті. Тиісті құрылым мен модельді табудың басты мәселесі болып табылатын ерекше маңызды сала - мәтін өндіру. XPath - XML-дегі түйіндер мен деректер элементтеріне сілтеме жасау үшін қолданылатын стандартты механизм. Ол операциялық жүйелердің пайдаланушы интерфейстерінде қолданылатын каталог иерархиясын басқарудың стандартты әдістеріне ұқсас. Кез келген нысандағы XML деректерін өндіру және құрылымдау үшін әдеттегі деректерді өндіру үшін кем дегенде екі кеңейту қажет. Бұл XPath нұсқаулығын кез келген деректер үлгісімен және әрбір деректер түйінімен әрбір деректер түйінімен байланыстыратын мүмкіндік және құжат ішіндегі кез келген түйіннің немесе түйіндер жиынтығының болуы мен санын табу мүмкіндігі. Мысалы, егер XML-де туыстық ағашты бейнелеу керек болса, осы кеңейтулерді пайдаланып, ағаштағы барлық жеке түйіндер, атау және қайтыс болған кездегі жас сияқты деректер элементтері және балалардың саны сияқты байланысты түйіндердің саны бар деректер жиынтығын құруға болады. Алдымен, ата-аналар мен ата-аналар арасындағы байланыс туралы мәліметтерді іздестіру керек. Құжат немесе хабарламаның құрылымына байланысты осы дерек түрлерін қосу құрылымды қазуды жеңілдетеді.