Кіріспе

Әртүрлі көздерден алынған деректерді біріктіру және бірыңғай көрініс беру Деректерді интеграциялау әртүрлі көздерден алынған деректерді біріктіруді және пайдаланушыларға олардың бірыңғай көрінісін ұсынуды қамтиды. Бұл процесс коммерциялық (мысалы, екі ұқсас компания өздерінің деректер базаларын біріктіруі қажет болған кезде) және ғылыми (мысалы, әр түрлі биоинформатикалық қоймалардан алынған зерттеу нәтижелерін біріктіру) салаларды қамтитын әртүрлі жағдайларда маңызды болады. Деректерді интеграциялау көлемі, күрделілігі (яғни үлкен деректер) мен қолданыстағы деректерді бөлісу қажеттілігінің артуымен жиі пайда болады. Ол кең көлемді теориялық жұмыстың басты тақырыбына айналды және көптеген ашық проблемалар шешілмеген болып қала береді. Деректерді интеграциялау ішкі және сыртқы пайдаланушылар арасындағы ынтымақтастықты ынталандырады. Интеграцияланатын деректер гетерогенді деректер базасы жүйесінен алынуы және клиенттер үшін файлдар желісі бойынша синхронды деректерді беретін бірыңғай бірізді деректер қоймасына айналуы тиіс. Деректер интеграциясының кең таралған қолданылуы - бұл бизнес ақпараты үшін пайдалы болуы мүмкін қолданыстағы деректер қорларынан ақпаратты талдау және алу кезінде деректерді өндіру.

Тарих

Гетерогенді дерек көздерін біріктіру мәселесі көбінесе ақпараттық силос ретінде аталады, бір сұрау интерфейсі бойынша біраз уақыттан бері бар. 1980 жылдардың басында компьютерлік ғалымдар гетерогендік деректер қорларының өзара әрекеттесуіне арналған жүйелерді жобалай бастады. Құрылымдалған метадеректерге негізделген алғашқы деректерді интеграциялау жүйесі 1991 жылы Миннесота университетінде Интеграцияланған қоғамдық пайдалану микродеректер сериясы (IPUMS) үшін жасалған. IPUMS деректер қоймасын құру әдісін қолданды, ол әртүрлі көздерден алынған деректерді алу, түрлендіру және бірегей көрініс схемасына жүктейді, сондықтан әртүрлі көздерден алынған деректер үйлесімді болады. IPUMS мыңдаған халық дерекқорын өзара іс-қимылға қабілетті етіп, ауқымды деректерді интеграциялаудың мүмкіндігін көрсетті. Деректер қоймасы әдісі тығыз байланысты архитектураны ұсынады, өйткені деректер бір ғана сұранысқа ие қоймада физикалық түрде келісілген, сондықтан сұраныстарды шешу үшін аз уақыт қажет. Деректер қоймасы әдісі жиі жаңартылатын деректер жиынтығы үшін мүмкін емес, сондықтан синхрондау үшін экстракттау, түрлендіру, жүктеу (ETL) процесін үнемі қайта орындау қажет. Деректер қоймаларын құру кезінде қиындықтар туындайды, егерде тек қана мәліметтер көздеріне сұрау интерфейсі болса және толық деректерге қол жетімділік болмаса. Бұл мәселе көбінесе саяхат немесе сыныпталған жарнама веб-қосымшалары сияқты бірнеше коммерциялық сұраныс қызметтерін біріктіргенде пайда болады. деректерді интеграциялау үрдісі деректерді еркін біріктіруге және ақпараттарды тікелей бастапқы деректер қорынан алуға мүмкіндік беретін аралас схема арқылы нақты уақыт деректеріне қол жеткізу үшін бірыңғай сұрау интерфейсін қамтамасыз етуге мүмкіндік берді (Көрші 2-ны қараңыз). Бұл сол дәуірде кең тараған SOA әдісіне сәйкес келеді. Бұл тәсіл аралас схема мен бастапқы көздердің схемасы арасындағы сәйкестендірулерге және сұранысты бастапқы деректер қорының схемасына сәйкес келетін бөлшектенген сұранымдарға аударуға негізделген. Мұндай сәйкестендірулерді екі жолмен нақтылау мүмкін: аралық схемадағы субъектілерден бастапқы көздердегі субъектілерге сәйкестендіру ("Global as View" (GAV) әдісі) немесе бастапқы көздердегі субъектілерден аралық схемаға сәйкестендіру ("Local as View" (LAV) әдісі). Соңғы тәсіл медиацияланған схемадағы сұранысты шешу үшін күрделірек тұжырымдарды қажет етеді, бірақ (тұрақты) медиацияланған схемаға жаңа дерек көздерін қосуды жеңілдетеді. Деректерді интеграциялау зерттеуіндегі кейбір жұмыстар семантикалық интеграция мәселесіне қатысты. Бұл мәселе интеграцияның архитектурасын құрылымдауды емес, гетерогендік дерек көздері арасындағы семантикалық қақтығыстарды қалай шешу керектігін қарастырады. Мысалы, егер екі компания өздерінің деректер базасын біріктірсе, олардың тиісті схемаларындағы "табыс" сияқты белгілі бір ұғымдар мен анықтамалар сөзсіз әртүрлі мағынаға ие болады. Бір деректер қорында бұл доллардағы пайданы білдіруі мүмкін (көшіп тұрған нүктелі сан), ал екіншісінде ол сату санын білдіруі мүмкін (толық сан). Мұндай проблемаларды шешудің жалпы стратегиясы схема терминдерін анық анықтайтын және осылайша семантикалық қақтығыстарды шешуге көмектесетін онтологияларды пайдалануды қамтиды. Бұл тәсіл онтологияға негізделген деректерді интеграциялауды білдіреді. Екінші жағынан, биоинформатиканың әртүрлі қоймаларынан алынған зерттеу нәтижелерін біріктіру мәселесі әртүрлі дерек көздерінен есептелген ұқсастықтарды оң болжамды құндылық сияқты бір өлшемшарт бойынша салыстыруды талап етеді. Бұл дерек көздерін тікелей салыстыруға мүмкіндік береді және тәжірибелердің табиғаты әртүрлі болған кезде де біріктіруге болады. Қазіргі деректер модельдеу әдістері әр деректер архитектурасына әртүрлі деректер мен ақпарат силоларының аралдары түрінде деректерді оқшаулауды енгізгендігі анықталды. Бұл деректерді оқшаулау - бұл деректерді модельдеу әдістемесінің қаламаған артефактісі, ол әртүрлі дерек модельдерін әзірлеуге әкеледі. Деректер базасы ретінде экрандықланған кезде, әртүрлі деректер модельдері әртүрлі деректер базасын құрайды. Деректерді оқшаулау артефактісін жою және интеграцияланған деректерді модельдеуді дамыту үшін жетілдірілген дерек модель әдістемелері әзірленді. Бір жетілдірілген деректер модельдеу әдісі стандартталған деректер субъектілері түріндегі құрылымдық метадеректермен то...

Мысал

Веб-қосымшаны қарастырайық, онда пайдаланушы қалалар туралы әр түрлі ақпаратты сұратуы мүмкін (мысалы, қылмыс статистикасы, ауа райы, қонақ үйлер, демография және т.б.). Әдетте ақпарат бір ғана схемамен бір деректер базасында сақталуы тиіс. Бірақ кез келген жеке кәсіпорын осындай кеңістікті жинауды қиындатып, қымбатқа түседі. Деректерді жинауға қажетті ресурстар болса да, ол қылмыс дерекқорында, ауа райы сайттарында және халық санағы деректеріінде бар деректерді қайталайды. Деректерді интеграциялау шешімі осы проблеманы осы сыртқы ресурстарды виртуалды медиацияланған схема бойынша материалдастырылған көріністер ретінде қарастыра отырып, "виртуалды деректерді интеграциялау" арқылы шешуі мүмкін. Бұл дегеніміз, қолданба жасаушылар виртуалды схеманы құрастырады - медиацияланған схема - пайдаланушылар қалайтын жауаптардың түрін ең жақсы модельдеу үшін. Бұдан кейін олар әрбір дереккөзге, мысалы қылмыс дерекқорына және ауа райы веб-сайтына арналған "жабықтарды" немесе адаптерлерді жобалайды. Бұл адаптерлер тек жергілікті сұраныс нәтижелерін (тиісті веб-сайттар немесе деректер қорлары қайтаратын) деректерді интеграциялау шешімі үшін оңай өңделетін нысанға айналдырады (2-суретті қараңыз). Қолданба пайдаланушысы аралас схемаға сұраныс жасаған кезде, деректерді интеграциялау шешімі осы сұранысты тиісті дерек көздері бойынша тиісті сұраныстарға айналдырады. Соңында виртуалды деректер қоры осы сұранымдардың нәтижелерін пайдаланушының сұранысына жауап ретінде біріктіреді. Бұл шешім жаңа көздерді қосудың ыңғайлылығын ұсынады, олар үшін адаптер немесе қолданбалы бағдарламалық жасақтама бледі жасау жеткілікті. Бұл ETL жүйелерімен немесе бірыңғай деректер базасы шешімдерімен қарама-қайшы, олар жүйеге жаңа деректер жиынтығын қолмен интеграциялауды қажет етеді. Виртуалды ETL шешімдері деректерді үйлестіруді іске асыру үшін виртуалды аралас схеманы қолданады; бұл арқылы деректер белгіленген "басты" көзден белгіленген мақсаттарға, өрістен өріске көшіріледі. Жоғары деңгейдегі деректерді виртуализациялау, сондай-ақ, хаб және спик архитектурасын пайдалана отырып, виртуалды медиацияланған схеманы немесе виртуалды метадеректер қоймасын құру үшін объектке бағдарланған модельдеу тұжырымдамасына негізделген. Әрбір дереккөз әртүрлі және дереккөздер арасындағы сенімді қосылыстарды қолдауға арналған емес. Сондықтан, деректерді виртуализациялау, сондай-ақ деректерді федерациялау деректерді және ақпаратты бір-бірінен айырмалы деректер жиынтықтарынан біріктіруді қолдау үшін кездейсоқ деректердің ортақтығына байланысты. Деректер көздеріндегі деректер мәнінің ортақ болмауынан қайтарылған жиынтық дұрыс емес, толық емес және растау мүмкін емес болуы мүмкін. Бір шешім - бұл дерекқорларды ETL қажетсіз біріктіру үшін әртүрлі дерекқорларды қайта құру. Қайта құрылған деректер қорлары деректер қорлары арасында референциялық тұтастықты жүзеге асыру мүмкін болатын ортақ шектеулерді қолдайды. Қайта құрылған деректер қорлары деректер қорлары бойынша деректер құндылығы ортақ болатын, жобаланған деректерге қол жеткізу жолдарын ұсынады.

Теория

Деректер интеграциясының теориясы, соның ішінде ұялы реляциялық / XML деректер қорлары және деректер қорларын бағдарлама ретінде қарастыратын деректер қорлары. Oracle немесе DB2 сияқты белгілі бір деректер базалары жүйелеріне қосылымдар JDBC сияқты іске асыру деңгейіндегі технологиялар арқылы қамтамасыз етіледі және теориялық деңгейде зерттелмейді.

Анықтамалар

Деректерді интеграциялау жүйелері ресми түрде тупель ретінде анықталады, онда жаһандық (немесе аралас) схема, бастапқы схемалардың гетерогендік жиынтығы және бастапқы және жаһандық схемалар арасындағы сұраныстарды картаға түсіретін карта. Екі және олардың әрқайсысы өздерінің қатынастарының белгілерімен құралған әліпбилер арқылы тілдерде айтылады. Карталау сұраныстар мен сұраныстар арасындағы мәлімдемелерден тұрады Пайдаланушылар деректерді интеграциялау жүйесіне сұраныс қойғанда, олар сұраныстарды қояды және карталау содан кейін жаһандық схемадағы элементтер мен бастапқы схемалардың арасындағы байланыстарды растайды. Схема бойынша деректер қоры әр қатынас үшін (реляциялық деректер базасында) бір жиынтық жиынтық ретінде анықталады. Деректер қорының бастапқы схемасына сәйкес келетін база әр түрлі гетерогендік дерек көздері үшін топтамалар жиынтығын қамтиды және дерекқордың бастапқы базасы деп аталады. Бұл бір көздік деректер қоры шын мәнінде ажыратылған деректер қорларының жиынтығын білдіруі мүмкін екеніне назар аударыңыз. Виртуалды аралас схемаға сәйкес келетін деректер қоры жаһандық деректер қоры деп аталады. Жалпы деректер қоры бастапқы деректер базасына қатысты сәйкестікті қанағаттандыруы тиіс. Бұл картаның заңдылығы олардың арасындағы сәйкестіктің сипатына байланысты және осы сәйкестікті модельдеудің екі танымал тәсілі бар: Global as View немесе GAV және Local as View немесе LAV. GAV жүйелері жалпы деректер базасын бұқаралық көріністер жиынтығы ретінде модельдейді. Бұл жағдайда сұранымның әрбір элементіне байланысты сұранысты өңдеу арасында жақсы анықталған қауымдастықтардың арқасында қарапайым операцияға айналады. Күрделілік жүктемесі деректерді интеграциялау жүйесіне деректерді қайнар деректер базасынан қалай алуға болатындығын нақты нұсқау беретін медиатор кодын іске асыруға жатады. Егер жүйеге жаңа көздер қосылса, медиаторды жаңарту үшін едәуір күш салу қажет болуы мүмкін, сондықтан көздер өзгеруі мүмкін емес болған жағдайда GAV әдісі артық көрінеді. Жоғарыда келтірілген деректерді интеграциялау жүйесінің үлгісіне GAV әдісі бойынша жүйе дизайнері алдымен әр қалалық ақпарат көздері үшін медиаторларды әзірлейді, содан кейін осы медиаторлардың айналасында жаһандық схеманы жобалайды. Мысалы, егер бір дерек көздері ауа райы веб-сайтына қызмет көрсеткен болса. Бұл жағдайда жобалаушы ауа райының тиісті элементін бүкіл әлемдегі схемаға қосады. Содан кейін барлық күш-жігерді ауа райы туралы мәліметтерді ауа райы веб-сайтына сұрау салуға айналдыратын тиісті медиаторлық кодты жазуға жұмсайды. Бұл күш-жігер басқа бір көз ауа райына қатысты болса, күрделі бола алады, өйткені дизайнерге екі көздің нәтижелерін дұрыс біріктіру үшін код жазу қажет болуы мүмкін. LAV-де, керісінше, дерекқор көздері ретінде үлгіленеді. Бұл жағдайда сұраныстың әрбір элементіне байланысты. Келесі бөлімде көрсетілгендей, элементтерді көздерден қалай алу керектігін анықтау жүгі сұрау процессорына жүктеледі. LAV модельдеудің пайдасы жаңа көздерді GAV жүйесіне қарағанда әлдеқайда аз жұмыспен қосуға болады, сондықтан LAV тәсілі аралас схема тұрақтылығы төмен немесе өзгеруі мүмкін жағдайларда артықшылықты болуы керек. Конъюнктивті сұранысты " қайда " сияқты деректер базасының қатынастарына қолданылатын логикалық функция ретінде қарастыруға болады. Егер тупл немесе тупл жиынтығы ережеге ауыстырылса және оны қанағаттандырса (нақты етеді), онда біз бұл туплды сұраныстағы жауаптар жиынтығының бөлігі деп санаймыз. Datalog сияқты ресми тілдер бұл сұраныстарды қысқаша және түсініксіз түрде білдірсе, жалпы SQL сұраныстары да конъюнктивті сұраныстар ретінде есептеледі. Деректерді интеграциялау тұрғысынан алғанда, "сұрауды ұстау" конъюнктивті сұранымдардың маңызды қасиеттерін білдіреді. Сұрау салуда басқа сұрау салу бар (белгісімен) егер қолдану нәтижелері кез-келген деректер қорына қолдану нәтижелерінің кіші жиынтығы болса. Егер алынған жиынтықтар кез келген деректер қоры үшін бірдей болса, екі сұраныс тең тең деп саналады. Бұл маңызды, өйткені GAV және LAV жүйелерінде пайдаланушы виртуалды схема бойынша конъюнктивті сұраныстарды ұсынады, бұл көріністер жиынтығы немесе "материалданған" конъюнктивті сұраныстар. Интеграция көріністер арқылы ұсынылған сұраныстарды қайта жазуға тырысады, олардың нәтижелері біздің пайдаланушының сұранысына сәйкес немесе барынша қамтылуы үшін. Бұл көріністерді (AQUV) пайдала...