Кіріспе

Ақпаратты алу технологиясы Федералдық іздеу бір немесе бірнеше іздеу жүйелерінің үстінде жасалған іздеу бағдарламасы арқылы әртүрлі көздерден ақпарат алады. Пайдаланушы бір ғана сұраныс сұранысын жасайды, ол федерацияға қатысатын іздеу жүйелеріне, деректер базаларына немесе басқа да сұраныс жүйелеріне таратылады. Кейіннен біріктірілген іздеу іздеу жүйелерінен алынған нәтижелерді пайдаланушыға ұсыну үшін жинақтап береді. Федерацияланған іздеуді бір үлкен ұйым ("кәсіпорын") немесе бүкіл веб үшін әртүрлі ақпараттық ресурстарды біріктіру үшін пайдалануға болады. Федерацияланған іздеу, үлестірілген іздеуден айырмашылығы, іздеу ресурстарының орталықтандырылған үйлестіруін қажет етеді. Бұл жеке іздеу жүйелеріне жіберілген сұраныстарды үйлестіруді және олардың әрқайсысы қайтаратын іздеу нәтижелерін біріктіруді қамтиды.

Мақсаты

Федерацияланған іздеу бір сұраныспен бірнеше әртүрлі мазмұн көздерін іздеу қажеттілігін қанағаттандыру үшін пайда болды. Бұл пайдаланушыға бірнеше деректер қорын бір уақытта нақты уақытта іздеуге, әртүрлі деректер қорының нәтижелерін пайдалы нысанға орналастыруға және нәтижелерді пайдаланушыға ұсынуға мүмкіндік береді. Бұл ақпараттарды агрегациялау немесе интеграциялау әдісі, ол көптеген ақпараттық ресурстарға бірден қол жеткізуді қамтамасыз етеді және әдетте деректерді стандартты немесе ішінара біртекті түрде қайтарады. Басқа тәсілдерге Enterprise деректер қоймасын, Деректер көлін немесе Деректер хабын құру жатады. Федерацияланған іздеу сұраныстары көптеген жолдармен (әрбір көз жеке-жеке сұралады), басқа тәсілдер деректерді импорттап, бірнеше рет түрлендіреді, әдетте бір түндегі топтық процестерде. Федералдық іздеу барлық көздерді нақты уақыт режимінде көрсетеді (барлығы онлайн және қол жетімді болған жағдайда). LinkedIn сияқты өнеркәсіптік іздеу жүйелерінде федералды іздеу екіжақты сұраныстар үшін тік артықшылықты жекелендіру үшін қолданылады. Мысалы, пайдаланушы LinkedIn-де "машиналық оқыту" сияқты сұранысты шығара отырып, ол машиналық оқыту дағдылары бар адамдарды, машиналық оқыту дағдыларын немесе тақырыпқа қатысты мазмұнды қажет ететін жұмыстарды іздеуді білдіруі мүмкін. Мұндай жағдайларда федеративтік іздеу әрбір жеке пайдаланушы үшін тік ретті жекелестыру үшін пайдаланушының ниеттерін (мысалы, жұмысқа алу, жұмыс іздеу немесе контент тұтыну) пайдалана алады.

Процесс

Питер Джаксоның (2004) сипаттауы бойынша, федерацияланған іздеу (1) сұранысты түрлендіруден және оны тиісті синтаксиспен бір-бірінен бөлек деректер базаларының немесе басқа веб-ресурстардың тобына таратудан, (2) деректер базаларынан жиналған нәтижелерді біріктіруден, (3) оларды минималды қайталанумен қысқа және біріктірілген форматта ұсынудан және (4) біріктірілген нәтижелер жиынтығын сұрыптау үшін автоматты түрде немесе портал пайдаланушысы арқылы жасалатын құралдарды ұсынудан тұрады. Коммерциялық немесе ашық қолжетімділіктегі федерацияланған іздеу порталдары әдетте қоғамдық қолжетімділіктегі библиографиялық деректер қорларын, қоғамдық қолжетімділіктегі Веб-ке негізделген кітапхана каталогтарын (OPAC), Google сияқты Веб-ке негізделген іздеу жүйелерін және / немесе ашық қолжетімділікті, үкіметтік немесе корпоративтік деректер жинақтарын іздеу. Осы жеке ақпарат көздері портал интерфейсіне іздеу сұранысының нәтижелерінің тізімін қайтарады. Пайдаланушы осы тізімді қарап шыға алады. Кейбір порталдар тек дерекқордың нақты нәтижелерін ғана скраптайды және пайдаланушыға тікелей ақпарат көзінің қосымшасына кіруге мүмкіндік бермейді. Ең күрделілері нәтижелер тізімін біріктіру және қайталануды жою арқылы анықтайды. Көптеген порталдарда қосымша мүмкіндіктер бар, бірақ негізгі идея бірдей: жеке іздеулердің дәлдігі мен маңыздылығын жақсарту, сондай-ақ ресурстарды іздеуге қажетті уақытты қысқарту. Бұл процесс қазіргі кездегі сканерлік іздеу жүйелерімен салыстырғанда кейбір негізгі артықшылықтарды ұсынады. Федеративтік іздеу жеке ақпарат көздерінің иелеріне көбейген трафикті басқарудан басқа ешқандай талаптарды немесе жүктемелерді қоюға тиіс емес. Федеративтік іздеулер жеке ақпарат көздері сияқты қазіргі уақыттағыдай, өйткені олар нақты уақытта ізделеді.

Іске асыру

Федеративтік іздеудің бір түрі - метаізделу жүйесі. Алайда метаіздестіру әдісі компоненттік іздеу жүйелерінің кемшіліктерін, мысалы, толық емес индекстерді жоймайды. Іздеу жүйелері индекстемейтін құжаттар Deep Web немесе көзге көрінбейтін Web деп аталатын нәрсеге айналады. Google Scholar - бұл іздеу жүйелері елемейтін электрондық құжаттарды индекстеу арқылы осы мәселені шешуге тырысатын көптеген жобалардың бірі. Мета-іздестіру әдісі, іздеу жүйесінің технологиясы сияқты, тек электрондық түрде сақталған ақпарат көздерімен жұмыс істейді. Метаіздестірудің басты міндеттерінің бірі - іздеу сұранысының біріктіріліп, біріктірілетін компоненттік іздеу жүйелерімен үйлесімділігін қамтамасыз ету. Егер іздеу жүйесінің іздеу сөздіктері немесе дерек моделі бір немесе бірнеше шетелдік мақсатты жүйелердің дерек моделіне қарағанда өзгеше болса, сұранысты әрбір шетелдік мақсатты жүйеге аудару керек. Бұл қарапайым деректер элементтерінің аудармасын пайдалану арқылы немесе семантикалық аударманы қажет етуі мүмкін. Мысалы, егер бір іздеу тетігі нақты тізбектерді немесе n граммды келтіруге мүмкіндік берсе, ал екіншісі болмаса, сұранысты әр іздеу тетігімен үйлесімді етіп аудару керек. Цитаталанған нақты тізбек сұранысын аудару үшін оны әр іздеу тетігінде қажетті іздеу нәтижелерін беру мүмкіндігі бар N грамм жинағына бөлуге болады. Федерацияланған іздеу жүйелерін іске асыруда кездесетін тағы бір қиындық - масштабталуы. Бірлескен іздеу жүйесінің жылдамдығын сақтау қиын, өйткені ол әрдайым көп ақпарат көздерін біріктіреді. Бұл мәселені шешу үшін біріккен іздестірудің бір түрі - АҚШ Энергетика министрлігінің Ғылыми және техникалық ақпарат кеңсесі ұйымдастырған WorldWideScience. WorldWideScience 40-тан астам ақпарат көздерінен тұрады, олардың бірнешеуі біріккен іздеу порталдары болып табылады. Осындай порталдардың бірі - "Ғылым". gov, ол өз кезегінде АҚШ Федералды үкіметінің ҒЗТ өнімінің көпшілігін білдіретін 30-дан астам ақпарат көздерін біріктіреді. Ғылым. gov ең жоғары рейтингті нәтижелерді WorldWideScience-ке қайтарады, содан кейін бұл нәтижелерді WorldWideScience құрамына кіретін басқа ақпарат көздері қайтаратын іздеумен біріктіреді және санайды. Sesam Search Application Toolkit дегеннің аббревиатурасы - параллель және құбыржолдық іздеулерді өңдеу үшін қажетті негіз мен функционалдылықтың көп бөлігін қамтамасыз ететін және оларды пайдаланушы интерфейсінде сәнді түрде көрсететін платформа, инженерлерге индекс / деректер қорының конфигурациясын реттеуге назар аударуға мүмкіндік береді. Федерацияланған іздеудегі тік ретті жекелендіру үшін LinkedIn іздеу жүйесі Apache 2.0 лицензиясы бойынша шығарылған ашық кодты федерацияланған іздеу жүйесі болып табылады. Ол танымал ашық бастапқы кодты іздеу жүйелеріне алдын ала жасалған қосылымдарды қамтиды және косинус векторының ұқсастығын пайдалана отырып, нәтижелерді қайтарады.