Кіріспе

Деректер жиынтығында әр түрлі дерек көздерінен бірдей нысанға сілтеме жасайтын жазбаларды табу (деректерді сәйкестендіру, деректерді байланыстыру, нысанды анықтау және тағы да басқа атаулармен белгілі) – деректер жиынтығында әр түрлі дерек көздерінен (мысалы, дерек файлдары, кітаптар, веб-сайттар және деректер базалары) бірдей нысанға сілтеме жасайтын жазбаларды табу міндеті. Жазбаларды байланыстыру әр түрлі деректер жиынтықтарын біріктіргенде қажет болады, олар ортақ идентификаторды (мысалы, деректер базасының кілті, URI, ұлттық идентификациялық нөмірі) бөлісе алады немесе бөліспеуі мүмкін, бұл жазба пішіміндегі, сақтау орнындағы немесе деректерді жинаушының стилі немесе қалауындағы айырмашылықтарға байланысты болуы мүмкін. RL-ге бағытталған сәйкестендіруден өткен деректер жиынтығы өзара байланысты деректер жиынтығы деп аталады.

Атау беру ережесі

"Жазбаны байланыстыру" – статистиктер, эпидемиологтар, тарихшылар және тағы басқалар бір дерек көзінен екінші дерек көзіндегі бірдей объектіні сипаттайтын жазбаларды біріктіру процесін сипаттау үшін қолданатын термин. Дегенмен, осы процесті атау үшін көптеген басқа да терминдер қолданылады. Өкінішке орай, терминологияның көп болуы осы зерттеу қауымдастықтары арасындағы сілтемелердің аз болуына әкеп соқты. Компьютер ғалымдары оны "деректерді салыстыру" немесе "объектінің идентификациялық мәселесі" деп атайды. Коммерциялық пошта және деректер базасы қолданбалары оны "біріктіру/тазалау процесі" немесе "тізімді тазарту" деп атайды. Осы ұғымды сипаттау үшін қолданылатын басқа атаулар: "корреференция/объект/таныстыру/аты/жазбаны анықтау", "объектіні анықтау/байланыстыру", "шамалы сәйкестік", "қайталауды анықтау", "қайталаудан тазалау", "жазбаларды салыстыру", "(анықтамалық) келісу", "объектіні идентификациялау", "деректер/ақпаратты интеграциялау" және "біріктіру". Олар ұқсас атауларды бөліссе де, жазбаны байланыстыру және байланысты деректер – деректерді өңдеу және құрылымдаудың екі бөлек тәсілі. Екеуі де әртүрлі деректер жиынтықтарындағы сәйкес келетін объектілерді анықтаумен айналысса да, жазбаны байланыстыру "объектілерді" адамдармен теңестіреді; ал байланысты деректер деректер жиынтықтарындағы кез келген веб-ресурсты байланыстыру мүмкіндігіне негізделген, сондай-ақ идентификатордың кең ұғымын, атап айтқанда URI-ді пайдаланады.

Тарих

Жазбаларды байланыстыру туралы алғашқы идея 1946 жылы Халберт Л. Даннның "Американдық қоғамдық денсаулық журналында" жарияланған "Жазбаларды байланыстыру" атты мақаласына қайнар көз болады. Говард Борден Ньюкомб 1959 жылы "Science" журналындағы мақаласында қазіргі заманғы жазба байланысы теориясының ықтималдық негізін қалады. Бұлар 1969 жылы Иван Феллеги мен Алан Сантердің "Жазбаларды байланыстыру теориясы" атты новаторлық еңбегінде ресми түрде бекітілді, онда олар сипаттаған ықтималдық шешім ережесінің салыстыру атрибуттары шартты түрде тәуелсіз болған жағдайда ең тиімді екенін дәлелдеді. Олар өз жұмыстарында есептеу және автоматтандыру саласындағы жетістіктерді үлкен көлемдегі әкімшілік деректер жинағына қолдануға қызығушылықтың артып келе жатқанын мойындады, ал Феллеги-Сантер теориясы көптеген жазба байланыстыру қолданбалары үшін математикалық негіз болып табылады. 1990 жылдардың соңынан бері, түрлі машиналық оқыту техникалары жасалды, олар тиімді жағдайларда Феллеги-Сантер теориясы үшін қажетті шартты ықтималдықтарды бағалауға қолданылуы мүмкін. Бірнеше зерттеушілер Феллеги-Сантер алгоритмінің шартты тәуелсіздік туралы болжамы тәжірибеде көбінесе бұзылатынын хабарлады; алайда, салыстыру атрибуттары арасындағы шартты тәуелділікті нақты модельдеуге жасалған жарияланған әрекеттер жазба байланысының сапасын жақсартуға әкелген жоқ. Керісінше, осы болжамдарға сүйенбейтін машиналық оқыту немесе нейрондық желі алгоритмдері жеткілікті мөлшерде белгіленген оқу деректері болған кезде әлдеқайда жоғары дәлдік береді. Жазбаларды байланыстыру компьютердің көмегінсіз де жүзеге асырылуы мүмкін, бірақ компьютерлерді жазбаларды байланыстыру үшін жиі пайдаланудың басты себептері – қолмен тексеруді азайту немесе тоқтату және нәтижелерді оңай қайта өндіруге мүмкіндік беру. Компьютерлік сәйкестендірудің артықшылықтары – өңдеуді орталықтандыру, сапаны жақсарту, жылдамдық, тұрақтылық және нәтижелерді жақсырақ қайта өндіру.

Деректерді алдын ала өңдеу

Жазбаларды байланыстыру байланыстырылатын деректердің сапасына өте сезімтал, сондықтан қарастырылып отырған барлық дерек жиынтықтары (әсіресе олардың негізгі идентификаторлары) жазбаларды байланыстыру алдында дерек сапасын бағалаудан өтуі керек. Бір нысанның көптеген негізгі идентификаторлары дерек жиынтықтары арасында (тіпті олардың ішінде) әртүрлі форматта ұсынылуы мүмкін, бұл олар туралы алдын ала білмесе, жазбаларды байланыстыруды қиындатады. Мысалы, Уильям Дж. Смит есімді адамның негізгі идентификаторлары үш түрлі дерек жиынтығында былай көрінуі мүмкін:

Дерек жиынтығы Аты Туған күні Тұрғылықты қаласы Дерек жиынтығы 1 Уильям Дж. Смит 1973-02-01 Беркли, Калифорния Дерек жиынтығы 2 Смит, В. Дж. 1973.01.02 Беркли, Калифорния Дерек жиынтығы 3 Билл Смит 1973-01-02 Беркли, Калифорния. Бұл мысалда әртүрлі пішімдеу стильдері бірдей логикалық идентификатор мәндері бар, бірақ әртүрлі көрінетін жазбаларға әкеледі. Көптеген, мүмкін барлық жазбаларды байланыстыру стратегиялары осы мәндерді біркелкі форматқа қалыпқа келтірген немесе стандарттаған жағдайда дәлірек нәтиже береді (мысалы, барлық есімдер «Тегі, Аты» түрінде, ал барлық күндер «ЖЖЖЖ/ЖЖ/КК» түрінде). Стандарттау қарапайым ережелерге негізделген деректерді түрлендіру арқылы немесе лексикалық талдау және ықтималдық жасырын Марков модельдері сияқты күрделі процедуралар арқылы жүзеге асырылуы мүмкін. Бағдарламалық қамтамасыздандыру бөлімінде тізілген кейбір пакеттер деректерді стандарттау процесін жеңілдету үшін осы мүмкіндіктердің бір бөлігін ұсынады.

Ұйымдарды реттеу

Еншілікті шешу – бұл операциялық барлау процесі, әдетте еншілікті шешу қозғалтқышымен немесе аралық бағдарламалық құралмен (middleware) қамтамасыз етіледі. Осы процестің арқасында ұйымдар әртүрлі деректер көздерін байланыстырып, бірнеше деректер жинағыштарындағы мүмкін болатын еншілік сәйкестіктерді және көзге көрінбейтін қатынастарды анықтауға мүмкіндік алады. Ол жеке тұлғаларға және/немесе ұйымдарға қатысты ақпаратты бірнеше дерек көздерінен талдайды, содан кейін сәйкестіктердің қаншалықты сәйкес келетінін және егер бар болса, осы сәйкестіктер арасындағы көзге көрінбейтін қатынастарды анықтау үшін ықтималдық және мүмкіндік бағалауды қолданады. Еншілікті шешу жүйелері көбінесе тәуекелдерді, алаяқтықтарды және мүдделер қақтығыстарын анықтау үшін қолданылады, бірақ клиенттік деректерді интеграциялау (CDI) және бас деректерді басқару (MDM) талаптарында да пайдалы құралдар болып табылады. Еншілікті шешу жүйелерін қолданудың кең таралған мысалдарына террористік тексеру, сақтандыру алаяқтығын анықтау, АҚШ Патриоттық заңына сәйкестік, ұйымдасқан бөлшек сауда қылмысын анықтау және үміткерлерді тексеру жатады. Мысалы: әртүрлі деректер жинағыштарында – қызметкерлердің тізімдері, жеткізушілердің деректері, қара тізімдер және т.б. – ұйымда ABC деп аталатын еншіліктің бірнеше нұсқасы болуы мүмкін, олар бір адамды білдіруі де, білдірмеуі де мүмкін. Бұл жазбалар дерек көздерінде ABC1, ABC2 немесе ABC3 ретінде көрінуі мүмкін. Адрес, туған күні немесе әлеуметтік қамсыздандыру нөмірі сияқты негізгі атрибуттар арасындағы ұқсастықты салыстыру арқылы пайдаланушы кейбір мүмкін сәйкестіктерді жоюға және басқаларын өте ықтимал сәйкестіктер ретінде растауға мүмкіндік алады. Содан кейін еншілікті шешу жүйелері деректердегі жасырын қатынастарды анықтау үшін, ақылға қонымды логикаға негізделген ережелерді қолданады. Жоғарыдағы мысалда, ABC1 және ABC2 бір адам емес, екі түрлі адам болуы мүмкін, бірақ олар мекенжай немесе телефон нөмірі сияқты ортақ атрибуттарды бөліседі.

Адам мен машина арасындағы гибридті жазба байланысы

Жоғары сапалы жазбаларды байланыстыру көбінесе үнемі өзгеріп отыратын, құрылымсыз үлкен деректер ағынындағы белгісіздікті қауіпсіз басқару үшін адам-машина гибридті жүйесін қажет етеді. Байланыс қателері байланыстырылған деректерге және оның талдауына таралатынын ескере отырып, интерактивті жазбаларды байланыстыру жүйелері ұсынылған. Интерактивті жазбаларды байланыстыру – бұл автоматтандырылған әдістердің нәтижелерін адамдардың итеративті түрде жақсартуы және белгісіздікті, сондай-ақ оның келесі талдауларға таралуын басқаруы. Интерактивті жазбаларды байланыстыру жүйелерінің басты мақсаты – күмәнді байланыстарды қолмен шешу және нәтижелерді нақты қолданба үшін қанағаттанарлық деңгейге жеткенше тексеру. Адамның қатысу кезеңдерінде жеке құпияны қорғайтын интерактивті жазбаларды байланыстырудың түрлері де ұсынылған.

Құпиялылықты сақтау үшін жазбаларды байланыстыру

Деректер базасын әр түрлі ұйымдар арасында байланыстыру қажеттілігі артып келеді, мұнда осы ұйымдар ұстап отырған толықтыратын деректер, мысалы, белгілі бір жағымсыз дәрілік реакцияларға осал науқастарды анықтауға көмектеседі (аурухана, дәрігер, дәріхана деректер базасын байланыстыру арқылы). Дегенмен, мұндай көптеген жағдайларда, байланыстырылатын деректер базаларында адамдар туралы құпия ақпарат болады, оны ұйымдар арасында бөлісуге болмайды. Құпиялылықты сақтайтын жазбаларды байланыстыру (PPRL) әдістері, байланысқа қатысатын ұйымдар арасында бастапқы құпия мәліметтерді бөлісу қажеттілігінсіз деректер базасын байланыстыру мақсатында әзірленген. PPRL-де салыстырылатын жазбалардың атрибуттарының мәндері әдетте бір жолмен кодталады немесе шифрланады. Бұл кодтау техникаларының бірі – Bloom сүзгісі, ол сәйкес құпия мәтінді бөлісу қажеттілігінсіз кодталған мәндер арасында шамаменгі ұқсастықты есептеуге мүмкіндік береді. PPRL процесінің соңында, сәйкес деп танылған жазба жұптары туралы ақпараттың шектеулі бөлігі ғана байланыстыру процесіне қатысатын ұйымдарға ашылады. PPRL-де қолданылатын техникалар.