Кіріспе

Формалды деректер моделі жоқ ақпарат
Құрылымсыз деректер (немесе құрылымдалмаған ақпарат) – бұл алдын ала анықталған деректер моделі жоқ немесе алдын ала анықталған тәртіппен ұйымдастырылмаған ақпарат. Құрылымсыз ақпарат көбінесе мәтінге негізделген, бірақ оған күндер, сандар және фактілер сияқты деректер де кіре алады. Бұл деректер базасында өрістерге бөлініп сақталған немесе құжаттарда белгіленген (семантикалық таңбалармен) деректерге қарағанда дәстүрлі бағдарламалармен түсінуді қиындататын белгісіздіктер мен түсініксіздіктерге алып келеді. 1998 жылы «Меррилл Линч» компаниясы «құрылымсыз деректер ұйымдағы деректердің басым бөлігін құрайды, кейбір бағалаулар бойынша 80%-ға дейін жетеді» деген мәлімдеме жасады. Бұл санның қандай көзден алынғаны белгісіз, бірақ оған кейбір тараптар келіседі. Басқа дереккөздер де құрылымдалмаған деректердің осындай немесе одан да жоғары пайыздық үлесін көрсетеді. IDC және Dell EMC деректердің көлемі 2020 жылға қарай 40 зеттабайтқа дейін өседі деп болжайды, бұл 2010 жылдың басымен салыстырғанда 50 есеге артық. Соңғы кезде IDC және Seagate компаниялары 2025 жылға қарай әлемдік деректер кеңістігінің 163 зеттабайтқа дейін өседі деп болжады, және оның көп бөлігі құрылымсыз болады. Computer World журналы құрылымдалмаған ақпараттың ұйымдардағы барлық деректердің 70-80%-дан астамын құрауы мүмкін екенін хабарлайды.

Өмірбаян

Бизнес-интеллект саласындағы алғашқы зерттеулер сандық деректерден гөрі құрылымдалмаған мәтіндік деректерге бағытталған. Кешірек, 1958 жылдан бастап, H. П. Лун сияқты компьютерлік ғылымның зерттеушілері құрылымдалмаған мәтінді табу және жіктеу мәселесіне ерекше назар бөлді. Машиналық мәтіндік талдаудың математикалық және технологиялық прогресі көптеген компанияларды зерттеулер жүргізуге ынталандырды, нәтижесінде сезімталдық талдау, тұтынушылар пікірін анықтау және колл-орталықтарды жақсарту сияқты салалар пайда болды. 2000 жылдардың соңында үлкен деректердің пайда болуы қазіргі заманғы болжамдық талдау және түбірлік себептерді анықтау сияқты салаларда құрылымдалмаған деректерді талдауға деген қызығушылықты күшейтті.

Құрылымсыз деректермен жұмыс істеу

Деректерді өндіру, табиғи тілді өңдеу (ТТӨ) және мәтіндік талдау сияқты техникалар осы ақпараттағы үлгілерді табу немесе оны түсіндірудің әртүрлі әдістерін ұсынады. Мәтінді құрылымдаудың кең таралған тәсілдері көбінесе мәтінді өндіруге негізделген құрылымдық талдау үшін метадеректермен немесе сөздердің сөз тіркесіндегі рөлін белгілеу арқылы қолмен таңбалауды қамтиды. Құрылымсыз ақпаратты басқару архитектурасы (UIMA) стандарты осы ақпаратты мағынасын шығару және ақпарат туралы құрылымды деректер жасау үшін өңдеуге арналған ортақ платформаны ұсынды. Машинамен өңделетін құрылымды құратын бағдарламалық жасақтама адамдық коммуникацияның барлық түрлерінде кездесетін тілдік, дыбыстық және визуалды құрылымды пайдалана алады. Алгоритмдер мәтіннен осы туа біткен құрылымды анықтай алады, мысалы, сөздердің морфологиясын, сөйлемнің синтаксисін және басқа да кіші және ірі масштабтағы үлгілерді қарастыру арқылы. Құрылымсыз ақпаратты екіұштылықты жою және маңыздылығын арттыру үшін байытуға және таңбалауға болады, содан кейін іздеу және табу процесін жеңілдету үшін тиісті әдістер қолданылады. "Құрылымсыз деректерге" кітаптар, журналдар, құжаттар, метадеректер, денсаулық сақтау туралы мәліметтер, аудио, бейне, аналогты деректер, кескіндер, файлдар және электрондық хаттың мәтіні, веб-бет немесе мәтін редакторының құжаты сияқты құрылымдалмаған мәтіндер жатуы мүмкін. Негізгі мазмұнның нақты құрылымы болмаса да, ол әдетте нысандарға (мысалы, файлдарға немесе құжаттарға) жинақталады, олардың өзі құрылымға ие және сондықтан құрылымды және құрылымсыз деректердің қоспасы болып табылады, бірақ жиынтығында бұл әлі де "құрылымсыз деректер" деп аталады. Мысалы, HTML веб-беті таңбаланған, бірақ HTML таңбалауы көбінесе тек көрсету үшін ғана қолданылады. Ол таңбаланған элементтердің мағынасын немесе функциясын беттің ақпараттық мазмұнын автоматты түрде өңдеуге көмектесетіндей етіп түсірмейді. XHTML таңбалауы элементтерді машинамен өңдеуге мүмкіндік береді, бірақ ол әдетте таңбаланған терминдердің семантикалық мағынасын түсірмейді немесе жеткізбейді. Құрылымсыз деректер көбінесе электрондық құжаттарда кездесетіндіктен, құжаттардың барлығын жіктеуге қабілетті мазмұн немесе құжатты басқару жүйесін пайдалану деректерді беру және құжаттарды өңдеуге қарағанда жиі артықшылыққа ие. Құжатты басқару құжаттар жинағына құрылым беруге мүмкіндік береді. Іздеу жүйелері мұндай деректерді, әсіресе мәтінді индекстеу және іздеу үшін кең таралған құралға айналды.

Табиғи тіл өңдеудегі тәсілдер

Мәтіндік құжаттардағы құрылымсыз деректерге рет келтіру үшін арнайы есептеу жұмыс ағындары жасалған. Бұл жұмыс ағындары көбінесе мыңдаған, тіпті миллиондаған құжаттар жиынтығымен жұмыс істеуге немесе қолмен түсіндіруге қарағанда әлдеқайда көп көлемді өңдеуге бағытталған. Осы тәсілдердің бірнешеуі онлайн-талдау өңдеуі (OLAP) тұжырымдамасына негізделген және мәтіндік кубтар сияқты дерек үлгілерімен қолдауға алынуы мүмкін. Құжат метадеректері дерек үлгісі арқылы қолжетімді болғаннан кейін, құжаттардың ішкі жиынтықтарының (яғни мәтіндік кубтың жасушаларының) тұжырымдамаларын жасау фразалық тәсілдермен жүзеге асырылуы мүмкін.

Медицина мен биомедициналық зерттеудегі тәсілдер

Биомедициналық зерттеулер құрылымдалмаған деректердің бір негізгі көзін құрайды, өйткені зерттеушілер өздерінің нәтижелерін ғылыми журналдарда жиі жариялайды. Бұл құжаттардағы тілден құрылымдық элементтерді алу қиынға түседі (мысалы, онда қамтылған күрделі техникалық терминология мен байқауларды толық контекстке қою үшін қажетті салалық білімге байланысты), бірақ осы іс-шаралардың нәтижелері техникалық және медициналық зерттеулер арасындағы байланыстарды, сондай-ақ жаңа ауруларды емдеудің жолдары туралы ақпаратты табуға мүмкіндік береді. Биомедициналық құжаттарға құрылым беруге бағытталған соңғы әрекеттерге құжаттар арасындағы тақырыптарды анықтау үшін қолданылатын өзін-өзі ұйымдастыру картасы тәсілдері, жалпы мақсаттағы қадағалаусыз алгоритмдер және CaseOLAP жұмыс ағынының қолданылуы кіреді. CaseOLAP сөз тіркесімдерінің категориялық қатынастарын дәл (қатынастарды анықтайды), дәйекті (жоғары дәрежеде қайталанатын) және тиімді түрде анықтайды. Бұл платформа қолжетімділікті арттырып, биомедициналық қауымдастыққа биомедициналық зерттеулердің кең ауқымында қолданылатын мәтіндік фрагменттерді табу құралдарын ұсынады. Аталған «құрылымдалмаған деректер» термині 2018 жылы GDPR күшіне енгеннен кейін ЕО-да сирек қолданылады. GDPR «құрылымдалмаған деректерді» атап көрсетпейді де, анықтамайды да. Ол «құрылымдалған» сөзін келесідей пайдаланады (анықтамасыз): GDPR-дың 15-тармағының бөліктері, «Жеке тұлғалардың қорғалуы жеке деректерді өңдеуге қатысты болғанда қолданылуы керек, егер олар файлдық жүйеде сақталған болса». GDPR-дың 4-бабында «файлдық жүйе» дегеніміз – «нақты критерийлерге сәйкес қолжетімді жеке деректердің құрылымдалған жиынтығы». Насихаттаумен айналысатын әрбір мүше жинаған жеке деректердің жиынтығының нақты критерийі мен формасы маңызды емес, егер бұл деректер жиынтығы байланыс орнатылған нақты адамға қатысты деректерді оңай табуға мүмкіндік берсе, бірақ бұл мән-жайларды бас сот ісіндегі барлық жағдайларды ескере отырып, сұрау салған сот анықтауы тиіс. (EUС, Todistajat v. Tietosuojavaltuutettu, Jehovan, 61-тармақ). Егер жеке деректерді оңай табуға болатын болса, онда ол файлдық жүйе болып саналады және «құрылымдалған» немесе «құрылымдалмаған» екеніне қарамастан GDPR қолданылады. Көптеген қазіргі электрондық жүйелер, қолжетімділік пен қолданбалы бағдарламалық қамтамасыз етуге байланысты, деректерді оңай табуға мүмкіндік береді.