Кіріспе
Формалды деректер моделі жоқ ақпарат
Құрылымсыз деректер (немесе құрылымдалмаған ақпарат) – бұл алдын ала анықталған деректер моделі жоқ немесе алдын ала анықталған тәртіппен ұйымдастырылмаған ақпарат. Құрылымсыз ақпарат көбінесе мәтінге негізделген, бірақ оған күндер, сандар және фактілер сияқты деректер де кіре алады. Бұл деректер базасында өрістерге бөлініп сақталған немесе құжаттарда белгіленген (семантикалық таңбалармен) деректерге қарағанда дәстүрлі бағдарламалармен түсінуді қиындататын белгісіздіктер мен түсініксіздіктерге алып келеді. 1998 жылы «Меррилл Линч» компаниясы «құрылымсыз деректер ұйымдағы деректердің басым бөлігін құрайды, кейбір бағалаулар бойынша 80%-ға дейін жетеді» деген мәлімдеме жасады. Бұл санның қандай көзден алынғаны белгісіз, бірақ оған кейбір тараптар келіседі. Басқа дереккөздер де құрылымдалмаған деректердің осындай немесе одан да жоғары пайыздық үлесін көрсетеді. IDC және Dell EMC деректердің көлемі 2020 жылға қарай 40 зеттабайтқа дейін өседі деп болжайды, бұл 2010 жылдың басымен салыстырғанда 50 есеге артық. Соңғы кезде IDC және Seagate компаниялары 2025 жылға қарай әлемдік деректер кеңістігінің 163 зеттабайтқа дейін өседі деп болжады, және оның көп бөлігі құрылымсыз болады. Computer World журналы құрылымдалмаған ақпараттың ұйымдардағы барлық деректердің 70-80%-дан астамын құрауы мүмкін екенін хабарлайды.
Unstructured data (or unstructured information) is information that either does not have a pre defined data model or is not organized in a pre defined manner. Unstructured information is typically text heavy, but may contain data such as dates, numbers, and facts as well. This results in irregularities and ambiguities that make it difficult to understand using traditional programs as compared to data stored in fielded form in databases or annotated (semantically tagged) in documents. In 1998, Merrill Lynch said "unstructured data comprises the vast majority of data found in an organization, some estimates run as high as 80%." It's unclear what the source of this number is, but nonetheless it is accepted by some. Other sources have reported similar or higher percentages of unstructured data. , IDC and Dell EMC project that data will grow to 40 zettabytes by 2020, resulting in a 50 fold growth from the beginning of 2010. More recently, IDC and Seagate predict that the global datasphere will grow to 163 zettabytes by 2025 and majority of that will be unstructured. The Computer World magazine states that unstructured information might account for more than 70–80% of all data in organizations.
Өмірбаян
Бизнес-интеллект саласындағы алғашқы зерттеулер сандық деректерден гөрі құрылымдалмаған мәтіндік деректерге бағытталған. Кешірек, 1958 жылдан бастап, H. П. Лун сияқты компьютерлік ғылымның зерттеушілері құрылымдалмаған мәтінді табу және жіктеу мәселесіне ерекше назар бөлді. Машиналық мәтіндік талдаудың математикалық және технологиялық прогресі көптеген компанияларды зерттеулер жүргізуге ынталандырды, нәтижесінде сезімталдық талдау, тұтынушылар пікірін анықтау және колл-орталықтарды жақсарту сияқты салалар пайда болды. 2000 жылдардың соңында үлкен деректердің пайда болуы қазіргі заманғы болжамдық талдау және түбірлік себептерді анықтау сияқты салаларда құрылымдалмаған деректерді талдауға деген қызығушылықты күшейтті.
Құрылымсыз деректермен жұмыс істеу
Деректерді өндіру, табиғи тілді өңдеу (ТТӨ) және мәтіндік талдау сияқты техникалар осы ақпараттағы үлгілерді табу немесе оны түсіндірудің әртүрлі әдістерін ұсынады. Мәтінді құрылымдаудың кең таралған тәсілдері көбінесе мәтінді өндіруге негізделген құрылымдық талдау үшін метадеректермен немесе сөздердің сөз тіркесіндегі рөлін белгілеу арқылы қолмен таңбалауды қамтиды. Құрылымсыз ақпаратты басқару архитектурасы (UIMA) стандарты осы ақпаратты мағынасын шығару және ақпарат туралы құрылымды деректер жасау үшін өңдеуге арналған ортақ платформаны ұсынды. Машинамен өңделетін құрылымды құратын бағдарламалық жасақтама адамдық коммуникацияның барлық түрлерінде кездесетін тілдік, дыбыстық және визуалды құрылымды пайдалана алады. Алгоритмдер мәтіннен осы туа біткен құрылымды анықтай алады, мысалы, сөздердің морфологиясын, сөйлемнің синтаксисін және басқа да кіші және ірі масштабтағы үлгілерді қарастыру арқылы. Құрылымсыз ақпаратты екіұштылықты жою және маңыздылығын арттыру үшін байытуға және таңбалауға болады, содан кейін іздеу және табу процесін жеңілдету үшін тиісті әдістер қолданылады. "Құрылымсыз деректерге" кітаптар, журналдар, құжаттар, метадеректер, денсаулық сақтау туралы мәліметтер, аудио, бейне, аналогты деректер, кескіндер, файлдар және электрондық хаттың мәтіні, веб-бет немесе мәтін редакторының құжаты сияқты құрылымдалмаған мәтіндер жатуы мүмкін. Негізгі мазмұнның нақты құрылымы болмаса да, ол әдетте нысандарға (мысалы, файлдарға немесе құжаттарға) жинақталады, олардың өзі құрылымға ие және сондықтан құрылымды және құрылымсыз деректердің қоспасы болып табылады, бірақ жиынтығында бұл әлі де "құрылымсыз деректер" деп аталады. Мысалы, HTML веб-беті таңбаланған, бірақ HTML таңбалауы көбінесе тек көрсету үшін ғана қолданылады. Ол таңбаланған элементтердің мағынасын немесе функциясын беттің ақпараттық мазмұнын автоматты түрде өңдеуге көмектесетіндей етіп түсірмейді. XHTML таңбалауы элементтерді машинамен өңдеуге мүмкіндік береді, бірақ ол әдетте таңбаланған терминдердің семантикалық мағынасын түсірмейді немесе жеткізбейді. Құрылымсыз деректер көбінесе электрондық құжаттарда кездесетіндіктен, құжаттардың барлығын жіктеуге қабілетті мазмұн немесе құжатты басқару жүйесін пайдалану деректерді беру және құжаттарды өңдеуге қарағанда жиі артықшылыққа ие. Құжатты басқару құжаттар жинағына құрылым беруге мүмкіндік береді. Іздеу жүйелері мұндай деректерді, әсіресе мәтінді индекстеу және іздеу үшін кең таралған құралға айналды.
Табиғи тіл өңдеудегі тәсілдер
Мәтіндік құжаттардағы құрылымсыз деректерге рет келтіру үшін арнайы есептеу жұмыс ағындары жасалған. Бұл жұмыс ағындары көбінесе мыңдаған, тіпті миллиондаған құжаттар жиынтығымен жұмыс істеуге немесе қолмен түсіндіруге қарағанда әлдеқайда көп көлемді өңдеуге бағытталған. Осы тәсілдердің бірнешеуі онлайн-талдау өңдеуі (OLAP) тұжырымдамасына негізделген және мәтіндік кубтар сияқты дерек үлгілерімен қолдауға алынуы мүмкін. Құжат метадеректері дерек үлгісі арқылы қолжетімді болғаннан кейін, құжаттардың ішкі жиынтықтарының (яғни мәтіндік кубтың жасушаларының) тұжырымдамаларын жасау фразалық тәсілдермен жүзеге асырылуы мүмкін.
Медицина мен биомедициналық зерттеудегі тәсілдер
Биомедициналық зерттеулер құрылымдалмаған деректердің бір негізгі көзін құрайды, өйткені зерттеушілер өздерінің нәтижелерін ғылыми журналдарда жиі жариялайды. Бұл құжаттардағы тілден құрылымдық элементтерді алу қиынға түседі (мысалы, онда қамтылған күрделі техникалық терминология мен байқауларды толық контекстке қою үшін қажетті салалық білімге байланысты), бірақ осы іс-шаралардың нәтижелері техникалық және медициналық зерттеулер арасындағы байланыстарды, сондай-ақ жаңа ауруларды емдеудің жолдары туралы ақпаратты табуға мүмкіндік береді. Биомедициналық құжаттарға құрылым беруге бағытталған соңғы әрекеттерге құжаттар арасындағы тақырыптарды анықтау үшін қолданылатын өзін-өзі ұйымдастыру картасы тәсілдері, жалпы мақсаттағы қадағалаусыз алгоритмдер және CaseOLAP жұмыс ағынының қолданылуы кіреді. CaseOLAP сөз тіркесімдерінің категориялық қатынастарын дәл (қатынастарды анықтайды), дәйекті (жоғары дәрежеде қайталанатын) және тиімді түрде анықтайды. Бұл платформа қолжетімділікті арттырып, биомедициналық қауымдастыққа биомедициналық зерттеулердің кең ауқымында қолданылатын мәтіндік фрагменттерді табу құралдарын ұсынады. Аталған «құрылымдалмаған деректер» термині 2018 жылы GDPR күшіне енгеннен кейін ЕО-да сирек қолданылады. GDPR «құрылымдалмаған деректерді» атап көрсетпейді де, анықтамайды да. Ол «құрылымдалған» сөзін келесідей пайдаланады (анықтамасыз): GDPR-дың 15-тармағының бөліктері, «Жеке тұлғалардың қорғалуы жеке деректерді өңдеуге қатысты болғанда қолданылуы керек, егер олар файлдық жүйеде сақталған болса». GDPR-дың 4-бабында «файлдық жүйе» дегеніміз – «нақты критерийлерге сәйкес қолжетімді жеке деректердің құрылымдалған жиынтығы». Насихаттаумен айналысатын әрбір мүше жинаған жеке деректердің жиынтығының нақты критерийі мен формасы маңызды емес, егер бұл деректер жиынтығы байланыс орнатылған нақты адамға қатысты деректерді оңай табуға мүмкіндік берсе, бірақ бұл мән-жайларды бас сот ісіндегі барлық жағдайларды ескере отырып, сұрау салған сот анықтауы тиіс. (EUС, Todistajat v. Tietosuojavaltuutettu, Jehovan, 61-тармақ). Егер жеке деректерді оңай табуға болатын болса, онда ол файлдық жүйе болып саналады және «құрылымдалған» немесе «құрылымдалмаған» екеніне қарамастан GDPR қолданылады. Көптеген қазіргі электрондық жүйелер, қолжетімділік пен қолданбалы бағдарламалық қамтамасыз етуге байланысты, деректерді оңай табуға мүмкіндік береді.
Parts of GDPR Recital 15, "The protection of natural persons should apply to the processing of personal data if contained in a filing system." GDPR Article 4, "‘filing system’ means any structured set of personal data which are accessible according to specific criteria "
GDPR Case law on what defines a "filing system"; "the specific criterion and the specific form in which the set of personal data collected by each of the members who engage in preaching is actually structured is irrelevant, so long as that set of data makes it possible for the data relating to a specific person who has been contacted to be easily retrieved, which is however for the referring court to ascertain in the light of all the circumstances of the case in the main proceedings.” (CJEU, Todistajat v. Tietosuojavaltuutettu, Jehovan, Paragraph 61). If personal data is easily retrieved then it is a filing system and then it is in scope for GDPR regardless of being "structured" or "unstructured". Most electronic systems today, subject to access and applied software, can allow for easy retrieval of data.