Кіріспе
Деректерді жіктеу – деректерді олардың атрибуттарына, мысалы, файл түрі, мазмұны, басқа метадеректерге негізделген санаттарға бөлу процесі. Содан кейін деректерге тиісті дерек жиынтықтарына сәйкес келетін атрибуттар жиынтығын сипаттайтын сынып белгілері тағайындалады. Мақсаты – құрылымдалмаған ақпаратқа мағыналы сынып атрибуттарын беру. Үлкен деректерді талдау бүгінгі ұйымдарда деректерді жіктеудің маңыздылығын көрсетті. Деректерді басқару саласында, ақпараттың өмірлік циклын басқару (ILM) процесінің бір бөлігі ретінде деректерді жіктеуді ұйымдарға келесі сұрақтарға тиімді жауап беруге мүмкіндік беретін/көмектесетін деректерді жіктеу құралы ретінде анықтауға болады: Қандай дерек түрлері бар? Қандай деңгейдегі сезімталдық қажет? Деректер қазіргі уақытта қайда сақталады? Қандай қолжетімділік деңгейлері іске асырылған? Қауіпсіздік деңгейі қандай және ол сәйкестік ережелеріне сәйкес келе ме? Әдетте, деректерді жіктеу деректердің түрін, әсіресе құпиялылық және тұтастық мәселелерін анықтау үшін қолданылатын бірнеше белгілер жиынтығы ретінде қарастырылады. Іске асырылған кезде ол IT-мамандары мен процестер немесе қолданбалардың иелері арасында байланыс құралады. IT-қызметкерлері деректердің құндылығы туралы хабардар болады, ал басқару (әдетте қолданбалардың иелері) дерек орталығының операцияларын тиімді жүргізу үшін қай бөлікке инвестициялау қажет екенін жақсырақ түсінеді. Бұл тәуекелдерді басқару, заңдық іздеу және мемлекеттік ережелерге сәйкестік мәселелерінде ерекше маңызды болуы мүмкін. Деректерді жіктеу әдетте қолмен жүзеге асырылатын процесс; алайда, деректер туралы ақпаратты жинауға көмектесетін әртүрлі жеткізушілерден көптеген құралдар бар. Деректерді жіктеу кезінде келесілерді ескеру қажет:
Нормативтік талаптар
Стратегиялық немесе меншік құндылығы
Ұйымның ерекше саясаты
Этикалық және құпиялылық мәселелері
Шарттық келісімдер
What data types are available? What level of sensitivity is needed? Where is the data currently stored? What access levels are implemented? What protection level is implemented and does it adhere to compliance regulations? Typically, data classification is viewed as a multitude of label that are used to define the type of data, especially on confidentiality and integrity issues. When implemented, it provides a bridge between IT professionals and process or application owners. IT staff are informed about the value of data, and management (usually application owners) better understand which part of the data center needs investment to keep operations running effectively. This can be particularly important in risk management, legal discovery, and compliance with government regulations. Data classification is typically a manual process; however, there are many tools from different vendors that can help gather information about the data. Data classification needs to take into account the following:
Regulatory requirements
Strategic or proprietary worth
Organization specific policies
Ethical and privacy considerations
Contractual agreements
Data sensitivity levels must be considered.
Деректердің сезімталдық деңгейлерін ескеру қажет.
What data types are available? What level of sensitivity is needed? Where is the data currently stored? What access levels are implemented? What protection level is implemented and does it adhere to compliance regulations? Typically, data classification is viewed as a multitude of label that are used to define the type of data, especially on confidentiality and integrity issues. When implemented, it provides a bridge between IT professionals and process or application owners. IT staff are informed about the value of data, and management (usually application owners) better understand which part of the data center needs investment to keep operations running effectively. This can be particularly important in risk management, legal discovery, and compliance with government regulations. Data classification is typically a manual process; however, there are many tools from different vendors that can help gather information about the data. Data classification needs to take into account the following:
Regulatory requirements
Strategic or proprietary worth
Organization specific policies
Ethical and privacy considerations
Contractual agreements
Data sensitivity levels must be considered.
Жартылай құрылымды немесе көп құрылымды деректерді жіктеудің негізгі критерийлері
Уақыт критерийлері ең қарапайым және ең көп қолданылатыны, онда әртүрлі дерек түрлері жасалған уақыты, қол жеткен уақыты, жаңартылған уақыты сияқты уақыт бойынша бағаланады. Түр, атау, иесі, орналасқан жері сияқты метадеректер критерийлері одан да күрделі жіктеу саясатын құру үшін қолданылуы мүмкін. Мазмұндық критерийлер, яғни мазмұнды озық жіктеу алгоритмдерін пайдалануды қамтитындар, құрылымдалмаған деректерді жіктеудің ең жетілген түрлері болып табылады. Бұл критерийлердің кез келгені кестелік немесе реляциялық деректерге «Негізгі критерийлер» ретінде де қолданылуы мүмкін. Бұл критерийлер деректердің ұсынылу форматының ішкі емес, қолданбаға тән қасиеттері болып табылады.
Бизнес деректерін жіктеу тәсілдері
Бизнес ортасында деректерді жіктеудің үш әртүрлі тәсілі бар, олардың әрқайсысы – қағазға негізделген жіктеу, автоматтандырылған жіктеу және пайдаланушы жүзеге асыратын (немесе қолданатын) жіктеу – өз пайдалары мен кемшіліктеріне ие.
Қағаз түріндегі жіктеу саясаты
Корпоративтік деректерді жіктеу саясаты қызметкерлердің ұйымның жалпы деректерді қорғау саясаты мен стратегиясына сәйкес, олармен жұмыс істейтін деректердің түрлерін қалай өңдеу керектігін анықтайды. Жақсы жазылған саясат пайдаланушыларға ақпараттың құндылығын және оны өңдеудің тиісті талаптарын – мысалы, деректерге кімнің қол жеткізе алатынын және құқықтарды басқару шаблоны қолданылу керек пе, жоқ па – жылдам және түсінікті түрде шешуге көмектеседі. Дегенмен, қолдау технологиясы болмаған жағдайда, барлық қызметкер саясаттан хабардар екенін және оны дұрыс іске асырып жатқанын қамтамасыз ету қиындық тудырады.
Автоматтандырылған жіктеу саясаты
Бұл техника пайдаланушылардың араласуын қажет етпейді, барлық байланыс нүктелеріндегі классификация саясатын тұрақты түрде қолдануға мүмкіндік береді, бұл үшін ауқымды хабарлау және оқыту бағдарламалары қажет емес. Классификация мазмұндағы кілт сөздерге немесе сөз тіркестеріне негізделген бағдарламалық алгоритмдерді қолданатын жүйелер арқылы жүзеге асырылады, олар оны талдап, жіктемелейді. Бұл тәсіл, егер белгілі бір деректер пайдаланушының қатысуынсыз жасалса, мысалы, ERP жүйелерімен жасалған есептер, немесе деректерде оңай анықталатын жеке ақпарат болса, мысалы, кредиттік карта деректері, тиімді болады. Дегенмен, автоматтандырылған жүйелер контексті түсінбейді, сондықтан қателіктерге бейім, пайдаланушыларды көңілсіздікке түсіріп, бизнес процестерін қиындататын жалған оң нәтижелерді, сондай-ақ ұйымдарды құпия деректерді жоғалту қаупіне ұшырататын жалған теріс қателерді тудыруы мүмкін.
Пайдаланушымен байланысты жіктеу саясаты
Деректерді жіктеу процесін толық автоматтандыру мүмкін, бірақ ол пайдаланушы бақылауында болғанда ең тиімді. Пайдаланушы басқаратын жіктеу әдісі қызметкерлердің өзіне деректерге қай белгінің қойылғанын анықтау және оны құру, өңдеу, жіберу немесе сақтау кезінде бағдарламалық құрал арқылы бекіту жауапкершілігін жүктейді. Пайдаланушыны процеске қатыстырудың артықшылығы – деректердің контекстін, бизнес құндылығын және құпиялылығын білу арқасында оларға дұрыс және нақты шешімдер қабылдауға мүмкіндік береді. Пайдаланушы басқаратын жіктеу – автоматтандырылған жіктеуді толықтыру үшін жиі қолданылатын қосымша қауіпсіздік деңгейі. Пайдаланушыларды жіктеуге қатыстыру қауіпсіздік туралы хабардарлықты арттыру, ұйымдық мәдениетті жақсарту және пайдаланушы мінез-құлқына бақылау жасау мүмкіндігі сияқты қосымша ұйымдық пайдаларға да әкеледі, бұл есеп беруге көмектеседі және нормативтік талаптарға сәйкестікті растауға мүмкіндік береді. Бұдан әрі, менеджерлер осы мінез-құлық деректерін мүмкін ішкі қауіпті анықтау үшін пайдалана алады және пайдаланушыларға қосымша нұсқаулар беру арқылы кез келген мәселені шеше алады, мысалы, қосымша оқыту немесе қағидаларды қатаңдату арқылы.