Кіріспе
Үлкен деректер жиынтықтарындағы үлгілерді табу және анықтау процесі
Деректерді қазу – машиналық оқыту, статистика және деректер базасы жүйелерінің тоғысқан жеріндегі әдістерді қолдана отырып, үлкен деректер жиынтықтарындағы үлгілерді табу және анықтау процесі. Деректерді қазу – «деректер қорында білімді табу» немесе KDD процесінің талдау кезеңі. Бұл сонымен қатар кең таралған термин және көбінесе ірі көлемдегі деректерді немесе ақпаратты өңдеудің кез келген түріне (жинау, алу, сақтау, талдау және статистика), сондай-ақ компьютерлік шешімдерді қолдау жүйесінің кез келген қолданылуына, оның ішінде жасанды интеллектке (мысалы, машиналық оқыту) және бизнес-интеллектке қолданылады. Көбінесе жалпылама терминдер (ірі көлемді) деректерді талдау және саралау, немесе нақты әдістерге қатысты жасанды интеллект және машиналық оқыту көбірек орынды. Деректерді қазу міндеті – бұрын белгісіз, қызықты үлгілерді, мысалы, деректер жазбаларының топтарын (кластерлік талдау), ерекше жазбаларды (аномалияны анықтау) және тәуелділіктерді (әрекеттік ережелерді табу, тізбекті үлгілерді табу) анықтау үшін үлкен деректер көлемін жартылай автоматты немесе автоматты түрде талдау. Бұл көбінесе кеңістіктік индекстер сияқты деректер базасының әдістерін пайдалануды қамтиды. Бұл үлгілерді кіріс деректерінің қорытындысы ретінде қарастыруға болады және оларды одан әрі талдау кезінде немесе, мысалы, машиналық оқыту мен болжамдық талдау кезінде пайдалануға болады. Мысалы, деректерді қазу кезеңі деректердегі бірнеше топтарды анықтауы мүмкін, содан кейін оларды шешімдерді қолдау жүйесі арқылы дәлірек болжамдар алу үшін пайдалануға болады. Деректерді жинау, деректерді дайындау, нәтижелерді түсіндіру және есеп беру деректерді қазу кезеңіне кірмейді, бірақ олар қосымша қадамдар ретінде жалпы KDD процесіне жатады. Деректерді талдау мен деректерді қазу арасындағы айырмашылық – деректерді талдау деректер жиынтығындағы модельдер мен гипотезаларды сынау үшін қолданылады, мысалы, маркетингтік кампанияның тиімділігін талдау, деректер көлеміне қарамастан. Ал деректерді қазу машиналық оқыту мен статистикалық модельдерді пайдаланып, үлкен деректер көлеміндегі жасырын немесе көмескі үлгілерді анықтайды. Деректерді іздеу, деректерді балық аулау және деректерді тыңдау терминдері үлкен популяциялық деректер жиынтығының үлгілерін алу үшін деректерді қазу әдістерін қолдануға қатысты, олар ашылған кез келген үлгілердің дұрыстығы туралы сенімді статистикалық қорытындылар жасауға тым кішкентай (немесе болуы мүмкін). Алайда, бұл әдістер үлкен деректер популяциясына қарсы сынау үшін жаңа гипотезалар жасау үшін пайдаланылуы мүмкін.
Этимология
1960 жылдары статистиктер мен экономистер деректерді аулау немесе деректерді зерттеу сияқты терминдерді қолданды, олар деректерді алдын ала гипотезасыз талдауды жаман тәжірибе деп санайтын. "Деректерді өндіру" терминін экономист Майкл Ловелл 1983 жылы "Экономикалық зерттеулер шолуында" жарияланған мақаласында осыған ұқсас сын тұрғысынан қолданды. Ловеллдің сөзіне қарағанда, бұл тәжірибе "эксперименттер" (позитивті) және "балық аулау" немесе "жасырын іздеу" (негативті) сияқты әртүрлі атаулармен жасырынып келді. "Деректерді өндіру" термині 1990 жылдары деректер базасы қауымдастығында пайда болды, көбінесе оң коннотациялармен. 1980 жылдардың басында қысқа мерзімге "деректер базасын өндіру"™ фразасы қолданылды, бірақ Сан-Диегодағы HNC компаниясы оны өздерінің Database Mining Workstation жұмыс станциясын насихаттау үшін тауарлық белгі ретінде тіркегендіктен, зерттеушілер деректерді өндіруге көшті. Басқа қолданылатын терминдер: деректер археологиясы, ақпаратты жинау, ақпаратты табу, білімді алу және т.б. Грегорий Пьятецкий Шапиро осы тақырыптағы алғашқы семинарда (KDD 1989) "деректер базасындағы білімді ашу" терминін енгізді, және бұл термин жасанды интеллект және машиналық оқыту қауымдастықтарында кеңінен танымал болды. Алайда, "деректерді өндіру" термині бизнес және баспасөз қауымдастықтарында көбірек танылды. Қазіргі уақытта "деректерді өндіру" және "білімді ашу" терминдері бір-бірін алмастыра қолданылады.
Өмірбаян
Деректерден үлгілерді қолмен іздеу ғасырлар бойы қалыптасқан. Деректердегі үлгілерді анықтаудың алғашқы әдістері Байес теоремасы (1700 жылдар) және регрессиялық талдау (1800 жылдар) болып табылады. Компьютерлік технологияның кең таралуы, қолжетімділігі және қуатының артуы деректерді жинау, сақтау және өңдеу мүмкіндіктерін едәуір арттырды. Деректер жиынтығының көлемі мен күрделілігі артқан сайын, тікелей "қолмен" деректерді талдау, компьютерлік ғылымдағы жаңа жетістіктердің, әсіресе машиналық оқыту саласындағы, мысалы, нейрондық желілер, кластерлік талдау, генетикалық алгоритмдер (1950 жылдар), шешім ағаштары және шешімдер ережелері (1960 жылдар), сондай-ақ қолдаушы векторлық машиналар (1990 жылдар) көмегімен автоматтандырылған деректерді өңдеумен толықтырылды. Деректерді тарту – бұл үлкен деректер жиынтығында жасырын үлгілерді анықтау мақсатымен осы әдістерді қолдану процесі. Ол қолданбалы статистика мен жасанды интеллект (әдетте математикалық негізін қамтамасыз етеді) пен дерекқорларды басқару арасындағы байланысты қамтамасыз етеді, деректерді дерекқорларда сақтау және индекстеу тәсілін пайдаланып, оқу және ашу алгоритмдерін тиімдірек орындауға мүмкіндік береді, соның арқасында осы әдістерді үлкен деректер жиынтықтарына қолдануға болады.
Алдын ала өңдеу
Деректерді қазу алгоритмдерін қолдану алдында мақсатты деректер жиынтығы құрастырылуы тиіс. Деректерді қазу деректерде нақты бар үлгілерді ғана анықтай алатынын ескеретін болсақ, мақсатты деректер жиынтығы осы үлгілерді қамтитындай жеткілікті үлкен, бірақ қабылданатын уақыт ішінде қазуға болатындай ықшам болуы керек. Деректердің көп кездесетін көзі – деректер базары немесе деректер қоймасы. Деректерді қазу алдында көпөлшемді деректер жиынтығын талдау үшін алдын ала өңдеу қажет. Содан кейін мақсатты жиынтық тазартылады. Деректерді тазалау шулы және дерегі жоқ жазбаларды жояды.
Нәтижелерді растау
Деректерді талдау қасақана дұрыс қолданылмаған жағдайда, маңызды көрінетін, бірақ болашақ мінез-құлықты болжамайтын және жаңа деректер жинағында қайта жаңғыртылмайтын нәтижелерге әкелуі мүмкін, демек, пайдасы шамалы болады. Мұның себебі кейде тым көп болжамдарды зерттеу және тиісті статистикалық гипотезалық тестілеу жүргізбеу болуы мүмкін. Машиналық оқытудағы осы мәселенің қарапайым түрі үдемелі оқыту (overfitting) деп аталады, бірақ осы мәселе процестің әртүрлі кезеңдерінде туындауы мүмкін, сондықтан осыған жол бермеу үшін оқу/тест жиынтығына бөлу (егер мүлдем қажет болса) жеткіліксіз болуы мүмкін. Деректерден білім табудың соңғы қадамы – деректерді талдау алгоритмдері тапқан үлгілердің кеңірек деректер жинағында кездесетінін тексеру болып табылады. Алгоритмдер тапқан барлық үлгілер міндетті түрде дұрыс емес. Деректерді талдау алгоритмдерінің жалпы деректер жинағында жоқ, оқу жинағында ғана үлгілерді табуы жиі кездеседі. Бұл үдемелі оқыту (overfitting) деп аталады. Мұны жеңу үшін бағалау кезінде деректерді талдау алгоритмі оқытылмаған деректер жинағы қолданылады. Оқытылған үлгілер осы тест жинағына қолданылады және алынған нәтижелер қажетті нәтижелермен салыстырылады. Мысалы, "спам" мен "заңды" электрондық поштаны ажыратуға тырысатын деректерді талдау алгоритмі, электрондық пошта үлгілерінен тұратын оқу жинағында оқытылады. Оқытылғаннан кейін, алынған үлгілер оны оқымаған электрондық поштаның тест жинағына қолданылады. Үлгілердің дәлдігі олардың қанша электрондық поштаны дұрыс жіктегеніне қарай өлшеніп, бағаланады. Алгоритмді бағалау үшін ROC қисықтары сияқты бірнеше статистикалық әдістер қолданылуы мүмкін. Егер алынған үлгілер қажетті стандарттарға сай келмесе, алдын ала өңдеу және деректерді талдау кезеңдерін қайта қарап, өзгерту қажет. Егер алынған үлгілер қажетті стандарттарға сай келсе, соңғы қадам – алынған үлгілерді түсіндіру және оларды білімге айналдыру болып табылады.
Стандарттар
Деректерді өндіру процесі үшін стандарттарды анықтауға бірқатар күш-жігер жұмсалды, мысалы, 1999 жылғы Еуропалық салааралық стандартты деректерді өндіру процесі (CRISP DM 1.0) және 2004 жылғы Java деректерді өндіру стандарты (JDM 1.0). Осы процестердің ізбасарларын (CRISP DM 2.0 және JDM 2.0) әзірлеу 2006 жылы белсенді жүрді, бірақ содан бері тоқтап қалды. JDM 2.0 жобасы аяқталмай кері тартылды. Алған модельдерді алмасу үшін – әсіресе болжамдық талдау үшін – негізгі стандарт – Predictive Model Markup Language (PMML), бұл Data Mining Group (DMG) ұйымы әзірлеген және көптеген деректерді өндіру қолданбаларында алмасу форматы ретінде қолданылатын XML негізді тіл. Атынан көрініп тұрғандай, ол тек болжамдық модельдерді қамтиды, бұл бизнес-қолданбалар үшін өте маңызды деректерді өндіру міндеті. Дегенмен, (мысалы) кеңістіктік кластерлеуді қамтитын кеңейтімдер DMG-ден тәуелсіз түрде ұсынылды.
Ерекше қолданылуы
Деректерді талдау цифрлық деректер бар кез келген жерде қолданылады. Деректерді талдаудың нақты мысалдары бизнес, медицина, ғылым, қаржы, құрылыс және бақылау салаларында кездеседі.
Еуропадағы жағдай
Еуропаның жеке өмірге қатысты заңдары күшті, және тұтынушылардың құқықтарын одан да нығайту жұмыстары жүргізілуде. Дегенмен, 1998-2000 жылдар аралығында жасалған АҚШ-ЕО «Қауіпсіз бағдарлама» қағидалары қазіргі таңда еуропалық қолданушыларды АҚШ компанияларының жеке өмірге қатысты құқықтарын бұзу қаупіне ұшыратуда. Эдвард Сноуденнің жаһандық бақылауды жариялауы салдарынан, бұл келісімді күштен шығару туралы пікірталас күшейді, себебі деректер, әсіресе, Ұлттық қауіпсіздік агенттігіне толық ашылады, және АҚШ-пен келісімге келу әрекеттері сәтсіз аяқталды. Ұлыбританияда корпорациялардың белгілі бір клиенттер тобын анықтап, оларды шамадан тыс баға төлеуге мәжбүрлеу сияқты жағдайлар тіркелді. Мұндай топтар көбінесе төмен әлеуметтік-экономикалық жағдайы бар, цифрлық нарықта қалай пайдалануға болатынын білмейтін адамдар болып табылады.
АҚШ-тағы жағдай
Америка Құрама Штаттарында жеке өмірге қатысты алаңдаушылықтар АҚШ Конгресі арқылы Денсаулық сақтауды тасымалдау және жауапкершілік туралы заң (HIPAA) сияқты реттеуші шараларды қабылдау арқылы қарастырылды. HIPAA жеке тұлғалардан олар ұсынатын ақпаратқа және оның қазіргі және болашақ қолданылуына қатысты "хабардар келісім" беруді талап етеді. "Биотех Бизнес Уик" журналында жарияланған мақалада айтылғандай, "AAHC-ның пікірінше, HIPAA тәжірибеде зерттеу саласындағы ұзақ жылдар бойы қолданылып келе жатқан ережелерден артық қорғауды ұсынбауы мүмкін. Көбірек маңыздысы, хабардар келісім арқылы қорғауға бағытталған ереже орташа адамдар үшін түсініксіз болу деңгейіне жетеді". Бұл деректерді жинақтау және өңдеу практикасында деректердің анонимділігін қамтамасыз ету қажеттігін көрсетеді. АҚШ ақпараттық құпиялылық заңнамасы, мысалы HIPAA және Отбасылық білім беру құқықтары мен құпиялылық туралы заң (FERPA), тек әрбір заң қарастыратын нақты салаларға ғана қолданылады. АҚШ-тағы көптеген компаниялардың деректерді өңдеуін пайдалану ешқандай заңнамамен реттелмейді.
Еуропадағы жағдай
Еуропалық авторлық құқық туралы деректер базасы заңдарына сәйкес, авторлық құқық иеленушінің рұқсатысыз авторлық құқықпен қорғалған туындыларды (мысалы, веб-шахтерлік арқылы) өндіру заңсыз болып табылады. Егер деректер қоры Еуропада қарапайым деректерден тұрса, онда авторлық құқық болмауы мүмкін, бірақ деректер қорына қатысты құқықтар болуы мүмкін, сондықтан деректерді өндіру дерекқорлар туралы директивамен қорғалатын зияткерлік меншік иелерінің құқықтарына бағынады. Харгривс шолуының ұсынысы бойынша, бұл Ұлыбритания үкіметінің 2014 жылы авторлық құқық туралы заңға өзгеріс енгізуіне әкелді, бұл шектеу және ерекшелік ретінде мазмұнды өндіруге мүмкіндік берді. Ұлыбритания 2009 жылы деректерді өндіруге ерекшелік енгізген Жапониядан кейін әлемдегі екінші ел болды. Алайда, Ақпараттық қоғам туралы 2001 жылғы директиваның шектеулеріне байланысты, Ұлыбританияның ерекшелігі тек коммерциялық емес мақсаттарда мазмұнды өндіруге рұқсат береді. Ұлыбританияның авторлық құқық заңдары сондай-ақ осы ережеге келісімшарт шарттарының басымдығын жолдармайды. 2020 жылдан бастап Швейцария да деректерді өндіруді реттеуді бастады, оны белгілі бір шарттармен ғылыми-зерттеу саласында рұқсат етеді, бұл шарттар Швейцария авторлық құқық заңының 24d бабында белгіленген. Бұл жаңа бап 2020 жылғы 1 сәуірде күшіне енді. 2013 жылы Еуропалық комиссия "Еуропа үшін лицензиялар" тақырыбымен мәтін және деректерді өндіру мәселесі бойынша мүдделі тараптармен талқылау өткізді. Бұл құқықтық мәселені шешуде лицензиялауға, шектеулер мен ерекшеліктерге қарағанда, көбірек назар аудару нәтижесінде, 2013 жылдың мамыр айында университеттердің, зерттеушілердің, кітапханалардың, азаматтық қоғам ұйымдарының және ашық қолжетімділік баспаларының өкілдері мүдделі тараптар диалогын тоқтатты.
АҚШ-тағы жағдай
АҚШ-тың авторлық құқық заңнамасы, әсіресе әділ пайдалану ережесі, Америкада және Израиль, Тайвань және Оңтүстік Корея сияқты әділ пайдалануға рұқсат беретін елдерде контент өндірудің заңдылығын қамтамасыз етеді. Контент өндіру трансформациялық сипатта болғандықтан, яғни ол бастапқы туындыны ығыстырмайды, сондықтан әділ пайдалану шеңберінде заңды деп есептеледі. Мысалы, Google Book келісімі аясындағы сотта төрағалық еткен судья Google-дың авторлық құқыққа ие кітаптарды цифрлық форматқа көшіру жобасының заңды екенін мәлімдеді, себебі жобаның трансформациялық қолданылуы – мәтін және деректерді өндіру сияқты пайдалы мүмкіндіктерді ұсынды.