Кіріспе

Тіл білімі мен компьютерлік ғылымдар саласы – табиғи тілді компьютерлердің өңдеуі. Табиғи тілді өңдеу (ТТӨ) – компьютерлік ғылым мен ақпаратты іздеудің салааралық тармағы. Ол негізінен компьютерлерге адам тілін қолдау және оны манипуляциялау мүмкіндігін берумен айналысады. Бұл мәтіндік немесе сөздік корпус сияқты табиғи тілдік деректер жиынтықтарын ережеге негізделген немесе ықтималдық (яғни, статистикалық және соңғы кезде нейрондық желіге негізделген) машиналық оқыту әдістерін қолдана отырып өңдеуді қамтиды. Мақсат – құжаттардың мазмұнын, соның ішінде олардың ішіндегі тілдің контекстуалды ерекшеліктерін "түсінуге" қабілетті компьютер құру. Осы мақсатта табиғи тілді өңдеу жиі теориялық тіл білімінен идеялар алады. Технология содан кейін құжаттардағы ақпаратты және түсініктерді дәл шығарып алады, сондай-ақ құжаттарды жіктеп, ұйымдастырады. Табиғи тілді өңдеудегі қиындықтар көбінесе сөзді тану, табиғи тілді түсіну және табиғи тілді жасаумен байланысты.

Символды НЛП (1950-ші жылдар 1990-шы жылдардың басында)

Символикалық НЛП-нің қағидасын Джон Сёрлдің «қытай бөлмесі» тәжірибесі жақсы түсіндіреді: ережелер жиынтығын (мысалы, қытай тіліндегі сөздіктер, сұрақтар мен оларға сәйкес жауаптар) ескере отырып, компьютер табиғи тілді түсінуді (немесе басқа да НЛП міндеттерін) осы ережелерді өзіне келетін деректерге қолдану арқылы имитациялайды. 1950 жылдар: 1954 жылғы Джорджтаун тәжірибесінде 60-тан астам орыс тіліндегі сөйлемдердің толық автоматты түрде ағылшын тіліне аударылуы қамтылды. Авторлар үш-бес жыл ішінде машиналық аударма мәселесі шешілетінін мәлімдеді. Дегенмен, нақты прогресс өте баяу болды, ал 1966 жылғы ALPAC есебінен кейін он жылдық зерттеулер күтілген нәтижелерді бермеді, машиналық аудармаға бөлген қаржы күрт азайтылды. Америкада машиналық аударма бойынша қосымша зерттеулер жүргізілмеді (бірақ кейбір зерттеулер Жапония және Еуропа сияқты басқа жерлерде жалғасты) 1980-ші жылдардың соңына дейін, алғашқы статистикалық машиналық аударма жүйелері әзірленгенше. 1960 жылдар: 1960 жылдары жасалған табысты табиғи тілді өңдеу жүйелерінің ішінде SHRDLU, шектеулі сөздікпен және шектеулі «блоктар әлемінде» жұмыс істейтін табиғи тіл жүйесі, және Джозеф Вайзенбаумның 1964 және 1966 жылдар аралығында жазған Роджерлік психотерапевттің имитациясы ELIZA болды. Адамның ой-өрісі мен эмоциялары туралы дерлік ешқандай ақпаратты пайдаланбастан, ELIZA кейде таң қалдыратын дәрежеде адам сияқты әрекеттесе алды. «Науқас» өте шағын білім базасынан асып кеткен жағдайда, ELIZA жалпылама жауап бере алады, мысалы, «Басым ауырады» деген сөзге «Неліктен басыңыз ауырады деп айтасыз?» деп жауап беруі мүмкін. Росс Куилланның табиғи тілдегі табысты жұмысы тек жиырма сөзден тұратын сөздікпен көрсетілді, себебі сол кезде компьютер жадында осы сөздерге ғана орын болатын. 1970 жылдар: 1970 жылдары көптеген бағдарламашылар «концептуалды онтологияларды» жаза бастады, олар нақты әлем туралы ақпаратты компьютер түсінетін деректерге құрылымдады. Мысалдар: MARGIE (Шанк, 1975), SAM (Каллингфорд, 1978), PAM (Виленски, 1978), TaleSpin (Михан, 1976), QUALM (Лехнерт, 1977), Саясат (Карбонелл, 1979) және Сюжеттік бірліктер (Лехнерт, 1981). Осы кезеңде алғашқы чат-боттар жасалды (мысалы, PARRY). 1980 жылдар: 1980-ші жылдар мен 1990-шы жылдардың басында НЛП-да символикалық әдістердің өркендеу кезеңі болды. Сол кездегі зерттеулердің басты бағыттары: ережелерге негізделген талдау (мысалы, генеративтік грамматиканың есептеулік операционализациясы ретінде HPSG-ді дамыту), морфология (мысалы, екі деңгейлі морфология), семантика (мысалы, Леск алгоритмі), сілтеме (мысалы, орталықтау теориясы аясында) және табиғи тілді түсінудің басқа да салалары (мысалы, риторикалық құрылым теориясында). Басқа да зерттеулер жалғасты, мысалы, Racter және Jabberwacky арқылы чат-боттарды дамыту. 1990 жылдардағы статистикалық бұрылысқа әкелген маңызды оқиға – осы кезеңде сандық бағалаудың маңыздылығының артуы болды.

Статистикалық НЛП (1990-2010 жылдар)

1980 жылға дейін табиғи тілді өңдеу жүйелерінің көпшілігі қолмен жазылған күрделі ережелерге негізделген. Алайда, 1980 жылдардың соңынан бастап, тіл өңдеу үшін машиналық оқыту алгоритмдерін енгізу арқылы табиғи тілді өңдеуде революция болды. Бұл есептеу қуатының тұрақты өсуіне (Мур заңы) және теориялық негіздері тілдік өңдеуге машиналық оқыту әдісін негіздеген корпус лингвистикасының түрін тежеген Чомскийдің лингвистикалық теорияларының (мысалы, трансформациялық грамматика) ықпалының біртіндеп төмендеуіне байланысты болды. 1990 жылдар: Көптеген маңызды статистикалық әдістер НЛП-де машиналық аударма саласында пайда болды, әсіресе IBM Research-тегі IBM сәйкестендіру модельдері сияқты жұмыстарға байланысты. Бұл жүйелер Канада Парламенті мен Еуропалық Одақ жасаған көптілді мәтіндік корпус қолдана алды, себебі заңдар барлық үкіметтік рәсімдерді тиісті үкімет жүйелерінің барлық ресми тілдеріне аударуды талап етті. Дегенмен, көптеген басқа жүйелер осы жүйелер іске асыратын міндеттер үшін арнайы жасалған корпусқа тәуелді болды, бұл осы жүйелердің табысындағы маңызды шектеу болды (және көбінесе солай болып қала береді). Осының салдарынан, шектеулі деректерден тиімді оқыну әдістерін зерттеуге көптеген зерттеулер бағытталды. 2000 жылдар: Интернеттің өсуімен 1990 жылдардың ортасынан бастап шикі (белгіленбеген) тілдік деректердің көлемі арта түсті. Сондықтан зерттеулер бақылаусыз және жартылай бақылаулы оқыту алгоритмдеріне көбірек назар аударды. Мұндай алгоритмдер қажетті жауаптармен қолмен белгіленбеген деректерден немесе белгіленген және белгіленбеген деректердің комбинациясын пайдаланып оқытуға болады. Әдетте, бұл тапсырма бақыланатын оқытудан әлдеқайда қиын және берілген кіріс деректері үшін әдетте аз дәлді нәтижелер береді. Алайда, қол жетімді белгіленбеген деректердің орасан зор көлемі бар (соның ішінде, басқа нәрселермен қатар, бүкіл Дүниежүзілік желінің мазмұны), егер қолданылатын алгоритмнің уақыт күрделілігі жеткілікті төмен болса, ол нашар нәтижелерді өтеуге болады.

Нейрологиялық НЛП (қазіргі)

2003 жылы сөздік n-граммалық модель, сол кездегі ең жақсы статистикалық алгоритм, көп қабатты перцептронмен (бір жасырын қабатпен және бірнеше сөздік контекст ұзындығымен, 14 миллионға дейін сөздік корпуста CPU кластерінде оқытылған) Йошуа Бенжио және авторлар тобымен басып өтті. 2010 жылы Томаш Миколов (сонда Брно технологиялық университетінің докторанты) авторлармен бірге тілдік модельдеуге бір жасырын қабатты қарапайым рекурренттік нейрондық желі қолданды, ал келесі жылдары ол Word2vec-ті әзірледі. 2010 жылдары бейнелеуді оқыту және терең нейрондық желілер стиліндегі (көптеген жасырын қабаттары бар) машиналық оқыту әдістері табиғи тілді өңдеуде кеңінен таралды. Бұл танымалдылықтың себебі, ішінара, осындай техникалар көптеген табиғи тіл міндеттерінде, мысалы, тілдік модельдеу және синтаксистік талдауда, ең жақсы нәтижелерге жете алатынын көрсеткен көптеген нәтижелерге байланысты болды. Бұл медицина және денсаулық сақтау саласында маңызды болып табылады, онда НЛП электрондық денсаулық сақтау жазбаларындағы жазбалар мен мәтіндерді талдауға көмектеседі, олар әйтпесе зерттеу үшін қолжетімсіз болар еді, күтімді жақсарту немесе пациенттің құпиялылығын қорғау мақсатында.

Статистикалық әдіс

1980 жылдардың соңы мен 1990 жылдардың ортасында статистикалық тәсіл ережелерге негізделген тәсілдердің тиімсіздігінен туындаған жасанды интеллекттің қысқы кезеңін аяқтады. Ең алғашқы шешім ағаштары, қатаң «егер-әйтсе» ережелері жүйесін құраса да, бұрынғы ережелерге негізделген тәсілдерге ұқсас болды. Тек жасырын Марков модельдерін енгізу, сөздердің түрлерін анықтауға қолданылған кезде, ескі ережелерге негізделген тәсілдің тоқтағанын көрсетті.

Нейро желілері

Статистикалық әдістердің маңызды кемшілігі – оларға күрделі ерекшеліктерді жасау қажет. 2015 жылдан бері статистикалық тәсіл сөздердің семантикалық ерекшеліктерін анықтау үшін сөздерді ендіруді пайдаланатын нейрондық желілер тәсілімен алмастырылды. Орталық міндеттер (мысалы, сөздердің сөйлеу бөлігін анықтау және тәуелділіктерді талдау) енді қажет емес. Жаңадан ойлап табылған тізбек-тізбек түрлендірулерге негізделген нейрондық машиналық аударма, бұрынғы статистикалық машиналық аударма үшін қажет болған сөздерді үйлестіру сияқты орталық қадамдарды қолданусыз қылып берді.

Жалпы NLP міндеттері

Келесіде табиғи тілді өңдеуде ең көп зерттелген міндеттердің тізімі келтірілген. Осы міндеттердің кейбіреулері нақты өмірде тікелей қолданылады, ал қалғандары көбінесе ірі мәселелерді шешуге көмектесетін қосалқы міндеттер ретінде қолданылады. Табиғи тілді өңдеу міндеттері өте тығыз байланысты болғамен, оларды қарапайымдық үшін санаттарға бөлуге болады. Төменде олардың жалпы жіктелуі берілген.