Кіріспе
Тіл білімінің нақты мәтіндердегі мысалдар арқылы тілді зерттейтін саласы.
Корпустық лингвистика – тілді зерттеудің эмпириялық әдісі, ол мәтіндік корпус (көпше түрі – корпустар) арқылы жүзеге асырылады. Корпустар – теңгерілген, көбінесе қабатталған, аутентикалық, "нақты өмірден" алынған ауызша немесе жазбаша мәтіндердің жиынтығы, олар белгілі бір тілдік түрленуді бейнелеуге бағытталған. Мәтіндік корпус әдісі кез келген табиғи тілдегі мәтіндерді сол тілді басқаратын абстрактілі ережелер жиынтығын алу үшін пайдаланады. Бұл нәтижелер осы тілдің басқа да ұқсас талдаудан өткен тілдермен байланысын зерттеу үшін қолданылуы мүмкін. Алғашқы корпустар бастапқы мәтіндерден қолмен құрастырылған, бірақ қазір бұл жұмыс автоматтандырылған. Корпустар лингвистикалық зерттеулер үшін ғана емес, 1969 жылдан бері сөздіктерді (1969 жылы ағылшын тілінің американдық мұралық сөздігінен бастап) және анықтамалық грамматикаларды құрастыру үшін де кеңінен қолданылып келеді, 1985 жылы жарық көрген ағылшын тілінің толық грамматикасы осы саладағы алғашқы жұмыс болды. Бұл саладағы сарапшылар корпустың аннотациясы туралы әртүрлі пікірде. Бұл көзқарастар Джон Макхарди Синклерден бастап, мәтіндердің өзі сөйлейтіндей минималды аннотацияны жақтаған, ағылшын тілінің қолданысын зерттеу тобынан (Лондон университетінің колледжі) – аннотацияның қатаң тіркеу арқылы тілдік түсінікті арттыруға мүмкіндік беретінін жақтаған.
Тарих
Грамматикалық сипаттамаға жасалған алғашқы тыраштандырулардың бір бөлігі, кем дегенде, белгілі бір діни немесе мәдени маңызы бар мәтіндер жиынтығына негізделген. Мысалы, Пратишакхья әдебиеті Ведаларда кездесетін санскрит тілінің дыбыс үлгілерін сипаттады, ал Панинидің классикалық санскрит грамматикасы сол мәтіндер жиынтығын талдауға негізделген. Сол сияқты, араб тілінің грамматикасын зерттеген ертедегі ғалымдар Құранның тіліне ерекше назар бөлген. Батыс Еуропалық ғалымдар Киелі кітаптың және басқа да канондық мәтіндердің тілін егжей-тегжейлі зерттеу үшін конкорданстар жасады.
Pāṇini's grammar of classical Sanskrit was based at least in part on analysis of that same corpus. Similarly, the early Arabic grammarians paid particular attention to the language of the Quran. In the Western European tradition, scholars prepared concordances to allow detailed study of the language of the Bible and other canonical texts.
Ағылшын тіліндегі corpora
Қазіргі заманғы корпус лингвистикасының маңызды кезеңі 1967 жылы жарық көрген «Қазіргі американдық ағылшын тілінің есептеу талдауы» болды. Генри Кучера мен В. Нельсон Фрэнсис жазған бұл еңбек 1961 жылғы американдық ағылшын тілінің бір миллион сөзінен тұратын, құрылымдалған және теңгерілген корпус – Браун корпусын талдауға негізделген. Корпус әртүрлі жанрлардан 2000 мәтін үлгісін қамтиды. Браун корпусы – лингвистикалық зерттеулер үшін жасалған алғашқы компьютерлік корпус. Кучера мен Фрэнсис Браун корпусын түрлі есептеу талдауларынан өткізіп, содан кейін лингвистика, тіл білімі, психология, статистика және социология элементтерін біріктіре отырып, бай және алуан түрлі еңбек жасады. Тағы бір маңызды жарияланым – 1960 жылы Рэндольф Квирктің «Ағылшын тілінің қолданысын сипаттауға қатысты» еңбегі, онда ол ағылшын тілінің қолданысын зерттеуді ұсынды. Квирк корпусы – бүкіл тілді бейнелеу мақсатымен құрылған алғашқы қазіргі заманғы корпус. Біраз уақыттан кейін Бостондық «Houghton Mifflin» баспасы Кучераға жаңа «American Heritage Dictionary» үшін үш жолдық цитаталар базасын ұсынуды сұрады, бұл корпус лингвистикасын қолдана отырып жасалған алғашқы сөздік болды. «AHD» жаңашылдыққа бет бұрып, нормативтік элементтерді (тілді қалай қолдану керек) сипаттамалық ақпаратпен (оның іс жүзінде қалай қолданылатыны) біріктірді. Басқа баспагерлер де осы жолды ұстанды. Британдық «Collins» баспасының «COBUILD» монолингваль оқушы сөздігі, ағылшын тілін шет тілі ретінде үйренетін пайдаланушыларға арналған. «Ағылшын тілінің қолданыс корпусы» ең маңызды корпус негізіндегі грамматиканы жасауда қолданылды, оны Квирк және т.б. жазып, 1985 жылы «Ағылшын тілінің толық грамматикасы» деген атпен жариялады. Браун корпусы сондай-ақ ұқсас құрылымдағы көптеген корпус тудырды: «LOB Corpus» (1960-шы жылдардағы британдық ағылшын тілі), «Kolhapur» (үнді ағылшын тілі), «Wellington» (жаңазеландиялық ағылшын тілі), «Australian Corpus of English» (австралиялық ағылшын тілі), «Frown Corpus» (1990-шы жылдардағы американдық ағылшын тілі) және «FLOB Corpus» (1990-шы жылдардағы британдық ағылшын тілі). Басқа корпус тілдердің, түрлерінің және стильдерінің көптеген үлгілерін ұсынады, олардың ішінде «International Corpus of English» және «British National Corpus» бар, ол 1990 жылдары баспагерлер, университеттер (Оксфорд және Ланкастер) және Британ кітапханасының консорциумы жасаған, ауызша және жазбаша мәтіндердің 100 миллион сөзден тұратын жиынтығы. Қазіргі заманғы американдық ағылшын тіліндегі жұмыс тоқтап қалды, бірақ 400 миллионнан астам сөзді қамтитын «Corpus of Contemporary American English» (1990 жылдан қазірге дейін) веб-интерфейс арқылы қолжетімді. Алғашқы компьютерлік ауызша тілдің транскрипциясы 1971 жылы «Montreal French Project» жобасымен жасалды, онда бір миллион сөз болды, бұл Шана Поплэктің Оттава-Халл аймағындағы ауызша француз тілінің әлдеқайда үлкен корпусын құруға түрткі болды.
Көптілді корпус
1990 жылдары табиғи тілді бағдарламалаудағы (ТЖБ) статистикалық әдістердің көптеген маңызды жетістіктері машиналық аударма саласында орын алды, әсіресе IBM Research-тегі жұмыстардың арқасында. Бұл жүйелер Канада Парламенті мен Еуропалық Одақ құрған, барлық үкіметтік мәліметтерді тиісті үкімет жүйелерінің барлық ресми тілдеріне аударуды талап ететін заңдар нәтижесінде пайда болған көптілді мәтіндік корпус қолдана алды. Еуропалық емес тілдерде де корпус бар. Мысалы, Жапониядағы Жапон тілі және лингвистика институты жапон тілінің ауызша және жазбаша корпустарын жасады. Видео деректерді пайдалану арқылы есімдер тілінің корпус та құрылды.
Ежелгі тілдер корпустары
Тірі тілдер корпустарынан өзге, көне тілдердегі мәтіндер жинағының компьютерлік корпустары да жасалған. Мысалы, 1970 жылдан бері дамытылып келе жатқан еврей Киелі кітабының Андерсен Форбс дерекқоры, онда әрбір сөйлем жеті деңгейге дейінгі синтаксисті көрсететін графиктер арқылы талданады және әрбір бөлік жеті ақпараттық өріспен белгіленеді. Құран араб тіліндегі корпусы – Құранның классикалық араб тіліне арналған түсіндірмелі корпус. Бұл – морфологиялық жіктеу, сөз түрлерін анықтау және тәуелділік грамматикасын қолдана отырып жүргізілетін синтаксистік талдау сияқты көп деңгейлі түсіндірмелерді қамтитын жаңа жоба. Санскрит тілінің сандық корпусы (СКД) – санскрит тілінің тіл білімі және филологиясы саласындағы мәтіндік-тарихи зерттеулер үшін арналған, толық морфологиялық және лексикалық талдау жасалған санскрит мәтіндерінің сандық бөлінген корпусы.
Белгілі бір салалардағы корпорациялар
Таза тіл білімі зерттеулерінен өзге, зерттеушілер корпус лингвистикасын басқа академиялық және кәсіби салаларға қолдана бастады, мысалы, жаңа ғылым саласы – Заң және корпус лингвистикасы, ол корпус деректері мен құралдарын пайдаланып құқықтық мәтіндерді түсінуге бағытталған. DBLP Discovery Dataset компьютерлік ғылымға қатысты, авторлық құрастыру, сілтемелер немесе зерттеу салалары сияқты маңызды метадеректермен бірге тиісті компьютерлік ғылым жарияланымдарын қамтиды. NLP Scholar ACL антологиясы мен Google Scholar метадеректер жиынтығын біріктіріп, көбірек назар аударатын деректер жиынтығын ұсынды. Корпустар аударма жұмысына немесе шетел тілдерін оқытуға да көмектесе алады.
Әдістер
Корпустық лингвистика деректен теорияға қарай жол табуға бағытталған бірқатар зерттеу әдістерін жасады. Уоллис пен Нельсон (2001) алғаш рет 3А перспективасы деп атаған нәрсені ұсынды: Аннотация, абстракция және талдау. Аннотация – мәтіндерге схема қолданудан тұрады. Аннотацияларға құрылымдық белгілеу, сөздердің түрлерін анықтау, синтаксистік талдау және көптеген басқа да түрлендірулер кіруі мүмкін. Абстракция – схемадағы терминдерді теориялық тұрғыдан негізделген модельдегі немесе деректер жинағындағы терминдерге аудару (бейімдеу). Абстракция көбінесе лингвист бағытталған іздеуді қамтиды, бірақ мысалы, талдаушылар үшін ережелерді үйрену де кіруі мүмкін. Талдау – деректер жинағын статистикалық тұрғыдан зерттеу, өңдеу және жалпылау. Талдауға статистикалық бағалау, ережелер жинағын оңтайландыру немесе білімді ашу әдістері кіруі мүмкін. Бүгінгі таңда көптеген лексикалық корпус сөздердің түрлерімен (POS белгілерімен) белгіленген. Дегенмен, тіпті «белгіленбеген қарапайым мәтінмен» жұмыс істейтін корпус лингвистері де маңызды терминдерді бөліп көрсету үшін әлдебір әдіс қолданады. Мұндай жағдайларда аннотация мен абстракция лексикалық іздеуде біріктіріледі. Аннотацияланған корпусты жариялаудың артықшылығы – басқа пайдаланушылар корпуспен тәжірибелер жүргізе алады (корпус менеджерлері арқылы). Бұл жұмысты авторлардың пікірінен өзгеше қызығушылықтары мен көзқарастары бар лингвистер пайдалана алады. Деректерді бөлісу арқылы корпус лингвистері корпусты лингвистикалық пікірталас пен одан әрі зерттеулер үшін негізгі орын ретінде қарастырады.