Кіріспе
Салыстырмалы лингвистиканың әдісі. Лексикостатистика – тілдердің лексикалық туыстығының проценттік көрсеткіштерін салыстыру арқылы олардың байланысын анықтауға бағытталған салыстырмалы лингвистиканың әдісі. Лексикостатистика салыстырмалы әдіспен байланысты, бірақ бастапқы тілді қайта құруға көмектеспейді. Оны глоттохронологиядан ажырату қажет, ол екі немесе одан көп тілдің ортақ, ертерек бастапқы тілден неше уақыт бұрын бөлініп шыққандығын бағалау үшін лексикостатистикалық әдістерді қолдануға тырысады. Дегенмен, бұл лексикостатистиканың қолданылуының тек бір түрі ғана; оның басқа қолданыстары негізгі лексикалық элементтердің өзгеріс жылдамдығы тұрақты деген болжамды қабылдамайды. "Лексикостатистика" термині шатастырады, себебі математикалық теңдеулер қолданылады, бірақ статистика қолданылмайды. Лексикадан басқа тілдің басқа да ерекшеліктері қолданылуы мүмкін, бірақ мұндай жағдай сирек кездеседі. Салыстырмалы әдіс кіші топтарды анықтау үшін ортақ, анықталған жаңалықтарды пайдаланса, лексикостатистика оларды анықтамайды. Лексикостатистика – қашықтыққа негізделген әдіс, ал салыстырмалы әдіс тілдің белгілерін тікелей қарастырады. Лексикостатистика әдісі салыстырмалы әдіске қарағанда қарапайым және жылдам техника болып табылады, бірақ оның шектеулері бар (төменде талқыланады). Оны екі әдіс арқылы алынған ағаштарды салыстырып тексеру арқылы растауға болады.
Lexicostatistics is a method of comparative linguistics that involves comparing the percentage of lexical cognates between languages to determine their relationship. Lexicostatistics is related to the comparative method but does not reconstruct a proto language. It is to be distinguished from glottochronology, which attempts to use lexicostatistical methods to estimate the length of time since two or more languages diverged from a common earlier proto language. This is merely one application of lexicostatistics, however; other applications of it may not share the assumption of a constant rate of change for basic lexical items. The term "lexicostatistics" is misleading in that mathematical equations are used but not statistics. Other features of a language may be used other than the lexicon, though this is unusual. Whereas the comparative method used shared identified innovations to determine sub groups, lexicostatistics does not identify these. Lexicostatistics is a distance based method, whereas the comparative method considers language characters directly. The lexicostatistics method is a simple and fast technique relative to the comparative method but has limitations (discussed below). It can be validated by cross checking the trees produced by both methods.
Тарих
Лексикостатистиканы Моррис Свадеш 1950 жылдары бұрынғы идеялар негізінде жазылған бірнеше мақаласында әзірледі. Бұл концепцияны алғаш рет 1834 жылы Дюмон д'Урвилл қолданды, ол түрлі "Океандық" тілдерді салыстырып, туыстық коэффициентін есептеу әдісін ұсынған. Хаймс (1960) және Эмблтон (1986) лексикостатистика тарихын шолуға арналған еңбектер жазды.
Сөз тізімі құрылсын
Мақсаты – барлық тілдерде қолданылатын мағыналардың тізімін жасау (қол, ауыз, аспан, мен). Содан кейін, қарастырылып жатқан әр тіл үшін осы мағыналық категорияларға сөздер жиналады. Swadesh бастапқыда мәндердің үлкен жиынтығын 200-ге дейін қысқартты. Кейін ол оны одан да қысқарту қажет екенін, бірақ бастапқы тізіміне енбеген кейбір мағыналарды қоса алатынын анықтады, нәтижесінде 100 тармақты тізім пайда болды. Wiktionary-дегі Swadesh тізімі бірнеше тілде барлығы 207 мағынаны ұсынады. Қатаң критерийлерді қолданатын басқа тізімдер де жасалды, мысалы, Dolgopolsky тізімі және Leipzig–Jakarta тізімі, сондай-ақ, белгілі бір салаға бағытталған тізімдер. Мысалы, Dyen, Kruskal және Black 84 үнді-еуропалық тіл үшін 200 мағынаны цифрлық форматта ұсынады.
Танымдық қасиеттерді анықтау
Білікті және тәжірибелі тіл білімі маманы туыстық туралы шешімдер қабылдау үшін қажет. Бірақ білімнің артуымен шешімдерді нақтылау қажет болуы мүмкін. Дегенмен, лексикостатистика барлық шешімдердің дұрыс болуына тірелмейді. Осы тізімдегі әрбір сөз жұбы үшін (әр түрлі тілдерде) форманың туыстығы оң, теріс немесе анықталмаған болуы мүмкін. Кейде бір тілде бір ұғымды білдіретін бірнеше сөз болады, мысалы, "кішкентай" және "ұсақ" сөздері "үлкен емес" мағынасын білдіреді.
Лексикостатистикалық пайыздарды есептеу
Бұл пайыз белгілі бір тіл жұбы үшін мағыналардың туыстық байланыста болуының үлесімен байланысты, яғни нақтыланбаған жағдайларды ескермей, жалпы санына қатысты. Бұл мән N×N қашықтықтар кестесіне енгізіледі, мұнда N – салыстырылып жатқан тілдердің саны. Кесте толықтырылғаннан кейін, оның үшбұрышты бөлігінің жартысы ғана толтырылады. Туыстық байланыстың үлесі жоғары болған сайын, тілдердің бір-бірімен байланысы тығыз болады.
Қолданбалар
Лексикостатистиканы қолданудың көрнекті маманы Исидор Дьен болды. Ол лексикостатистиканы австронезиялық және индоевропалық тілдерді жіктеу үшін пайдаланды. 2012 жылы Клэр Боуэрн мен Квентин Аткинсон Пама-Нюган тілдерінің барлық негізгі топтары мен оқшауланған тілдерін көрсететін 194 докулектіге есептеу филогенетикалық әдістерін қолдану нәтижелерін жариялады. Олардың моделі көптеген австралиялық тілдерді зерттеушілер бұрын ұсынған және қабылдаған көптеген тармақтар мен бөлімдерді "қайта анықтады", сонымен қатар Паман (деректердің жетіспеуімен қиындық тудыратын) және Нгумпин-Япа (тілдер арасындағы қарыз алудың жоғары деңгейі генетикалық картинаны бүркемелейтін) сияқты мәселелі тармақтар туралы түсінік берді. Олардың деректер жиынтығы аңшы-жинақшы тілдер отбасы үшін ең ірі дерекқор болып табылады және австронезия тілдерінен кейін жалпы алғанда екінші орында тұрады (Greenhill et al. 2008). Олардың қорытындысы бойынша, Пама-Нюган тілдері лексикостатистикалық әдістерге ерекше келмейді, бұл әдістер әлемнің басқа тілдер отбасыларына да сәтті қолданылған.
Сындар
Хойджер (1956) сияқты зерттеушілер мағыналық бірліктерге эквивалент табудың қиын екенін көрсетті, ал көптеген ғалымдар Свадеш тізімдерін өзгерту қажет деп санады. Гудшинский (1956) жалпыға ортақ тізім жасау мүмкіндігіне күмән келтірді. Қарыз сөздер, дәстүр және тыйым сияқты факторлар нәтижелерді басқа әдістердегідей бұрмалауы мүмкін. Кейде лексикостатистикада туыстық емес, лексикалық ұқсастық негізінде ұқсастықтар ізделеді. Бұл жағдайда, бұл массалық салыстырумен тең. Мағыналық категорияларды және синонимдерді таңдау субъективті болып табылады.
Жақсылатылған әдістер
Қазіргі заманғы есептеу статистикалық гипотезаларды тексеру әдістерінің кейбіреулері лексикостатистиканың жетілдірілген нұсқалары болып саналады, себебі олар ұқсас сөз тізімдері мен арақашықтық өлшемдерін пайдаланады.