Введение

Метод сравнительной лингвистики

Лексикостатистика – это метод сравнительной лингвистики, заключающийся в сравнении процента лексических когнатов между языками для установления их родства. Лексикостатистика связана с сравнительным методом, но не предполагает реконструкцию праязыка. Её следует отличать от глоттохронологии, которая стремится использовать лексикостатистические методы для оценки времени, прошедшего с момента расхождения двух или более языков от общего предкового праязыка. Однако это лишь одно из применений лексикостатистики; другие области её применения могут не основываться на предположении о постоянной скорости изменения базовой лексики. Термин "лексикостатистика" вводит в заблуждение, поскольку используются математические уравнения, а не статистические методы. Помимо лексики, могут рассматриваться и другие языковые признаки, хотя это встречается редко. В то время как сравнительный метод использует общие инновации для определения подгрупп, лексикостатистика не выявляет эти инновации. Лексикостатистика – это метод, основанный на измерении расстояния, в то время как сравнительный метод непосредственно анализирует языковые признаки. Метод лексикостатистики является более простым и быстрым по сравнению со сравнительным методом, но имеет свои ограничения (описанные ниже). Его можно подтвердить, сравнивая деревья, построенные обоими методами.

История

Лексикостатистика была разработана Моррисом Свадешем в серии статей в 1950-х годах, основываясь на более ранних идеях. Первое известное применение этой концепции относится к 1834 году, когда Дюмон д'Урвиль сравнил различные "океанские" языки и предложил метод для вычисления коэффициента родства. История лексикостатистики рассматривается в работах Хаймса (1960) и Эмблетона (1986).

Создать список слов

Цель состоит в том, чтобы составить список общеупотребимых значений (рука, рот, небо, я). Затем для каждого рассматриваемого языка собираются слова, соответствующие этим значениям. Изначально Свадеш сократил более обширный список значений до 200. Позже он пришел к выводу, что необходимо дальнейшее сокращение, но при этом можно включить некоторые значения, отсутствовавшие в первоначальном списке, что привело к созданию его более позднего списка из 100 пунктов. Список Свадеша в Викисловаре содержит в общей сложности 207 значений для ряда языков. Были разработаны альтернативные списки, использующие более строгие критерии, например, список Долгопольского и список Лейпциг–Джакарта, а также списки с более узкой специализацией; например, Dyen, Kruskal и Black создали список из 200 значений для 84 индоевропейских языков в цифровом формате.

Определять знания

Для определения родства слов необходим квалифицированный и опытный лингвист. Однако эти решения могут потребовать корректировки по мере накопления новых знаний. При этом лексикостатистика не требует абсолютной точности всех этих определений. Для каждой пары слов (из разных языков) в этом списке степень родства формы может быть положительной, отрицательной или неопределенной. Иногда в языке существует несколько слов для обозначения одного и того же понятия, например, "small" и "little" для обозначения "not big".

Вычислить лексикостатистические проценты

Этот процент отражает долю значений для конкретной языковой пары, имеющих общее происхождение, то есть соотносится с общим числом без учета неоднозначности. Это значение вносится в таблицу расстояний N×N, где N – количество сравниваемых языков. После заполнения таблица будет заполнена наполовину в треугольном виде. Чем выше доля общих корней, тем ближе языки друг к другу.

Приложения

Ведущим сторонником применения лексикостатистики был Исидор Дьен. Он использовал лексикостатистику для классификации австронезийских языков, а также индоевропейских. В 2012 году Клэр Боуэрн и Квентин Аткинсон опубликовали результаты применения ими вычислительных филогенетических методов к 194 диалектам, представляющим все основные подгруппы и изолированные языки Пама-Нюнган. Их модель "реконструировала" многие ветви и деления, которые ранее предлагались и принимались многими другими австралийскими лингвистами, а также дала некоторое представление о более проблемных ветвях, таких как Паман (сложность которого обусловлена недостатком данных) и Нгумпин-Япа (где генетическая картина затруднена очень высокой степенью заимствований между языками). Их набор данных является самым крупным в своем роде для семьи языков охотников-собирателей и вторым по величине в целом после австронезийской (Greenhill et al. 2008). Они заключили, что языки Пама-Нюнган на самом деле не являются исключением для лексикостатистических методов, которые успешно применялись к другим языковым семьям мира.

Критика

Такие исследователи, как Хойджер (1956), показали, что возникали трудности с поиском эквивалентов для значений, и многие сочли необходимым модифицировать списки Свадеша. Гудшинский (1956) подверг сомнению возможность создания универсального списка. Факторы, такие как заимствования, традиции и табу, могут искажать результаты, как и в случае с другими методами. Иногда лексикостатистика применялась с использованием лексического сходства вместо родства для выявления соответствий. Это равносильно массовому сравнению. Выбор семантических категорий субъективен, как и выбор синонимов.

Улучшенные методы

Некоторые современные методы вычислительного статистического проверки гипотез можно рассматривать как усовершенствования лексикостатистики, поскольку они используют аналогичные списки слов и меры расстояния.