Введение

Грамматика зависимостей (DG) — это класс современных грамматических теорий, основанных на отношениях зависимости (в отличие от отношений составляющих в рамках фразовой структуры), восходящих преимущественно к работам Люсьена Тесньера. Зависимость — это представление о том, что лингвистические единицы, например слова, связаны друг с другом направленными связями. (Ограниченный) глагол рассматривается как структурный центр синтаксической структуры предложения. Все остальные синтаксические единицы (слова) связаны с глаголом либо напрямую, либо косвенно посредством этих направленных связей, называемых зависимостями. Грамматика зависимостей отличается от грамматики фразовой структуры тем, что, хотя она способна выделять фразы, она, как правило, не акцентирует внимание на фразовых узлах. Структура зависимости определяется отношением между словом (главным элементом) и его зависимыми элементами. Структуры зависимости более плоские, чем структуры фраз, частично из-за отсутствия конечного компонента – глагольной фразы, и поэтому они хорошо подходят для анализа языков со свободным порядком слов, таких как чешский или варльпири.

История

Понятие зависимости между грамматическими единицами существовало с самых ранних записанных грамматик, например, у Панини, и поэтому концепция зависимости, вероятно, предшествует понятию структуры фраз на многие столетия. Ибн Мада, лингвист XII века из Кордовы, Андалусии, возможно, был первым грамматиком, использовавшим термин «зависимость» в грамматическом смысле, который мы используем сегодня. В раннее Новое время концепция зависимости, по-видимому, сосуществовала с концепцией структуры фраз, последняя вошла в латинскую, французскую, английскую и другие грамматики благодаря широкому изучению терминологической логики античности. Зависимость также конкретно проявляется в работах Самуэля Брассаи (1800–1897), венгерского лингвиста, Франца Керна (1830–1894), немецкого филолога, и Хаймана Харитона Тиктина (1850–1936), румынского лингвиста. Однако современные грамматики зависимости начинаются главным образом с работ Люсьена Тесньера. Тесньер был французом, полиглотом и профессором лингвистики в университетах Страсбурга и Монпелье. Его основная работа «Элементы структурного синтаксиса» была опубликована посмертно в 1959 году – он умер в 1954 году. Основный подход к синтаксису, разработанный им, по-видимому, был независимо воспринят другими в 1960-х годах, и с тех пор ряд других грамматик, основанных на зависимости, приобрели известность. DG вызвала большой интерес в Германии как к теоретическому синтаксису, так и к языковой педагогике. В последние годы значительное развитие теорий, основанных на зависимости, связано с вычислительной лингвистикой и частично обусловлено влиятельной работой Дэвида Хейса в области машинного перевода в корпорации RAND в 1950-х и 1960-х годах. Системы, основанные на зависимости, все чаще используются для синтаксического анализа естественного языка и создания деревьев зависимостей. В настоящее время интерес к грамматике зависимостей растет, а международные конференции по лингвистике зависимостей – относительно недавнее явление (Depling 2011, Depling 2013, Depling 2015, Depling 2017, Depling 2019).

Зависимость против структуры фразы

Зависимость – это соответствие один к одному: для каждого элемента (например, слова или морфемы) в предложении в структуре этого предложения существует ровно один узел, соответствующий этому элементу. Результатом этого соответствия один к одному является то, что грамматики зависимости являются грамматиками слов (или морфем). Существуют только элементы и зависимости, связывающие эти элементы в структуру. Эту ситуацию следует сопоставить со структурой фразы. Структура фразы – это соответствие один к одному или более, то есть для каждого элемента в предложении в структуре существует один или несколько узлов, соответствующих этому элементу. Результатом этого различия является то, что структуры зависимости минимальны по сравнению с соответствующими структурами фразы, поскольку они обычно содержат значительно меньше узлов. Эти деревья иллюстрируют два возможных способа представления зависимостных и фразоструктурных отношений (см. ниже). Это зависимостное дерево является «упорядоченным» деревом, то есть оно отражает фактический порядок слов. Многие зависимостные деревья абстрагируются от линейного порядка и фокусируются только на иерархическом порядке, что означает, что они не отображают фактический порядок слов. Это дерево составляющих (= структура фразы) следует условностям минимальной структуры фразы (BPS), при которой сами слова используются в качестве меток узлов. Различие между грамматикой зависимости и грамматикой фразовой структуры во многом обусловлено исходным делением предложения. Фразоструктурное отношение вытекает из исходного бинарного деления, при котором предложение разделяется на именную фразу-субъект (NP) и глагольную фразу-сказуемое (VP). Это деление, безусловно, присутствует в базовом анализе предложения, который мы находим в работах, например, Леонарда Блумфилда и Ноама Хомского. Однако Тесньер решительно возражал против этого бинарного деления, предпочитая позиционировать глагол как корень всей структуры предложения. Тесньер утверждал, что деление на субъект и сказуемое происходит из терминологической логики и не имеет места в лингвистике. Важность этого различия заключается в том, что если признать, что исходное деление на субъект и сказуемое в синтаксисе реально, то, скорее всего, вы выберете путь грамматики фразовой структуры, а если отвергнуть это деление, то необходимо рассматривать глагол как корень всей структуры и, следовательно, выбрать путь грамматики зависимости.

Представление зависимостей

Для представления зависимостей существуют различные условные обозначения, используемые исследователями. Следующие схемы (в дополнение к дереву выше и деревьям ниже) иллюстрируют некоторые из этих условных обозначений:

Представления в (a–d) являются деревьями, при этом конкретные условные обозначения, используемые в каждом дереве, различаются. Сплошные линии обозначают зависимости, а светло-пунктирные – линии проекции. Единственное различие между деревом (a) и деревом (b) заключается в том, что в дереве (a) для маркировки узлов используется класс категории, а в дереве (b) – сами слова в качестве меток узлов. Дерево (c) является упрощенным, поскольку строка слов и линии проекции, расположенные ниже, считаются излишними и, следовательно, опущены. Дерево (d) абстрагируется от линейного порядка и отражает только иерархический порядок. Стрелочные дуги в (e) представляют собой альтернативное условное обозначение, используемое для отображения зависимостей и предпочтительное в грамматике слов (Word Grammar). Скобки в (f) используются редко, но тем не менее способны отражать иерархию зависимостей; зависимые элементы заключаются в большее количество скобок, чем их определяющие элементы. И, наконец, отступы, как в (g), – это еще одно условное обозначение, которое иногда используется для указания иерархии слов. Зависимые элементы располагаются под определяющими элементами и имеют отступ. Как и дерево (d), отступы в (g) абстрагируются от линейного порядка. Суть этих условных обозначений в том, что это всего лишь условные обозначения. Они не влияют на базовое понимание зависимости как отношения, объединяющего синтаксические единицы.

Типы зависимостей

Представления зависимостей, представленные выше (и далее), отображают синтаксические зависимости. Действительно, большая часть исследований в рамках теории зависимостей сосредоточена на синтаксических зависимостях. Однако синтаксические зависимости – это лишь один из трех или четырех видов зависимостей. Например, теория смысла текста акцентирует внимание на роли семантических и морфологических зависимостей наряду с синтаксическими. Также можно выделить четвертый вид – просодические зависимости. Разграничение этих типов зависимостей может быть важным, поскольку в противном случае высока вероятность ошибочного принятия семантических, морфологических и/или просодических зависимостей за синтаксические. В следующих четырех подразделах будет кратко описан каждый из этих типов зависимостей. В ходе обсуждения существование синтаксических зависимостей принимается как данность и используется в качестве отправной точки для определения природы остальных трех типов зависимостей.

Семантические зависимости

Семантические зависимости понимаются в терминах предикатов и их аргументов. Аргументы предиката семантически зависят от этого предиката. Зачастую семантические зависимости совпадают и указывают в том же направлении, что и синтаксические зависимости. Однако в некоторых случаях семантические зависимости могут указывать в направлении, противоположном синтаксическим зависимостям, или быть полностью независимыми от них. Иерархия слов в следующих примерах демонстрирует стандартные синтаксические зависимости, а стрелки указывают на семантические зависимости:

Два аргумента, Сэм и Салли, в дереве (а) зависят от предиката *likes*, при этом эти аргументы также синтаксически зависят от *likes*. Это означает, что семантические и синтаксические зависимости совпадают и указывают в одном направлении (вниз по дереву). Атрибутивные прилагательные, однако, являются предикатами, принимающими в качестве аргумента определяемое существительное, поэтому *big* является предикатом в дереве (b), принимающим *bones* в качестве аргумента; семантическая зависимость направлена вверх по дереву и, следовательно, противоречит синтаксической зависимости. Аналогичная ситуация наблюдается в (c), где предложный предикат *on* принимает два аргумента – *the picture* и *the wall*; одна из этих семантических зависимостей направлена вверх по синтаксической иерархии, а другая – вниз. Наконец, предикат *to help* в (d) принимает аргумент *Jim*, но не имеет с ним прямой связи в синтаксической иерархии, что означает полную независимость семантической зависимости от синтаксических зависимостей.

Морфологические зависимости

Морфологические зависимости возникают между словами или частями слов. Когда данное слово или часть слова влияет на форму другого слова, то последнее морфологически зависит от первого. Согласование является, таким образом, проявлением морфологических зависимостей. Как и семантические зависимости, морфологические зависимости могут совпадать и указывать в том же направлении, что и синтаксические зависимости, совпадать и указывать в противоположном направлении синтаксических зависимостей или быть полностью независимыми от них. Для обозначения морфологических зависимостей теперь используются стрелки. Множественное число *houses* в примере (а) требует множественного числа указательного определителя, поэтому появляется *these*, а не *this*, что означает наличие морфологической зависимости, направленной по иерархии от *houses* к *these*. В примере (b) ситуация обратная: единственное число подлежащего *Sam* требует появления согласующего суффикса *s* у глагола *works*, что означает наличие морфологической зависимости, направленной по иерархии от *Sam* к *works*. Тип определителя в немецких примерах (с) и (d) влияет на флективный суффикс, который появляется в прилагательном *alt*. При использовании неопределенного артикля *ein* у прилагательного появляется сильное мужское окончание *er*. При использовании определенного артикля *der*, напротив, у прилагательного появляется слабое окончание *e*. Таким образом, поскольку выбор определителя влияет на морфологическую форму прилагательного, существует морфологическая зависимость, направленная от определителя к прилагательному, причем эта морфологическая зависимость полностью независима от синтаксических зависимостей. Рассмотрим далее следующие французские предложения:

Мужской род подлежащего *le chien* в примере (а) требует мужского рода предикативного прилагательного *blanc*, в то время как женский род подлежащего *la maison* требует женского рода этого прилагательного. Морфологическая зависимость, полностью независимая от синтаксических зависимостей, таким образом, снова пересекает синтаксическую иерархию. Морфологические зависимости играют важную роль в типологических исследованиях. Языки классифицируются как преимущественно с головной маркировкой (*Sam work s*) или преимущественно с зависимой маркировкой (*these houses*), при этом большинство, если не все языки, содержат в той или иной степени как головную, так и зависимую маркировку.

Прозодические зависимости

Прозодические зависимости признаются для учета поведения клитик. Клитика – это синтаксически автономный элемент, прозодически зависящий от носителя. Следовательно, клитика интегрируется в просодию своего носителя, то есть образует единое слово с ним. Прозодические зависимости существуют исключительно в линейном измерении (горизонтальном измерении), в то время как стандартные синтаксические зависимости существуют в иерархическом измерении (вертикальном измерении). Классическими примерами клитик в английском языке являются сокращенные вспомогательные глаголы (например, ll, s, ve) и показатель притяжательного падежа s. Прозодические зависимости в следующих примерах обозначены дефисом и отсутствием вертикальной линии проекции.

Дефисы и отсутствие линий проекции указывают на прозодические зависимости. Дефис слева от клитики указывает на то, что она прозодически зависит от слова, непосредственно предшествующего ей (He'll, There's), а дефис справа от клитики (здесь не показан) указывает на то, что она прозодически зависит от слова, непосредственно следующего за ней. Данная клитика часто прозодически зависит от своего синтаксического зависимого (He'll, There's) или от своей головы (would've). В других случаях она может прозодически зависеть от слова, которое не является ни ее головой, ни ее непосредственным зависимым (Florida's).

Синтаксические зависимости

Синтаксические зависимости являются основным направлением исследований в ДГ, как было сказано выше. Вопрос о том, как определяется наличие и направление синтаксических зависимостей, часто остаётся предметом дискуссий. В этой связи необходимо признать, что обоснованность синтаксических зависимостей, представленных в деревьях в данной статье, принимается на веру. Однако, благодаря существующей иерархии, многие ДГ могут в значительной степени подтвердить эти зависимости, хотя определённые разногласия неизбежны. Базовый вопрос о том, как выявляются синтаксические зависимости, оказался сложным для однозначного ответа. Тем не менее, в этой области следует признать, что задача идентификации и определения наличия и направления синтаксических зависимостей в ДГ не проще и не сложнее, чем определение составляющих в грамматике фразовой структуры. Для этого используются различные эвристики, а базовые тесты для определения составляющих служат полезными инструментами. Синтаксические зависимости, принятые в деревьях в этой статье, группируют слова таким образом, чтобы это наиболее точно соответствовало результатам стандартных тестов перестановки, подстановки и эллипсиса для определения составляющих. Этимологические соображения также предоставляют полезные сведения о направлении зависимостей. Многообещающим принципом, на котором можно основывать существование синтаксических зависимостей, является распределение. Когда речь идёт об определении корня данной фразы, слово, которое в наибольшей степени определяет распределение этой фразы в целом, и является её корнем.

Линейный порядок и прерывистые линии

Традиционно, грамматики зависимостей (ГЗ) использовали иной подход к линейному порядку (порядку слов), чем формальные грамматики структуры фраз. Структуры зависимости минимальны по сравнению с их аналогами в рамках структуры фраз, и эти минимальные структуры позволяют сосредоточиться на двух измерениях упорядочения. Разделение вертикального измерения (иерархический порядок) от горизонтального измерения (линейный порядок) достигается легко. Этот аспект зависимостных структур позволил ГЗ, начиная с работ Тесньера (1959), сосредоточиться на иерархическом порядке так, как это едва ли возможно для формальных грамматик структуры фраз. Для Тесньера линейный порядок был вторичен по отношению к иерархическому, поскольку иерархический порядок предшествовал линейному в сознании говорящего. Стэммы (деревья), созданные Тесньером, отражали эту точку зрения; они абстрагировались от линейного порядка, чтобы сосредоточиться почти исключительно на иерархическом порядке. Многие ГЗ, последовавшие за Тесньером, переняли эту практику, то есть создавали древовидные структуры, отражающие только иерархический порядок, например,

Традиционный акцент на иерархическом порядке создал впечатление, что ГЗ имеют мало что сказать о линейном порядке, и способствовал мнению о том, что ГЗ особенно хорошо подходят для изучения языков со свободным порядком слов. Однако негативным следствием такого внимания к иерархическому порядку стало недостаточное исследование ГЗ конкретных явлений порядка слов, таких как стандартные разрывы. Всесторонние описания зависимостей, касающиеся топикализации, вынесения вперед (fronting), скремблирования и экстрапозиции, в основном отсутствуют во многих устоявшихся рамках ГЗ. Эту ситуацию можно противопоставить формальным грамматикам структуры фраз, которые посвятили огромные усилия изучению этих явлений. Однако природа зависимостной связи не препятствует сосредоточению на линейном порядке. Структуры зависимости так же способны исследовать явления порядка слов, как и структуры фраз. Следующие деревья иллюстрируют это; они представляют собой один из способов изучения разрывов с использованием структур зависимости. Деревья предлагают способ решения распространенных проблем. Пример из немецкого языка используется для иллюстрации разрыва, вызванного скремблированием:

Деревья a слева показывают нарушения проективности (= пересекающиеся линии), а деревья b справа демонстрируют один из способов устранения этих нарушений. Вытесненная составляющая принимает слово в качестве своей головы, которое не является ее управляющим элементом. Слова, выделенные красным цветом, обозначают катену (=цепь) слов, простирающуюся от корня вытесненной составляющей до управляющего элемента этой составляющей. Разрывы затем исследуются с точки зрения этих катен. Ограничения на топикализацию, вынесение вперед, скремблирование и экстрапозицию могут быть исследованы и выявлены путем изучения природы участвующих катен.

Синтаксические функции

Традиционно грамматики зависимостей (ГЗ) рассматривали синтаксические функции (= грамматические функции, грамматические отношения) как примитивные. Они постулируют набор функций (например, субъект, объект, косое падежное дополнение, определитель, атрибут, предикатив и т. д.). Эти функции могут выступать в качестве меток зависимостей в древовидных структурах, например:

Синтаксические функции в этом дереве показаны зеленым цветом: ATTR (атрибут), COMP P (дополнение предлога), COMP TO (дополнение к инфинитиву), DET (определитель), P ATTR (предложный атрибут), PRED (предикатив), SUBJ (субъект), TO COMP (дополнение к инфинитиву). Выбранные здесь функции и используемые в дереве сокращения лишь репрезентативны для общей позиции ГЗ по отношению к синтаксическим функциям. Фактический набор функций и обозначений, используемых в разных ГЗ, варьируется. Как примитив теории, статус этих функций существенно отличается от того, что наблюдается в некоторых грамматиках фразовой структуры. Традиционно грамматики фразовой структуры выводят синтаксические функции из структуры (созвездия). Например, объект идентифицируется как NP, входящий в состав конечного VP, а субъект – как NP, находящийся вне конечного VP. Поскольку ГЗ отвергают существование конечного VP, им никогда не предоставлялась возможность рассматривать синтаксические функции таким образом. Суть вопроса в том, что первично: традиционно ГЗ считают синтаксические функции примитивными и выводят структуру из этих функций, в то время как грамматики фразовой структуры традиционно считают структуру примитивной и выводят из нее синтаксические функции. Этот вопрос о первичности (функций или структуры) не является догматичным. Позиции обоих типов грамматик (зависимостей и фразовой структуры) не ограничиваются узко традиционными взглядами. Грамматики зависимостей и фразовой структуры полностью совместимы с обоими подходами к синтаксическим функциям. Действительно, моностратифицированные системы, основанные исключительно на зависимостях или фразовой структуре, скорее всего, отвергнут представление о том, что функции выводятся из структуры или наоборот. Они будут считать и то, и другое примитивным, что означает, что ни одно не может быть выведено из другого.