Введение
Методология обработки естественного языка Грамматика ограничений (CG) - это методологическая парадигма для обработки естественного языка (NLP). Лингвист пишет, контекстные правила компилируются в грамматику, которая присваивает грамматические теги ("читывания") для слов или других знаков в тексте. Типичные теги адресуют лемматизацию (лексему или базовую форму), инфлексию, деривацию, синтаксическую функцию, зависимость, валентность, роли случая, семантический тип и т. Д. Каждое правило либо добавляет, удаляет, выбирает или заменяет тег или набор грамматических тегов в контексте данного предложения. Контекстные условия могут быть связаны с любым тегом или набором тегов любого слова в любом месте предложения, либо локально (определенные расстояния), либо глобально (неопределенные расстояния). Контекстные условия в одном и том же правиле могут быть связаны, т.е. обусловлены друг другом, отрицаются или блокируются вмешивающимися словами или тегами. Типичные КГ состоят из тысяч правил, которые применяются постепенно, охватывая все более продвинутые уровни анализа. В каждом уровне безопасные правила используются до эвристических правил, и ни одному правилу не разрешается удалять последнее считывание данного типа, обеспечивая таким образом высокую степень надежности. Концепция CG была запущена Фредом Карлссоном в 1990 году (Karlsson 1990; Karlsson et al., eds, 1995), и с тех пор CG-таггеры и анализаторы были написаны для большого количества языков, регулярно достигая точности F-баллов для части речи (класса слов) более 99%. Ряд синтаксических систем CG сообщили о F-оценках около 95% для ярлыков синтаксических функций. Системы CG могут использоваться для создания полных синтаксических деревьев в других формализмах путем добавления небольших, не терминальных грамматик структуры фраз или грамматик зависимостей, и ряд проектов Treebank использовали CG для автоматической аннотации. Методология компьютерной грамотности также использовалась в ряде приложений языковых технологий, таких как проверка орфографии и системы машинного перевода.
Constraint grammar (CG) is a methodological paradigm for natural language processing (NLP). Linguist written, context dependent rules are compiled into a grammar that assigns grammatical tags ("readings") to words or other tokens in running text. Typical tags address lemmatisation (lexeme or base form), inflexion, derivation, syntactic function, dependency, valency, case roles, semantic type etc. Each rule either adds, removes, selects or replaces a tag or a set of grammatical tags in a given sentence context. Context conditions can be linked to any tag or tag set of any word anywhere in the sentence, either locally (defined distances) or globally (undefined distances). Context conditions in the same rule may be linked, i. e. conditioned upon each other, negated, or blocked by interfering words or tags. Typical CGs consist of thousands of rules, that are applied set wise in progressive steps, covering ever more advanced levels of analysis. Within each level, safe rules are used before heuristic rules, and no rule is allowed to remove the last reading of a given kind, thus providing a high degree of robustness. The CG concept was launched by Fred Karlsson in 1990 (Karlsson 1990; Karlsson et al., eds, 1995), and CG taggers and parsers have since been written for a large variety of languages, routinely achieving accuracy F scores for part of speech (word class) of over 99%. A number of syntactic CG systems have reported F scores of around 95% for syntactic function labels. CG systems can be used to create full syntactic trees in other formalisms by adding small, non terminal based phrase structure grammars or dependency grammars, and a number of Treebank projects have used CG for automatic annotation. CG methodology has also been used in a number of language technology applications, such as spell checkers and machine translation systems.
CG-1
Первой реализацией CG был CGP Фреда Карлссона в начале 1990-х годов. Он был полностью основан на LISP, а синтаксис был основан на выражениях LISP (Karlsson 1990).
CG-2
Внедрение mdis CG 2 Паси Тапанайнена удалило некоторые скобки в формате грамматики и было реализовано в C++, интерпретируя грамматику как конечный преобразователь для скорости. CG 2 был позже повторно реализован (с использованием метода, не связанного с FST) группой VISL в Syddansk Universitet как открытый исходный код VISL CG, сохранив тот же формат, что и закрытый исходный код Tapanainen.