Введение

Цифровые коллекции данных естественного языка

В лингвистике и обработке естественного языка корпус (корпуса) или текстовый корпус — это набор данных, состоящий из изначально цифровых и оцифрованных языковых ресурсов, с аннотациями или без них. С аннотациями они используются в корпусной лингвистике для статистического проверки гипотез, выявления случаев употребления или подтверждения лингвистических правил в рамках определенной языковой области. В технологиях поиска корпус представляет собой коллекцию документов, по которым осуществляется поиск.

Обзор

Корпус может содержать тексты на одном языке (одноязычный корпус) или текстовые данные на нескольких языках (многоязычный корпус). Для повышения полезности корпусов при проведении лингвистических исследований они часто подвергаются процессу, известному как аннотирование. Примером аннотирования корпуса является частеречная разметка, или POS-разметка, при которой информация о части речи каждого слова (глагол, существительное, прилагательное и т. д.) добавляется в корпус в виде тегов. Другой пример – указание леммы (базовой) формы каждого слова. Если язык корпуса не является рабочим языком исследователей, использующих его, для создания двуязычной аннотации применяется межстрочная глосса. Некоторые корпусы имеют более структурированные уровни анализа. В частности, небольшие корпусы могут быть полностью синтаксически разобраны. Такие корпусы обычно называют Treebanks или корпусами с синтаксической разметкой. Сложность обеспечения полной и последовательной аннотации всего корпуса означает, что такие корпусы обычно меньше и содержат от одного до трех миллионов слов. Возможны и другие уровни лингвистического структурированного анализа, включая аннотации для морфологии, семантики и прагматики.