Введение
Корпусная лингвистика – это раздел лингвистики, изучающий язык на основе примеров, содержащихся в реальных текстах.
Корпусная лингвистика – это эмпирический метод изучения языка посредством текстового корпуса (множественное число – корпуса). Корпусы представляют собой сбалансированные, часто стратифицированные коллекции аутентичных текстов речи или письма, отражающих реальное языковое разнообразие. Метод корпусной лингвистики использует совокупность текстов на естественном языке для выявления абстрактных правил, управляющих этим языком. Полученные результаты могут быть использованы для изучения взаимосвязей между изучаемым языком и другими языками, подвергнутыми аналогичному анализу. Первые корпуса создавались вручную на основе исходных текстов, но в настоящее время эта работа автоматизирована. Корпусы используются не только для лингвистических исследований, но с 1969 года все чаще применяются при составлении словарей (начиная с "Американского наследия словаря английского языка" в 1969 году) и справочных грамматик, первым примером чего является "Всеобъемлющая грамматика английского языка", опубликованная в 1985 году. Специалисты в этой области придерживаются различных точек зрения относительно аннотирования корпусов. Эти точки зрения варьируются от Джона Макхарди Синклера, сторонника минимальной аннотации, позволяющей текстам говорить самим за себя, до группы Survey of English Usage (University College, London), которая выступает за аннотирование, обеспечивающее более глубокое лингвистическое понимание благодаря тщательной фиксации данных.
История
Некоторые из самых ранних попыток грамматического описания были основаны, по крайней мере частично, на корпусах текстов, имеющих особое религиозное или культурное значение. Например, литература Пратишакхья описывала звуковую структуру санскрита, встречающуюся в Ведах, а грамматика классического санскрита, созданная Панини, основывалась по крайней мере частично на анализе этого же корпуса текстов. Аналогичным образом, ранние арабские грамматисты уделяли особое внимание языку Корана. В западноевропейской традиции учёные составляли конкордансы для детального изучения языка Библии и других канонических текстов.
Pāṇini's grammar of classical Sanskrit was based at least in part on analysis of that same corpus. Similarly, the early Arabic grammarians paid particular attention to the language of the Quran. In the Western European tradition, scholars prepared concordances to allow detailed study of the language of the Bible and other canonical texts.
Английские корпуса
Важной вехой в современной корпусной лингвистике стала публикация "Computational Analysis of Present Day American English" в 1967 году. Работа была написана Генри Кучерой и В. Нельсоном Фрэнсисом на основе анализа "Brown Corpus" – структурированного и сбалансированного корпуса, состоящего из одного миллиона слов американского английского языка 1961 года. Корпус включает 2000 текстовых примеров, представляющих различные жанры. "Brown Corpus" стал первым компьютеризированным корпусом, разработанным для лингвистических исследований. Кучера и Фрэнсис подвергли "Brown Corpus" разнообразным компьютерным анализам, а затем объединили достижения лингвистики, методики преподавания языков, психологии, статистики и социологии, чтобы создать масштабное и многогранное исследование. Еще одной ключевой публикацией стала работа Рэндольфа Квирка "Towards a description of English Usage" (1960), в которой он представил "Survey of English Usage". Корпус Квирка был первым современным корпусом, созданным с целью отражения всего языкового разнообразия. Вскоре после этого бостонское издательство Houghton Mifflin обратилось к Кучере с просьбой предоставить миллион слов текстовых примеров для нового "American Heritage Dictionary" – первого словаря, составленного с использованием корпусной лингвистики. "AHD" предпринял инновационный шаг, объединив нормативные (как следует использовать язык) и дескриптивные (как язык используется на самом деле) элементы. Другие издательства последовали этому примеру. Одноязычный словарь Collins COBUILD, предназначенный для изучающих английский язык как иностранный, был составлен на основе "Bank of English". "Survey of English Usage" использовался при разработке одной из важнейших грамматик, основанных на корпусных данных, написанной Квирком и др. и опубликованной в 1985 году под названием "A Comprehensive Grammar of the English Language". "Brown Corpus" послужил основой для создания ряда аналогично структурированных корпусов: LOB Corpus (британский английский 1960-х годов), Kolhapur (индийский английский), Wellington (новозеландский английский), Australian Corpus of English (австралийский английский), Frown Corpus (американский английский начала 1990-х годов) и FLOB Corpus (британский английский 1990-х годов). Другие корпусы охватывают множество языков, вариантов и стилей, включая International Corpus of English и British National Corpus – коллекцию из 100 миллионов слов, состоящую из разнообразных устных и письменных текстов, созданную в 1990-х годах консорциумом издательств, университетов (Оксфорда и Ланкастера) и Британской библиотеки. Работа над American National Corpus для современного американского английского языка была приостановлена, однако корпус современного американского английского языка (Corpus of Contemporary American English), насчитывающий более 400 миллионов слов (1990 – настоящее время), доступен через веб-интерфейс. Первый компьютеризированный корпус транскрибированной разговорной речи был создан в 1971 году в рамках Montreal French Project и содержал один миллион слов, что вдохновило Шану Поплэк на создание гораздо более крупного корпуса разговорного французского языка в районе Оттавы-Халла.
Многоязычная корпуса
В 1990-х годах многие из заметных ранних успехов в области статистических методов в программировании на естественном языке (НЛП) были достигнуты в сфере машинного перевода, особенно благодаря работам, проводившимся в IBM Research. Эти системы смогли использовать существующие многоязычные текстовые корпуса, созданные Парламентом Канады и Европейским Союзом в соответствии с законами, предписывающими перевод всех государственных материалов на все официальные языки соответствующих государств. Существуют также корпуса для неевропейских языков. Например, Национальный институт японского языка и лингвистики в Японии разработал ряд корпусов устной и письменной японской речи. Корпусы жестовых языков также создаются на основе видеоданных.
Корпорации древних языков
Кроме этих корпусов живых языков, компьютерные корпуса также созданы на основе собраний текстов на древних языках. Примером служит база данных Андерсена Форбса по еврейской Библии, разрабатываемая с 1970-х годов, в которой каждое предложение разбирается с использованием графов, представляющих до семи уровней синтаксиса, и каждый фрагмент снабжен семью информационными полями. Коранический арабский корпус – это аннотированный корпус для классического арабского языка Корана. Это недавний проект с многоуровневой аннотацией, включающей морфологическое сегментирование, определение частей речи и синтаксический анализ с использованием грамматики зависимостей. Цифровой корпус санскрита (DCS) – это «корпус санскритских текстов с разделением по санхи, с полным морфологическим и лексическим анализом, предназначенный для исторических исследований в санскритской лингвистике и филологии».
Корпорации из конкретных областей
Помимо чисто лингвистических исследований, исследователи стали применять корпусную лингвистику к другим академическим и профессиональным областям, таким как развивающаяся поддисциплина "Право и корпусная лингвистика", которая стремится к пониманию юридических текстов с использованием корпусных данных и инструментов. Набор данных DBLP Discovery Dataset сосредоточен на информатике и содержит релевантные публикации в этой области с подробными метаданными, такими как аффилиация авторов, цитирования или области исследований. Более специализированный набор данных был представлен NLP Scholar – это комбинация статей из ACL Anthology и метаданных Google Scholar. Корпуса также могут быть полезны в работе переводчиков или при обучении иностранным языкам.
Методы
Лингвистика корпуса породила ряд исследовательских методов, стремящихся проложить путь от данных к теории. Уоллис и Нельсон (2001) впервые представили так называемую 3A-перспективу: аннотация, абстракция и анализ. Аннотация заключается в применении схемы к текстам. Аннотации могут включать структурную разметку, частеречную разметку, синтаксический анализ и множество других видов представления. Абстракция состоит в сопоставлении (отображении) терминов схемы с терминами теоретически обоснованной модели или набора данных. Абстракция обычно включает лингвистический поиск, но может также включать, например, обучение правил для парсеров. Анализ заключается в статистическом исследовании, обработке и обобщении данных. Анализ может включать статистические оценки, оптимизацию баз правил или методы поиска знаний. Большинство современных лексических корпусов снабжены частеречной разметкой (POS-разметкой). Однако даже лингвисты корпуса, работающие с "неразмеченным текстом", неизбежно применяют какой-либо метод для выделения значимых терминов. В таких случаях аннотация и абстракция объединяются в лексическом поиске. Преимущество публикации аннотированного корпуса заключается в том, что другие пользователи могут проводить эксперименты с этим корпусом (с помощью программ управления корпусами). Лингвисты с иными интересами и отличными от первоначальных взглядами могут использовать результаты этой работы. Публикуя данные, лингвисты корпуса позволяют рассматривать корпус как арену для лингвистических дискуссий и дальнейших исследований.