Введение
Частое сочетание слов, идущих друг за другом – понятие корпусной лингвистики. В корпусной лингвистике коллокация – это последовательность слов или терминов, которые встречаются вместе чаще, чем можно было бы ожидать случайно. В фразеологии коллокация является типом композитивной фразы, то есть её значение может быть понято из составляющих её слов. Это противопоставляется идиоме, где значение целого нельзя вывести из значения его частей и оно может быть с ними совершенно не связано. Существует около семи основных типов коллокаций: прилагательное + существительное, существительное + существительное (например, собирательные существительные), существительное + глагол, глагол + существительное, наречие + прилагательное, глагол + предложное сочетание (фразовые глаголы) и глагол + наречие. Извлечение коллокаций – это вычислительный метод, который находит коллокации в документе или корпусе, используя различные элементы вычислительной лингвистики, сходные с методами интеллектуального анализа данных.
the corpus linguistics notion
In corpus linguistics, a collocation is a series of words or terms that co occur more often than would be expected by chance. In phraseology, a collocation is a type of compositional phraseme, meaning that it can be understood from the words that make it up. This contrasts with an idiom, where the meaning of the whole cannot be inferred from its parts, and may be completely unrelated. There are about seven main types of collocations: adjective + noun, noun + noun (such as collective nouns), noun + verb, verb + noun, adverb + adjective, verbs + prepositional phrase (phrasal verbs), and verb + adverb. Collocation extraction is a computational technique that finds collocations in a document or corpus, using various computational linguistics elements resembling data mining.
В словарях
В 1933 году во «Втором промежуточном отчете о английских коллокациях» Гарольда Палмера была подчеркнута важность коллокаций как ключа к созданию естественного звучания речи для изучающих иностранный язык. Таким образом, начиная с 1940-х годов, информация о часто встречающихся сочетаниях слов стала стандартной частью одноязычных учебных словарей. По мере того как эти словари становились «менее ориентированными на отдельные слова и более – на фразы», коллокациям уделялось все больше внимания. Эта тенденция, начиная с начала XXI века, поддерживалась благодаря доступности больших текстовых корпусов и интеллектуального программного обеспечения для работы с ними, что позволило обеспечить более систематическое описание коллокаций в словарях. Используя эти инструменты, такие словари, как «Словарь английского языка Macmillan» и «Словарь современного английского языка Longman», стали включать в себя блоки или панели со списками частотных коллокаций. Существует также ряд специализированных словарей, посвященных описанию частотных коллокаций в языке. К ним относятся (для испанского языка) Redes: Diccionario combinatorio del español contemporaneo (2004), (для французского языка) Le Robert: Dictionnaire des combinaisons de mots (2007), а также (для английского языка) LTP Dictionary of Selected Collocations (1997) и Macmillan Collocations Dictionary (2010).
Статистически значимая колокация
Тест Стьюдента может быть использован для определения, является ли встречаемость словосочетания в корпусе статистически значимой. Для биграммы пусть – безусловная вероятность появления в корпусе размером , а – безусловная вероятность появления в корпусе. t-статистика для биграммы вычисляется следующим образом:
где – выборочное среднее встречаемости , – количество появлений , – вероятность появления при нулевой гипотезе о независимом появлении и в тексте, а – выборочная дисперсия. При большом тест t эквивалентен Z-тесту.