Введение

Частое сочетание слов, идущих друг за другом – понятие корпусной лингвистики. В корпусной лингвистике коллокация – это последовательность слов или терминов, которые встречаются вместе чаще, чем можно было бы ожидать случайно. В фразеологии коллокация является типом композитивной фразы, то есть её значение может быть понято из составляющих её слов. Это противопоставляется идиоме, где значение целого нельзя вывести из значения его частей и оно может быть с ними совершенно не связано. Существует около семи основных типов коллокаций: прилагательное + существительное, существительное + существительное (например, собирательные существительные), существительное + глагол, глагол + существительное, наречие + прилагательное, глагол + предложное сочетание (фразовые глаголы) и глагол + наречие. Извлечение коллокаций – это вычислительный метод, который находит коллокации в документе или корпусе, используя различные элементы вычислительной лингвистики, сходные с методами интеллектуального анализа данных.

В словарях

В 1933 году во «Втором промежуточном отчете о английских коллокациях» Гарольда Палмера была подчеркнута важность коллокаций как ключа к созданию естественного звучания речи для изучающих иностранный язык. Таким образом, начиная с 1940-х годов, информация о часто встречающихся сочетаниях слов стала стандартной частью одноязычных учебных словарей. По мере того как эти словари становились «менее ориентированными на отдельные слова и более – на фразы», коллокациям уделялось все больше внимания. Эта тенденция, начиная с начала XXI века, поддерживалась благодаря доступности больших текстовых корпусов и интеллектуального программного обеспечения для работы с ними, что позволило обеспечить более систематическое описание коллокаций в словарях. Используя эти инструменты, такие словари, как «Словарь английского языка Macmillan» и «Словарь современного английского языка Longman», стали включать в себя блоки или панели со списками частотных коллокаций. Существует также ряд специализированных словарей, посвященных описанию частотных коллокаций в языке. К ним относятся (для испанского языка) Redes: Diccionario combinatorio del español contemporaneo (2004), (для французского языка) Le Robert: Dictionnaire des combinaisons de mots (2007), а также (для английского языка) LTP Dictionary of Selected Collocations (1997) и Macmillan Collocations Dictionary (2010).

Статистически значимая колокация

Тест Стьюдента может быть использован для определения, является ли встречаемость словосочетания в корпусе статистически значимой. Для биграммы пусть – безусловная вероятность появления в корпусе размером , а – безусловная вероятность появления в корпусе. t-статистика для биграммы вычисляется следующим образом:

где – выборочное среднее встречаемости , – количество появлений , – вероятность появления при нулевой гипотезе о независимом появлении и в тексте, а – выборочная дисперсия. При большом тест t эквивалентен Z-тесту.