Введение
Слово, которое встречается в тексте чаще, чем можно было бы ожидать случайно. В корпусной лингвистике ключевым словом является слово, встречающееся в тексте с большей частотой, чем следовало бы ожидать, исходя из случайности. Ключевые слова вычисляются посредством статистического теста (например, логлинейного или хи-квадрат), который сравнивает частоту слов в тексте с их ожидаемой частотой, полученной на основе гораздо большего корпуса, служащего референсным для общего языкового использования. Ключевость – это характеристика слова или фразы, определяющая его значимость в данном контексте. Сочетания существительных с частями речи, которые читатель вряд ли заметит, такие как предлоги, наречия времени и местоимения, могут быть релевантной частью ключевости. Даже отдельные местоимения могут выступать в качестве ключевых слов. Это следует отличать от коллокации – характеристики, связывающей два слова или фразы, которые обычно встречаются на определенном расстоянии друг от друга. Ключевость является текстовой, а не языковой характеристикой (то есть слово обладает ключевостью в определенном текстовом контексте, но может не обладать ею в других контекстах, в то время как узлы и коллокаты часто встречаются вместе в текстах одного и того же жанра, поэтому коллокация в значительной степени является языковым явлением). Множество ключевых слов, обнаруженных в данном тексте, обладают общей ключевостью и являются ко-ключевыми. Слова, которые обычно встречаются в одном тексте с ключевым словом, называются ассоциатами.
In corpus linguistics a key word is a word which occurs in a text more often than we would expect to occur by chance alone. Key words are calculated by carrying out a statistical test (e. g., loglinear or chi squared) which compares the word frequencies in a text against their expected frequencies derived in a much larger corpus, which acts as a reference for general language use. Keyness is then the quality a word or phrase has of being "key" in its context. Combinations of nouns with parts of speech that human readers would not likely notice, such as prepositions, time adverbs, and pronouns can be a relevant part of keyness. Even separate pronouns can constitute keywords. Compare this with collocation, the quality linking two words or phrases usually assumed to be within a given span of each other. Keyness is a textual feature, not a language feature (so a word has keyness in a certain textual context but may well not have keyness in other contexts, whereas a node and collocate are often found together in texts of the same genre so collocation is to a considerable extent a language phenomenon). The set of keywords found in a given text share keyness, they are co key. Words typically found in the same texts as a key word are called associates.
Социологические аспекты
В политике, социологии и критическом анализе дискурса основополагающей работой в отношении ключевых слов был труд Раймонда Уильямса (1976), однако Уильямс был убежденным марксистом, и критический анализ дискурса, как правило, поддерживал это политическое понимание термина: ключевые слова являются частью идеологий, а их изучение – частью социальной критики. Культурология развивалась в схожем направлении. Это резко контрастирует с современной лингвистикой, которая с осторожностью относится к политическому анализу и стремится к неполитизированной объективности. Развитие технологий, новых методов и методологии, связанных с обработкой больших корпусов текстов, лишь укрепило эту тенденцию.
Переводчивость
Однако существует множество политических аспектов, которые становятся значимыми при изучении ключевых слов в связи с культурами, обществами и их историей. Люблинская этнолингвистическая школа изучает польские и европейские ключевые слова именно таким образом. Анна Вирцбикка (1997), пожалуй, самый известный культурный лингвист, пишущий на английском языке в настоящее время, исследует языки как части культур, развивающихся в обществе и истории. И игнорировать политику становится невозможно, когда ключевые слова переходят из одной культуры в другую. Андерхилл и Джанниното показывают, как политические термины, такие как «гражданин» и «индивидуум», интегрировались в китайское мировоззрение на протяжении XIX и XX веков. Они утверждают, что это часть сложной перестройки концептуальных кластеров, связанных с понятием «народ». Ключевые слова, такие как «гражданин», порождают различные варианты перевода на китайский язык и являются частью продолжающейся адаптации к глобальным концепциям индивидуальных прав и обязанностей. Понимание ключевых слов в таком контексте становится решающим для понимания того, как развивается политика Китая по мере становления коммунизма и развития свободного рынка и прав граждан. Андерхилл и Джанниното утверждают, что это часть сложных способов взаимодействия идеологических мировоззрений с языком как с непрерывным средством восприятия и понимания мира. Барбара Кассен изучает ключевые слова более традиционным способом, стремясь определить слова, специфичные для отдельных культур, чтобы продемонстрировать, что многие из наших ключевых слов лишь частично «непереводимы» на их «эквиваленты». Грекам, возможно, потребуется четыре слова, чтобы охватить все значения, которые подразумевают англоговорящие, когда говорят о «любви». Аналогично, французам достаточно слова «liberté», в то время как англоговорящие приписывают разные ассоциации словам «liberty» и «freedom»: «свобода слова» или «свобода передвижения», но «Статуя Свободы».
Программная идентификация
Ключевые слова выявляются программным обеспечением, которое сравнивает список слов текста со списком слов, основанным на более крупном опорном корпусе. Программное обеспечение, такое как WordSmith, например, составляет списки ключевых слов и фраз и позволяет графически отображать частоту их появления в текстах.