Введение

Наиболее распространенным форматом для конкордансных строк является Key Word In Context (KWIC). Термин KWIC был придуман Хансом Петером Луном. Система была основана на концепции, называемой «ключевое слово в заголовках», которая была впервые предложена для манчестерских библиотек в 1864 году Андреа Крестадоро. Индекс KWIC формируется путем сортировки и выравнивания слов в заголовке статьи, чтобы каждое слово (за исключением стоп-слов) в заголовках можно было найти в алфавитном порядке в индексе. Это был полезный метод индексации технических руководств до того, как компьютерный поиск по полному тексту стал обычным. Например, поисковый запрос, включающий все слова в примере определения ("KWIC – это аббревиатура для Key Word In Context, наиболее распространенный формат для конкордансных строк") и слоган Википедии на английском языке ("the free encyclopedia"), выполненный на странице Википедии, может дать индекс KWIC следующим образом. Индекс KWIC обычно использует широкую компоновку, чтобы показать максимальный объем информации в контексте (не показано в следующем примере). KWIC – это аббревиатура для Key Word In Context, страница 1 Key Word In Context, наиболее распространенный формат для конкордансных строк. Страница 1 наиболее распространенный формат для конкордансных строк. Страница 1 это аббревиатура для Key Word In Context, наиболее распространенный формат страница 1 Wikipedia, The Free Encyclopedia, страница 0 In Context, наиболее распространенный формат для конкордансных строк. Страница 1 Wikipedia, The Free Encyclopedia, страница 0 KWIC – это аббревиатура для Key Word In Context, наиболее распространенный формат страница 1 для Key Word In Context, наиболее распространенный формат для конкорданса страница 1 Wikipedia, The Free Encyclopedia, страница 0 KWIC – это аббревиатура для KeyWord In Context, наиболее распространенный формат страница 1

Индекс KWIC является частным случаем пермутированного индекса. Этот термин указывает на то, что он индексирует все циклические перестановки заголовков. Книги, состоящие из множества коротких разделов со своими описательными заголовками, особенно сборники страниц руководств, часто заканчивались разделом пермутированного индекса, позволяя читателю легко найти раздел по любому слову из его заголовка. Эта практика, также известная как Key Word Out of Context (KWOC), в настоящее время не распространена.

Ссылки в литературе

Примечание: Первая ссылка не отображает индекс KWIC, если не оплатить доступ к статье. Вторая ссылка вообще не содержит упоминания об этой работе. Дэвид Л. Парнас использует индекс KWIC в качестве примера, демонстрирующего, как выполнять модульное проектирование, в своей статье «О критериях, используемых при декомпозиции систем на модули», доступной как классическая статья ACM. Кристофер Д. Маннинг и Хинрих Шютце описывают индекс KWIC и компьютерную конкорданцию в разделе 1.4.5 своей книги «Основы статистической обработки естественного языка». Кембридж, Массачусетс: MIT Press, 1999. Они ссылаются на статью Х. П. Луна 1960 года «Ключевое слово в контекстном индексе технической литературы (индекс KWIC)». Согласно «Concordantia et Indices Missalium Romanorum» преподобного Джерарда О’Коннора, «Большинство конкордансов, созданных в последнее время с использованием компьютерного программного обеспечения, используют форматы KWIC (ключевое слово в контексте) и KWICn (ключевое слово в центре), которые представляют ключевое слово, обычно выделенное жирным шрифтом в фиксированной позиции, в пределах ограниченного объема контекста, то есть три [или] четыре слова текста до ключевого слова и такое же количество слов после него. Этот формат чрезвычайно полезен, поскольку ключевое слово легко идентифицируется вместе с его контекстом. Конкорданс Римского Миссала создан как в формате KWIC, так и в формате KWICn и примечателен тем, что каждая словарная форма приводится в том виде, в котором она встречается в тексте, то есть не лемматизируется».