Введение
Наиболее распространенным форматом для конкордансных строк является Key Word In Context (KWIC). Термин KWIC был придуман Хансом Петером Луном. Система была основана на концепции, называемой «ключевое слово в заголовках», которая была впервые предложена для манчестерских библиотек в 1864 году Андреа Крестадоро. Индекс KWIC формируется путем сортировки и выравнивания слов в заголовке статьи, чтобы каждое слово (за исключением стоп-слов) в заголовках можно было найти в алфавитном порядке в индексе. Это был полезный метод индексации технических руководств до того, как компьютерный поиск по полному тексту стал обычным. Например, поисковый запрос, включающий все слова в примере определения ("KWIC – это аббревиатура для Key Word In Context, наиболее распространенный формат для конкордансных строк") и слоган Википедии на английском языке ("the free encyclopedia"), выполненный на странице Википедии, может дать индекс KWIC следующим образом. Индекс KWIC обычно использует широкую компоновку, чтобы показать максимальный объем информации в контексте (не показано в следующем примере). KWIC – это аббревиатура для Key Word In Context, страница 1 Key Word In Context, наиболее распространенный формат для конкордансных строк. Страница 1 наиболее распространенный формат для конкордансных строк. Страница 1 это аббревиатура для Key Word In Context, наиболее распространенный формат страница 1 Wikipedia, The Free Encyclopedia, страница 0 In Context, наиболее распространенный формат для конкордансных строк. Страница 1 Wikipedia, The Free Encyclopedia, страница 0 KWIC – это аббревиатура для Key Word In Context, наиболее распространенный формат страница 1 для Key Word In Context, наиболее распространенный формат для конкорданса страница 1 Wikipedia, The Free Encyclopedia, страница 0 KWIC – это аббревиатура для KeyWord In Context, наиболее распространенный формат страница 1
Key Word In Context (KWIC) is the most common format for concordance lines. The term KWIC was coined by Hans Peter Luhn. The system was based on a concept called keyword in titles, which was first proposed for Manchester libraries in 1864 by Andrea Crestadoro. A KWIC index is formed by sorting and aligning the words within an article title to allow each word (except the stop words) in titles to be searchable alphabetically in the index. It was a useful indexing method for technical manuals before computerized full text search became common. For example, a search query including all of the words in an example definition ("KWIC is an acronym for Key Word In Context, the most common format for concordance lines") and the Wikipedia slogan in English ("the free encyclopedia"), searched against a Wikipedia page, might yield a KWIC index as follows. A KWIC index usually uses a wide layout to allow the display of maximum 'in context' information (not shown in the following example). KWIC is anacronym for Key Word In Context, page 1 Key Word In Context, the most common format for concordance lines. page 1 the most common format for concordance lines. page 1 is an acronym for Key Word In Context, the most common format page 1Wikipedia, The Free Encyclopediapage 0 In Context, the most common format for concordance lines. page 1Wikipedia, The Free Encyclopediapage 0KWIC is an acronym for Key Word In Context, the most page 1 KWIC is an acronym for Key Word page 1 common format for concordance lines. page 1 for Key Word In Context, the most common format for concordance page 1 Wikipedia, The Free Encyclopediapage 0KWIC is an acronym for KeyWord In Context, the most common page 1
Индекс KWIC является частным случаем пермутированного индекса. Этот термин указывает на то, что он индексирует все циклические перестановки заголовков. Книги, состоящие из множества коротких разделов со своими описательными заголовками, особенно сборники страниц руководств, часто заканчивались разделом пермутированного индекса, позволяя читателю легко найти раздел по любому слову из его заголовка. Эта практика, также известная как Key Word Out of Context (KWOC), в настоящее время не распространена.
Ссылки в литературе
Примечание: Первая ссылка не отображает индекс KWIC, если не оплатить доступ к статье. Вторая ссылка вообще не содержит упоминания об этой работе. Дэвид Л. Парнас использует индекс KWIC в качестве примера, демонстрирующего, как выполнять модульное проектирование, в своей статье «О критериях, используемых при декомпозиции систем на модули», доступной как классическая статья ACM. Кристофер Д. Маннинг и Хинрих Шютце описывают индекс KWIC и компьютерную конкорданцию в разделе 1.4.5 своей книги «Основы статистической обработки естественного языка». Кембридж, Массачусетс: MIT Press, 1999. Они ссылаются на статью Х. П. Луна 1960 года «Ключевое слово в контекстном индексе технической литературы (индекс KWIC)». Согласно «Concordantia et Indices Missalium Romanorum» преподобного Джерарда О’Коннора, «Большинство конкордансов, созданных в последнее время с использованием компьютерного программного обеспечения, используют форматы KWIC (ключевое слово в контексте) и KWICn (ключевое слово в центре), которые представляют ключевое слово, обычно выделенное жирным шрифтом в фиксированной позиции, в пределах ограниченного объема контекста, то есть три [или] четыре слова текста до ключевого слова и такое же количество слов после него. Этот формат чрезвычайно полезен, поскольку ключевое слово легко идентифицируется вместе с его контекстом. Конкорданс Римского Миссала создан как в формате KWIC, так и в формате KWICn и примечателен тем, что каждая словарная форма приводится в том виде, в котором она встречается в тексте, то есть не лемматизируется».
Christopher D. Manning and Hinrich Schütze describe a KWIC index and computer concordancing in section 1.4.5 of their book Foundations of Statistical Natural Language Processing. Cambridge, Mass: MIT Press, 1999. They cite an article from H. P. Luhn from 1960, "Key word in context index for technical literature (kwic index)". According to Rev. Gerard O'Connor's Concordantia et Indices Missalium Romanorum, "Most of the concordances produced in recent times and with the aid of computer software use both the KWIC (keyword in context) and KWICn (keyword in center) formats, which lists the keyword, usually highlighted in bold text in a consistent position, within a limited amount of context text, i. e. three [or] four words of the text prior to the keyword and the same amount of text following. This format is extremely useful in that the keyword is easily identified together with its context. The Concordance of the Roman Missal is produced in both the KWIC and KWICn formats and is noteworthy in that each word form is listed as it appears in the text, that is, it is un lemmatized."