Кіріспе
Конкорданс жолдарының жалпы пішімі
Контекст бойынша негізгі сөз (KWIC) – конкорданс жолдарының ең көп таралған пішімі. KWIC термині Ханс Петер Луннмен бірге пайда болды. Жүйе атаулардағы кілт сөз деп аталатын ұғымға негізделген, оны алғаш рет Манчестер кітапханалары үшін 1864 жылы Андреа Крестадоро ұсынған. KWIC индексі мақала атауларындағы сөздерді сұрыптап, үйлестіру арқылы құрылады, бұл атаулардағы әрбір сөзді (тоқтату сөздерін қоспағанда) индексте әліппелік тәртіппен іздеуге мүмкіндік береді. Бұл әдіс техникалық нұсқаулықтарды индекстеудің тиімді тәсілі болды, компьютерлік толық мәтінді іздеу кең таралғанша. Мысалы, іздеу сұранысы, анықтамадағы барлық сөздерді ("KWIC – Контексттегі негізгі сөздің аббревиатурасы, конкорданс жолдарының ең көп таралған пішімі") және ағылшын тіліндегі Wikipedia слоганы ("еркін энциклопедия") қамтыса, Wikipedia бетінде іздеу келесідей KWIC индексін бере алады. KWIC индексі әдетте максималды "контексттегі" ақпаратты көрсетуге мүмкіндік беретін кең макетті пайдаланады (келесі мысалда көрсетілмеген). KWIC – Контексттегі негізгі сөздің анакронимі, 1-бет Контексттегі негізгі сөз, конкорданс жолдарының ең көп таралған пішімі. 1-бет – конкорданс жолдарының ең көп таралған пішімі. 1-бет – Контексттегі негізгі сөздің аббревиатурасы, ең көп таралған пішім 1-бет Wikipedia, The Free Encyclopedia 0-бет Контексттегі негізгі сөз, конкорданс жолдарының ең көп таралған пішімі. 1-бет Wikipedia, The Free Encyclopedia 0-бет KWIC – Контексттегі негізгі сөздің аббревиатурасы, ең көп 1-бет KWIC – Негізгі сөз 1-бет конкорданс жолдарының ең көп таралған пішімі. 1-бет Контексттегі негізгі сөз үшін, ең көп таралған пішім 1-бет Wikipedia, The Free Encyclopedia 0-бет KWIC – KeyWord In Context, ең көп таралған 1-бет
Key Word In Context (KWIC) is the most common format for concordance lines. The term KWIC was coined by Hans Peter Luhn. The system was based on a concept called keyword in titles, which was first proposed for Manchester libraries in 1864 by Andrea Crestadoro. A KWIC index is formed by sorting and aligning the words within an article title to allow each word (except the stop words) in titles to be searchable alphabetically in the index. It was a useful indexing method for technical manuals before computerized full text search became common. For example, a search query including all of the words in an example definition ("KWIC is an acronym for Key Word In Context, the most common format for concordance lines") and the Wikipedia slogan in English ("the free encyclopedia"), searched against a Wikipedia page, might yield a KWIC index as follows. A KWIC index usually uses a wide layout to allow the display of maximum 'in context' information (not shown in the following example). KWIC is anacronym for Key Word In Context, page 1 Key Word In Context, the most common format for concordance lines. page 1 the most common format for concordance lines. page 1 is an acronym for Key Word In Context, the most common format page 1Wikipedia, The Free Encyclopediapage 0 In Context, the most common format for concordance lines. page 1Wikipedia, The Free Encyclopediapage 0KWIC is an acronym for Key Word In Context, the most page 1 KWIC is an acronym for Key Word page 1 common format for concordance lines. page 1 for Key Word In Context, the most common format for concordance page 1 Wikipedia, The Free Encyclopediapage 0KWIC is an acronym for KeyWord In Context, the most common page 1
KWIC индексі – пермутацияланған индекстің ерекше жағдайы. Бұл термин тақырыптардың барлық циклдық пермутацияларын индекстейтінін көрсетеді. Көптеген қысқа бөлімдерден тұратын кітаптар, әсіресе нұсқаулық беттерінің жинақтары, көбінесе пермутацияланған индекс бөлімімен аяқталады, бұл оқырманға тақырыбындағы кез келген сөз арқылы бөлімді оңай табуға мүмкіндік береді. Бұл тәсіл, сондай-ақ Контекстен тыс кілт сөз (KWOC) деп белгілі, қазіргі уақытта жиі қолданылмайды.
Әдебиеттегі сілтемелер
Ескерту: Бірінші сілтемеде KWIC индексі көрсетілмейді, егер сіз мақаланы көру үшін төлем жасасаңыз. Екінші сілтемеде мақала тізімде жоқ. Дэвид Л. Парнас өзінің «Системаларды модульдерге бөлу критерийлері» атты еңбегінде модульдік жобалауды қалай жүзеге асыруға болатынын көрсету үшін KWIC индексін мысал ретінде келтіреді. Бұл еңбек ACM Classic Paper ретінде қолжетімді. Кристофер Д. Маннинг және Хинрих Шутце KWIC индексі мен компьютерлік конкордансталуды өздерінің «Статистикалық табиғи тілді өңдеу негіздері» кітабының 1.4.5 бөлімінде сипаттайды. Кембридж, Массачусетс: MIT Press, 1999 жыл. Олар Х. П. Лунның 1960 жылғы «Техникалық әдебиет үшін контекстік кілт сөз индексі (kwic индексі)» атты мақаласына сілтеме жасайды. Пастор Жерард О'Коннордың «Concordantia et Indices Missalium Romanorum» еңбегінде айтылғандай, «Жақында жасалған және компьютерлік бағдарламалық жасақтамамен құрылған конкорданстардың көпшілігі KWIC (контекстегі кілт сөз) және KWICn (ортадағы кілт сөз) форматтарын қолданады, бұл кілт сөзді, әдетте, қалың әріппен белгіленген, шектеулі контекстте – кілт сөзден бұрынғы үш [немесе] төрт сөз және одан кейінгі бірдей мөлшердегі мәтін ішінде тізімдейді. Бұл форматтың ең үлкен артықшылығы – кілт сөзді оның контексімен бірге анықтаудың оңайдығы. Римдік Missal Concordance KWIC және KWICn форматтарында жасалған, және әрбір сөз түрі мәтіндегідей тізімделеді, яғни леммаланбаған».
Christopher D. Manning and Hinrich Schütze describe a KWIC index and computer concordancing in section 1.4.5 of their book Foundations of Statistical Natural Language Processing. Cambridge, Mass: MIT Press, 1999. They cite an article from H. P. Luhn from 1960, "Key word in context index for technical literature (kwic index)". According to Rev. Gerard O'Connor's Concordantia et Indices Missalium Romanorum, "Most of the concordances produced in recent times and with the aid of computer software use both the KWIC (keyword in context) and KWICn (keyword in center) formats, which lists the keyword, usually highlighted in bold text in a consistent position, within a limited amount of context text, i. e. three [or] four words of the text prior to the keyword and the same amount of text following. This format is extremely useful in that the keyword is easily identified together with its context. The Concordance of the Roman Missal is produced in both the KWIC and KWICn formats and is noteworthy in that each word form is listed as it appears in the text, that is, it is un lemmatized."