Введение
Метод организации знаний
Контролируемые словари предоставляют способ организации знаний для последующего поиска. Они используются в схемах предметной индексации, предметных рубриках, тезаурусах, таксономиях и других системах организации знаний. Схемы контролируемых словарей предписывают использование заранее определенных, предпочтительных терминов, отобранных разработчиками этих схем, в отличие от словарей естественного языка, которые не имеют подобных ограничений.
В библиотеке и информатике
В библиотечном и информационном деле контролируемый словарь – это тщательно отобранный список слов и фраз, используемых для присвоения меток единицам информации (документу или произведению), чтобы облегчить их поиск. Контролируемые словари решают проблемы омонимов, синонимов и многозначности, устанавливая взаимно однозначное соответствие между понятиями и предпочтительными терминами. Проще говоря, контролируемые словари снижают нежелательную неоднозначность, свойственную естественным языкам, где одно и то же понятие может быть выражено разными словами, и обеспечивают согласованность. (Например, система предметных рубрик, использующая контролируемый словарь.) Для выбора предпочтительных терминов – в данном случае предметных рубрик – необходимо учитывать варианты написания одного и того же слова (например, американский и британский варианты), выбор между научной и общеупотребительной терминологией (таракан и Periplaneta americana), а также выбор между синонимами (автомобиль и машина) и другие сложные вопросы. Выбор предпочтительных терминов основывается на принципах пользовательского спроса (какие термины пользователи, скорее всего, будут использовать), литературного спроса (какие термины обычно используются в литературе и документах) и структурного спроса (термины, выбранные с учетом структуры и объема контролируемого словаря). Контролируемые словари также обычно решают проблему омонимов с помощью уточняющих признаков. Например, термин "pool" необходимо уточнять, чтобы он относился либо к бассейну для плавания, либо к виду бильярда, чтобы каждый предпочтительный термин или рубрика соответствовал только одному понятию.
Типы, используемые в библиотеках
В библиотеках используются два основных типа инструментов контролируемого словарного запаса: предметные рубрики и тезаурусы. Хотя различия между ними стираются, некоторые незначительные отличия всё ещё сохраняются. Исторически предметные рубрики разрабатывались каталогизаторами для описания книг в библиотечных каталогах, а тезаурусы использовались индексаторами для присвоения индексных терминов документам и статьям. Предметные рубрики, как правило, имеют более широкий охват, описывая целые книги, в то время как тезаурусы обычно более специализированны и охватывают очень конкретные дисциплины. Из-за системы карточных каталогов предметные рубрики часто содержат термины в косвенном порядке (хотя с развитием автоматизированных систем это постепенно устраняется), тогда как термины тезауруса всегда представлены в прямом порядке. В предметных рубриках, как правило, чаще используется предварительная координация терминов, когда разработчик контролируемого словарного запаса объединяет различные понятия для формирования одного предпочтительного заголовка (например, «дети и терроризм»), в то время как в тезаурусах обычно используются отдельные, прямые термины. Тезаурусы перечисляют не только эквивалентные термины, но и более узкие, более широкие термины и связанные термины среди различных предпочтительных и непредпочтительных (но потенциально синонимичных) терминов, чего исторически не было в большинстве предметных рубрик. Например, сама система предметных рубрик Библиотеки Конгресса не обладала значительной синдетической структурой до 1943 года, и лишь в 1985 году она начала использовать тезаурусные термины «Более широкий термин» и «Более узкий термин». Термины выбираются и организуются квалифицированными специалистами (включая библиотекарей и специалистов по информационной науке), обладающими опытом в соответствующей области. Термины контролируемого словарного запаса могут точно описывать содержание документа, даже если сами эти термины не встречаются в тексте документа. Известные системы предметных рубрик включают систему Библиотеки Конгресса, медицинские предметные рубрики (MeSH), разработанные Национальной медицинской библиотекой США, и Sears. Известные тезаурусы включают тезаурус по искусству и архитектуре и тезаурус ERIC. При выборе терминов для контролируемого словарного запаса разработчик должен учитывать специфичность выбранного термина, возможность использования прямого ввода, внутреннюю согласованность и стабильность языка. Наконец, количество предварительной координации (в этом случае возникает вопрос о степени перечисления по сравнению с синтезом) и последующей координации в системе также является важным аспектом. Элементы контролируемого словарного запаса (термины/фразы), используемые в качестве тегов для облегчения идентификации содержания документов или других объектов информационной системы (например, СУБД, веб-сервисы), квалифицируются как метаданные.
Преимущества
Контролируемые словари часто заявляются как способ повышения точности поиска по свободному тексту, например, за счет уменьшения числа нерелевантных результатов в списке найденных документов. Эти нерелевантные результаты (ложные срабатывания) часто вызваны внутренней неоднозначностью естественного языка. В качестве примера можно привести английское слово "football". "Football" – это название, которое дается ряду различных командных видов спорта. Самым популярным из этих видов спорта во всем мире является ассоциативный футбол, который в некоторых странах также называют "soccer". Слово "football" также применяется к регби (регби-юнион и регби-лига), американскому футболу, австралийскому футболу, гэльскому футболу и канадскому футболу. Таким образом, поиск по запросу "football" может вернуть документы, посвященные совершенно разным видам спорта. Контролируемый словарь решает эту проблему, присваивая документам метки, устраняющие неоднозначность. По сравнению с поиском по свободному тексту, использование контролируемого словаря может значительно повысить эффективность системы информационного поиска, если эффективность измеряется точностью (процент документов в списке найденных, которые действительно соответствуют теме поиска). В некоторых случаях контролируемый словарь может также повысить полноту поиска, поскольку, в отличие от схем, основанных на естественном языке, после поиска корректного предпочтительного термина нет необходимости искать другие термины, которые могут быть его синонимами.
Проблемы
Контролируемый поиск по словарю может приводить к неудовлетворительной полноте выдачи, поскольку он может не найти некоторые документы, которые на самом деле релевантны поисковому запросу. Это особенно проблематично, когда поисковый запрос включает термины, лишь косвенно связанные с предметной областью, в результате чего индексатор может решить использовать другой термин (но поисковик может считать и этот термин подходящим). По сути, избежать этого можно только опытному пользователю контролируемого словаря, чье понимание терминологии совпадает с пониманием индексатора. Другая причина может заключаться в том, что статья просто не была проиндексирована, из-за недостаточной полноты индексирования. Например, статья может упоминать футбол как второстепенную тему, и индексатор может решить не присваивать ей метку "футбол", поскольку это не является основной темой. Однако для поисковика эта статья может оказаться релевантной, и в этом случае полнота выдачи снижается. Поиск по свободному тексту автоматически обнаружит такую статью. С другой стороны, поиск по свободному тексту обладает высокой полнотой (ищется каждое слово), поэтому, хотя он имеет значительно более низкую точность, он потенциально может обеспечить высокую полноту, если поисковик преодолеет проблему синонимов, вводя все возможные комбинации. Контролируемые словари могут быстро устаревать в быстро развивающихся областях знаний, если предпочтительные термины не обновляются регулярно. Даже в идеальном случае контролируемый словарь часто менее специфичен, чем слова, используемые в самом тексте. Индексаторы, выбирая подходящие термины индексации, могут неправильно понять автора, в то время как эта проблема не возникает при поиске по свободному тексту, поскольку он использует слова, написанные автором. Использование контролируемых словарей может быть дороже, чем поиск по свободному тексту, поскольку для индексации каждой записи требуются эксперты или дорогостоящие автоматизированные системы. Кроме того, пользователю необходимо быть знакомым со схемой контролируемого словаря, чтобы эффективно использовать систему. Но, как уже упоминалось, контроль синонимов и омонимов может помочь повысить точность. Разработаны многочисленные методики, помогающие в создании контролируемых словарей, включая фасетную классификацию, которая позволяет описывать запись данных или документ несколькими способами. Выбор слов в используемых словарях не является нейтральным, и индексатор должен тщательно учитывать этические аспекты своего выбора. Например, традиционно колониальные термины часто были предпочтительными при обсуждении вопросов коренных народов, что вызывало споры.
Приложения
Контролируемые словари, такие как заголовки предметов Библиотеки Конгресса, являются важным компонентом библиографии – науки об изучении и классификации книг. Они были изначально разработаны в библиотечном деле и информатике. В 1950-х годах государственные учреждения начали разрабатывать контролируемые словари для быстро растущей литературы в специализированных областях; примером является Medical Subject Headings (MeSH), разработанный Национальной медицинской библиотекой США. Впоследствии появились коммерческие фирмы (называемые службами реферирования и индексирования), которые стали индексировать стремительно увеличивающийся объем литературы во всех областях знаний. В 1960-х годах сформировалась индустрия онлайн-библиографических баз данных, основанная на коммутируемой сети X.25. Доступ к этим службам редко предоставлялся широкой публике из-за сложности их использования; поисковые запросы выполнялись специализированными библиотекарями, называемыми поисковыми посредниками. В 1980-х годах появились первые базы данных полного текста, содержащие полный текст статей, а также библиографическую информацию. Онлайн-библиографические базы данных перешли в Интернет и стали общедоступными; однако большинство из них являются проприетарными и могут быть дорогостоящими в использовании. Студенты колледжей и университетов могут иметь доступ к некоторым из этих служб бесплатно, а также некоторые из них могут быть доступны бесплатно в публичных библиотеках.
Техническая коммуникация
В крупных организациях для улучшения технической коммуникации могут внедряться контролируемые словари. Использование контролируемого словаря обеспечивает то, что все используют одно и то же слово для обозначения одного и того же понятия. Такая последовательность терминов – одна из важнейших концепций в технической документации и управлении знаниями, где прилагаются усилия для использования одного и того же слова на протяжении всего документа или во всей организации, а не немного отличающихся вариантов для обозначения одного и того же.
Семантическая сеть и структурированные данные
Поиск в Интернете может быть значительно улучшен благодаря разработке контролируемого словаря для описания веб-страниц; использование такого словаря может привести к созданию Семантической сети, в которой содержание веб-страниц описывается с помощью машиночитаемой схемы метаданных. Одним из первых предложений такой схемы является инициатива Dublin Core. Примером контролируемого словаря, пригодного для индексации веб-страниц, является PSH. Вряд ли какая-либо одна схема метаданных когда-либо сможет описать содержимое всей Сети. Для создания Семантической сети может потребоваться использование двух или более систем метаданных для описания содержимого веб-страницы. Язык обмениваемых фасетных метаданных (XFML) разработан для того, чтобы создатели контролируемых словарей могли публиковать и обмениваться системами метаданных. XFML основан на принципах фасетной классификации. Контролируемые словари Семантической сети определяют понятия и отношения (термины), используемые для описания интересующей области или сферы деятельности. Например, для представления человека в машиночитаемом формате необходим словарь, содержащий формальное определение "Человек", такой как словарь Friend of a Friend (FOAF), который имеет класс "Person", определяющий типичные свойства человека, включая, но не ограничиваясь ими, имя, титул, организацию, адрес электронной почты и домашнюю страницу, или словарь "Person" Schema.org. Аналогично, книгу можно описать с помощью словаря "Book" Schema.org и общих терминов публикации из словаря Dublin Core, событие – с помощью словаря "Event" Schema.org и так далее. Чтобы использовать машиночитаемые термины из любого контролируемого словаря, веб-разработчики могут выбирать из различных форматов аннотаций, включая RDFa, HTML5 Microdata или JSON-LD в разметке, или сериализации RDF (RDF/XML, Turtle, N3, TriG, TriX) во внешних файлах.