Введение
Компьютерный лексикон английского языка WordNet — это лексическая база данных, содержащая информацию о семантических связях между словами, объединяющая их по различным отношениям, включая синонимию, гипонимию и меронимию. Синонимы объединяются в синсеты, снабженные краткими определениями и примерами употребления. Таким образом, WordNet можно рассматривать как сочетание и расширение функциональности словаря и тезауруса. Хотя он доступен для пользователей через веб-браузер, его основное применение – автоматический анализ текста и приложения искусственного интеллекта. WordNet был изначально разработан для английского языка, а база данных и программные инструменты для английского языка распространяются под лицензией BSD и свободно доступны для скачивания с сайта WordNet. В настоящее время существуют WordNet для более чем 200 языков.
WordNet is a lexical database of semantic relations between words that links words into semantic relations including synonyms, hyponyms, and meronyms. The synonyms are grouped into synsets with short definitions and usage examples. It can thus be seen as a combination and extension of a dictionary and thesaurus. While it is accessible to human users via a web browser, its primary use is in automatic text analysis and artificial intelligence applications. It was first created in the English language and the English WordNet database and software tools have been released under a BSD style license and are freely available for download from that WordNet website. There are now WordNets in more than 200 languages.
История и члены команды
WordNet был впервые создан в 1985 году, исключительно на английском языке, в Лаборатории когнитивных наук Принстонского университета под руководством профессора психологии Джорджа Армитажа Миллера. Позже проект возглавила Кристиан Феллбаум. Первоначально проект финансировался Управлением военно-морских исследований США, а затем и другими государственными учреждениями США, включая DARPA, Национальный научный фонд, Управление перспективных разработок (ранее — Управление передовых исследований и разработок) и REFLEX. Джордж Миллер и Кристиан Феллбаум получили премию Антонио Замполли в 2006 году за их работу над WordNet. Глобальная ассоциация WordNet — это некоммерческая организация, предоставляющая платформу для обсуждения, обмена опытом и объединения WordNet для всех языков мира. Кристиан Феллбаум и Пик Т. Й. М. Воссен являются её сопредседателями.
Психолингвистические аспекты
Первоначальной целью проекта WordNet было создание лексической базы данных, соответствующей теориям человеческой семантической памяти, разработанным в конце 1960-х годов. Психологические эксперименты показали, что люди организуют свои знания о понятиях экономично и иерархически. Время, необходимое для извлечения концептуальных знаний, казалось, напрямую зависело от количества иерархий, которые говорящему нужно было "пройти", чтобы получить доступ к этим знаниям. Так, говорящим было легче подтвердить, что канарейки умеют петь, поскольку канарейка – это певчая птица, но требовалось немного больше времени, чтобы подтвердить, что канарейки умеют летать (так как для этого нужно было обратиться к понятию "птица" на более высоком уровне иерархии), и еще больше времени, чтобы подтвердить, что у канареек есть кожа (что требовало поиска по нескольким уровням гипонимии, вплоть до "животного"). Хотя эти психолингвистические эксперименты и лежащие в их основе теории подвергались критике, некоторые аспекты организации WordNet согласуются с экспериментальными данными. Например, аномальная афазия избирательно нарушает способность говорящих воспроизводить слова из определенной семантической категории, соответствующей иерархии в WordNet. Антонимичные прилагательные (центральные прилагательные WordNet в "гантелевидной" структуре) встречаются гораздо чаще, чем можно было бы ожидать случайно, и это подтверждается для многих языков.
Как лексическая онтология
WordNet иногда называют онтологией, что является утверждением, которое его создатели отвергают. Отношения гиперним/гипоним между синсетами существительных можно интерпретировать как отношения специализации между концептуальными категориями. Иными словами, WordNet можно интерпретировать и использовать как лексическую онтологию в понимании компьютерной науки. Однако, прежде чем использовать такую онтологию, её необходимо исправить, поскольку она содержит сотни существенных семантических несоответствий; например, наблюдаются (i) общие специализации для взаимоисключающих категорий и (ii) избыточность в иерархии специализации. Более того, преобразование WordNet в лексическую онтологию, пригодную для представления знаний, обычно также включает в себя (i) разграничение отношений специализации на отношения типа «подтипОтношения» и «экземплярОтношения», и (ii) присвоение каждой категории интуитивно понятных уникальных идентификаторов. Хотя такие исправления и преобразования были выполнены и задокументированы в рамках интеграции WordNet 1.7 в совместно обновляемую базу знаний WebKB 2, большинство проектов, заявляющих о повторном использовании WordNet для приложений, основанных на знаниях (как правило, информационно-поисковых систем, ориентированных на знания), просто используют его напрямую. WordNet также был преобразован в формальную спецификацию с использованием гибридной методологии, сочетающей подходы «снизу вверх» и «сверху вниз», для автоматического извлечения из него ассоциативных связей и интерпретации этих связей в терминах набора концептуальных отношений, формально определенных в фундаментальной онтологии DOLCE. В большинстве работ, утверждающих об интеграции WordNet в онтологии, содержание WordNet не просто исправлялось при необходимости; вместо этого оно подвергалось значительной переинтерпретации и обновлению, когда это было целесообразно. Так, например, онтология верхнего уровня WordNet была реструктурирована в соответствии с подходом, основанным на OntoClean, или использовалась в качестве основного источника для построения нижних классов онтологии SENSUS.
Ограничения
Наиболее широко обсуждаемым ограничением WordNet (и связанных с ним ресурсов, таких как ImageNet) является то, что некоторые семантические отношения лучше подходят для конкретных понятий, чем для абстрактных. Например, легко установить гипонимические/гипернимические отношения, чтобы показать, что "хвойное дерево" – это тип "дерева", "дерево" – это тип "растения", а "растение" – это тип "организма", но сложно классифицировать эмоции, такие как "страх" или "счастье", в столь же глубокие и чётко определённые гипонимические/гипернимические отношения. Многие понятия в WordNet специфичны для определенных языков, и наиболее точное соответствие между языками составляет 94%. Синонимы, гипонимы, меронимы и антонимы встречаются во всех языках, для которых существует WordNet, но другие семантические отношения зависят от языка. Это ограничивает совместимость между языками. Однако это также делает WordNet ресурсом для выявления и изучения различий между языками, поэтому это не всегда является ограничением для всех задач. WordNet не содержит информации об этимологии или произношении слов и предоставляет лишь ограниченную информацию об употреблении. WordNet стремится охватить большинство повседневных слов и не включает в себя много специализированной терминологии. WordNet является наиболее часто используемым вычислительным лексиконом английского языка для дезаамбигуации значений слов (WSD) – задачи, направленной на присвоение словам в тексте контекстуально подходящих значений (то есть членов синсета). Однако утверждается, что WordNet кодирует слишком детализированные смысловые различия. Эта проблема препятствует достижению системами WSD уровня производительности, сопоставимого с человеческим, поскольку люди не всегда согласны при выборе значения из словаря, соответствующего слову в контексте. Проблема гранулярности решалась путём разработки методов кластеризации, которые автоматически объединяют близкие значения одного и того же слова.
Оскорбительное содержание
WordNet включает в себя слова, которые могут восприниматься как уничижительные или оскорбительные. Интерпретация слова может меняться со временем и в разных социальных группах, поэтому WordNet не всегда может определить слово как "уничижительное" или "оскорбительное" вне контекста. Следовательно, пользователи WordNet должны самостоятельно определять оскорбительные или уничижительные слова. Однако это ограничение характерно и для других лексических ресурсов, таких как словари и тезаурусы, которые также содержат уничижительные и оскорбительные слова. Некоторые словари указывают на уничижительные слова, но не охватывают все контексты, в которых слово может быть приемлемым или оскорбительным для различных социальных групп. Поэтому пользователям словарей также необходимо самостоятельно выявлять все оскорбительные слова.
Лицензионные и открытые WordNets
Некоторые словесные сети были впоследствии созданы для других языков. Обзор 2012 года содержит перечень словесных сетей и информацию об их доступности. В стремлении расширить использование WordNet, сообщество Global WordNet постепенно переводило свои WordNet под открытую лицензию, чтобы исследователи и разработчики могли легко получать доступ к ним и использовать их как языковые ресурсы для обеспечения онтологических и лексических знаний в задачах обработки естественного языка (NLP). Open Multilingual WordNet предоставляет доступ к словесным сетям с открытой лицензией на различных языках, все они связаны с Princeton Wordnet английского языка (PWN). Цель состоит в том, чтобы упростить использование словесных сетей на нескольких языках.
Приложения
WordNet использовался для множества целей в информационных системах, включая дезаmbигуацию значений слов, информационный поиск, автоматическую классификацию текста, автоматическое реферирование текста, машинный перевод и даже автоматическую генерацию кроссвордов. Распространенное применение WordNet – определение степени семантической близости между словами. Было предложено несколько алгоритмов, включая измерение расстояния между словами и синсетами в графовой структуре WordNet, например, путем подсчета количества ребер между синсетами. Логика заключается в том, что чем ближе два слова или синсета, тем ближе их значения. Ряд алгоритмов определения семантической близости слов на основе WordNet реализованы в пакете Perl под названием WordNet::Similarity и в пакете Python под названием NLTK. Другие, более сложные методы определения семантической близости на основе WordNet включают ADW, реализация которого доступна на Java. WordNet также может использоваться для установления связей между различными словарями и тезаурусами.
Интерфейсы
Принстон ведет список связанных проектов, включающий ссылки на некоторые из широко используемых программных интерфейсов прикладного программирования (API) для доступа к WordNet с использованием различных языков и сред разработки.
Связанные проекты и расширения
WordNet связан с несколькими базами данных Семантической сети. WordNet также широко используется повторно посредством сопоставлений между синсетами WordNet и категориями из онтологий. Чаще всего сопоставляются только категории верхнего уровня WordNet.
Глобальная ассоциация WordNet
Глобальная Ассоциация WordNet (GWA) — это общественная некоммерческая организация, предоставляющая платформу для обсуждения, обмена и объединения словарных сетей для всех языков мира. GWA также способствует стандартизации словарных сетей между языками, чтобы обеспечить единообразие в представлении синсетов в человеческих языках. GWA поддерживает список словарных сетей, разрабатываемых по всему миру.
Связанные данные
BabelNet, очень большая многоязычная семантическая сеть с миллионами концепций, полученных путем интеграции WordNet и Википедии с использованием автоматического алгоритма сопоставления. Онтология SUMO имеет полное ручное сопоставление между всеми синсетами WordNet и всеми элементами SUMO (включая его доменные онтологии, когда WordNet содержит значение слова для данного термина SUMO), которое можно просмотреть, например, в OpenCyc – открытой онтологии и базе знаний повседневных знаний здравого смысла, содержащей 12 000 терминов, связанных с синсетами WordNet. DOLCE является первым модулем библиотеки WonderWeb Foundational Ontologies (WFOL). Эта верхняя онтология была разработана на основе строгих онтологических принципов, вдохновленных философской традицией, с четкой ориентацией на язык и познание. OntoWordNet – результат экспериментального выравнивания верхнего уровня WordNet с DOLCE. Предполагается, что такое выравнивание может привести к "онтологически обогащенному" WordNet, который будет концептуально более строгим, когнитивно прозрачным и эффективно использоваться в различных приложениях. DBpedia, база данных структурированной информации, связана с WordNet. eXtended WordNet – проект Университета Техаса в Далласе, направленный на улучшение WordNet путем семантического разбора глосс, что делает информацию, содержащуюся в этих определениях, доступной для автоматических систем обработки знаний. Он свободно доступен по лицензии, аналогичной лицензии WordNet. Проект GCIDE создал словарь, объединив общедоступный словарь Вебстера 1913 года с некоторыми определениями WordNet и материалами, предоставленными волонтерами. Он был выпущен под лицензией GPL. ImageNet – база данных изображений, организованная в соответствии с иерархией WordNet (в настоящее время только существительные), в которой каждый узел иерархии представлен миллионами изображений. В настоящее время в среднем на каждый узел приходится более 500 изображений. BioWordnet, биомедицинское расширение WordNet, был прекращен из-за проблем со стабильностью между версиями. WikiTax2WordNet – сопоставление между синсетами WordNet и категориями Википедии. WordNet++ – ресурс, включающий более миллионов семантических связей, извлеченных из Википедии и соединяющих пары синсетов WordNet. SentiWordNet – ресурс для поддержки приложений анализа тональности, полученный путем присвоения тегов всем синсетам WordNet 3.0 в соответствии с их предполагаемой степенью позитивности, негативности и нейтральности. ColorDict – это Android-приложение для мобильных телефонов, использующее базу данных WordNet и другие, такие как Википедия. UBY LMF – база данных, содержащая 10 ресурсов, включая WordNet.
Связанные проекты
FrameNet — это лексическая база данных, имеющая некоторые сходства с WordNet и ссылающаяся на него. Lexical Markup Framework (LMF) — это стандарт ISO, разработанный в ISO/TC37 для определения единой стандартизированной структуры при создании лексиконов, включая WordNet. Подмножество LMF для WordNet называется Wordnet LMF. Реализация была выполнена в рамках проекта KYOTO. Программа UNL — это проект под эгидой ООН, направленный на объединение лексико-семантических данных многих языков для использования в системах машинного перевода и извлечения информации. Meaning Monkey — бесплатный онлайн-словарь, основанный на базе данных WordNet. Dictionary.video — это видеословарь, ориентированный на произношение. Его текстовая часть расширена на основе WordNet.