Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Семантический лексикон – это цифровой словарь слов, снабженных семантическими классами, что позволяет устанавливать связи между словами, с которыми ранее не встречались. Семантические лексиконы создаются на основе семантических сетей, которые отражают семантические отношения между словами. Отличие семантического лексикона от семантической сети заключается в том, что семантический лексикон содержит определения для каждого слова, или "глоссу".
A semantic lexicon is a digital dictionary of words labeled with semantic classes so associations can be drawn between words that have not previously been encountered. Semantic lexicons are built upon semantic networks, which represent the semantic relations between words. The difference between a semantic lexicon and a semantic network is that a semantic lexicon has definitions for each word, or a "gloss".
Структура
Семантические лексиконы состоят из лексических записей. Эти записи не орфографические, а семантические, что позволяет избежать проблем, связанных с омонимией и полисемией. Эти лексические записи связаны между собой семантическими отношениями, такими как гиперонимия, гипонимия, меронимия или тропонимия. Синонимичные записи объединяются в так называемые "синсеты", как это принято в WordNet Принстонского университета.
Semantic lexicons are made up of lexical entries. These entries are not orthographic, but semantic, eliminating issues of homonymy and polysemy. These lexical entries are interconnected with semantic relations, such as hyperonymy, hyponymy, meronymy, or troponymy. Synonymous entries are grouped together in what the Princeton WordNet calls "synsets"
Именные имена
Существительные упорядочены в таксономию, структурированную в иерархию, где самое широкое и всеобъемлющее существительное находится на вершине, например, "вещь", а существительные становятся все более и более конкретными по мере удаления от вершины. Самое верхнее существительное в семантическом лексиконе называется уникальным началом. Наиболее специфические существительные (те, у которых нет подчиненных), являются конечными узлами. Отношения между ними часто представляют собой отношение "часть к целому", например, клавиши являются частью ноутбука. Необходимые атрибуты, определяющие конкретную запись, также обязательно присутствуют в гипониме этой записи. Таким образом, если у компьютера есть клавиши, а ноутбук является типом компьютера, то у ноутбука должны быть клавиши. Однако во многих случаях это различие может быть размытым. Хорошим примером является предмет мебели – стул. Большинство людей определит стул как имеющий ножки и сиденье (то есть часть, на которой сидят). Однако существуют художественные или современные стулья, у которых вообще нет ножек. Кресла-мешки тоже не имеют ножек, но мало кто станет утверждать, что это не стулья. Вопросы такого рода – это ключевые вопросы, которые стимулируют исследования и работу в области таксономии и онтологии.
Nouns are ordered into a taxonomy, structured into a hierarchy where the broadest and most encompassing noun is located at the top, such as "thing", with the nouns becoming more and more specific the further they are from the top. The very top noun in a semantic lexicon is called a unique beginner. The most specific nouns (those that do not have any subordinates), are terminal nodes. which is a “part to whole” relationship, such as keys are part of a laptop. The necessary attributes that define a specific entry are also necessarily present in that entry’s hyponym. So, if a computer has keys, and a laptop is a type of computer, then a laptop must have keys. However, there are many instances where this distinction can become vague. A good example of this is the item chair. Most would define a chair as having legs and a seat (as in the part one sits on). However, there are some artistic or modern chairs that do not have legs at all. Beanbags also do not have legs, but few would argue that they aren't chairs. Questions like this are the core questions that drive research and work in the fields of taxonomy and ontology.
Глаголы
Синсеты глаголов организованы аналогично синсетам существительных: более общие и всеобъемлющие глаголы располагаются в верхней части иерархии, а тропонимы (глаголы, описывающие более конкретный способ совершения действия) группируются ниже. Специфичность глагола изменяется по вектору, при этом глаголы становятся все более и более конкретными по отношению к определенному качеству. Это крайне сложная и пока не решенная задача в области машинного перевода. Одна из проблем заключается в том, что ни один язык не является дословным переводом другого. То есть, каждый язык имеет определенные структурные или синтаксические отличия от всех остальных. Кроме того, языки часто содержат слова, которые трудно перевести на другие языки, и тем более – с точным соответствием слово за словом. Предлагались варианты создания единой структуры для wordnets. Исследования показали, что в каждом известном человеческом языке существует концепция, схожая с синонимией, гипонимией, меронимией и антонимией. Однако все предложенные идеи подвергались критике за использование модели, наиболее эффективной для английского языка и менее подходящей для других языков. Еще одним препятствием в этой области является отсутствие четких руководств по созданию семантических лексиконов и их содержанию. Каждый проект лексикона на каждом языке применяет несколько (или значительно) отличающийся подход к своей словесной сети. Даже не существует общепринятого определения того, что такое «слово». Орфографически слово определяется как последовательность букв с пробелами с обеих сторон, но семантически это предмет оживленных дискуссий. Например, легко определить «собака» или «стержень» как слова, но как насчет «сторожевая собака» или «громоотвод»? Последние два примера можно считать орфографически отдельными словами, хотя семантически они представляют собой одно понятие: один – это тип собаки, а другой – тип стержня. Помимо этих неясностей, wordnets также характеризуются идиосинкразией, непоследовательностью в маркировке элементов. Они избыточны, поскольку часто к каждому значению (синсету) присваивается несколько слов. Они также открыты для расширения, поскольку часто фокусируются и углубляются в терминологию и специализированную лексику.
Verb synsets are arranged much like their noun counterparts: the more general and encompassing verbs are near the top of the hierarchy while troponyms (verbs that describe a more specific way of doing something) are grouped beneath. Verb specificity moves along a vector, with the verbs becoming more and more specific in reference to a certain quality. This is an extremely challenging and as of yet unsolved issue in the Machine Translation field. One issue arises from the fact that no two languages are word for word translations of each other. That is, every language has some sort of structural or syntactic difference from every other. In addition, languages often have words that don’t translate easily into other languages, and certainly not with an exact word to word match. Proposals have been made to create a set framework for wordnets. Research has shown that every known human language has some sort of concept resembling synonymy, hyponymy, meronymy, and antonymy. However, every idea so far proposed has been met with criticism for using a pattern that works best for English and less for other languages. Another obstacle in the field is that no solid guidelines exist for semantic lexicon framework and contents. Each lexicon project in each different language has had a slightly (or not so slightly) different approach to their wordnet. There is not even an agreed upon definition of what a “word” is. Orthographically, they are defined as a string of letters with spaces on either side, but semantically it becomes a very debated subject. For example, though it is not difficult to define dog or rod as words, but what about guard dog or lightning rod? The latter two examples would be considered orthographically separate words, though semantically they make up one concept: one is a type of dog and one is a type of rod. In addition to these confusions, wordnets are also idiosyncratic, in that they do not consistently label items. They are redundant, in that they often have several words assigned to each meaning (synsets). They are also open ended, in that they often focus on and extend into terminology and domain specific vocabulary.