Введение

Обработка естественного языка. Семантическое сходство – это метрика, определяемая для набора документов или терминов, где идея расстояния между элементами основана на близости их значения или семантического содержания, в отличие от лексикографического сходства. Это математические инструменты, используемые для оценки силы семантической связи между единицами языка, понятиями или экземплярами посредством числового описания, полученного на основе сравнения информации, подтверждающей их значение или описывающей их природу. Термин «семантическое сходство» часто путают с «семантической связанностью». Семантическая связанность включает в себя любые отношения между двумя терминами, в то время как семантическое сходство подразумевает только отношение «является». Например, «автомобиль» схож с «автобусом», но также связан с «дорогой» и «вождением». С вычислительной точки зрения, семантическое сходство можно оценить, определив топологическое сходство, используя онтологии для определения расстояния между терминами/концепциями. Например, простая метрика для сравнения понятий, упорядоченных в частично упорядоченном множестве и представленных в виде узлов направленного ациклического графа (например, таксономии), будет кратчайшим путем, соединяющим два узла понятия. На основе анализа текста, семантическую связанность между единицами языка (например, словами, предложениями) также можно оценить, используя статистические методы, такие как модель векторного пространства, для установления корреляции между словами и текстовыми контекстами из подходящего текстового корпуса. Оценка предлагаемых мер семантического сходства/связанности проводится двумя основными способами. Первый основан на использовании наборов данных, разработанных экспертами и состоящих из пар слов с оценкой степени семантического сходства/связанности. Второй способ основан на интеграции этих мер в конкретные приложения, такие как поиск информации, рекомендательные системы, обработка естественного языка и т.д.

Терминология

Понятие семантического сходства более конкретно, чем семантическая связанность, поскольку последняя включает в себя такие отношения, как антонимия и меронимия, в то время как сходство – нет. Однако в большинстве публикаций эти термины используются как взаимозаменяемые, наряду с такими понятиями, как семантическое расстояние. По сути, семантическое сходство, семантическое расстояние и семантическая связанность все сводятся к вопросу: "Насколько термин А соотносится с термином Б?". Ответ на этот вопрос обычно выражается числом в диапазоне от −1 до 1 или от 0 до 1, где 1 указывает на чрезвычайно высокую степень сходства.

Визуализация

Интуитивно понятным способом визуализации семантического сходства терминов является объединение тесно связанных терминов в группы и увеличение расстояния между отдалённо связанными терминами. Такой подход часто используется на практике при создании интеллект-карт и концептуальных карт. Более прямой способ визуализации семантического сходства двух лингвистических единиц предлагает подход семантического свёртывания (Semantic Folding). В рамках этого подхода лингвистическая единица, такая как термин или текст, может быть представлена путём генерации пикселя для каждой из её активных семантических характеристик, например, в сетке 128 x 128. Это позволяет напрямую визуально сравнивать семантику двух единиц, сопоставляя графические представления их соответствующих наборов характеристик.

В вычислительной лингвистике

Несколько метрик используют WordNet — лексическую базу данных английских слов, созданную вручную. Несмотря на преимущества, которые дает участие человека в создании этой базы данных, поскольку слова не изучаются автоматически, она не способна измерять семантическую близость между многословными терминами и не учитывает динамически расширяющийся словарный запас.

В обработке естественного языка

Обработка естественного языка (NLP) — это область компьютерных наук и лингвистики. Анализ тональности, понимание естественного языка и машинный перевод (автоматический перевод текста с одного человеческого языка на другой) — лишь некоторые из основных областей его применения. Например, если известен один информационный ресурс в интернете, часто возникает непосредственная потребность найти похожие ресурсы. Семантическая сеть предоставляет семантические расширения для поиска аналогичных данных по содержанию, а не только по произвольным идентификаторам. Методы глубокого обучения стали точным способом определения семантической близости между двумя текстовыми фрагментами, при котором каждый фрагмент сначала преобразуется в непрерывное векторное представление.

Семантические сети сходства

Семантическая сеть сходства (SSN) — это особая форма семантической сети, предназначенная для представления концепций и их семантического сходства. Её основное преимущество заключается в снижении сложности вычисления семантических расстояний. Бендек (2004, 2008) представил концепцию сетей семантического сходства (SSN) как специализацию семантической сети для измерения семантического сходства на основе онтологических представлений. Реализации включают обработку генетической информации.

Статьи обследования

Статья конференции: C. d'Amato, S. Staab, N. Fanizzi. 2008. О влиянии онтологий описательной логики на концептуальное сходство. В материалах 16-й международной конференции по инженерии знаний: практика и образцы. Страницы 48–63. Ачитрецца, Италия, Springer Verlag.
Статья в журнале, посвященная более общей теме связанности, включая также сходство: Z. Zhang, A. Gentile, F. Ciravegna. 2013. Последние достижения в методах лексико-семантической связанности – обзор. Natural Language Engineering 19 (4), 411–479, Cambridge University Press.
Книга: S. Harispe, S. Ranwez, S. Janaqi, J. Montmain. 2015. Семантическое сходство на основе анализа естественного языка и онтологий, Morgan & Claypool Publishers.