Введение
Последовательность между семантически связанными упорядоченными словами классифицируется как лексическая цепочка. Лексическая цепочка - это последовательность связанных слов в письменном виде, охватывающая узкое (соседствующие слова или предложения) или широкое контекстное окно (весь текст). Лексическая цепочка не зависит от грамматической структуры текста и фактически представляет собой список слов, который захватывает часть сплоченной структуры текста. Лексическая цепочка может обеспечить контекст для разрешения неоднозначного термина и позволить разъяснить понятия, которые представляет термин. Рим → столица → город → население Википедия → ресурс → веб
Wikipedia → resource → web
Подходы и методы
Использование лексических цепочек в задачах обработки естественного языка (например, сходство текста, расхождение смысла слова, кластеризация документов) широко изучалось в литературе. Barzilay et al используют лексические цепочки для получения резюме из текстов. Они предлагают метод, основанный на четырех этапах: сегментация исходного текста, построение лексических цепей, идентификация надежных цепей и извлечение значимых предложений. Сильбер и Маккой также исследуют резюмирование текста, но их подход к построению лексических цепочек работает в линейном времени. Некоторые авторы используют WordNet для улучшения поиска и оценки лексических цепочек. Буданицкий и Кирст сравнивают несколько измерений семантического расстояния и родства с использованием лексических цепей в сочетании с WordNet. Их исследование приходит к выводу, что показатель сходства Цзян и Конрата дает лучший общий результат. Молдован и Адриан изучают использование лексических цепочек для поиска тематически связанных слов для систем ответов на вопросы. Это делается с учетом глосса для каждого синсета в WordNet. Согласно их выводам, тематические отношения через лексические цепочки улучшают производительность систем ответов на вопросы в сочетании с WordNet. Маккарти и другие. представить методологию категоризации и поиска наиболее преобладающих синсетов в немаркированных текстах с использованием WordNet. В отличие от традиционных подходов (например, BOW), они рассматривают отношения между терминами, которые не встречаются явно. Эркан и Цикели исследуют влияние лексических цепочек в задаче извлечения ключевых слов с помощью контролируемой перспективы машинного обучения. В Вей и др. объединяют лексические цепочки и WordNet для извлечения из текстов набора семантически связанных слов и использования их для кластеризации. Их подход использует онтологическую иерархическую структуру, чтобы обеспечить более точную оценку сходства между терминами во время задачи дезавуггиации смысла слова.
Лексическая цепь и встраивание слов
Несмотря на то, что применимость лексических цепей разнообразна, мало работается над их изучением с недавними достижениями в НЛП, в частности с встраиванием слов. В WordNet используются встраивания смысла слова для создания лексических цепей, которые интегрированы с нейронной моделью машинного перевода. Маскарелли предлагает модель, которая использует лексические цепочки для использования статистического машинного перевода с помощью кодера документов. Вместо использования внешней лексической базы данных, они используют встраивания слов для обнаружения лексических цепочек в исходном тексте. Руас и другие. предлагают две техники, которые сочетают лексические базы данных, лексические цепочки и встраивание слов, а именно гибкую лексическую цепь II (FLLC II) и фиксированную лексическую цепь II" (FXLC II). Основная цель как FLLC II, так и FXLC II - более лаконично представлять совокупность слов по их семантическим значениям. В FLLC II лексические цепочки собираются динамически в соответствии с семантическим содержанием каждого оцениваемого термина и отношениями с его соседями. Пока существует семантическая связь, которая соединяет два или более слова, они должны быть объединены в единое понятие. Семантические отношения получаются через WordNet, который работает на основе истины, чтобы указать, какая лексическая структура соединяет два слова (например, гипернимы, гипонимы, меринонимы). Если слово не имеет смыслового родства с текущей цепью, инициализируется новая лексическая цепь. С другой стороны, FXLC II разбивает сегменты текста на заранее определенные куски, каждый из которых содержит определенное количество слов. В отличие от FLLC II, метод FXLC II группирует определенное количество слов в одну и ту же структуру, независимо от семантической связи, выраженной в лексической базе данных. В обоих методах каждая сформированная цепочка представлена словом, чей вектор встраивания слов, подготовленный заранее, наиболее похож на средний вектор составляющих слов в той же цепи.