Введение

Выявление связей перевода между словами в битексте, выравнивание слов естественного языка. Выравнивание слов битекста, или просто выравнивание слов, – это задача обработки естественного языка, заключающаяся в определении связей перевода между словами (или реже – многословными единицами) в битексте. Результатом является двудольный граф между двумя сторонами битекста, с дугой между двумя словами, если и только если они являются переводами друг друга. Выравнивание слов обычно выполняется после того, как выравнивание предложений уже определило пары предложений, являющихся переводами друг друга. Выравнивание слов битекста является важной вспомогательной задачей для большинства методов статистического машинного перевода. Параметры статистических моделей машинного перевода обычно оцениваются на основе наблюдений за выровненными битекстами, и, наоборот, автоматическое выравнивание слов обычно выполняется путем выбора выравнивания, которое наилучшим образом соответствует статистической модели машинного перевода. Круговое применение этих двух подходов приводит к реализации алгоритма максимизации ожиданий. Этот подход к обучению является примером обучения без учителя, поскольку системе не предоставляются примеры желаемого результата, а она пытается найти значения для не наблюдаемой модели и выравнивания, которые наилучшим образом объясняют наблюдаемый битекст. Недавние исследования начали изучать контролируемые методы, основанные на предоставлении системе (обычно небольшого) количества предложений, выровненных вручную. Помимо преимуществ, связанных с дополнительной информацией, предоставляемой обучением с учителем, эти модели обычно также могут легче использовать преимущества объединения множества признаков данных, таких как контекст, синтаксическая структура, часть речи или информация из лексикона перевода, которые трудно интегрировать в генеративные статистические модели, традиционно используемые. Помимо обучения систем машинного перевода, другие области применения выравнивания слов включают индукцию лексиконов перевода, обнаружение значений слов, устранение неоднозначности значений слов и межъязыковую проекцию лингвистической информации.

HMM

Вогель и др. разработали подход, основанный на вероятностях лексического перевода и относительном выравнивании, путем сопоставления задачи с моделью скрытых Марковых цепей. Состояния и наблюдения соответствуют исходным и целевым словам, соответственно. Вероятности переходов моделируют вероятности выравнивания. При обучении вероятности перевода и выравнивания могут быть получены в алгоритме прямого и обратного прохода (Forward-backward).