Введение
Парадигма машинного перевода. Статистический машинный перевод (СМТ) был подходом к машинному переводу, который вытеснил предыдущий подход, основанный на правилах, поскольку он требовал явного описания каждого лингвистического правила, что было дорогостоящим и часто не обеспечивало обобщения на другие языки. С 2003 года сам статистический подход постепенно вытесняется подходом, основанным на глубоком обучении и нейронных сетях. Первые идеи статистического машинного перевода были предложены Уорреном Уивером в 1949 году, включая идеи применения теории информации Клода Шеннона. Статистический машинный перевод был вновь представлен в конце 1980-х – начале 1990-х годов исследователями из Исследовательского центра IBM имени Томаса Дж. Уотсона.
Statistical machine translation (SMT) was a machine translation approach, that superseded the previous, rule based approach because it required explicit description of each and every linguistic rule, which was costly, and which often did not generalize to other languages. Since 2003, the statistical approach itself has been gradually superseded by the deep learning based neural network approach. The first ideas of statistical machine translation were introduced by Warren Weaver in 1949, including the ideas of applying Claude Shannon's information theory. Statistical machine translation was re introduced in the late 1980s and early 1990s by researchers at IBM's Thomas J. Watson Research Center
Основание
Идея статистического машинного перевода берет начало в теории информации. Документ переводится в соответствии с распределением вероятности того, что строка на целевом языке (например, английском) является переводом строки на исходном языке (например, французском). Проблема моделирования этого распределения вероятностей решалась различными способами. Один из подходов, хорошо подходящий для компьютерной реализации, – применение теоремы Байеса, то есть , где модель перевода – это вероятность того, что исходная строка является переводом целевой строки, а языковая модель – это вероятность встретить эту целевую строку. Такое разложение привлекательно, поскольку оно разделяет проблему на две подзадачи. Поиск наилучшего перевода осуществляется путем выбора варианта, дающего наибольшую вероятность: Для строгой реализации этого потребовался бы исчерпывающий поиск по всем строкам на целевом языке. Эффективное выполнение поиска – задача декодера машинного перевода, который использует исходную строку, эвристики и другие методы для ограничения пространства поиска, сохраняя при этом приемлемое качество. Этот компромисс между качеством и временем выполнения также встречается в распознавании речи. Поскольку системы перевода не могли хранить все целевые строки и их переводы, документ обычно переводился по предложениям, но и этого было недостаточно. Языковые модели обычно аппроксимировались сглаженными n-граммами, и аналогичные подходы применялись к моделям перевода, однако возникала дополнительная сложность из-за различной длины предложений и порядка слов в языках. Статистические модели перевода изначально были основаны на словах (модели 1–5 из IBM Hidden Markov model, разработанные Стефаном Фогелем, и модель 6 от Франца Иосифа Оха), но значительный прогресс был достигнут с внедрением моделей, основанных на фразах. В последующих работах были включены синтаксические или квазисинтаксические структуры.
For a rigorous implementation of this one would have to perform an exhaustive search by going through all strings in the native language. Performing the search efficiently is the work of a machine translation decoder that uses the foreign string, heuristics and other methods to limit the search space and at the same time keeping acceptable quality. This trade off between quality and time usage can also be found in speech recognition. As the translation systems were not able to store all native strings and their translations, a document was typically translated sentence by sentence, but even this was not enough. Language models were typically approximated by smoothed n gram models, and similar approaches have been applied to translation models, but there was additional complexity due to different sentence lengths and word orders in the languages. The statistical translation models were initially word based (Models 1 5 from IBM Hidden Markov model from Stephan Vogel and Model 6 from Franz Joseph Och), but significant advances were made with the introduction of phrase based models. Later work incorporated syntax or quasi syntactic structures.
Недостатки
Создание корпуса может быть дорогостоящим. Конкретные ошибки трудно предсказать и исправить. Результаты могут демонстрировать кажущуюся беглость, скрывающую проблемы перевода. Статистический машинный перевод обычно показывает худшие результаты для языковых пар с существенно различающимся порядком слов. Преимущества, достигнутые при переводе между западноевропейскими языками, не отражают результаты для других языковых пар из-за меньших объемов обучающих корпусов и более значительных грамматических различий.
Перевод на основе фраз
В переводе на основе фраз целью было снижение ограничений, присущих переводу на основе отдельных слов, путем перевода целых последовательностей слов, длина которых может различаться. Эти последовательности слов назывались блоками или фразами, однако, как правило, это были не лингвистические фразы, а фраземы, выявленные статистическими методами на основе корпусов текстов. Было показано, что ограничение переводимых фраз именно лингвистическими фразами (синтаксически мотивированными группами слов, см. синтаксические категории) приводит к снижению качества перевода. Отобранные фразы затем сопоставлялись друг с другом один к одному на основе таблицы перевода фраз и могли быть переупорядочены. Эту таблицу можно было обучить на основе выравнивания слов или непосредственно из параллельного корпуса. Вторая модель обучалась с использованием алгоритма максимизации ожиданий, аналогично модели IBM, основанной на словах. Длинные предложения могли быть разбиты, а короткие – объединены. Существуют даже языки, использующие системы письма без явного обозначения конца предложения (например, тайский). Выравнивание предложений может быть выполнено с помощью алгоритма выравнивания Гейла — Черча. Благодаря этому и другим математическим моделям возможен эффективный поиск и извлечение наиболее оптимального выравнивания предложений.
Выровнение слов
Выравнивание предложений обычно предоставляется корпусом или получается с помощью вышеупомянутого алгоритма выравнивания Гейла — Черча. Однако, для обучения, например, модели перевода, нам необходимо знать, какие слова выравниваются в паре исходного и целевого предложений. Модели IBM или подход на основе скрытых марковских моделей (HMM) были попытками решить эту задачу. Функциональные слова, не имеющие четкого эквивалента в целевом языке, представляли собой еще одну проблему для статистических моделей. Например, при переводе с английского на немецкий, в предложении "John does not live here" слово "does" не имеет очевидного соответствия в переведенном предложении "John wohnt hier nicht". С помощью логических рассуждений оно может быть выровнено со словом "wohnt" (поскольку в английском языке оно содержит грамматическую информацию для глагола "live") или "nicht" (поскольку оно появляется в предложении только из-за отрицания), либо остаться невыровненным.
Статистические аномалии
Примером такой аномалии было то, что фраза "Я поехал на поезде в Берлин" была ошибочно переведена как "Я поехал на поезде в Париж" из-за статистической распространенности сочетания "поезд в Париж" в обучающем наборе данных.
Идиомы
В зависимости от используемых корпусов, идиомы не всегда могли быть переведены "идиоматически". Например, при использовании канадского Hansard в качестве двуязычного корпуса, "hear" (слышать) почти неизменно переводилось как "Bravo!" (Браво!), поскольку в парламенте выражение "Hear, Hear!" (Выражаем одобрение!) соответствует "Bravo!". Эта проблема связана с выравниванием слов, так как в очень специфических контекстах идиоматическое выражение выравнивалось со словами, в результате чего получалось идиоматическое выражение с тем же значением в целевом языке. Однако это случалось редко, поскольку такое выравнивание обычно не работает в других контекстах. По этой причине идиомы можно было подвергать только фразовому выравниванию, поскольку их дальнейшее разложение приводило к потере смысла. Эта проблема была характерна для перевода, основанного на отдельных словах.
Различный порядок слов
В разных языках порядок слов различен. Определенная классификация возможна, исходя из типичного порядка подлежащего (S), сказуемого (V) и дополнения (O) в предложении, и можно говорить, например, о языках SVO или VSO. Существуют также дополнительные различия в порядке слов, например, в расположении определений к существительным или в использовании одних и тех же слов в вопросительной или утвердительной форме. При распознавании речи речевой сигнал и соответствующее текстовое представление могут быть сопоставлены друг с другом последовательно, блоками. Однако это не всегда верно для одного и того же текста на разных языках. В статистическом машинном переводе (SMT) система может обрабатывать лишь небольшие последовательности слов, поэтому разработчику необходимо учитывать порядок слов при проектировании программы. Предпринимались попытки решения этой проблемы с помощью моделей перестановки порядка слов, в которых распределение возможных изменений порядка для каждого элемента перевода оценивается на основе параллельного корпуса текстов. Различные варианты перестановок могут быть оценены с помощью языковой модели, и выбирается наиболее вероятный.