Введение
Машинный перевод - это подполе вычислительной лингвистики, которое исследует использование программного обеспечения для перевода текста или речи с одного естественного языка на другой. В 1950-х годах машинный перевод стал реальностью в исследованиях, хотя ссылки на этот предмет можно найти еще в 17 веке. Джорджтаунский эксперимент, в котором в 1954 году был успешно переведен более шестидесяти русских предложений на английский язык, был одним из самых ранних зарегистрированных проектов. Исследователи эксперимента в Джорджтауне утверждали, что машинальный перевод будет решен в течение нескольких лет. Вскоре после этого в Советском Союзе были проведены аналогичные эксперименты. Следовательно, успех эксперимента ознаменовал эру значительного финансирования исследований машинного перевода в Соединенных Штатах. Достигнутый прогресс был намного медленнее, чем ожидалось; в 1966 году в докладе ALPAC было установлено, что десять лет исследований не оправдали ожиданий эксперимента в Джорджтауне и привели к резкому сокращению финансирования. Интерес к статистическим моделям машинного перевода рос, которые стали более распространенными и менее дорогими в 1980-х годах, поскольку доступная вычислительная мощность увеличилась. Хотя не существует автономной системы "полностью автоматического высококачественного перевода неограниченного текста", в настоящее время существует множество программ, которые способны обеспечить полезный результат в рамках строгих ограничений. Некоторые из этих программ доступны в Интернете, такие как Google Translate и система SYSTRAN, которая поддерживает BabelFish от AltaVista (которая была заменена переводчиком Microsoft Bing в мае 2012 года).
Начало
Происхождение машинного перевода можно проследить до работы Аль-Кинди, арабского криптографа 9-го века, который разработал методы системного перевода языка, включая криптоанализ, анализ частоты, вероятности и статистику, которые используются в современном машинном переводе. Идея машинного перевода появилась позже, в 17 веке. В 1629 году Рене Декарт предложил универсальный язык, с эквивалентными идеями в разных языках, разделяющих один символ. В середине 1930-х годов первые патенты на "переводческие машины" были поданы Жоржем Артсруни для автоматического двуязычного словаря с использованием бумажной ленты. Русский Питер Троянский представил более подробное предложение, которое включало в себя как двуязычный словарь, так и метод решения грамматических задач между языками, основанный на грамматической системе эсперанто. Эта система была разделена на три этапа: первый этап состоял из редактора на исходном языке, чтобы организовать слова в их логические формы и выполнять синтаксические функции; второй этап требовал, чтобы машина "переводила" эти формы на целевой язык; и третий этап требовал редактора на целевом языке, чтобы нормализовать этот выход. Предложение Троянского оставалось неизвестным до конца 1950-х годов, к тому времени компьютеры были хорошо известны и использовались.
Ранние годы
Первый набор предложений по компьютерному машинному переводу был представлен в 1949 году Уорреном Уивером, исследователем из Фонда Рокфеллера, "Переводный меморандум". Эти предложения были основаны на теории информации, успехах в взломе кода во время Второй мировой войны и теориях об универсальных принципах, лежащих в основе естественного языка. Через несколько лет после того, как Уивер представил свои предложения, во многих университетах Соединенных Штатов начались серьезные исследования. 7 января 1954 года в штаб-квартире IBM в Нью-Йорке состоялся эксперимент Джорджтаун-IBM. Это была первая публичная демонстрация системы машинного перевода. Демонстрация была широко освещена в газетах и вызвала интерес общественности. Однако сама система была не более чем "игрушкой". В нем было всего 250 слов и 49 тщательно отобранных русских предложений, переведенных на английский язык, в основном в области химии. Тем не менее, это поддержало идею о том, что машинный перевод неизбежен, и стимулировало финансирование исследований не только в США, но и во всем мире. В то время как исследования в 1960-х годах были сосредоточены на ограниченных языковых парах и входах, в 1970-х годах спрос был на недорогие системы, которые могли бы переводить ряд технических и коммерческих документов. Этот спрос был вызван ростом глобализации и спросом на переводы в Канаде, Европе и Японии.
1980-е и начало 1990-х годов
К 1980-м годам увеличилось как разнообразие, так и количество установленных систем машинного перевода. В то время использовался ряд систем, основанных на мейнфрейме, таких как SYSTRAN, Logos, Ariane G5 и Metal. В результате расширения доступности микрокомпьютеров появился рынок систем машинного перевода низкого уровня. Многие компании воспользовались этим в Европе, Японии и США. Системы также были выведены на рынок в Китае, Восточной Европе, Корее и Советском Союзе. В 1980-х годах в ТТ была большая активность, особенно в Японии. С компьютером пятого поколения Япония намеревалась превзойти конкурентов в области компьютерного оборудования и программного обеспечения, и один из проектов, в котором участвовали многие крупные японские электронные фирмы, заключался в создании программного обеспечения для перевода на английский и с английского языка (Fujitsu, Toshiba, NTT, Brother, Catena, Matsushita, Mitsubishi, Sharp, Sanyo, Hitachi, NEC, Panasonic, Kodensha, Nova, Oki). Исследования в 1980-х годах, как правило, опирались на перевод через некоторое разнообразие промежуточных лингвистических представлений, включая морфологический, синтаксический и семантический анализ. В конце 1980-х годов произошел большой всплеск в ряде новых методов машинного перевода. Одна система была разработана в IBM, которая была основана на статистических методах. Макото Нагао и его группа использовали методы, основанные на большом количестве примеров перевода, метод, который теперь называется машинным переводом на основе примеров. Определяющей особенностью обоих этих подходов было пренебрежение синтаксическими и семантическими правилами и полагаться вместо этого на манипулирование большими текстовыми корпусами. В 1990-х годах, воодушевленные успехами в области распознавания речи и синтеза речи, исследования в области перевода речи начались с разработки немецкого проекта Verbmobil. Система FALCon (Foreign Area Language Converter), технология машинного перевода, разработанная Армейской исследовательской лабораторией, была использована в 1997 году для перевода документов для солдат в Боснии. В результате появления недорогих и более мощных компьютеров значительно возросло использование машинного перевода. Именно в начале 1990-х годов машинный перевод начал переходить от больших мейнфреймов к персональным компьютерам и рабочим станциям. Две компании, которые некоторое время возглавляли рынок ПК, были Globalink и MicroTac, после чего было установлено, что слияние двух компаний (в декабре 1994 года) отвечает корпоративным интересам обеих компаний. В это же время Intergraph и Systran также начали предлагать версии для ПК. Сайты также стали доступны в Интернете, такие как Babel Fish от AltaVista (с использованием технологии Systran) и Google Language Tools (также изначально используя исключительно технологию Systran).
2000-е годы
В области машинного перевода в 2000-х годах произошли значительные изменения. Большое количество исследований было проведено в области статистического машинного перевода и машинного перевода на основе примеров. В области перевода речи исследования были сосредоточены на переходе от систем с ограниченным доменом к системам перевода без домена. В рамках различных исследовательских проектов в Европе (например, TC STAR) и США (STR DUST и DARPA Global автономная программа использования языков) были разработаны решения для автоматического перевода парламентских выступлений и новостей. В этих сценариях сфера содержания больше не ограничивалась какой-либо особой областью, а речь, которую нужно было перевести, охватывала различные темы. Французско-немецкий проект Quaero исследовал возможность использования машинных переводов для многоязычного интернета. Проект стремился перевести не только веб-страницы, но и видео и аудио файлы в Интернете.
2010-е годы
В последнее десятилетие методы нейронного машинного перевода (НМТ) заменили статистический машинный перевод. Термин "нейронный машинный перевод" был придуман Бахданау и др. и Суцкевером и др., которые также опубликовали первое исследование по этой теме в 2014 году. Нейронным сетям нужна лишь часть памяти, необходимой для статистических моделей, и целые предложения могут быть смоделированы интегрированным образом. Первый крупномасштабный NMT был запущен Baidu в 2015 году, а затем Google Neural Machine Translation (GNMT) в 2016 году. За этим последовали другие службы перевода, такие как DeepL Translator, и внедрение технологии NMT в старых услугах перевода, таких как Microsoft Translator. Нейронные сети используют единую архитектуру нейронной сети от конца до конца, известную как последовательность к последовательности (seq2seq), которая использует две повторяющиеся нейронные сети (RNN). Кодирующий RNN и декодер RNN. Кодирующий RNN использует кодирующие векторы на исходном предложении, а декодер RNN генерирует целевое предложение на основе предыдущего кодирующего вектора. Дальнейшие достижения в области технологий обращения внимания, трансформации и обратного распространения сделали НМТ гибкими и принятыми в большинстве машинных переводов, резюме и технологиях чат-ботов.