Введение

Eurotra был проектом машинного перевода, учрежденным и финансируемым Европейской комиссией с 1978 по 1992 год.

История

В 1976 году Европейская комиссия начала использовать коммерчески разработанную систему машинного перевода SYSTRAN с планом расширить ее применение на другие языки, помимо изначально поддерживаемых (русский-английский и английский-французский), что, однако, оказалось сложной задачей. Это, а также потенциал существующих систем в европейских исследовательских центрах, привело к решению в 1978 году начать проект Eurotra, первоначально через подготовительную координационную группу Eurotra. Целью проекта было создание системы машинного перевода для официальных языков Европейского сообщества, которыми в то время были датский, нидерландский, немецкий, английский, французский, итальянский, а позднее – греческий, испанский и португальский. Однако со временем ожидания снизились: "Полностью автоматический перевод высокого качества" оказалась недостижимой целью. В конечном итоге, истинная сущность Eurotra была признана как предварительные конкурентные исследования, а не разработка прототипов. Проект был мотивирован одним из основополагающих принципов ЕС: правом всех граждан читать любые документы Комиссии на своем языке. С присоединением новых стран возник взрывной рост числа языковых пар, а необходимость перевода всех документов, речей и протоколов заседаний, производимых ЕС, на остальные восемь языков быстро сделала перевод основной статьей административного бюджета. Для решения этой проблемы и был разработан Eurotra. Проект был необычен тем, что вместо единой исследовательской группы он состоял из групп-членов, распределенных по странам-участницам, организованных по языковому, а не национальному принципу (например, группы в Лёвене и Утрехте тесно сотрудничали), а секретариат располагался в Европейской комиссии в Люксембурге. Архитектура проекта также была нетипичной для проектов машинного перевода. Более ранние системы, такие как SYSTRAN, в значительной степени опирались на словари с ограниченной поддержкой изменения порядка слов. Более современные системы часто использовали вероятностный подход, основанный на параллельных корпусах. Eurotra анализировала структуру текста, сначала проводя синтаксический анализ, затем – анализ зависимостей, а затем – окончательный анализ с использованием третьей грамматики для получения так называемого промежуточного представления (IR). Поскольку все три модуля были реализованы на языке Prolog, теоретически можно было бы пропустить эту структуру в обратном порядке через соответствующие модули для другого языка, чтобы получить переведенный текст на любом из остальных языков. Однако на практике языковые пары реализовывались иначе. Первый "живой" перевод занял 4 Мб памяти на компьютере Microvax под управлением Ultrix и C Prolog в течение одних выходных в начале 1987 года. Предложение, переведенное с английского на датский, звучало как "Япония производит компьютеры". Основной проблемой системы было создание так называемых "парсевых лесов" – часто для любой фразы можно было применить большое количество различных грамматических правил, создавая сотни, а то и тысячи (часто идентичных) парсевых деревьев. Это требовало огромного объема компьютерной памяти и неоправданно замедляло процесс. Хотя Eurotra так и не создала "рабочую" систему машинного перевода, проект оказал значительное долгосрочное влияние на развивающиеся языковые отрасли в странах-членах ЕС, особенно в южных странах – Греции, Италии, Испании и Португалии. Существует как минимум одна коммерческая система машинного перевода (разработанная академическим/коммерческим консорциумом в Дании), основанная на технологии Eurotra.