Введение
Eurotra был проектом машинного перевода, учрежденным и финансируемым Европейской комиссией с 1978 по 1992 год.
История
В 1976 году Европейская комиссия начала использовать коммерчески разработанную систему машинного перевода SYSTRAN с планом расширить ее применение на другие языки, помимо изначально поддерживаемых (русский-английский и английский-французский), что, однако, оказалось сложной задачей. Это, а также потенциал существующих систем в европейских исследовательских центрах, привело к решению в 1978 году начать проект Eurotra, первоначально через подготовительную координационную группу Eurotra. Целью проекта было создание системы машинного перевода для официальных языков Европейского сообщества, которыми в то время были датский, нидерландский, немецкий, английский, французский, итальянский, а позднее – греческий, испанский и португальский. Однако со временем ожидания снизились: "Полностью автоматический перевод высокого качества" оказалась недостижимой целью. В конечном итоге, истинная сущность Eurotra была признана как предварительные конкурентные исследования, а не разработка прототипов. Проект был мотивирован одним из основополагающих принципов ЕС: правом всех граждан читать любые документы Комиссии на своем языке. С присоединением новых стран возник взрывной рост числа языковых пар, а необходимость перевода всех документов, речей и протоколов заседаний, производимых ЕС, на остальные восемь языков быстро сделала перевод основной статьей административного бюджета. Для решения этой проблемы и был разработан Eurotra. Проект был необычен тем, что вместо единой исследовательской группы он состоял из групп-членов, распределенных по странам-участницам, организованных по языковому, а не национальному принципу (например, группы в Лёвене и Утрехте тесно сотрудничали), а секретариат располагался в Европейской комиссии в Люксембурге. Архитектура проекта также была нетипичной для проектов машинного перевода. Более ранние системы, такие как SYSTRAN, в значительной степени опирались на словари с ограниченной поддержкой изменения порядка слов. Более современные системы часто использовали вероятностный подход, основанный на параллельных корпусах. Eurotra анализировала структуру текста, сначала проводя синтаксический анализ, затем – анализ зависимостей, а затем – окончательный анализ с использованием третьей грамматики для получения так называемого промежуточного представления (IR). Поскольку все три модуля были реализованы на языке Prolog, теоретически можно было бы пропустить эту структуру в обратном порядке через соответствующие модули для другого языка, чтобы получить переведенный текст на любом из остальных языков. Однако на практике языковые пары реализовывались иначе. Первый "живой" перевод занял 4 Мб памяти на компьютере Microvax под управлением Ultrix и C Prolog в течение одних выходных в начале 1987 года. Предложение, переведенное с английского на датский, звучало как "Япония производит компьютеры". Основной проблемой системы было создание так называемых "парсевых лесов" – часто для любой фразы можно было применить большое количество различных грамматических правил, создавая сотни, а то и тысячи (часто идентичных) парсевых деревьев. Это требовало огромного объема компьютерной памяти и неоправданно замедляло процесс. Хотя Eurotra так и не создала "рабочую" систему машинного перевода, проект оказал значительное долгосрочное влияние на развивающиеся языковые отрасли в странах-членах ЕС, особенно в южных странах – Греции, Италии, Испании и Португалии. Существует как минимум одна коммерческая система машинного перевода (разработанная академическим/коммерческим консорциумом в Дании), основанная на технологии Eurotra.
The goal of the project as to create machine translation system for the official languages of the European Community, which at the time were Danish, Dutch, German, English, French, Italian, later including Greek, Spanish and Portuguese. However, as time passed, expectations became tempered; "Fully Automatic High Quality Translation" was not a reasonably attainable goal. The true character of Eurotra was eventually acknowledged to be in fact pre competitive research rather than prototype development. The project was motivated by one of the founding principles of the EU: that all citizens had the right to read any and all proceedings of the Commission in their own language. As more countries joined, this produced a combinatorial explosion in the number of language pairs involved, and the need to translate every paper, speech and even set of meeting minutes produced by the EU into the other eight languages meant that translation rapidly became the overwhelming component in the administrative budget. To solve this problem Eurotra was devised. The project was unusual in that rather than consisting of a single research team, it had member groups distributed around the member countries, organised along language rather than national lines (for example, groups in Leuven and Utrecht worked closely together), and the secretariat was based at the European Commission in Luxembourg. The actual design of the project was unusual as MT projects go. Older systems, such as SYSTRAN, were heavily dictionary based, with minor support for rearranging word order. More recent systems have often worked on a probabilistic approach, based on parallel corpora. Eurotra addressed the constituent structure of the text to be translated, going through first a syntactic parse followed by a second parse to produce a dependency structure followed by a final parse with a third grammar to produce what was referred to internally as Intermediate Representation (IR). Since all three modules were implemented as Prolog programs, it would then in principle be possible to put this structure backwards through the corresponding modules for another language to produce a translated text in any of the other languages. However, in practice this was not in fact how language pairs were implemented. The first "live" translation occupied a 4Mb Microvax running Ultrix and C Prolog for a complete weekend some time in early 1987. The sentence, translated from English into Danish, was "Japan makes computers". The main problem faced by the system was the generation of so called "Parse Forests" often a large number of different grammar rules could be applied to any particular phrase, producing hundreds, even thousands of (often identical) parse trees. This used up huge quantities of computer store, slowing the whole process down unnecessarily. While Eurotra never delivered a "working" MT system, the project made a far reaching long term impact on the nascent language industries in European member states, in particular among the southern countries of Greece, Italy, Spain, and Portugal. There is at least one commercial MT system (developed by an academic/commercial consortium in Denmark) derived from Eurotra technology.