Кіріспе
Eurotra – 1978-1992 жылдар аралығында Еуропалық Комиссия құрған және қаржылаған машиналық аударма жобасы.
Тарих
1976 жылы Еуропалық Комиссия коммерциялық түрде дамытылған машиналық аударма жүйесі SYSTRAN-ды бастапқыда әзірленген тілдерден (орысша-ағылшын және ағылшынша-француз) өзге тілдерге де жұмыс істеуі үшін пайдалануды жоспарлады, бірақ бұл қиынға соқты. Осы және еуропалық зерттеу орталығының қолданыстағы жүйелеріндегі мүмкіндіктер 1978 жылы Eurotra жобасын бастау туралы шешім қабылдауға алып келді, бастапқыда Eurotra дайындық тобы арқылы. Төрт жылдан кейін Еуропалық Комиссия мен үйлестіру тобы Еуропалық Парламенттің мақұлдауын алды. Жобаның мақсаты – Еуропалық қауымдастықтың ресми тілдері үшін машиналық аударма жүйесін құру болды, сол кездегі тілдер: дат тілі, голланд тілі, неміс тілі, ағылшын тілі, француз тілі, итальян тілі, кейін грек, испан және португал тілдері қосылды. Алайда, уақыт өте келе, үміттер азайды; «Толық автоматты жоғары сапалы аударма» мақсатына жетудің қиын екені анық болды. Eurotra-ның нақты міндеті прототиптерді әзірлеуден гөрі, бәсекеге дайын зерттеулер жүргізу екені мойындалды. Жобаның негізгі себебі – барлық азаматтардың Комиссияның барлық құжаттарын өз тілінде оқуға құқығы бар деген ЕО құрылтайшы қағидаларының бірі болды. Елдер саны арта келе, тілдер жұбының саны экспоненциалды түрде өсті, ал ЕО шығарған барлық құжаттарды, сөздерді және тіпті отырыс хаттамаларын басқа сегіз тілге аудару қажеттігі аударма шығындарының әкімшілік бюджетте үлкен үлес құрауына әкелді. Осы мәселені шешу үшін Eurotra жобасы жасалды. Жобаның ерекшелігі – оған бір ғана зерттеу тобы емес, мүше елдерде орналасқан топтар кірді, олар ұлттық емес, тілдік принцип бойынша ұйымдастырылды (мысалы, Лёвен мен Утрехт топтары тығыз байланыста жұмыс істеді), ал хатшылық Люксембургтегі Еуропалық Комиссияда орналасқан. Жобаның дизайны басқа машиналық аударма жобаларынан ерекшеленді. SYSTRAN сияқты бұрынғы жүйелер негізінен сөздіктерге негізделген, ал сөздердің ретін өзгертуге шектеулі қолдау көрсетілді. Жаңа жүйелер көбінесе параллель корпусқа негізделген ықтималдық тәсілдерді қолданды. Eurotra аудармаға түсетін мәтіннің құрылымдық ерекшеліктерін қарастырды, алдымен синтаксистік талдаудан өтіп, содан кейін тәуелділік құрылымын анықтау үшін екінші талдау жасалды, содан кейін үшінші грамматиканы қолдана отырып, соңғы талдау жасалды, нәтижесінде «аралық өрнек» (IR) деп аталатын нәрсе пайда болды. Барлық үш модуль Prolog бағдарламалары түрінде іске асырылғандықтан, теориялық тұрғыдан бұл құрылымды басқа тілдің сәйкес модульдері арқылы кері өңдеуге болып, басқа тілдердің кез келгеніне аударма жасауға болады. Алайда, іс жүзінде тілдер жұбы осылай іске асырылмады. Алғашқы «тірі» аударма 1987 жылдың басында Ultrix және C Prolog жүйесінде 4 Мб Microvax компьютерінде бір апта бойы жұмыс істеді. Ағылшын тілінен дат тіліне аударылған сөйлем: «Жапония компьютерлер шығарады». Жүйенің басты мәселесі «талдау ормандарының» пайда болуы болды, себебі кез келген сөз тіркесіне көптеген грамматикалық ережелер қолданылуы мүмкін еді, нәтижесінде жүздеген, тіпті мыңдаған (көбінесе бірдей) талдау ағаштары пайда болды. Бұл компьютерлік жадтың үлкен көлемін пайдаланып, процестің жылдамдығын қажетсіз баяулатты. Eurotra ешқашан «жұмыс істейтін» машиналық аударма жүйесін ұсынбаса да, жоба Еуропалық мүше мемлекеттердегі, әсіресе Грекия, Италия, Испания және Португалияның оңтүстік елдеріндегі жаңа тілдік индустрияға ұзақ мерзімді әсер етті. Eurotra технологиясының негізінде жасалған кем дегенде бір коммерциялық машиналық аударма жүйесі бар (Даниядағы академиялық/коммерциялық консорциум әзірлеген).
The goal of the project as to create machine translation system for the official languages of the European Community, which at the time were Danish, Dutch, German, English, French, Italian, later including Greek, Spanish and Portuguese. However, as time passed, expectations became tempered; "Fully Automatic High Quality Translation" was not a reasonably attainable goal. The true character of Eurotra was eventually acknowledged to be in fact pre competitive research rather than prototype development. The project was motivated by one of the founding principles of the EU: that all citizens had the right to read any and all proceedings of the Commission in their own language. As more countries joined, this produced a combinatorial explosion in the number of language pairs involved, and the need to translate every paper, speech and even set of meeting minutes produced by the EU into the other eight languages meant that translation rapidly became the overwhelming component in the administrative budget. To solve this problem Eurotra was devised. The project was unusual in that rather than consisting of a single research team, it had member groups distributed around the member countries, organised along language rather than national lines (for example, groups in Leuven and Utrecht worked closely together), and the secretariat was based at the European Commission in Luxembourg. The actual design of the project was unusual as MT projects go. Older systems, such as SYSTRAN, were heavily dictionary based, with minor support for rearranging word order. More recent systems have often worked on a probabilistic approach, based on parallel corpora. Eurotra addressed the constituent structure of the text to be translated, going through first a syntactic parse followed by a second parse to produce a dependency structure followed by a final parse with a third grammar to produce what was referred to internally as Intermediate Representation (IR). Since all three modules were implemented as Prolog programs, it would then in principle be possible to put this structure backwards through the corresponding modules for another language to produce a translated text in any of the other languages. However, in practice this was not in fact how language pairs were implemented. The first "live" translation occupied a 4Mb Microvax running Ultrix and C Prolog for a complete weekend some time in early 1987. The sentence, translated from English into Danish, was "Japan makes computers". The main problem faced by the system was the generation of so called "Parse Forests" often a large number of different grammar rules could be applied to any particular phrase, producing hundreds, even thousands of (often identical) parse trees. This used up huge quantities of computer store, slowing the whole process down unnecessarily. While Eurotra never delivered a "working" MT system, the project made a far reaching long term impact on the nascent language industries in European member states, in particular among the southern countries of Greece, Italy, Spain, and Portugal. There is at least one commercial MT system (developed by an academic/commercial consortium in Denmark) derived from Eurotra technology.