Кіріспе
Машиналық аударма парадигмасы. Статистикалық машиналық аударма (СМТ) – бұрынғы, ережелерге негізделген тәсілді ығыстырған машиналық аударма тәсілі. Ол әрбір тілдік ереженің нақты сипаттамасын қажет етті, бұл қымбатқа түсті және көбінесе басқа тілдерге қолданылмайтын еді. 2003 жылдан бері статистикалық тәсілдің өзі терең оқуға негізделген нейрондық желі тәсілімен біртіндеп алмастырылуда. Статистикалық машиналық аударманың алғашқы идеяларын 1949 жылы Уоррен Уивер ұсынды, оның ішінде Клод Шеннонның ақпарат теориясын қолдану туралы идеялар да болды. Статистикалық машиналық аударма 1980 жылдардың соңы мен 1990 жылдардың басында IBM-нің Томас Дж. Уотсон зерттеу орталығының ғалымдары тарапынан қайтадан енгізілді.
Statistical machine translation (SMT) was a machine translation approach, that superseded the previous, rule based approach because it required explicit description of each and every linguistic rule, which was costly, and which often did not generalize to other languages. Since 2003, the statistical approach itself has been gradually superseded by the deep learning based neural network approach. The first ideas of statistical machine translation were introduced by Warren Weaver in 1949, including the ideas of applying Claude Shannon's information theory. Statistical machine translation was re introduced in the late 1980s and early 1990s by researchers at IBM's Thomas J. Watson Research Center
Негізгі
Статистикалық машиналық аударма идеясы ақпарат теориясынан туындайды. Құжат, мақсатты тілдегі (мысалы, ағылшын тіліндегі) жолдың бастапқы тілдегі (мысалы, француз тіліндегі) жолдың аудармасы болу ықтималдығына сәйкес аударылады. Осы ықтималдық үлестірілімін модельдеу мәселесіне әртүрлі тәсілдер қолданылды. Компьютерде іске асыруға ыңғайлы тәсілдердің бірі – Бейес теоремасын қолдану, яғни , мұнда аударма моделі – бұл бастапқы тізбектің мақсатты тізбектің аудармасы болу ықтималдығы, ал тіл моделі – мақсатты тілдегі осы тізбекті кездестіру ықтималдығы. Бұл жіктеме тартымды, себебі ол мәселені екі кіші мәселеге бөледі. Ең жақсы аударманы табу үшін ең жоғары ықтималдылықты қамтамасыз ететіні таңдалады: Мұны қатаң түрде іске асыру үшін, ана тіліндегі барлық тізбектерді қарап, толыққанды іздеу жүргізу қажет. Іздеуді тиімді жүзеге асыру – бұл машиналық аударма декодерінің жұмысы, ол шетелдік тізбекті, эвристикалық тәсілдерді және басқа да әдістерді қолданып, іздеу кеңістігін шектейді және қанағаттанарлық сапаны сақтайды. Сапа мен уақытты пайдалану арасындағы бұл шарттылық сөйлеуді тануда да кездеседі. Аударма жүйелері барлық түпнұсқа тізбектерді және олардың аудармаларын сақтай алмағандықтан, құжат әдетте сөйлем бойынша сөйлемге аударылды, бірақ тіпті мұрағат жеткіліксіз болды. Тіл модельдері көбінесе тегістелген n-граммалық модельдермен шамаланған, ал аударма модельдеріне ұқсас тәсілдер қолданылды, бірақ тілдердегі әртүрлі сөйлем ұзындығы мен сөздердің ретіне байланысты қосымша қиындықтар туындады. Статистикалық аударма модельдері бастапқыда сөздерге негізделген (Стефан Фогельдің IBM жасырын Марков модельдері және Франц Йозеф Охтың 6-моделі), бірақ сөз тіркестеріне негізделген модельдерді енгізу арқылы маңызды жетістіктерге қол жеткізілді. Кейінгі жұмыстарда синтаксис немесе квази-синтаксистік құрылымдар да қосылды.
For a rigorous implementation of this one would have to perform an exhaustive search by going through all strings in the native language. Performing the search efficiently is the work of a machine translation decoder that uses the foreign string, heuristics and other methods to limit the search space and at the same time keeping acceptable quality. This trade off between quality and time usage can also be found in speech recognition. As the translation systems were not able to store all native strings and their translations, a document was typically translated sentence by sentence, but even this was not enough. Language models were typically approximated by smoothed n gram models, and similar approaches have been applied to translation models, but there was additional complexity due to different sentence lengths and word orders in the languages. The statistical translation models were initially word based (Models 1 5 from IBM Hidden Markov model from Stephan Vogel and Model 6 from Franz Joseph Och), but significant advances were made with the introduction of phrase based models. Later work incorporated syntax or quasi syntactic structures.
Кемшіліктер
Корпусты құру қымбатқа түсуі мүмкін. Нақты қателерді болжау және түзету қиын. Нәтижелер аударма мәселелерін жасыратын сыртқы жағынан ағылшынды көріне алады. Статистикалық машиналық аударма әдетте сөздердің реті күрт өзгеше тілдер жұбы үшін нашар жұмыс істейді. Батыс Еуропа тілдері арасындағы аудармадан алынған пайдалар кішкентай оқу корпустары мен грамматикалық айырмашылықтардың көп болуына байланысты басқа тілдер жұптары үшін нәтижелерді көрсетпейді.
Сөз тіркесімен аударылған аударма
Фразалық аудармадағы мақсат – әртүрлі ұзындықтағы сөздердің толық тізбектерін аудару арқылы сөздік аударманың шектеулерін азайту болды. Сөздер тізбегі блоктар немесе фразалар деп аталды, бірақ көбінесе олар тілдік фразалар емес, статистикалық әдістермен корпус деректерінен анықталған фраземалар еді. Фраземаларды тілдік фразалармен (синтаксикалық тұрғыдан негізделген сөз топтары, синтаксикалық категорияларға қараңыз) шектеу аударма сапасын нашарлатады. Таңдалған фразалар фразалық аударма кестесіне сүйене отырып, бірін-бірімен сәйкестендіріліп, қайта реттелді. Бұл кесте сөздердің сәйкестігі арқылы немесе тікелей параллель корпус деректерінен оқытылуы мүмкін. Екінші модель, сөздік негіздес IBM моделі сияқты, күтуді максимизациялау алгоритмі арқылы оқытылды. Ұзын сөйлемдер бөліне алады, ал қысқа сөйлемдер біріктіріледі. Кейбір тілдерде тіпті сөйлем соңының нақты белгісі жоқ жазу жүйелері де бар (мысалы, тай тілі). Сөйлемдерді туралау Гейл Черч алгоритмі арқылы жүзеге асырылуы мүмкін. Осы және басқа математикалық модельдердің көмегімен ең жоғары бағаланған сөйлемдерді тиімді іздеу және алуға болады.
Сөздерді сәйкестендіру
Сөйлемдерді сәйкестендіру әдетте деректер жинағы арқылы беріледі немесе жоғарыда аталған Гейл Черч сәйкестендіру алгоритмімен қамтамасыз етіледі. Дегенмен, аударма моделін үйрену үшін, бастапқы тілдегі мақсатты тілдегі сөйлем жұбындағы қай сөздердің сәйкес екенін білу қажет. IBM модельдері немесе HMM тәсілі осы мәселені шешуге жасалған әрекеттер болды. Мақсатты тілде анық эквиваленті жоқ қызметтік сөздер статистикалық модельдер үшін тағы бір қиындық тудырды. Мысалы, ағылшын тілінен неміс тіліне аударғанда, "John does not live here" сөйлемдегі "does" сөзі "John wohnt hier nicht" деген аудармадағы сөйлемде анық сәйкес келе қоймайды. Логикалық тұрғыдан алғанда, ол "wohnt" (өйткені ағылшын тілінде "live" сөзінің грамматикалық ақпаратын қамтиды) немесе "nicht" (тек қана сөйлем теріс пішімде болғандықтан ғана пайда болады) сөздерімен сәйкестендірілуі мүмкін, немесе сәйкессіз болуы мүмкін.
Статистикалық аномалиялар
Мұндай аномалияның мысалы, "Мен пойызбен Берлинге бардым" деген сөйлем, оқу жиынтығында "пойызбен Парижге" фразасының жиі кездесуіне байланысты "Мен пойызбен Парижге бардым" деп қате аударылған.
Идиомалар
Пайдаланылған деректер жиынтығына байланысты, идиомаларды "идиоматикалық" тұрғысынан аудару мүмкін болмады. Мысалы, екі тілді деректер жиынтығы ретінде канадалық Хансардты қолданғанда, "hear" сөзі көбінесе "Bravo!" деп аударылды, себебі Парламентте "Hear, Hear!" сөзі "Bravo!" деп айтылады. Бұл мәселе сөздерді үйлестірумен байланысты, өйткені нақты жағдайларда идиомалық тіркес мақсатты тілде ұқсас мағынаны беретін сөздермен үйлесіп кетті. Дегенмен, мұндай үйлесім әдетте басқа контекстерде жұмыс істемейді. Сондықтан идиомаларды тек фразалық үйлестіруге тартуға болады, оларды мағынасын жоғалтпай одан да бөлу мүмкін емес. Бұл мәселе сөздік аудармаға тән еді.
Сөздердің әртүрлі реті
Тілдерде сөздердің реті әртүрлі болады. Кейбір жіктемелерді сөйлемдегі жатқыш (S), етістік (V) және толықтырғыш (O) элементтерінің әдеттегі ретін анықтау арқылы жасауға болады, мысалы, SVO немесе VSO тілдері туралы айтуға болады. Сөздердің ретіне қатысты қосымша айырмашылықтар да бар, мысалы, есімдерге қатысты анықтауыштардың қайда орналасқаны, немесе бір сөздер сұрақ немесе хабар ретінде қолданылуы. Сөзді тануда сөйлеу сигналы мен оған сәйкес келетін мәтіндік бейнелеу блокты түрде бір-бірімен байланыстырылуы мүмкін. Бірақ бұл әрқашан екі тілдегі бірдей мәтін үшін осылай болмайды. Статистикалық машиналық аударма (SMT) үшін, машиналық аудармашы тек сөздердің шағын тізбектерін ғана басқара алады, сондықтан сөздердің ретін бағдарлама жасаушы ескеруі керек. Мұндай мәселені шешуге жасалған әрекеттердің бірі – қайта реттеу модельдерін қолдану, онда аударманың әрбір бөлігі үшін орналасу өзгерістерінің ықтималдығы сәйкестендірілген екі тілді мәтіннен болжалады. Әртүрлі орналасу өзгерістерін тіл моделінің көмегімен бағалауға болады және ең жақсысы таңдалады.