Кіріспе

Машиналық аударма парадигмасы. Статистикалық машиналық аударма (СМТ) – бұрынғы, ережелерге негізделген тәсілді ығыстырған машиналық аударма тәсілі. Ол әрбір тілдік ереженің нақты сипаттамасын қажет етті, бұл қымбатқа түсті және көбінесе басқа тілдерге қолданылмайтын еді. 2003 жылдан бері статистикалық тәсілдің өзі терең оқуға негізделген нейрондық желі тәсілімен біртіндеп алмастырылуда. Статистикалық машиналық аударманың алғашқы идеяларын 1949 жылы Уоррен Уивер ұсынды, оның ішінде Клод Шеннонның ақпарат теориясын қолдану туралы идеялар да болды. Статистикалық машиналық аударма 1980 жылдардың соңы мен 1990 жылдардың басында IBM-нің Томас Дж. Уотсон зерттеу орталығының ғалымдары тарапынан қайтадан енгізілді.

Негізгі

Статистикалық машиналық аударма идеясы ақпарат теориясынан туындайды. Құжат, мақсатты тілдегі (мысалы, ағылшын тіліндегі) жолдың бастапқы тілдегі (мысалы, француз тіліндегі) жолдың аудармасы болу ықтималдығына сәйкес аударылады. Осы ықтималдық үлестірілімін модельдеу мәселесіне әртүрлі тәсілдер қолданылды. Компьютерде іске асыруға ыңғайлы тәсілдердің бірі – Бейес теоремасын қолдану, яғни , мұнда аударма моделі – бұл бастапқы тізбектің мақсатты тізбектің аудармасы болу ықтималдығы, ал тіл моделі – мақсатты тілдегі осы тізбекті кездестіру ықтималдығы. Бұл жіктеме тартымды, себебі ол мәселені екі кіші мәселеге бөледі. Ең жақсы аударманы табу үшін ең жоғары ықтималдылықты қамтамасыз ететіні таңдалады: Мұны қатаң түрде іске асыру үшін, ана тіліндегі барлық тізбектерді қарап, толыққанды іздеу жүргізу қажет. Іздеуді тиімді жүзеге асыру – бұл машиналық аударма декодерінің жұмысы, ол шетелдік тізбекті, эвристикалық тәсілдерді және басқа да әдістерді қолданып, іздеу кеңістігін шектейді және қанағаттанарлық сапаны сақтайды. Сапа мен уақытты пайдалану арасындағы бұл шарттылық сөйлеуді тануда да кездеседі. Аударма жүйелері барлық түпнұсқа тізбектерді және олардың аудармаларын сақтай алмағандықтан, құжат әдетте сөйлем бойынша сөйлемге аударылды, бірақ тіпті мұрағат жеткіліксіз болды. Тіл модельдері көбінесе тегістелген n-граммалық модельдермен шамаланған, ал аударма модельдеріне ұқсас тәсілдер қолданылды, бірақ тілдердегі әртүрлі сөйлем ұзындығы мен сөздердің ретіне байланысты қосымша қиындықтар туындады. Статистикалық аударма модельдері бастапқыда сөздерге негізделген (Стефан Фогельдің IBM жасырын Марков модельдері және Франц Йозеф Охтың 6-моделі), бірақ сөз тіркестеріне негізделген модельдерді енгізу арқылы маңызды жетістіктерге қол жеткізілді. Кейінгі жұмыстарда синтаксис немесе квази-синтаксистік құрылымдар да қосылды.

Кемшіліктер

Корпусты құру қымбатқа түсуі мүмкін. Нақты қателерді болжау және түзету қиын. Нәтижелер аударма мәселелерін жасыратын сыртқы жағынан ағылшынды көріне алады. Статистикалық машиналық аударма әдетте сөздердің реті күрт өзгеше тілдер жұбы үшін нашар жұмыс істейді. Батыс Еуропа тілдері арасындағы аудармадан алынған пайдалар кішкентай оқу корпустары мен грамматикалық айырмашылықтардың көп болуына байланысты басқа тілдер жұптары үшін нәтижелерді көрсетпейді.

Сөз тіркесімен аударылған аударма

Фразалық аудармадағы мақсат – әртүрлі ұзындықтағы сөздердің толық тізбектерін аудару арқылы сөздік аударманың шектеулерін азайту болды. Сөздер тізбегі блоктар немесе фразалар деп аталды, бірақ көбінесе олар тілдік фразалар емес, статистикалық әдістермен корпус деректерінен анықталған фраземалар еді. Фраземаларды тілдік фразалармен (синтаксикалық тұрғыдан негізделген сөз топтары, синтаксикалық категорияларға қараңыз) шектеу аударма сапасын нашарлатады. Таңдалған фразалар фразалық аударма кестесіне сүйене отырып, бірін-бірімен сәйкестендіріліп, қайта реттелді. Бұл кесте сөздердің сәйкестігі арқылы немесе тікелей параллель корпус деректерінен оқытылуы мүмкін. Екінші модель, сөздік негіздес IBM моделі сияқты, күтуді максимизациялау алгоритмі арқылы оқытылды. Ұзын сөйлемдер бөліне алады, ал қысқа сөйлемдер біріктіріледі. Кейбір тілдерде тіпті сөйлем соңының нақты белгісі жоқ жазу жүйелері де бар (мысалы, тай тілі). Сөйлемдерді туралау Гейл Черч алгоритмі арқылы жүзеге асырылуы мүмкін. Осы және басқа математикалық модельдердің көмегімен ең жоғары бағаланған сөйлемдерді тиімді іздеу және алуға болады.

Сөздерді сәйкестендіру

Сөйлемдерді сәйкестендіру әдетте деректер жинағы арқылы беріледі немесе жоғарыда аталған Гейл Черч сәйкестендіру алгоритмімен қамтамасыз етіледі. Дегенмен, аударма моделін үйрену үшін, бастапқы тілдегі мақсатты тілдегі сөйлем жұбындағы қай сөздердің сәйкес екенін білу қажет. IBM модельдері немесе HMM тәсілі осы мәселені шешуге жасалған әрекеттер болды. Мақсатты тілде анық эквиваленті жоқ қызметтік сөздер статистикалық модельдер үшін тағы бір қиындық тудырды. Мысалы, ағылшын тілінен неміс тіліне аударғанда, "John does not live here" сөйлемдегі "does" сөзі "John wohnt hier nicht" деген аудармадағы сөйлемде анық сәйкес келе қоймайды. Логикалық тұрғыдан алғанда, ол "wohnt" (өйткені ағылшын тілінде "live" сөзінің грамматикалық ақпаратын қамтиды) немесе "nicht" (тек қана сөйлем теріс пішімде болғандықтан ғана пайда болады) сөздерімен сәйкестендірілуі мүмкін, немесе сәйкессіз болуы мүмкін.

Статистикалық аномалиялар

Мұндай аномалияның мысалы, "Мен пойызбен Берлинге бардым" деген сөйлем, оқу жиынтығында "пойызбен Парижге" фразасының жиі кездесуіне байланысты "Мен пойызбен Парижге бардым" деп қате аударылған.

Идиомалар

Пайдаланылған деректер жиынтығына байланысты, идиомаларды "идиоматикалық" тұрғысынан аудару мүмкін болмады. Мысалы, екі тілді деректер жиынтығы ретінде канадалық Хансардты қолданғанда, "hear" сөзі көбінесе "Bravo!" деп аударылды, себебі Парламентте "Hear, Hear!" сөзі "Bravo!" деп айтылады. Бұл мәселе сөздерді үйлестірумен байланысты, өйткені нақты жағдайларда идиомалық тіркес мақсатты тілде ұқсас мағынаны беретін сөздермен үйлесіп кетті. Дегенмен, мұндай үйлесім әдетте басқа контекстерде жұмыс істемейді. Сондықтан идиомаларды тек фразалық үйлестіруге тартуға болады, оларды мағынасын жоғалтпай одан да бөлу мүмкін емес. Бұл мәселе сөздік аудармаға тән еді.

Сөздердің әртүрлі реті

Тілдерде сөздердің реті әртүрлі болады. Кейбір жіктемелерді сөйлемдегі жатқыш (S), етістік (V) және толықтырғыш (O) элементтерінің әдеттегі ретін анықтау арқылы жасауға болады, мысалы, SVO немесе VSO тілдері туралы айтуға болады. Сөздердің ретіне қатысты қосымша айырмашылықтар да бар, мысалы, есімдерге қатысты анықтауыштардың қайда орналасқаны, немесе бір сөздер сұрақ немесе хабар ретінде қолданылуы. Сөзді тануда сөйлеу сигналы мен оған сәйкес келетін мәтіндік бейнелеу блокты түрде бір-бірімен байланыстырылуы мүмкін. Бірақ бұл әрқашан екі тілдегі бірдей мәтін үшін осылай болмайды. Статистикалық машиналық аударма (SMT) үшін, машиналық аудармашы тек сөздердің шағын тізбектерін ғана басқара алады, сондықтан сөздердің ретін бағдарлама жасаушы ескеруі керек. Мұндай мәселені шешуге жасалған әрекеттердің бірі – қайта реттеу модельдерін қолдану, онда аударманың әрбір бөлігі үшін орналасу өзгерістерінің ықтималдығы сәйкестендірілген екі тілді мәтіннен болжалады. Әртүрлі орналасу өзгерістерін тіл моделінің көмегімен бағалауға болады және ең жақсысы таңдалады.