Кіріспе

Машиналық аударма - мәтінді немесе сөйлеуді бір табиғи тілден екіншісіне аудару үшін бағдарламалық жасақтаманы қолдануды зерттейтін есептеу лингвистикасының кіші саласы. 1950 жылдары машиналық аударма зерттеулерде нақты нәрсеге айналды, дегенмен бұл тақырыпқа сілтемелер 17 ғасырдың басында кездеседі. 1954 жылы алтымыстан астам орыс сөйлемдерін ағылшын тіліне толық автоматты түрде аударуды қамтитын Джорджтаун эксперименті ең алғашқы жобалардың бірі болды. Джорджтаун экспериментіне қатысқан зерттеушілер машиналық аударма мәселесі бірнеше жылдың ішінде шешіледі деген сенімде. Көп ұзамай Совет Одағында да осыған ұқсас тәжірибелер жүргізілді. Нәтижесінде, эксперименттің сәттілігі Америка Құрама Штаттарында машиналық аударма зерттеулеріне елеулі қаржы бөлу дәуірін бастады. Жетілген прогресс күтілгеннен әлдеқайда баяу болды; 1966 жылы ALPAC баяндамасы он жылдық зерттеу Джорджтаун эксперименті күткенді орындамағандығын және қаржыландырудың күрт азаюына әкелгенін анықтады. 1980 жылдары қол жетімді есептеу қуатының артуымен машиналық аударма үшін статистикалық модельдерге қызығушылық артып, олар кең таралған және арзан болды. "Текстті шектеусіз толық автоматты түрде жоғары сапалы аударма" автономды жүйесі болмаса да, қатаң шектеулер шеңберінде пайдалы нәтижелер беру мүмкіндігі бар көптеген бағдарламалар қазір бар. Бұл бағдарламалардың бірнешеуі онлайн режимінде қол жетімді, мысалы Google Translate және AltaVista-ның BabelFish-ін (ол 2012 жылдың мамырында Microsoft Bing аудармашысымен ауыстырылды) қамтамасыз ететін SYSTRAN жүйесі.

Бастауы

Машиналық аударманың басталуы 9-ғасырдағы араб криптографы Аль Киндидің еңбегіне байланысты болуы мүмкін, ол жүйелі тіл аудармасының әдістерін, соның ішінде криптоанализ, жиілікті талдау, ықтималдық және статистиканы дамытты, олар қазіргі заманғы машиналық аудармада қолданылады. Машиналық аударма идеясы 17 ғасырда пайда болды. 1629 жылы Рене Декарт әртүрлі тілдерде бірдей идеялар бір белгімен бөлісетін әмбебап тілді ұсынды. 1930 жылдардың ортасында "аударма машиналарына" алғашқы патенттерді Жорж Арцруни қағаз таспасын пайдаланатын автоматты екі тілді сөздік үшін қолданды. Орыс Пётр Троянский екі тілді сөздік пен эсперантоның грамматикалық жүйесіне негізделген тілдер арасындағы грамматикалық рөлдерді шешу әдісін қамтитын егжей-тегжейлі ұсынысты ұсынды. Бұл жүйе үш кезеңге бөлінді: бірінші кезеңге сөздерді логикалық формаларына реттеу және синтаксистік функцияларды жүзеге асыру үшін бастапқы тілдегі ана тілімен сөйлейтін редактор кірді; екінші кезеңге машина осы формаларды мақсатты тілге "аудармалауды" қажет етті; үшінші кезеңге мақсатты тілдегі ана тілімен сөйлейтін редактор осы шығысты қалыпқа келтірді. Троянскийдің ұсынысы 1950 жылдардың аяғына дейін белгісіз болды, сол кезде компьютерлер жақсы танымал болды және пайдаланылды.

Алғашқы жылдары

Компьютерлік машиналық аударма үшін ұсыныстардың алғашқы топтамасын 1949 жылы Рокфеллер қорының зерттеушісі Уоррен Уивер ұсынды, "Аударма меморандумы". Бұл ұсыныстар ақпараттық теорияға, Екінші дүниежүзілік соғыс кезінде кодтарды бұзудағы табыстарға және табиғи тілдің негізі болып табылатын әмбебап принциптер туралы теорияларға негізделген. Уивер өз ұсыныстарын ұсынғаннан кейін бірнеше жылдан кейін АҚШ-тың көптеген университеттерінде зерттеулер басталды. 1954 жылдың 7 қаңтарында Нью-Йоркте IBM бас кеңсесінде Джорджтаун IBM эксперименті өтті. Бұл машиналық аударма жүйесін алғаш рет көпшілік алдында көрсету болды. Бұл демонстрация туралы газеттерде кеңінен жарияланып, көпшілік қызығушылық танытты. Алайда, жүйенің өзі "ойыншық" жүйе ғана болды. Ол тек 250 сөзден тұратын және 49 ресейлік сөйлемді ағылшын тіліне мұқият аударған, негізінен химия саласында. Дегенмен, бұл машиналық аударманың жақын арада болатыны туралы ойды көтермеледі және АҚШ-та ғана емес, бүкіл әлемде зерттеулерді қаржыландыруды ынталандырды. 1960 жылдары жүргізілген зерттеулер шектеулі тіл жұптары мен кіріске бағытталған болса, 1970 жылдары сұраныс техникалық және коммерциялық құжаттардың аудармаларын жасай алатын арзан жүйелерге қатысты болды. Бұл сұранысқа жаһанданудың өсуі және Канада, Еуропа және Жапонияда аударма сұранысының артуы себеп болды.

1980 жылдар мен 1990 жылдардың басында

1980 жылдары автоматты аударма үшін орнатылған жүйелердің саны да, әртүрлілігі де өсті. SYSTRAN, Logos, Ariane G5 және Metal сияқты мейнфрейм технологиясына негізделген бірқатар жүйелер қолданылды. Микрокомпьютерлердің қол жетімділігінің жақсаруы нәтижесінде төменгі деңгейдегі машиналық аударма жүйелері нарығы пайда болды. Көптеген компаниялар Еуропа, Жапония және АҚШ-та осы мүмкіндікті пайдаланды. Сонымен қатар, Қытай, Шығыс Еуропа, Корея және Кеңес Одағында да жүйелер нарыққа шығарылды. 1980 жылдары ТМ-де әсіресе Жапонияда көп іс-әрекет болды. Бесінші буын компьютерімен Жапония компьютерлік аппараттық және бағдарламалық қамтамасыз етудегі бәсекелестерінен асып түсуді көздеді, ал көптеген ірі жапондық электроника фирмаларының қатысуымен ағылшын тіліне және ағылшын тіліне аудару бағдарламалық қамтамасыз етуін жасау болды (Fujitsu, Toshiba, NTT, Brother, Catena, Matsushita, Mitsubishi, Sharp, Sanyo, Hitachi, NEC, Panasonic, Kodensha, Nova, Oki). 1980 жылдардағы зерттеулер әдетте морфологиялық, синтаксистік және семантикалық талдауды қамтитын аралық тілдік бейнелеудің кейбір түрлері арқылы аудармаға сүйенді. 1980 жылдардың соңында машиналық аударма үшін бірқатар жаңа әдістердің пайда болуы болды. IBM-де статистикалық әдістерге негізделген бір жүйе жасалды. Макото Нагао мен оның тобы көптеген аударма үлгілеріне негізделген әдістерді қолданды, бұл әдіс қазір үлгіге негізделген машиналық аударма деп аталады. Бұл екі тәсілдің де ерекшелігі синтаксистік және семантикалық ережелерді елемеу және үлкен мәтіндік корпустарды манипуляциялауға сүйену болды. 1990 жылдары сөйлеуді тану мен сөйлеу синтезі саласындағы жетістіктерден жігер алған сөйлеуді аудару бойынша зерттеулер неміс Verbmobil жобасын әзірлеу арқылы басталды. Forward Area Language Converter (FALCon) жүйесі - Армияның ғылыми-зерттеу зертханасы әзірлеген машиналық аударма технологиясы. Ол 1997 жылы Босниядағы солдаттар үшін құжаттарды аудару үшін қолданылды. Автоматты аудармалардың қолданылуы арзан және қуатты компьютерлердің пайда болуы нәтижесінде айтарлықтай өсті. Бұл 1990-шы жылдардың басында машиналық аударма үлкен мейнфрейм компьютерлерден дербес компьютерлер мен жұмыс станцияларына көшуді бастады. PC нарығын бір уақыт бойы басқаратын екі компания Globalink және MicroTac болды, содан кейін екі компанияның бірігуі (1994 жылдың желтоқсанында) екеуінің де корпоративтік мүддесіне сай деп табылды. Осы уақытта Intergraph және Systran компьютерлік нұсқаларын ұсына бастады. Сондай-ақ, Интернетте AltaVista's Babel Fish (Systran технологиясын пайдалана отырып) және Google Language Tools (алғашқыда Systran технологиясын ғана пайдалана отырып) сияқты сайттар қол жетімді болды.

2000 жылдар

Машиналық аударма саласында 2000-шы жылдары үлкен өзгерістер болды. Статистикалық машиналық аударма және мысалға негізделген машиналық аударма бойынша көптеген зерттеулер жүргізілді. Сөйлеу аудармалары саласында зерттеулер аударма жүйелерін домендік шектеуге емес, домендік шектеуге бағытталды. Еуропадағы (мысалы, TC STAR) және АҚШ-тағы (STR DUST және DARPA Global автономды тілдерді пайдалану бағдарламасы) түрлі зерттеу жобаларында Парламент баяндамаларын және хабарларды автоматты түрде аудару үшін шешімдер жасалды. Бұл сценарийлерде мазмұнның ауқымы белгілі бір саламен шектелмейді, керісінше аударма жасалатын баяндамалар әр түрлі тақырыптарды қамтиды. Француз-неміс тіліндегі Quaero жобасы көп тілді интернет үшін машиналық аудармаларды пайдалану мүмкіндігін зерттеді. Бұл жоба веб-беттерді ғана емес, сонымен қатар интернеттегі бейне және аудио файлдарды аударуға бағытталған.

2010 жылдар

Соңғы онжылдықта статистикалық машиналық аударманың орнын жүйкелік машиналық аударма (НМТ) әдістері алды. Нейрологиялық машиналық аударма термині 2014 жылы осы тақырыпқа қатысты алғашқы зерттеуді жариялаған Бахданау және басқалар және Суцкевер және басқалар жасаған. Нейро желілеріне статистикалық модельдерге қажетті жадтың тек бір бөлігі ғана қажет болды және бүтін сөйлемдерді интеграцияланған түрде модельдеуге болады. Бірінші ірі масштабтағы НМТ-ны Baidu 2015 жылы іске қосты, содан кейін 2016 жылы Google Neural Machine Translation (GNMT) іске қосылды. Одан кейін DeepL Translator сияқты басқа аударма қызметтері пайда болды және NMT технологиясын Microsoft Translator сияқты ескі аударма қызметтерінде қабылдады. Нейрондық желілер бірден бір нервтік желі архитектурасын (seq2seq) пайдаланып, екі қайталанатын нейрондық желілерді (RNN) қолданады. Кодтаушы RNN және декодер RNN. Кодтаушы RNN бастапқы сөйлемде кодтау векторларын қолданады, ал декодер RNN алдыңғы кодтау векторының негізінде мақсатты сөйлемді жасайды. Көңіл бөлу қабатының, трансформация мен кері таралу техникасының одан әрі жетілуі НМТ-ны икемді етіп, көптеген машиналық аударма, қорытындылау және чат-бот технологияларында қабылдады.