Кіріспе

Біттексттегі сөздер арасындағы аударма қатынастарын анықтау

Біттекст сөздерін сәйкестендіру, немесе жай ғана сөздік сәйкестендіру – бұл біттекстегі сөздердің (немесе сирек кездесетін көп сөзді тіркестердің) арасындағы аударма қатынастарын анықтауға бағытталған табиғи тілдік өңдеу міндеті. Нәтижесінде, біттекстің екі жағы арасында екі бөлімді график құрылады, онда егер екі сөз бір-бірінің аудармасы болса, олардың арасында доға болады. Сөздік сәйкестендіру әдетте сөйлемдерді сәйкестендіруден кейін жасалады, яғни бір-бірінің аудармасы болып табылатын сөйлемдер жұптастырылады. Біттекст сөздерін сәйкестендіру – статистикалық машиналық аударманың көптеген әдістері үшін маңызды көмекші міндет. Статистикалық машиналық аударма модельдерінің параметрлері әдетте сөздік сәйкестендіру жасалған біттекстерді қарастыру арқылы есептеледі, ал керісінше, автоматты сөздік сәйкестендіру статистикалық машиналық аударма моделіне ең жақсы сәйкес келетін сәйкестендіруді таңдау арқылы жүзеге асырылады. Осы екі идеяны циклді түрде қолдану күту-максимизациялау алгоритмінің бір мысалы болып табылады. Оқытудың бұл тәсілі бақылаусыз оқытудың бір түрі болып табылады, себебі жүйеге күтілетін нәтижелердің үлгілері берілмейді, ал жүйе байқалған біттексті ең жақсы түсіндіретін модельдің және сәйкестендірулердің мәндерін табуға тырысады. Соңғы жұмыстарда жүйеге қолмен сәйкестендірілген (әдетте аз) сөйлемдер ұсыну арқылы бақыланатын әдістер зерттеле бастады. Бақылау арқылы алынған қосымша ақпараттан өзге, бұл модельдер деректердің көптеген ерекшеліктерін, мысалы, контекст, синтаксистік құрылым, сөздердің түрлерін немесе аударма лексикасы туралы ақпаратты оңай біріктіре алады, оларды дәстүрлі генеративтік статистикалық модельдерге енгізу қиын. Машиналық аударма жүйелерін оқытудан басқа, сөздік сәйкестендірудің басқа да қолданыстарына аударма лексикасын құру, сөз мағынасын анықтау, сөз мағынасын ажырату және лингвистикалық ақпаратты бір тілден екінші тілге ауыстыру кіреді.

ХММ

Vogel және тағы басқалар лексикалық аударма ықтималдықтары мен салыстырмалы тікелей сәйкестік принципін қолданған әдіс жасады. Проблема жасырын Марков моделіне бейімделу арқылы шешілді. Модель күйлері бастапқы тілдегі сөздерді, ал байқаулары мақсатты тілдегі сөздерді көрсетеді. Күш өту ықтималдықтары тікелей сәйкестік ықтималдықтарын модельдейді. Оқу процесінде аударма және тікелей сәйкестік ықтималдықтарын алға және кері бағытталған алгоритм арқылы есептеуге болады.