Екітілді мәтіндегі сөздер арасындағы аудармалық байланыстарды анықтау
Bitext word alignment
Екітілді мәтіндегі сөздердің қатынасын анықтау: аударма сөздерді байланыстыру, машиналық аудармауда маңызды роль атқарады. Сөздерді үйлестіру туралы біліңіз!
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Кіріспе
Біттексттегі сөздер арасындағы аударма қатынастарын анықтау
Identifying translation relationships among the words in a bitext
aligning natural language words
Біттекст сөздерін сәйкестендіру, немесе жай ғана сөздік сәйкестендіру – бұл біттекстегі сөздердің (немесе сирек кездесетін көп сөзді тіркестердің) арасындағы аударма қатынастарын анықтауға бағытталған табиғи тілдік өңдеу міндеті. Нәтижесінде, біттекстің екі жағы арасында екі бөлімді график құрылады, онда егер екі сөз бір-бірінің аудармасы болса, олардың арасында доға болады. Сөздік сәйкестендіру әдетте сөйлемдерді сәйкестендіруден кейін жасалады, яғни бір-бірінің аудармасы болып табылатын сөйлемдер жұптастырылады. Біттекст сөздерін сәйкестендіру – статистикалық машиналық аударманың көптеген әдістері үшін маңызды көмекші міндет. Статистикалық машиналық аударма модельдерінің параметрлері әдетте сөздік сәйкестендіру жасалған біттекстерді қарастыру арқылы есептеледі, ал керісінше, автоматты сөздік сәйкестендіру статистикалық машиналық аударма моделіне ең жақсы сәйкес келетін сәйкестендіруді таңдау арқылы жүзеге асырылады. Осы екі идеяны циклді түрде қолдану күту-максимизациялау алгоритмінің бір мысалы болып табылады. Оқытудың бұл тәсілі бақылаусыз оқытудың бір түрі болып табылады, себебі жүйеге күтілетін нәтижелердің үлгілері берілмейді, ал жүйе байқалған біттексті ең жақсы түсіндіретін модельдің және сәйкестендірулердің мәндерін табуға тырысады. Соңғы жұмыстарда жүйеге қолмен сәйкестендірілген (әдетте аз) сөйлемдер ұсыну арқылы бақыланатын әдістер зерттеле бастады. Бақылау арқылы алынған қосымша ақпараттан өзге, бұл модельдер деректердің көптеген ерекшеліктерін, мысалы, контекст, синтаксистік құрылым, сөздердің түрлерін немесе аударма лексикасы туралы ақпаратты оңай біріктіре алады, оларды дәстүрлі генеративтік статистикалық модельдерге енгізу қиын. Машиналық аударма жүйелерін оқытудан басқа, сөздік сәйкестендірудің басқа да қолданыстарына аударма лексикасын құру, сөз мағынасын анықтау, сөз мағынасын ажырату және лингвистикалық ақпаратты бір тілден екінші тілге ауыстыру кіреді.
Bitext word alignment or simply word alignment is the natural language processing task of identifying translation relationships among the words (or more rarely multiword units) in a bitext, resulting in a bipartite graph between the two sides of the bitext, with an arc between two words if and only if they are translations of one another. Word alignment is typically done after sentence alignment has already identified pairs of sentences that are translations of one another. Bitext word alignment is an important supporting task for most methods of statistical machine translation. The parameters of statistical machine translation models are typically estimated by observing word aligned bitexts, and conversely automatic word alignment is typically done by choosing that alignment which best fits a statistical machine translation model. Circular application of these two ideas results in an instance of the expectation maximization algorithm. This approach to training is an instance of unsupervised learning, in that the system is not given examples of the kind of output desired, but is trying to find values for the unobserved model and alignments which best explain the observed bitext. Recent work has begun to explore supervised methods which rely on presenting the system with a (usually small) number of manually aligned sentences. In addition to the benefit of the additional information provided by supervision, these models are typically also able to more easily take advantage of combining many features of the data, such as context, syntactic structure, part of speech, or translation lexicon information, which are difficult to integrate into the generative statistical models traditionally used. Besides the training of machine translation systems, other applications of word alignment include translation lexicon induction, word sense discovery, word sense disambiguation and the cross lingual projection of linguistic information.
ХММ
Vogel және тағы басқалар лексикалық аударма ықтималдықтары мен салыстырмалы тікелей сәйкестік принципін қолданған әдіс жасады. Проблема жасырын Марков моделіне бейімделу арқылы шешілді. Модель күйлері бастапқы тілдегі сөздерді, ал байқаулары мақсатты тілдегі сөздерді көрсетеді. Күш өту ықтималдықтары тікелей сәйкестік ықтималдықтарын модельдейді. Оқу процесінде аударма және тікелей сәйкестік ықтималдықтарын алға және кері бағытталған алгоритм арқылы есептеуге болады.
Vogel et al. developed an approach featuring lexical translation probabilities and relative alignment by mapping the problem to a Hidden Markov model. The states and observations represent the source and target words respectively. The transition probabilities model the alignment probabilities. In training the translation and alignment probabilities can be obtained from and in the Forward backward algorithm.