Тіл моделі: табиғи тілдің статистикалық моделі, қолданылу аймақтары, даму тарихы (1980 жылдан бастап). Жаңа үлгілер: нейрондық желілер, трансформерлер.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Тіл құрылымының статистикалық моделі
Statistical model of structure of language
Тіл моделі – табиғи тілдің ықтималдық моделі. 1980 жылы алғашқы маңызды статистикалық тіл моделі ұсынылды, ал он жылдық ішінде IBM «Шеннон стиліндегі» эксперименттер жүргізді, онда мәтінді болжау немесе түзету кезінде адамдардың жұмысын бақылау және талдау арқылы тіл моделін жақсартудың мүмкіндіктері анықталды. Тіл модельдері түрлі міндеттерге пайдалы: сөзді тану (төмен ықтималдық тізбектерді – мысалы, мағынасыз сөздерді – болжаудың алдын алуға көмектеседі), машиналық аударма, табиғи тілді жасау (адам тіліне жақын мәтін жасау), оптикалық таңбаларды тану, қолжазбаны тану, грамматикалық индукция және ақпаратты іздеу. Ірі тілдік модельдер, қазіргі уақытта олардың ең жетілген түрі, үлкен деректер жиынтықтарының (көбінесе ашық интернеттен алынған сөздерді пайдалана отырып), тура өткізілетін нейрондық желілер мен трансформерлердің үйлесімі болып табылады. Олар бұрынғы таза статистикалық модельдерді, мысалы, сөз тіркесі тіл моделін, алмастырған қайталамалы нейрондық желілерге негізделген модельдерді де еңсерді.
A language model is a probabilistic model of a natural language. In 1980, the first significant statistical language model was proposed, and during the decade IBM performed ‘Shannon style’ experiments, in which potential sources for language modeling improvement were identified by observing and analyzing the performance of human subjects in predicting or correcting text. Language models are useful for a variety of tasks, including speech recognition (helping prevent predictions of low probability (e. g. nonsense) sequences), machine translation, natural language generation (generating more human like text), optical character recognition, handwriting recognition, grammar induction, and information retrieval. Large language models, currently their most advanced form, are a combination of larger datasets (frequently using words scraped from the public internet), feedforward neural networks, and transformers. They have superseded recurrent neural network based models, which had previously superseded the pure statistical models, such as word n gram language model.
Экспоненциалды
Максималды энтропиялы тіл модельдері сөз бен n-грамма тарихы арасындағы қатынасты белгі функциялары арқылы кодтайды. Теңдеусіз келесідей:
Maximum entropy language models encode the relationship between a word and the n gram history using feature functions. The equation is
мұндағы – бөлініс функциясы, – параметрлік вектор, ал – белгі функциясы. Ең қарапайым жағдайда, белгі функциясы белгілі бір n-грамманың бар екенін көрсетеді. –ға алдын ала мән беру немесе кейбір реттеу түрлерін қолдану пайдалы. Логарифмдік билинейлік модель – экспоненциалды тіл моделінің тағы бір мысалы.
where is the partition function, is the parameter vector, and is the feature function. In the simplest case, the feature function is just an indicator of the presence of a certain n gram. It is helpful to use a prior on or some form of regularization. The log bilinear model is another example of an exponential language model.
Қайталанатын нейрондық желі
Сөздердің үздіксіз бейнелері немесе кіріктірілімдері қайталанатын нейрондық желілерге негізделген тіл модельдерінде (кейде толық кеңістіктік тіл модельдері деп те аталады) жасалады. Мұндай үздіксіз кеңістікті кіріктірулер өлшемдік қарғысты жеңілдетуге көмектеседі, ол сөздіктің көлеміне байланысты сөздердің мүмкін тізбектерінің саны экспоненциалды түрде өсуінің және деректердің сиректігіне себеп болуының салдары. Нейрондық желілер бұл мәселені сөздерді нейрондық желідегі салмақтардың сызықтық емес комбинациясы ретінде бейнелеу арқылы шешеді.
Continuous representations or embeddings of words are produced in recurrent neural network based language models (known also as continuous space language models). Such continuous space embeddings help to alleviate the curse of dimensionality, which is the consequence of the number of possible sequences of words increasing exponentially with the size of the vocabulary, furtherly causing a data sparsity problem. Neural networks avoid this problem by representing words as non linear combinations of weights in a neural net.