Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Статистическая модель структуры языка
Statistical model of structure of language
Языковая модель — это вероятностная модель естественного языка. В 1980 году была предложена первая значимая статистическая языковая модель, и в течение десятилетия компания IBM проводила эксперименты в стиле Шеннона, в ходе которых выявлялись потенциальные пути улучшения языкового моделирования путем наблюдения и анализа результатов, полученных от людей при предсказании или исправлении текста. Языковые модели полезны для решения широкого круга задач, включая распознавание речи (помогая предотвратить предсказание маловероятных, например, бессмысленных последовательностей), машинный перевод, генерацию естественного языка (создание текста, более похожего на человеческий), оптическое распознавание символов, распознавание рукописного текста, грамматическую индукцию и информационный поиск. Крупные языковые модели, представляющие собой их наиболее продвинутую форму на данный момент, являются комбинацией больших наборов данных (часто включающих слова, собранные из общедоступного интернета), прямых нейронных сетей и трансформеров. Они превзошли модели, основанные на рекуррентных нейронных сетях, которые, в свою очередь, заменили чистые статистические модели, такие как языковая модель на основе n-грамм.
A language model is a probabilistic model of a natural language. In 1980, the first significant statistical language model was proposed, and during the decade IBM performed ‘Shannon style’ experiments, in which potential sources for language modeling improvement were identified by observing and analyzing the performance of human subjects in predicting or correcting text. Language models are useful for a variety of tasks, including speech recognition (helping prevent predictions of low probability (e. g. nonsense) sequences), machine translation, natural language generation (generating more human like text), optical character recognition, handwriting recognition, grammar induction, and information retrieval. Large language models, currently their most advanced form, are a combination of larger datasets (frequently using words scraped from the public internet), feedforward neural networks, and transformers. They have superseded recurrent neural network based models, which had previously superseded the pure statistical models, such as word n gram language model.
Экспоненциальный
Модели языка с максимальной энтропией кодируют связь между словом и n-граммовой историей с использованием функций признаков. Уравнение имеет вид:
Maximum entropy language models encode the relationship between a word and the n gram history using feature functions. The equation is
где – функция разделения, – вектор параметров, а – функция признака. В простейшем случае функция признака является индикатором наличия определенного n-грамма. Целесообразно использовать априорное распределение для или какую-либо форму регуляризации. Лог-билинейная модель является другим примером экспоненциальной языковой модели.
where is the partition function, is the parameter vector, and is the feature function. In the simplest case, the feature function is just an indicator of the presence of a certain n gram. It is helpful to use a prior on or some form of regularization. The log bilinear model is another example of an exponential language model.
Рецидивирующая нейронная сеть
Непрерывные представления или встраивания слов формируются в языковых моделях, основанных на рекуррентных нейронных сетях (также известных как языковые модели непрерывного пространства). Такие встраивания в непрерывное пространство помогают смягчить проблему "проклятия размерности", возникающую из-за экспоненциального роста числа возможных последовательностей слов с увеличением размера словаря, что, в свою очередь, приводит к проблеме разреженности данных. Нейронные сети решают эту проблему, представляя слова как нелинейные комбинации весов в нейронной сети.
Continuous representations or embeddings of words are produced in recurrent neural network based language models (known also as continuous space language models). Such continuous space embeddings help to alleviate the curse of dimensionality, which is the consequence of the number of possible sequences of words increasing exponentially with the size of the vocabulary, furtherly causing a data sparsity problem. Neural networks avoid this problem by representing words as non linear combinations of weights in a neural net.