Введение

Статистическая модель структуры языка

Языковая модель — это вероятностная модель естественного языка. В 1980 году была предложена первая значимая статистическая языковая модель, и в течение десятилетия компания IBM проводила эксперименты в стиле Шеннона, в ходе которых выявлялись потенциальные пути улучшения языкового моделирования путем наблюдения и анализа результатов, полученных от людей при предсказании или исправлении текста. Языковые модели полезны для решения широкого круга задач, включая распознавание речи (помогая предотвратить предсказание маловероятных, например, бессмысленных последовательностей), машинный перевод, генерацию естественного языка (создание текста, более похожего на человеческий), оптическое распознавание символов, распознавание рукописного текста, грамматическую индукцию и информационный поиск. Крупные языковые модели, представляющие собой их наиболее продвинутую форму на данный момент, являются комбинацией больших наборов данных (часто включающих слова, собранные из общедоступного интернета), прямых нейронных сетей и трансформеров. Они превзошли модели, основанные на рекуррентных нейронных сетях, которые, в свою очередь, заменили чистые статистические модели, такие как языковая модель на основе n-грамм.

Экспоненциальный

Модели языка с максимальной энтропией кодируют связь между словом и n-граммовой историей с использованием функций признаков. Уравнение имеет вид:

где – функция разделения, – вектор параметров, а – функция признака. В простейшем случае функция признака является индикатором наличия определенного n-грамма. Целесообразно использовать априорное распределение для или какую-либо форму регуляризации. Лог-билинейная модель является другим примером экспоненциальной языковой модели.

Рецидивирующая нейронная сеть

Непрерывные представления или встраивания слов формируются в языковых моделях, основанных на рекуррентных нейронных сетях (также известных как языковые модели непрерывного пространства). Такие встраивания в непрерывное пространство помогают смягчить проблему "проклятия размерности", возникающую из-за экспоненциального роста числа возможных последовательностей слов с увеличением размера словаря, что, в свою очередь, приводит к проблеме разреженности данных. Нейронные сети решают эту проблему, представляя слова как нелинейные комбинации весов в нейронной сети.