Введение

Использование вычислительных инструментов для изучения лингвистики – научная область. Вычислительная лингвистика – это междисциплинарная область, занимающаяся вычислительным моделированием естественного языка, а также исследованием адекватных вычислительных методов для решения лингвистических задач. В целом, вычислительная лингвистика опирается на лингвистику, информатику, искусственный интеллект, математику, логику, философию, когнитивную науку, когнитивную психологию, психолингвистику, антропологию и нейронауку, среди прочих дисциплин.

Происхождение

Эта область соприкасалась с искусственным интеллектом с момента начала работ в США в 1950-х годах по использованию компьютеров для автоматического перевода текстов с иностранных языков, в особенности российских научных журналов, на английский язык. Поскольку подходы, основанные на правилах, позволяли выполнять арифметические (систематические) вычисления значительно быстрее и точнее, чем люди, предполагалось, что лексику, морфологию, синтаксис и семантику также можно изучить, используя четкие правила. После провала подходов, основанных на правилах, Дэвид Хейс ввел этот термин, чтобы отделить данную область от искусственного интеллекта, и стал одним из основателей как Ассоциации вычислительной лингвистики (ACL), так и Международного комитета по вычислительной лингвистике (ICCL) в 1970-х и 1980-х годах. То, что начиналось как попытка перевода между языками, развилось в гораздо более широкую область обработки естественного языка.

Аннотированные корпусы

Для детального изучения английского языка требовался аннотированный текстовый корпус. Пенн-Трибанк был одним из наиболее часто используемых корпусов. Он состоял из руководств по компьютерам IBM, транскрибированных телефонных разговоров и других текстов, содержащих в общей сложности более 4,5 миллионов слов американского английского языка, размеченных как частями речи, так и синтаксическими скобками. Японские корпусы предложений были проанализированы, и в отношении длины предложения была выявлена закономерность, соответствующая логнормальному распределению.

Приобретение языка моделирования

Тот факт, что в процессе освоения языка дети сталкиваются преимущественно с положительными примерами, то есть им предоставляется информация только о корректных формах, но не о некорректных, являлся ограничением для моделей того времени, поскольку модели глубокого обучения, доступные сейчас, не существовали в конце 1980-х годов. Было показано, что языки можно освоить, используя комбинацию простых входных данных, подаваемых постепенно по мере развития у ребенка памяти и продолжительности концентрации внимания, что объясняет длительный период языкового развития у младенцев и детей. Чтобы модели могли обучаться подобно детям, были созданы модели, основанные на концепции доступности, в которых устанавливались связи между действиями, восприятием и результатами, и эти связи соотносились с произносимыми словами. Важно отметить, что эти роботы смогли установить функциональные соответствия между словами и значениями без необходимости использования грамматической структуры. Используя уравнение Прайса и динамику урны Поля, исследователи разработали систему, которая не только предсказывает будущую лингвистическую эволюцию, но и позволяет получить представление об эволюционной истории современных языков.

Теории Чомского

Были предприняты попытки выяснить, как младенец осваивает "нестандартную грамматику", как это предполагается в нормальной форме Чомского.