Введение
Использование вычислительных инструментов для изучения лингвистики – научная область. Вычислительная лингвистика – это междисциплинарная область, занимающаяся вычислительным моделированием естественного языка, а также исследованием адекватных вычислительных методов для решения лингвистических задач. В целом, вычислительная лингвистика опирается на лингвистику, информатику, искусственный интеллект, математику, логику, философию, когнитивную науку, когнитивную психологию, психолингвистику, антропологию и нейронауку, среди прочих дисциплин.
the scientific field
Computational linguistics is an interdisciplinary field concerned with the computational modelling of natural language, as well as the study of appropriate computational approaches to linguistic questions. In general, computational linguistics draws upon linguistics, computer science, artificial intelligence, mathematics, logic, philosophy, cognitive science, cognitive psychology, psycholinguistics, anthropology and neuroscience, among others.
Происхождение
Эта область соприкасалась с искусственным интеллектом с момента начала работ в США в 1950-х годах по использованию компьютеров для автоматического перевода текстов с иностранных языков, в особенности российских научных журналов, на английский язык. Поскольку подходы, основанные на правилах, позволяли выполнять арифметические (систематические) вычисления значительно быстрее и точнее, чем люди, предполагалось, что лексику, морфологию, синтаксис и семантику также можно изучить, используя четкие правила. После провала подходов, основанных на правилах, Дэвид Хейс ввел этот термин, чтобы отделить данную область от искусственного интеллекта, и стал одним из основателей как Ассоциации вычислительной лингвистики (ACL), так и Международного комитета по вычислительной лингвистике (ICCL) в 1970-х и 1980-х годах. То, что начиналось как попытка перевода между языками, развилось в гораздо более широкую область обработки естественного языка.
Аннотированные корпусы
Для детального изучения английского языка требовался аннотированный текстовый корпус. Пенн-Трибанк был одним из наиболее часто используемых корпусов. Он состоял из руководств по компьютерам IBM, транскрибированных телефонных разговоров и других текстов, содержащих в общей сложности более 4,5 миллионов слов американского английского языка, размеченных как частями речи, так и синтаксическими скобками. Японские корпусы предложений были проанализированы, и в отношении длины предложения была выявлена закономерность, соответствующая логнормальному распределению.
Приобретение языка моделирования
Тот факт, что в процессе освоения языка дети сталкиваются преимущественно с положительными примерами, то есть им предоставляется информация только о корректных формах, но не о некорректных, являлся ограничением для моделей того времени, поскольку модели глубокого обучения, доступные сейчас, не существовали в конце 1980-х годов. Было показано, что языки можно освоить, используя комбинацию простых входных данных, подаваемых постепенно по мере развития у ребенка памяти и продолжительности концентрации внимания, что объясняет длительный период языкового развития у младенцев и детей. Чтобы модели могли обучаться подобно детям, были созданы модели, основанные на концепции доступности, в которых устанавливались связи между действиями, восприятием и результатами, и эти связи соотносились с произносимыми словами. Важно отметить, что эти роботы смогли установить функциональные соответствия между словами и значениями без необходимости использования грамматической структуры. Используя уравнение Прайса и динамику урны Поля, исследователи разработали систему, которая не только предсказывает будущую лингвистическую эволюцию, но и позволяет получить представление об эволюционной истории современных языков.
Теории Чомского
Были предприняты попытки выяснить, как младенец осваивает "нестандартную грамматику", как это предполагается в нормальной форме Чомского.