Введение
Генерация текста на естественных языках
Генерация естественного языка (NLG) — это программный процесс, создающий текст на естественном языке. Широко цитируемый обзор методов NLG описывает NLG как «подраздел искусственного интеллекта и вычислительной лингвистики, занимающийся построением компьютерных систем, способных создавать понятные тексты на английском или других человеческих языках на основе некоторого базового нелингвистического представления информации». Хотя существует общее согласие, что результатом любого процесса NLG является текст, существуют разногласия относительно того, должны ли входные данные системы NLG быть нелингвистическими. Распространенные области применения методов NLG включают создание различных отчетов, например, прогнозов погоды и чат-ботов. Автоматизированную NLG можно сравнить с процессом, который люди используют, когда преобразуют идеи в письменную форму или речь. Психолингвисты предпочитают термин «продукция языка» для этого процесса, который также можно описать математически или смоделировать на компьютере для психологических исследований. Системы NLG также можно сравнить с трансляторами искусственных компьютерных языков, таких как декомпиляторы или транспиляторы, которые также генерируют код, читаемый человеком, на основе промежуточного представления. Человеческие языки, как правило, значительно сложнее и допускают гораздо больше двусмысленности и разнообразия выражения, чем языки программирования, что делает NLG более сложной задачей. NLG можно рассматривать как дополнение к пониманию естественного языка (NLU): в то время как в NLU системе необходимо устранять неоднозначность входного предложения для получения машинного представления, в NLG системе необходимо принимать решения о том, как выразить представление словами. Практические аспекты создания систем NLU и NLG несимметричны. NLU должен обрабатывать неоднозначные или ошибочные пользовательские данные, в то время как идеи, которые система хочет выразить с помощью NLG, обычно известны точно. NLG должен выбрать конкретное, внутренне согласованное текстовое представление из множества возможных представлений, в то время как NLU обычно стремится создать единое, нормализованное представление выраженной идеи. Методы NLG варьируются от простых систем, основанных на шаблонах, таких как почтовая рассылка, генерирующая типовые письма, до систем, обладающих сложным пониманием человеческой грамматики. NLG также можно реализовать путем обучения статистической модели с использованием машинного обучения, как правило, на большом корпусе текстов, написанных людьми.
Подпись к изображению
За последние несколько лет наблюдается повышенный интерес к автоматическому генерированию подписей к изображениям, как части более широких усилий по исследованию интерфейса между зрением и языком. Являясь задачей преобразования данных в текст, алгоритм подписи изображений (или автоматического описания изображений) предполагает получение изображения, анализ его визуального содержания и генерацию текстового описания (обычно предложения), которое выражает наиболее выразительные аспекты изображения. Система подписи изображений включает в себя две подзадачи. В анализе изображений обнаруживаются и маркируются признаки и атрибуты изображения, после чего эти результаты сопоставляются с лингвистическими структурами. Современные исследования используют подходы глубокого обучения, применяя признаки из предварительно обученных сверточных нейронных сетей, таких как AlexNet, VGG или Caffe, где генераторы подписей используют слой активации из предварительно обученной сети в качестве входных признаков. Генерация текста, вторая задача, выполняется с использованием широкого спектра техник. Например, в системе Midge входные изображения представляются в виде троек, состоящих из обнаружения объектов/предметов, обнаружения действий/поз и пространственных отношений. Эти тройки затем преобразуются в тройки <существительное, глагол, предлог> и реализуются с использованием грамматики подстановки деревьев, а также создаются и оцениваются многоязычные репозитории для описания изображений.
Творческое письмо и компьютерный юмор
Создание творческого контента с помощью NLG предполагалось с момента возникновения этой области. Филипп Паркер – один из первых исследователей в этой области, разработавший целый арсенал алгоритмов, способных автоматически генерировать учебники, кроссворды, стихи и книги на самые разные темы – от переплетного дела до катаракты. Появление крупных предварительно обученных языковых моделей на основе трансформеров, таких как GPT-3, также привело к прорывам, поскольку такие модели демонстрируют заметную способность к выполнению задач, связанных с написанием текстов. Смежной областью применения NLG является вычислительное создание юмора. JAPE (Joke Analysis and Production Engine) – одна из первых крупных автоматизированных систем для создания юмора, использующая подход на основе шаблонов, закодированных вручную, для создания каламбуров и загадок для детей. HAHAcronym создает юмористические переинтерпретации любых акронимов, а также предлагает новые подходящие акронимы на основе заданных ключевых слов. Несмотря на достигнутый прогресс, остается много проблем в создании автоматизированного творческого и юмористического контента, который мог бы конкурировать с результатами, полученными человеком. В эксперименте по генерации сатирических заголовков, результаты их лучшей модели на основе BERT были признаны смешными в 9,4% случаев (в то время как реальные заголовки из The Onion – в 38,4%), а модель GPT-2, дообученная на сатирических заголовках, достигла 6,9%. Было отмечено, что две основные проблемы систем генерации юмора – это недостаток размеченных наборов данных и отсутствие формальных методов оценки, а также соревновательных мероприятий. Первоначальные результаты показывают, что человеческие оценки в этом отношении значительно превосходят метрики. Иными словами, человеческие оценки обычно в определенной степени предсказывают эффективность задачи (хотя и бывают исключения), в то время как оценки, полученные с помощью метрик, часто не позволяют хорошо предсказать эффективность задачи. Эти результаты предварительные. В любом случае, человеческие оценки являются наиболее распространенным методом оценки в NLG, в отличие от машинного перевода, где широко используются метрики. ИИ можно оценивать по степени соответствия его обучающим данным или, альтернативно, по фактической точности. Ответ, отражающий обучающие данные, но не реальность, является соответствующим, но не фактическим. Уверенный, но не соответствующий действительности ответ – это галлюцинация. В области обработки естественного языка галлюцинация часто определяется как «сгенерированный контент, который является бессмысленным или не соответствует предоставленному исходному контенту».