Введение

Компьютерный метод суммирования текста

Автоматическое суммирование – это процесс сокращения набора данных вычислительным путем для создания подмножества (суммарного обзора), представляющего наиболее важную или релевантную информацию из исходного контента. Для достижения этой цели обычно разрабатываются и используются алгоритмы искусственного интеллекта, специализированные для различных типов данных. Суммирование текста обычно реализуется методами обработки естественного языка, предназначенными для выявления наиболее информативных предложений в заданном документе. С другой стороны, визуальный контент можно суммировать с помощью алгоритмов компьютерного зрения. Суммирование изображений является предметом продолжающихся исследований; существующие подходы обычно стремятся отобразить наиболее репрезентативные изображения из заданной коллекции или создать видео, включающее только наиболее важный контент из всей коллекции. Алгоритмы суммирования видео идентифицируют и извлекают из исходного видеоконтента наиболее важные кадры (ключевые кадры) и/или наиболее важные видеосегменты (ключевые сцены), как правило, в хронологическом порядке. Видеосуммарные обзоры просто сохраняют тщательно отобранное подмножество оригинальных видеокадров и, следовательно, не идентичны результатам работы алгоритмов видеосинтеза, где новые видеокадры синтезируются на основе исходного видеоконтента.

Коммерческие продукты

В 2022 году Google Docs представил функцию автоматического реферирования.

Подходы

Существует два основных подхода к автоматическому суммированию: извлечение и абстрагирование.

Резюмирование на основе экстракции

Здесь контент извлекается из исходных данных, но извлеченный контент никак не изменяется. Примеры извлеченного контента включают ключевые фразы, которые могут быть использованы для "маркировки" или индексации текстового документа, или ключевые предложения (включая заголовки), которые в совокупности составляют аннотацию, а также репрезентативные изображения или видеофрагменты, как указано выше. Для текста извлечение аналогично просмотру, когда резюме (если оно есть), заголовки и подзаголовки, иллюстрации, первый и последний абзацы раздела и, опционально, первое и последнее предложения в абзаце просматриваются, прежде чем принять решение о чтении всего документа целиком. Другие примеры извлечения включают ключевые последовательности текста с точки зрения клинической значимости (например, пациент/проблема, вмешательство и результат). Это в основном применялось к тексту. Абстрактные методы создают внутреннее семантическое представление исходного контента (часто называемое языковой моделью), а затем используют это представление для создания аннотации, которая ближе к тому, как мог бы выразиться человек. Абстрагирование может преобразовывать извлеченный контент, перефразируя фрагменты исходного документа, чтобы более сильно сжать текст, чем при извлечении. Однако такое преобразование вычислительно гораздо сложнее, чем извлечение, и включает в себя обработку естественного языка и часто глубокое понимание предметной области исходного текста, особенно если исходный документ относится к специализированной области знаний. "Перефразирование" еще сложнее применить к изображениям и видео, поэтому большинство систем аннотирования являются экстрактивными.

Подводя итоги с помощью

Подходы, направленные на повышение качества суммирования, опираются на сочетание программных средств и человеческих усилий. В методе машино-поддерживаемого суммирования человеком, методы извлечения выделяют фрагменты текста, предлагаемые для включения (к которым человек может добавлять или удалять текст). В методе человеко-поддерживаемого машинного суммирования, человек выполняет постобработку результатов работы программного обеспечения, подобно тому, как редактируется результат автоматического перевода, например, от Google Translate.

Приложения и системы для обобщения

Существует два основных типа задач экстрактивного обобщения, в зависимости от того, на чем фокусируется программа обобщения. Первый – это общее обобщение, которое направлено на получение обобщенного резюме или реферата коллекции (будь то документы, наборы изображений, видео, новостные статьи и т.п.). Второй – обобщение, релевантное запросу, иногда называемое обобщением на основе запроса, которое обобщает объекты, специфичные для данного запроса. Системы обобщения способны создавать как текстовые резюме, релевантные запросу, так и общие машинные резюме, в зависимости от потребностей пользователя. Примером задачи обобщения является обобщение документов, которое пытается автоматически создать реферат из заданного документа. Иногда требуется создать резюме из одного исходного документа, а в других случаях можно использовать несколько исходных документов (например, кластер статей на одну и ту же тему). Эта задача называется многодокументным обобщением. Смежной областью применения является обобщение новостных статей. Представьте себе систему, которая автоматически собирает новостные статьи по определенной теме (из сети) и кратко представляет последние новости в виде резюме. Обобщение коллекции изображений – еще один пример применения автоматического обобщения. Оно заключается в выборе репрезентативного набора изображений из большего набора. В этом контексте резюме полезно для отображения наиболее репрезентативных изображений результатов в системе просмотра коллекции изображений. Обобщение видео – это смежная область, где система автоматически создает трейлер длинного видео. Это также находит применение в потребительских или личных видео, где можно пропустить скучные или повторяющиеся сцены. Аналогично, в видео с камер наблюдения необходимо извлекать важную и подозрительную активность, игнорируя все скучные и избыточные кадры. В общем, алгоритмы обобщения пытаются найти подмножества объектов (например, набор предложений или набор изображений), которые охватывают информацию всего набора. Это также называют основным набором. Эти алгоритмы моделируют такие понятия, как разнообразие, охват, информативность и репрезентативность резюме. Методы обобщения на основе запроса дополнительно моделируют релевантность резюме запросу. Некоторые методы и алгоритмы, которые естественным образом моделируют задачи обобщения, включают TextRank и PageRank, подмодульную функцию множества, детерминантный точечный процесс, максимальную предельно релевантную выборку (MMR) и другие.

Подходы к обучению под наблюдением

Начиная с работы Терни, многие исследователи стали рассматривать извлечение ключевых фраз как задачу контролируемого машинного обучения. Для заданного документа мы формируем пример для каждой униграммы, биграммы и триграммы, обнаруженной в тексте (хотя возможны и другие текстовые единицы, как обсуждается ниже). Затем мы вычисляем различные признаки, описывающие каждый пример (например, начинается ли фраза с прописной буквы?). Мы предполагаем, что для набора обучающих документов доступны известные ключевые фразы. Используя известные ключевые фразы, мы можем присвоить примерам положительные или отрицательные метки. Далее мы обучаем классификатор, способный различать положительные и отрицательные примеры на основе их признаков. Некоторые классификаторы выполняют двоичную классификацию для тестового примера, а другие присваивают вероятность того, что это ключевая фраза. Например, в приведенном выше тексте мы можем выучить правило, согласно которому фразы, начинающиеся с прописной буквы, с большей вероятностью являются ключевыми фразами. После обучения модели мы можем выбирать ключевые фразы для тестовых документов следующим образом: применяем ту же стратегию генерации примеров к тестовым документам, а затем пропускаем каждый пример через обученную модель. Ключевые фразы можно определить, анализируя решения двоичной классификации или вероятности, возвращаемые нашей моделью. Если предоставляются вероятности, для выбора ключевых фраз используется пороговое значение. Экстракторы ключевых фраз обычно оцениваются с использованием точности и полноты. Точность показывает, какая доля предложенных ключевых фраз является корректной. Полнота показывает, какая доля истинных ключевых фраз была предложена системой. Эти два показателя можно объединить в F-меру, которая является гармоническим средним этих двух значений (F = 2PR/(P + R)). Сопоставление между предложенными и известными ключевыми фразами можно проверить после стемминга или применения другой нормализации текста. Разработка системы извлечения ключевых фраз с учителем предполагает принятие ряда решений (некоторые из них применимы и к системам без учителя). Первое решение – это способ генерации примеров. Терни и другие использовали все возможные униграммы, биграммы и триграммы без разделяющих знаков препинания и после удаления стоп-слов. Хулт показал, что можно добиться улучшения, выбирая примеры в виде последовательностей токенов, соответствующих определенным шаблонам частей речи. В идеале механизм генерации примеров должен генерировать все известные размеченные ключевые фразы в качестве кандидатов, хотя это часто не так. Например, если мы используем только униграммы, биграммы и триграммы, мы никогда не сможем извлечь известную ключевую фразу, состоящую из четырех слов. Следовательно, полнота может пострадать. Однако генерация слишком большого количества примеров также может привести к низкой точности. Нам также необходимо создать признаки, описывающие примеры и достаточно информативные, чтобы алгоритм обучения мог различать ключевые фразы от неключевых. Обычно признаки включают различные частоты терминов (сколько раз фраза встречается в текущем тексте или в большем корпусе), длину примера, относительную позицию первого вхождения, различные булевы синтаксические признаки (например, содержит только прописные буквы) и т. д. В работе Терни использовалось около 12 таких признаков. Хулт использует сокращенный набор признаков, которые оказались наиболее успешными в работе KEA (Keyphrase Extraction Algorithm), основанной на основополагающей работе Терни. В конечном итоге системе необходимо вернуть список ключевых фраз для тестового документа, поэтому нам нужен способ ограничить их количество. Для получения числовых оценок, которые можно использовать с порогом, используются ансамблевые методы (т.е. использование голосования нескольких классификаторов) для предоставления пользователю заданного количества ключевых фраз. Этот метод использовал Терни с деревьями решений C4.5. Хулт использовал один двоичный классификатор, поэтому алгоритм обучения неявно определяет соответствующее число. После создания примеров и признаков нам нужен способ научиться предсказывать ключевые фразы. Можно использовать практически любой алгоритм контролируемого обучения, такой как деревья решений, наивный байесовский классификатор и индукция правил. В случае алгоритма GenEx Терни используется генетический алгоритм для обучения параметров алгоритма извлечения ключевых фраз, специфичного для предметной области. Экстрактор следует серии эвристик для идентификации ключевых фраз. Генетический алгоритм оптимизирует параметры этих эвристик с точки зрения производительности на обучающих документах с известными ключевыми фразами.

Неконтролируемый подход: TextRank

Другим алгоритмом извлечения ключевых фраз является TextRank. Хотя контролируемые методы обладают рядом преимуществ, таких как возможность создания интерпретируемых правил, определяющих признаки ключевой фразы, они также требуют большого объема обучающих данных. Необходимо большое количество документов с известными ключевыми фразами. Более того, обучение на конкретной предметной области, как правило, адаптирует процесс извлечения к этой области, в результате чего полученный классификатор не всегда может быть перенесен на другие области, что демонстрируют некоторые результаты Турни. Неконтролируемое извлечение ключевых фраз устраняет необходимость в обучающих данных. Оно подходит к проблеме с другой стороны. Вместо того, чтобы пытаться выучить явные признаки, характеризующие ключевые фразы, алгоритм TextRank использует структуру самого текста для определения ключевых фраз, которые кажутся "центральными" для текста, подобно тому, как PageRank выбирает важные веб-страницы. Вспомним, что это основано на понятии "престижа" или "рекомендации" в социальных сетях. Таким образом, TextRank не опирается на какие-либо предварительные обучающие данные, а может быть запущен на любом произвольном тексте, генерируя результат исключительно на основе внутренних свойств текста. Это делает алгоритм легко переносимым на новые предметные области и языки. TextRank – это алгоритм ранжирования на основе графов общего назначения для задач обработки естественного языка (NLP). По сути, он запускает PageRank на графе, специально разработанном для конкретной задачи NLP. Для извлечения ключевых фраз он строит граф, используя набор текстовых единиц в качестве вершин. Ребра основаны на некоторой мере семантического или лексического сходства между вершинами, представляющими текстовые единицы. В отличие от PageRank, ребра обычно не имеют направления и могут быть взвешены для отражения степени сходства. После построения графа он используется для формирования стохастической матрицы, в сочетании с коэффициентом затухания (как в "модели случайного блуждания"), а ранжирование вершин получается путем нахождения собственного вектора, соответствующего собственному значению 1 (то есть стационарному распределению случайного блуждания по графу). Вершины должны соответствовать тому, что мы хотим ранжировать. Теоретически, мы могли бы поступить аналогично контролируемым методам и создать вершину для каждой униграммы, биграммы, триграммы и т.д. Однако, чтобы граф оставался небольшим, авторы решили ранжировать отдельные униграммы на первом этапе, а затем добавить второй этап, который объединяет высокоранжированные соседние униграммы для формирования многословных фраз. Это имеет приятный побочный эффект, позволяющий генерировать ключевые фразы произвольной длины. Например, если при ранжировании униграмм "продвинутый", "естественный", "язык" и "обработка" получают высокие ранги, мы посмотрим на исходный текст и увидим, что эти слова встречаются последовательно, и создадим окончательную ключевую фразу, объединив все четыре слова. Следует отметить, что униграммы, помещенные в граф, могут быть отфильтрованы по частям речи. Авторы обнаружили, что лучше всего включать прилагательные и существительные. Таким образом, на этом этапе используются некоторые лингвистические знания. Ребра создаются на основе совместной встречаемости слов в данном применении TextRank. Две вершины соединяются ребром, если униграммы встречаются в пределах окна размером N в исходном тексте. N обычно составляет от 2 до 10. Таким образом, "естественный" и "язык" могут быть связаны в тексте о NLP. "Естественный" и "обработка" также будут связаны, поскольку они оба появятся в одной строке из N слов. Эти ребра основаны на понятии "связности текста" и идее, что слова, которые появляются рядом друг с другом, вероятно, связаны между собой значимым образом и "рекомендуют" друг друга читателю. Поскольку этот метод просто ранжирует отдельные вершины, нам нужен способ установить порог или сгенерировать ограниченное количество ключевых фраз. Выбранный метод заключается в установке числа T как пользовательской доли от общего числа вершин в графе. Затем выбираются T вершин/униграмм с наивысшими рангами на основе их стационарных вероятностей. Затем применяется этап постобработки для объединения соседних экземпляров этих T униграмм. В результате может быть сгенерировано больше или меньше T конечных ключевых фраз, но их количество должно быть примерно пропорционально длине исходного текста. Первоначально неясно, почему применение PageRank к графу совместной встречаемости должно приводить к полезным ключевым фразам. Один из способов понять это следующий. Слово, которое многократно встречается в тексте, может иметь множество различных соседей, встречающихся вместе с ним. Например, в тексте о машинном обучении униграмма "обучение" может встречаться вместе с "машинным", "контролируемым", "неконтролируемым" и "полуконтролируемым" в четырех разных предложениях. Таким образом, вершина "обучение" будет центральным "узлом", соединяющим эти другие модифицирующие слова. Запуск PageRank/TextRank на графе, вероятно, присвоит "обучению" высокий ранг. Аналогично, если текст содержит фразу "контролируемое классифицирование", то между "контролируемым" и "классифицированием" будет ребро. Если "классифицирование" встречается в других местах и, следовательно, имеет много соседей, его важность будет способствовать важности "контролируемого". Если оно получит высокий ранг, оно будет выбрано в качестве одной из T лучших униграмм, наряду с "обучением" и, вероятно, "классифицированием". На конечном этапе постобработки мы получим ключевые фразы "контролируемое обучение" и "контролируемое классифицирование". Короче говоря, граф совместной встречаемости будет содержать плотно связанные области для терминов, которые часто встречаются и в разных контекстах. Случайное блуждание по этому графу будет иметь стационарное распределение, которое присваивает большие вероятности терминам в центрах кластеров. Это аналогично тому, как плотно связанные веб-страницы получают высокий ранг от PageRank. Этот подход также использовался в обобщении документов, которое будет рассмотрено ниже.

Резюме документов

Как и выделение ключевых фраз, резюмирование документов ставит своей целью определить основную суть текста. Единственное существенное различие заключается в том, что теперь мы работаем с более крупными текстовыми единицами – целыми предложениями, а не отдельными словами и фразами.

Подходы к обучению под наблюдением

Наблюдаемое (или контролируемое) резюмирование текста очень похоже на контролируемое извлечение ключевых фраз. По сути, если у вас есть коллекция документов и созданные людьми резюме для них, вы можете выявить признаки предложений, которые делают их хорошими кандидатами для включения в резюме. Эти признаки могут включать положение предложения в документе (например, первые несколько предложений, вероятно, важны), количество слов в предложении и т.д. Основная сложность контролируемого экстрактивного резюмирования заключается в том, что известные резюме должны быть созданы вручную путем извлечения предложений, чтобы предложения в исходном обучающем документе можно было пометить как "входит в резюме" или "не входит в резюме". Люди обычно не создают резюме таким образом, поэтому простое использование аннотаций журнальных статей или существующих резюме обычно недостаточно. Предложения в этих аннотациях не обязательно соответствуют предложениям в оригинальном тексте, что затрудняет присвоение меток примерам для обучения. Однако следует отметить, что такие естественные резюме все еще можно использовать для оценки, поскольку оценка ROUGE 1 учитывает только униграммы.

Максимальная энтропия

В ходе семинаров по оценке DUC 2001 и 2002 годов, TNO разработала систему извлечения предложений для многодокументного реферирования в новостной области. Система была основана на гибридном подходе, использующем классификатор Naive Bayes и статистические языковые модели для моделирования значимости. Несмотря на хорошие результаты, исследователи хотели изучить эффективность классификатора максимальной энтропии (МЭ) для задачи реферирования встреч, поскольку МЭ известен своей устойчивостью к зависимостям признаков. Максимальная энтропия также успешно применялась для реферирования в области теленовостей.

Адаптируемое обобщение

Перспективным подходом является адаптивное суммирование документов/текстов. Он предполагает сначала определение жанра текста, а затем применение алгоритмов суммирования, оптимизированных для данного жанра. Такое программное обеспечение уже разработано.

TextRank и LexRank

Неконтролируемый подход к суммированию также во многом схож по духу с неконтролируемым извлечением ключевых фраз и позволяет избежать проблемы дорогостоящих обучающих данных. Некоторые неконтролируемые методы суммирования основаны на поиске "центроидного" предложения, которое представляет собой средний вектор слов всех предложений в документе. Затем предложения ранжируются в соответствии с их сходством с этим центроидным предложением. Более обоснованный способ оценки важности предложения – использование случайных блужданий и центральности собственных векторов. LexRank – это алгоритм, по сути идентичный TextRank, и оба используют этот подход для суммирования документов. Оба метода были разработаны разными группами одновременно, и LexRank был сосредоточен именно на суммировании, но его можно было бы так же легко использовать для извлечения ключевых фраз или любой другой задачи ранжирования в обработке естественного языка. Как в LexRank, так и в TextRank, граф строится путем создания вершины для каждого предложения в документе. Ребра между предложениями основаны на той или иной форме семантического сходства или перекрытия содержания. В то время как LexRank использует косинусное сходство векторов TF-IDF, TextRank использует очень похожую меру, основанную на количестве общих слов в двух предложениях (нормализованном по длине предложений). В работе, посвященной LexRank, рассматривалось использование невзвешенных ребер после применения порога к значениям косинуса, а также экспериментировали с использованием ребер с весами, равными оценке сходства. TextRank использует непрерывные оценки сходства в качестве весов. В обоих алгоритмах предложения ранжируются путем применения PageRank к полученному графу. Суммарный текст формируется путем объединения предложений с наивысшим рангом, используя пороговое значение или ограничение по длине для ограничения размера суммарного текста. Стоит отметить, что TextRank применялся к суммированию именно так, как описано здесь, в то время как LexRank использовался как часть более крупной системы суммирования (MEAD), которая объединяет оценку LexRank (стационарную вероятность) с другими признаками, такими как положение и длина предложения, используя линейную комбинацию с весами, заданными пользователем или настроенными автоматически. В этом случае могут потребоваться некоторые обучающие документы, хотя результаты TextRank показывают, что дополнительные признаки не являются абсолютно необходимыми. В отличие от TextRank, LexRank применялся к многодокументнóму суммированию.

Резюме из нескольких документов

Резюмирование нескольких документов — это автоматизированный процесс, направленный на извлечение информации из множества текстов, посвященных одной и той же теме. Итоговый сводный отчет позволяет отдельным пользователям, например, профессиональным аналитикам, быстро ознакомиться с информацией, содержащейся в большом объеме документов. Таким образом, системы многодокументного резюмирования дополняют новостные агрегаторы, продвигаясь дальше в решении проблемы информационной перегрузки. Многодокументное резюмирование также может выполняться в ответ на конкретный вопрос. Оно создает информационные отчеты, которые одновременно лаконичны и исчерпывающи. Объединяя различные точки зрения и представляя их в структурированном виде, каждая тема рассматривается с нескольких сторон в рамках одного документа. Если цель краткого резюме — упростить поиск информации и сократить время, указывая на наиболее релевантные исходные документы, то исчерпывающее многодокументное резюме само по себе должно содержать необходимую информацию, тем самым ограничивая необходимость обращения к оригинальным файлам случаями, когда требуется дополнительная детализация. Автоматические резюме представляют информацию, извлеченную из различных источников, алгоритмически, без какой-либо редакционной правки или субъективного вмешательства, что обеспечивает их полную объективность.

Разнообразие

Многодокументное экстрактивное резюмирование сталкивается с проблемой избыточности. В идеале, мы хотим извлекать предложения, которые одновременно "центральны" (то есть содержат основные идеи) и "разнообразны" (то есть отличаются друг от друга). Например, в наборе новостных статей об одном и том же событии, в каждой статье, вероятно, будет много похожих предложений. Для решения этой проблемы, LexRank применяет эвристический этап постобработки, который добавляет предложения в порядке ранжирования, но отбрасывает те, которые слишком похожи на уже включенные в резюме. Этот метод называется перекрестным подавлением информации в предложениях (CSIS). Эти методы основаны на идее, что предложения "рекомендуют" другие, похожие предложения читателю. Таким образом, если предложение очень похоже на многие другие, оно, скорее всего, будет иметь большое значение. Его важность также обусловлена важностью предложений, которые его "рекомендуют". Следовательно, чтобы получить высокий ранг и попасть в резюме, предложение должно быть похоже на множество предложений, которые, в свою очередь, также похожи на многие другие. Это интуитивно понятно и позволяет применять алгоритмы к любому новому тексту. Методы не зависят от предметной области и легко переносятся. Можно представить, что признаки, указывающие на важные предложения в новостной области, могут существенно отличаться от биомедицинской области. Однако, неконтролируемый подход, основанный на "рекомендациях", применим к любой области. Связанным методом является максимальная предельная релевантность (MMR), который использует алгоритм ранжирования общего назначения, такой как Page/Lex/TextRank, который обрабатывает как "центральность", так и "разнообразие" в единой математической структуре, основанной на поглощающих случайных блужданиях по марковской цепи (случайное блуждание, где определенные состояния завершают блуждание). Алгоритм называется GRASSHOPPER. Помимо явного стимулирования разнообразия в процессе ранжирования, GRASSHOPPER включает в себя предварительное ранжирование (на основе позиции предложения в случае резюмирования). Современные результаты в многодокументном резюмировании достигаются с использованием смесей субмодулярных функций. Эти методы позволили достичь самых современных результатов для корпусов Document Summarization Corpora, DUC 04–07. Схожие результаты были получены с использованием детерминантных точечных процессов (которые являются частным случаем субмодулярных функций) для DUC 04. Новый метод многоязычного многодокументного резюмирования, избегающий избыточности, генерирует идеограммы для представления значения каждого предложения в каждом документе, а затем оценивает сходство, сравнивая форму и положение идеограмм. Он не использует частоту слов, обучение или предварительную обработку. Он использует два параметра, задаваемых пользователем: эквивалентность (когда два предложения следует считать эквивалентными?) и релевантность (какой длины должно быть желаемое резюме?).

Субмодульные функции как общие инструменты для обобщения

Идея субмодульной функции множества недавно стала мощным инструментом моделирования для различных задач суммирования. Субмодульные функции естественным образом моделируют понятия охвата, информации, представления и разнообразия. Более того, несколько важных задач комбинаторной оптимизации возникают как частные случаи субмодульной оптимизации. Например, задача о покрытии множества является частным случаем субмодульной оптимизации, поскольку функция покрытия множества является субмодульной. Функция покрытия множества стремится найти подмножество объектов, покрывающих заданный набор концепций. Например, при создании резюме документа желательно, чтобы резюме охватывало все важные и релевантные концепции в документе. Это пример задачи о покрытии множества. Аналогично, задача о размещении объектов является частным случаем субмодульных функций. Функция размещения объектов также естественным образом моделирует охват и разнообразие. Другой пример задачи субмодульной оптимизации – использование детерминантного точечного процесса для моделирования разнообразия. Аналогично, процедура максимальной маржинальной релевантности также может рассматриваться как частный случай субмодульной оптимизации. Все эти важные модели, поощряющие охват, разнообразие и информативность, являются субмодульными. Кроме того, субмодульные функции могут быть эффективно объединены, и результирующая функция останется субмодульной. Таким образом, можно объединить одну субмодульную функцию, моделирующую разнообразие, другую, моделирующую охват, и использовать экспертную оценку для обучения правильной модели субмодульной функции для данной задачи. В то время как субмодульные функции хорошо подходят для задач суммирования, они также допускают очень эффективные алгоритмы оптимизации. Например, простой жадный алгоритм гарантирует постоянный коэффициент улучшения. Более того, жадный алгоритм чрезвычайно прост в реализации и может масштабироваться для работы с большими наборами данных, что очень важно для задач суммирования. Субмодульные функции достигли передовых результатов практически во всех задачах суммирования. Например, работа Lin и Bilmes, 2012 года, показала, что субмодульные функции достигают лучших на сегодняшний день результатов в системах DUC 04, DUC 05, DUC 06 и DUC 07 для суммирования документов. Аналогично, работа Lin и Bilmes, 2011 года, показала, что многие существующие системы автоматического суммирования являются примерами субмодульных функций. Это был прорывной результат, установивший субмодульные функции как подходящие модели для задач суммирования. Субмодульные функции также использовались для других задач суммирования. Tschiatschek и др., 2014 год, показали, что смеси субмодульных функций достигают передовых результатов для суммирования коллекций изображений. Аналогично, Bairi и др., 2015 год, показали полезность субмодульных функций для суммирования многодокументных иерархий тем. Субмодульные функции также успешно применялись для суммирования наборов данных машинного обучения.

Оценка

Наиболее распространенный способ оценки информативности автоматических резюме — сравнение их с эталонными резюме, созданными людьми. Оценка может быть внутренней или внешней, междокументной или внутридокументной.

Внутренние и внешние

Внутренняя оценка оценивает резюме напрямую, а внешняя – то, как система суммаризации влияет на выполнение другой задачи. Внутренние оценки в основном оценивали связность и информативность резюме. Внешние оценки, напротив, проверяли влияние суммаризации на такие задачи, как оценка релевантности, понимание прочитанного и т.п.

Межтекстовые и внутритекстовые

Внутритекстовая оценка оценивает результат работы конкретной системы суммаризации, в то время как межтекстовая оценка фокусируется на сравнительном анализе результатов нескольких систем суммаризации. Человеческие оценки часто существенно различаются в определении того, что представляет собой "хорошее" резюме, поэтому создание автоматизированного процесса оценки особенно сложно. Ручная оценка может быть использована, но она требует значительных затрат времени и усилий, поскольку предполагает, что люди должны читать не только сами резюме, но и исходные документы. Другие важные аспекты – это связность и полнота охвата. Наиболее распространенным методом оценки резюме является ROUGE (Recall Oriented Understudy for Gisting Evaluation). Он широко используется в системах суммаризации и перевода на конференциях NIST по пониманию документов. ROUGE – это метрика, основанная на полноте, которая определяет, насколько хорошо резюме охватывает содержание резюме, созданных человеком, именуемых эталонными. Она вычисляет совпадения n-грамм между автоматически сгенерированными резюме и ранее написанными человеческими резюме. Ориентация на полноту призвана стимулировать включение в резюме всех важных тем. Полнота может быть рассчитана для униграмм, биграмм, триграмм или 4-грамм. Например, ROUGE-1 – это доля униграмм, которые присутствуют как в эталонном резюме, так и в автоматическом резюме, относительно общего числа униграмм в эталонном резюме. Если имеется несколько эталонных резюме, их оценки усредняются. Высокая степень совпадения должна указывать на высокую степень общности концепций между двумя резюме. ROUGE не позволяет определить, является ли результат связным, то есть, логично ли связаны между собой предложения. Метрики ROUGE с более высоким порядком n-грамм в некоторой степени помогают решить эту проблему. Еще одна нерешенная задача – разрешение анафоры. Аналогично, для суммаризации изображений, Tschiatschek и др. разработали метрику Visual ROUGE, которая оценивает эффективность алгоритмов суммаризации изображений.

Домен-специфическое против домен-независимого обобщения

Техники обобщения, не зависящие от предметной области, используют наборы общих признаков для выявления информационно насыщенных фрагментов текста. Современные исследования сосредоточены на обобщении текстов конкретной предметной области с применением знаний, специфичных для этой области, таких как медицинские знания и онтологии для обобщения медицинских текстов.

Качественное

Основным недостатком систем оценки на сегодняшний день является необходимость наличия эталонного резюме (для некоторых методов – нескольких), для сравнения с автоматически созданными резюме. Это сложная и затратная задача. Требуются значительные усилия для создания корпусов текстов и соответствующих им резюме. Более того, некоторые методы требуют ручной разметки резюме (например, SCU в методе пирамиды). Наконец, все они проводят количественную оценку, основываясь на различных метриках сходства.

История

Первая публикация в этой области датируется 1957 годом (Ханс Питер Лун), с использованием статистического метода. Исследования значительно возросли в 2015 году. К 2016 году применялась техника частотно-обратной документальной частоты (TF-IDF). Резюмирование на основе шаблонов к 2016 году было признано наиболее эффективным методом для многодокументного резюмирования. В следующем году его превзошел латентный семантический анализ (LSA) в сочетании с неотрицательной матричной факторизацией (NMF). Хотя эти методы не заменили другие подходы и часто используются совместно с ними, к 2019 году методы машинного обучения стали доминировать в экстрактивном резюмировании отдельных документов, которое считалось приближающимся к стадии зрелости. К 2020 году область оставалась весьма активной, а исследования смещаются в сторону абстрактного суммирования и суммирования в реальном времени.

Последние подходы

Недавно распространение трансформерных моделей, вытесняющих более традиционные RNN (LSTM), обеспечило гибкость в преобразовании текстовых последовательностей в текстовые последовательности иного вида, что особенно хорошо подходит для автоматического реферирования. К таким моделям относятся T5 и Pegasus.