Введение
Техника суммирования текста. Выделение предложений — это техника, используемая для автоматического суммирования текста. В этом поверхностном подходе статистические эвристики применяются для определения наиболее важных предложений текста. Выделение предложений — это экономичный подход по сравнению с более сложными методами, требующими дополнительных знаний, таких как онтологии или лингвистические ресурсы. Проще говоря, "выделение предложений" работает как фильтр, пропускающий только содержательные предложения. Основной недостаток применения методов выделения предложений для суммирования заключается в потере связности в результирующем резюме. Тем не менее, резюме, составленное путем выделения предложений, могут дать ценные указания на основные идеи документа и часто оказываются достаточно понятными для читателей.
Sentence extraction is a technique used for automatic summarization of a text. In this shallow approach, statistical heuristics are used to identify the most salient sentences of a text. Sentence extraction is a low cost approach compared to more knowledge intensive deeper approaches which require additional knowledge bases such as ontologies or linguistic knowledge. In short "sentence extraction" works as a filter that allows only meaningful sentences to pass. The major downside of applying sentence extraction techniques to the task of summarization is the loss of coherence in the resulting summary. Nevertheless, sentence extraction summaries can give valuable clues to the main points of a document and are frequently sufficiently intelligible to human readers.
Процедура
Обычно для определения наиболее важных предложений в документе используется комбинация эвристических методов. Каждый метод присваивает предложению (положительную или отрицательную) оценку. После применения всех эвристических методов в резюме включаются предложения с наивысшими оценками. Отдельные эвристические методы взвешиваются в соответствии с их значимостью.
Ранние подходы и некоторые примеры эвристики
Основополагающие работы, заложившие основу для многих современных методов, были опубликованы Хансом Петером Луном в 1958 году и Х. П. Эдмундсоном в 1969 году. Лун предложил придавать больший вес предложениям в начале документа или абзаца. Эдмундсон подчеркнул важность слов из заголовка для составления резюме и впервые использовал стоп-списки для фильтрации неинформативных слов с низкой семантической ценностью (например, большинство грамматических слов, таких как "of", "the", "a"). Он также разделил слова на бонусные и стигматические, то есть слова, которые, вероятно, встречаются вместе с важной (например, словоформа "значимый") или неважной информацией. Его идея использования ключевых слов, то есть слов, которые значительно часто встречаются в документе, до сих пор является одной из основных эвристик современных систем автоматического реферирования. Благодаря наличию больших лингвистических корпусов, значение tf-idf, возникшее в информационном поиске, может быть успешно применено для выявления ключевых слов текста: если, например, слово "cat" встречается значительно чаще в тексте, подлежащем резюмированию (TF = "частота терминов"), чем в корпусе (IDF означает "обратная частота документов"; здесь под корпусом подразумевается "документ"), то "cat", вероятно, является важным словом текста; возможно, текст посвящен кошкам.