Введение
Машинное чтение неструктурированных документов
Извлечение информации (IE) – это задача автоматического извлечения структурированной информации из неструктурированных и/или полуструктурированных машиночитаемых документов и других источников, представленных в электронном виде. Как правило, это включает обработку текстов на естественном языке с помощью обработки естественного языка (NLP). Недавние разработки в области обработки мультимедийных документов, такие как автоматическая аннотация и извлечение контента из изображений, аудио, видео и документов, можно рассматривать как извлечение информации. Последние достижения в методах NLP позволили значительно улучшить производительность по сравнению с предыдущими годами. Примером может служить извлечение из новостных сообщений о корпоративных слияниях, таких как формальное отношение: , из предложения онлайн-новости, например: "Вчера компания Foo Inc., базирующаяся в Нью-Йорке, объявила о приобретении Bar Corp.".
Information extraction (IE) is the task of automatically extracting structured information from unstructured and/or semi structured machine readable documents and other electronically represented sources. Typically, this involves processing human language texts by means of natural language processing (NLP). Recent activities in multimedia document processing like automatic annotation and content extraction out of images/audio/video/documents could be seen as information extraction. Recent advances in NLP techniques have allowed for significantly improved performance compared to previous years. An example is the extraction from newswire reports of corporate mergers, such as denoted by the formal relation:
,
from an online news sentence such as:
"Yesterday, New York based Foo Inc. announced their acquisition of Bar Corp."
Широкая цель IE – позволить выполнять вычисления на ранее неструктурированных данных. Более конкретная цель – обеспечить автоматизированное рассуждение о логической форме входных данных. Структурированные данные – это семантически чётко определённые данные из выбранной целевой области, интерпретируемые в зависимости от категории и контекста. Извлечение информации является частью более масштабной задачи, связанной с разработкой автоматических методов управления текстом, выходящих за рамки его передачи, хранения и отображения. В области информационного поиска (IR) разработаны автоматические методы, как правило, статистического характера, для индексации больших коллекций документов и их классификации. Другой дополнительный подход – это обработка естественного языка (NLP), которая с большим успехом решила задачу моделирования обработки человеческого языка, учитывая масштабность этой задачи. По сложности и направленности IE занимает промежуточное положение между IR и NLP. Что касается входных данных, IE предполагает наличие набора документов, в которых каждый документ соответствует шаблону, то есть описывает одно или несколько сущностей или событий подобным образом, как и другие документы, но с отличающимися деталями. Например, рассмотрим группу новостных статей о латиноамериканском терроризме, где предполагается, что каждая статья основана на одном или нескольких террористических актах. Мы также определяем для каждой задачи IE шаблон, который представляет собой (или набор) фреймов аргументов (case frame) для хранения информации, содержащейся в одном документе. В примере с терроризмом шаблон будет содержать слоты, соответствующие лицу, совершившему теракт, жертве, оружию и дате события. Система IE для этой задачи должна "понимать" статью об атаке лишь в той мере, чтобы найти данные, соответствующие слотам в этом шаблоне.
История
Добыча информации берет свое начало в конце 1970-х годов, в первые дни обработки естественного языка (NLP). Ранней коммерческой системой середины 1980-х годов была JASPER, разработанная для Reuters компанией Carnegie Group Inc с целью предоставления финансовых новостей в реальном времени финансовым трейдерам. Начиная с 1987 года, развитие ИЭ было стимулировано серией конференций по пониманию сообщений (Message Understanding Conferences). MUC – это конференция, основанная на соревновательном принципе, которая была сосредоточена на следующих областях: MUC 1 (1987), MUC 3 (1989): Сообщения о военно-морских операциях. MUC 3 (1991), MUC 4 (1992): Терроризм в странах Латинской Америки. MUC 5 (1993): Совместные предприятия и микроэлектроника. MUC 6 (1995): Новостные статьи об изменениях в руководстве. MUC 7 (1998): Отчеты о запусках спутников. Значительную поддержку оказало Агентство перспективных исследовательских проектов Министерства обороны США (DARPA), которое стремилось автоматизировать рутинные задачи, выполняемые государственными аналитиками, такие как просмотр газет на предмет возможных связей с терроризмом.
MUC 1 (1987), MUC 3 (1989): Naval operations messages. MUC 3 (1991), MUC 4 (1992): Terrorism in Latin American countries. MUC 5 (1993): Joint ventures and microelectronics domain. MUC 6 (1995): News articles on management changes. MUC 7 (1998): Satellite launch reports. Considerable support came from the U. S. Defense Advanced Research Projects Agency (DARPA), who wished to automate mundane tasks performed by government analysts, such as scanning newspapers for possible links to terrorism.
Современное значение
В настоящее время значимость извлечения информации (ИИ) обусловлена растущим объемом информации, представленной в неструктурированном виде. Тим Бернерс-Ли, изобретатель Всемирной паутины, называет существующий Интернет сетью документов и выступает за то, чтобы большая часть контента была представлена как сеть данных. До тех пор, пока это не произойдет, Интернет в основном будет состоять из неструктурированных документов, лишенных семантических метаданных. Знания, содержащиеся в этих документах, можно сделать более доступными для машинной обработки путем преобразования в реляционную форму или посредством разметки тегами XML. Интеллектуальному агенту, отслеживающему новостную ленту, требуется извлечение информации для преобразования неструктурированных данных в формат, пригодный для логических выводов. Типичное применение извлечения информации – сканирование набора документов, написанных на естественном языке, и заполнение базы данных извлеченными данными.
Приложения Всемирной паутины
Извлечение информации (ИИ) было в центре внимания конференций MUC. Однако распространение сети Интернет усилило потребность в разработке систем ИИ, которые помогают людям справляться с огромным объемом данных, доступных в сети. Системы, выполняющие ИИ из онлайн-текста, должны соответствовать требованиям низкой стоимости, гибкости разработки и легкой адаптации к новым областям. Системы MUC не соответствуют этим критериям. Более того, лингвистический анализ, выполняемый для неструктурированного текста, не использует теги HTML/XML и форматы разметки, доступные в онлайн-текстах. В результате для ИИ в сети были разработаны менее ресурсоемкие подходы с использованием оберток – наборов высокоточных правил, извлекающих содержимое конкретной страницы. Ручная разработка оберток оказалась трудоемкой задачей, требующей высокой квалификации. Методы машинного обучения, с обучением с учителем или без учителя, используются для автоматического получения таких правил. Обертки обычно обрабатывают высокоструктурированные коллекции веб-страниц, такие как каталоги товаров и телефонные справочники. Однако они оказываются неэффективными при работе с менее структурированным текстом, что также часто встречается в сети Интернет. Недавние усилия в области адаптивного извлечения информации стимулируют разработку систем ИИ, способных обрабатывать различные типы текста – от хорошо структурированного до почти свободноформатного, где обычные обертки не работают, включая смешанные типы. Такие системы могут использовать неглубокие знания естественного языка и, следовательно, также могут применяться к менее структурированным текстам. Недавним развитием является визуальное извлечение информации, которое основано на отображении веб-страницы в браузере и создании правил на основе близости областей на отображенной веб-странице. Это помогает извлекать сущности из сложных веб-страниц, которые могут демонстрировать визуальный шаблон, но не имеют различимого шаблона в исходном коде HTML.