Введение
Извлечение упоминаний именованных сущностей в неструктурированном тексте в предопределенные категории.
Распознавание именованных сущностей (NER) (также известное как идентификация (именованных) сущностей, выделение фрагментов сущностей и извлечение сущностей) — это подзадача извлечения информации, целью которой является поиск и классификация именованных сущностей, упомянутых в неструктурированном тексте, в предопределенные категории, такие как имена людей, организации, местоположения, медицинские коды, временные выражения, количества, денежные суммы, проценты и т. д. Большинство исследований систем NER/NEE структурированы как работа с неразмеченным блоком текста, например, следующим:
Джим купил 300 акций Acme Corp. в 2006 году. И создание размеченного блока текста, выделяющего имена сущностей:
[Джим]Персона купил 300 акций [Acme Corp.]Организация в [2006]Время. В этом примере обнаружена и классифицирована персона, состоящая из одного токена, название компании из двух токенов и временное выражение. Современные системы NER для английского языка демонстрируют производительность, близкую к человеческой. Например, лучшая система, участвовавшая в MUC 7, показала результат 93,39% по F-мере, в то время как люди-аннотаторы – 97,60% и 96,95%.
Определение проблемы
В выражении «названная сущность» слово «названная» ограничивает задачу теми сущностями, для которых одна или несколько строк, таких как слова или фразы, (в достаточной степени) последовательно обозначают некоторый референт. Это тесно связано с жесткими десигнаторами, как определено Крипке, хотя на практике NER имеет дело со многими именами и референтами, которые не являются философски «жесткими». Например, автомобильная компания, созданная Генри Фордом в 1903 году, может именоваться Ford или Ford Motor Company, хотя «Форд» может относиться и ко многим другим сущностям (см. Ford). Жесткие десигнаторы включают собственные имена, а также термины для определенных биологических видов и веществ, но исключают местоимения (например, «он/она/оно»; см. разрешение кореференции), описания, выделяющие референт по его свойствам (см. также De dicto и de re), и названия для видов вещей, а не для отдельных экземпляров (например, «Банк»). Полное распознавание именованных сущностей часто разбивается, концептуально и, возможно, в реализации, на две отдельные задачи: обнаружение имен и классификация имен по типу сущностей, к которым они относятся (например, человек, организация или местоположение). Первая фаза обычно упрощается до задачи сегментации: имена определяются как непрерывные последовательности токенов, без вложенности, так что «Bank of America» является единым именем, несмотря на то, что внутри этого имени подстрока «America» сама по себе является именем. Эта задача сегментации формально аналогична чанкингу. Вторая фаза требует выбора онтологии для организации категорий сущностей. Временные выражения и некоторые числовые выражения (например, деньги, проценты и т. д.) также могут рассматриваться как именованные сущности в контексте задачи NER. Хотя некоторые экземпляры этих типов являются хорошими примерами жестких десигнаторов (например, 2001 год), есть также множество недействительных (например, я беру отпуск в «июне»). В первом случае 2001 год относится к 2001 году по григорианскому календарю. Во втором случае месяц июнь может относиться к месяцу неопределенного года (прошлый июнь, следующий июнь, каждый июнь и т. д.). Можно утверждать, что определение именованной сущности в таких случаях смягчается по практическим соображениям. Поэтому определение термина «названная сущность» не является строгим и часто требует пояснения в контексте его использования. В литературе предложено несколько иерархий типов именованных сущностей. Категории BBN, предложенные в 2002 году, используются для задач вопросно-ответной системы и состоят из 29 типов и 64 подтипов. Расширенная иерархия Секина, предложенная в 2002 году, включает 200 подтипов. В последнее время, в 2011 году, Риттер использовал иерархию, основанную на общих типах сущностей Freebase, в новаторских экспериментах по NER над текстом социальных сетей.
Подходы
Созданы системы NER, использующие лингвистические грамматические методы, а также статистические модели, такие как машинное обучение. Системы, основанные на грамматиках, разработанных вручную, обычно достигают более высокой точности, но при этом характеризуются меньшим охватом и требуют многомесячной работы опытных вычислительных лингвистов. Статистические системы NER обычно нуждаются в большом объеме вручную размеченных обучающих данных. Полуавтоматические подходы были предложены для снижения объема ручной разметки. Для машинного обучения NER использовались различные типы классификаторов, при этом условные случайные поля являются типичным выбором.
Проблематические области
В 2001 году исследования показали, что даже самые современные системы NER были недостаточно устойчивы, то есть системы NER, разработанные для одной области, как правило, показывали плохие результаты в других областях. Настройка систем NER для эффективной работы в новой области требует значительных усилий; это справедливо как для систем, основанных на правилах, так и для обучаемых статистических систем. Первые работы над системами NER в 1990-х годах были в основном направлены на извлечение информации из журналистских статей. Затем внимание переключилось на обработку военных депеш и докладов. Последующие этапы оценки автоматического извлечения контента (ACE) также включали несколько типов неформальных стилей текста, таких как веб-блоги и текстовые расшифровки телефонных разговоров. Начиная примерно с 1998 года, в сообществах молекулярной биологии, биоинформатики и обработки естественного языка в медицине наблюдается большой интерес к идентификации сущностей. Наиболее часто встречающейся сущностью в этой области были названия генов и продуктов генов. Также значительный интерес представляло распознавание химических соединений и лекарственных препаратов в контексте конкурса CHEMDNER, в котором участвовало 27 команд.
competition, with 27 teams participating in this task.
Текущие проблемы и исследования
Несмотря на высокие значения F1, полученные на наборе данных MUC 7, задача распознавания именованных сущностей далека от решения. Основные усилия направлены на снижение трудозатрат на аннотирование за счет использования полуобучающегося обучения, обеспечения устойчивой работы в различных областях и масштабирования до детальных типов сущностей. В последние годы многие проекты обратились к краудсорсингу, который является перспективным решением для получения высококачественных агрегированных оценок людей для контролируемых и полуобучающихся подходов машинного обучения в NER. Другой сложной задачей является разработка моделей для работы со сложными лингвистическими контекстами, такими как Twitter и поисковые запросы. Некоторые исследователи проводили сравнения производительности NER различных статистических моделей, таких как HMM (скрытая марковская модель), ME (максимальная энтропия) и CRF (условные случайные поля), а также наборов признаков. Недавно некоторые исследователи предложили полуобучающую модель на основе графов для задач NER, специфичных для языка. Недавно появившаяся задача идентификации "важных выражений" в тексте и установления связей с Википедией может рассматриваться как пример чрезвычайно детального распознавания именованных сущностей, где типы соответствуют фактическим страницам Википедии, описывающим (потенциально неоднозначные) понятия. Ниже приведен пример вывода системы Викификации:
<ENTITY url="https://en. wikipedia. org/wiki/Michael I. Jordan">Michael Jordan</ENTITY> – профессор в <ENTITY url="https://en. wikipedia. org/wiki/University of California, Berkeley">Berkeley</ENTITY>.
<ENTITY url="https://en. wikipedia. org/wiki/Michael I. Jordan"> Michael Jordan </ENTITY> is a professor at <ENTITY url="https://en. wikipedia. org/wiki/University of California, Berkeley"> Berkeley </ENTITY>
Еще одна область, в которой достигнут прогресс, но которая остается сложной, – это применение NER к Twitter и другим микроблогам, которые считаются "зашумленными" из-за нестандартной орфографии, краткости и неформальности текстов. Исследовательские сообщества организовывали задачи NER для английских твитов, чтобы сравнить производительность различных подходов, таких как двунаправленные LSTM, Learning to Search или CRF.