Введение

Информация без формальной модели данных

Неструктурированные данные (или неструктурированная информация) – это информация, которая не имеет предопределенной модели данных или не организована предопределенным образом. Неструктурированная информация обычно представлена в виде текста, но может также содержать данные, такие как даты, числа и факты. Это приводит к нерегулярности и неоднозначности, что затрудняет ее обработку традиционными программами по сравнению с данными, хранящимися в структурированном виде в базах данных или аннотированными (семантически размеченными) в документах. В 1998 году компания Merrill Lynch заявила, что "неструктурированные данные составляют подавляющее большинство данных в организации, по некоторым оценкам – до 80%". Источник этой цифры неясен, однако она принимается некоторыми специалистами. Другие источники приводят схожие или более высокие проценты неструктурированных данных. IDC и Dell EMC прогнозируют, что к 2020 году объем данных вырастет до 40 зеттабайт, что в 50 раз превышает объем данных начала 2010 года. В последнее время IDC и Seagate предсказали, что глобальная информационная сфера вырастет до 163 зеттабайт к 2025 году, и большая часть этого объема будет представлена неструктурированными данными. Журнал Computer World утверждает, что неструктурированная информация может составлять более 70–80% всех данных в организациях.

Предыстория

Самые ранние исследования в области бизнес-аналитики были сосредоточены на неструктурированных текстовых данных, а не на числовых данных. Уже в 1958 году исследователи в области компьютерных наук, такие как Х. П. Лун, уделяли особое внимание извлечению и классификации неструктурированного текста. Математические и технологические достижения, стимулированные машинным анализом текста, побудили ряд компаний исследовать возможные применения, что привело к развитию таких областей, как анализ тональности, выявление мнения клиентов и оптимизация работы колл-центров. Появление больших данных в конце 2000-х годов вызвало повышенный интерес к применению аналитики неструктурированных данных в современных областях, таких как предиктивная аналитика и анализ первопричин.

Работа с неструктурированными данными

Такие методы, как интеллектуальный анализ данных, обработка естественного языка (NLP) и анализ текста, предоставляют различные способы выявления закономерностей или интерпретации этой информации. Распространенные методы структурирования текста обычно включают ручную разметку метаданными или разметку частей речи для дальнейшего структурирования на основе интеллектуального анализа текста. Стандарт архитектуры управления неструктурированной информацией (UIMA) обеспечивает общую основу для обработки этой информации с целью извлечения смысла и создания структурированных данных об информации. Программное обеспечение, создающее структуру, пригодную для машинной обработки, может использовать лингвистическую, слуховую и визуальную структуру, присущую всем формам человеческого общения. Алгоритмы могут выводить эту внутреннюю структуру из текста, например, путем анализа морфологии слов, синтаксиса предложений и других закономерностей различного масштаба. Неструктурированная информация может быть обогащена и размечена для устранения неоднозначности, а затем применяются методы, основанные на релевантности, для облегчения поиска и обнаружения. Примеры "неструктурированных данных" включают книги, журналы, документы, метаданные, медицинские записи, аудио-, видеоматериалы, аналоговые данные, изображения, файлы и неструктурированный текст, такой как текст электронного письма, веб-страница или документ текстового редактора. Хотя основное содержание не имеет определенной структуры, оно обычно упаковывается в объекты (например, файлы или документы), которые сами по себе имеют структуру и, следовательно, представляют собой смесь структурированных и неструктурированных данных, но в совокупности все равно называется "неструктурированными данными". Например, HTML-веб-страница размечена, но HTML-разметка обычно служит исключительно для отображения. Она не передает значение или функцию размеченных элементов таким образом, чтобы поддерживать автоматическую обработку информационного содержания страницы. Разметка XHTML позволяет машинной обработке элементов, хотя обычно не передает семантическое значение размеченных терминов. Поскольку неструктурированные данные часто встречаются в электронных документах, часто предпочтительнее использовать систему управления контентом или документами, которая может классифицировать целые документы, чем передавать и обрабатывать данные внутри документов. Таким образом, управление документами обеспечивает возможность придания структуры коллекциям документов. Поисковые системы стали популярными инструментами для индексации и поиска таких данных, особенно текста.

Подходы к обработке естественного языка

Были разработаны специализированные вычислительные процессы для структурирования неструктурированных данных, содержащихся в текстовых документах. Эти процессы обычно предназначены для обработки наборов, состоящих из тысяч или даже миллионов документов, что значительно превышает возможности ручной аннотации. Некоторые из этих подходов основаны на концепции онлайн-аналитической обработки (OLAP) и могут поддерживаться моделями данных, такими как текстовые кубы. Как только метаданные документов становятся доступными через модель данных, создание сводок для подмножеств документов (то есть ячеек в текстовом кубе) может быть выполнено с использованием фразовых подходов.

Подходы в медицине и биомедицинских исследованиях

Биомедицинские исследования являются одним из основных источников неструктурированных данных, поскольку исследователи часто публикуют свои результаты в научных журналах. Хотя язык в этих документах затрудняет выделение структурных элементов (например, из-за сложной технической терминологии и требуемых для полной контекстуализации наблюдений знаний в предметной области), результаты этих исследований могут выявить связи между техническими и медицинскими исследованиями, а также указать на новые методы лечения заболеваний. Недавние попытки структурировать биомедицинские документы включают использование самоорганизующихся карт для выявления тематик в документах, универсальные алгоритмы неконтролируемого обучения и применение рабочего процесса CaseOLAP. CaseOLAP определяет связи между категориями фраз точно (идентифицирует связи), последовательно (обеспечивает высокую воспроизводимость) и эффективно. Эта платформа повышает доступность и предоставляет биомедицинскому сообществу инструменты для извлечения фраз, что расширяет возможности их применения в биомедицинских исследованиях. Термин "неструктурированные данные" редко используется в ЕС после вступления в силу GDPR в 2018 году. GDPR не упоминает и не определяет "неструктурированные данные", но использует слово "структурированные" следующим образом (без определения): в части 15 Общих положений GDPR указано: "Защита физических лиц должна распространяться на обработку персональных данных, если они содержатся в системе хранения". В статье 4 GDPR определение "системы хранения" звучит так: "система хранения означает любой структурированный набор персональных данных, к которым можно получить доступ по определенным критериям". (CJEU, Todistajat v. Tietosuojavaltuutettu, Jehovan, пункт 61). Если персональные данные легко извлекаются, то это система хранения и, следовательно, подпадает под действие GDPR, независимо от того, являются они "структурированными" или "неструктурированными". Большинство современных электронных систем, при наличии доступа и соответствующего программного обеспечения, позволяют легко извлекать данные.