Введение
Информация без формальной модели данных
Unstructured data (or unstructured information) is information that either does not have a pre defined data model or is not organized in a pre defined manner. Unstructured information is typically text heavy, but may contain data such as dates, numbers, and facts as well. This results in irregularities and ambiguities that make it difficult to understand using traditional programs as compared to data stored in fielded form in databases or annotated (semantically tagged) in documents. In 1998, Merrill Lynch said "unstructured data comprises the vast majority of data found in an organization, some estimates run as high as 80%." It's unclear what the source of this number is, but nonetheless it is accepted by some. Other sources have reported similar or higher percentages of unstructured data. , IDC and Dell EMC project that data will grow to 40 zettabytes by 2020, resulting in a 50 fold growth from the beginning of 2010. More recently, IDC and Seagate predict that the global datasphere will grow to 163 zettabytes by 2025 and majority of that will be unstructured. The Computer World magazine states that unstructured information might account for more than 70–80% of all data in organizations.
Неструктурированные данные (или неструктурированная информация) – это информация, которая не имеет предопределенной модели данных или не организована предопределенным образом. Неструктурированная информация обычно представлена в виде текста, но может также содержать данные, такие как даты, числа и факты. Это приводит к нерегулярности и неоднозначности, что затрудняет ее обработку традиционными программами по сравнению с данными, хранящимися в структурированном виде в базах данных или аннотированными (семантически размеченными) в документах. В 1998 году компания Merrill Lynch заявила, что "неструктурированные данные составляют подавляющее большинство данных в организации, по некоторым оценкам – до 80%". Источник этой цифры неясен, однако она принимается некоторыми специалистами. Другие источники приводят схожие или более высокие проценты неструктурированных данных. IDC и Dell EMC прогнозируют, что к 2020 году объем данных вырастет до 40 зеттабайт, что в 50 раз превышает объем данных начала 2010 года. В последнее время IDC и Seagate предсказали, что глобальная информационная сфера вырастет до 163 зеттабайт к 2025 году, и большая часть этого объема будет представлена неструктурированными данными. Журнал Computer World утверждает, что неструктурированная информация может составлять более 70–80% всех данных в организациях.
Unstructured data (or unstructured information) is information that either does not have a pre defined data model or is not organized in a pre defined manner. Unstructured information is typically text heavy, but may contain data such as dates, numbers, and facts as well. This results in irregularities and ambiguities that make it difficult to understand using traditional programs as compared to data stored in fielded form in databases or annotated (semantically tagged) in documents. In 1998, Merrill Lynch said "unstructured data comprises the vast majority of data found in an organization, some estimates run as high as 80%." It's unclear what the source of this number is, but nonetheless it is accepted by some. Other sources have reported similar or higher percentages of unstructured data. , IDC and Dell EMC project that data will grow to 40 zettabytes by 2020, resulting in a 50 fold growth from the beginning of 2010. More recently, IDC and Seagate predict that the global datasphere will grow to 163 zettabytes by 2025 and majority of that will be unstructured. The Computer World magazine states that unstructured information might account for more than 70–80% of all data in organizations.
Предыстория
Самые ранние исследования в области бизнес-аналитики были сосредоточены на неструктурированных текстовых данных, а не на числовых данных. Уже в 1958 году исследователи в области компьютерных наук, такие как Х. П. Лун, уделяли особое внимание извлечению и классификации неструктурированного текста. Математические и технологические достижения, стимулированные машинным анализом текста, побудили ряд компаний исследовать возможные применения, что привело к развитию таких областей, как анализ тональности, выявление мнения клиентов и оптимизация работы колл-центров. Появление больших данных в конце 2000-х годов вызвало повышенный интерес к применению аналитики неструктурированных данных в современных областях, таких как предиктивная аналитика и анализ первопричин.
Работа с неструктурированными данными
Такие методы, как интеллектуальный анализ данных, обработка естественного языка (NLP) и анализ текста, предоставляют различные способы выявления закономерностей или интерпретации этой информации. Распространенные методы структурирования текста обычно включают ручную разметку метаданными или разметку частей речи для дальнейшего структурирования на основе интеллектуального анализа текста. Стандарт архитектуры управления неструктурированной информацией (UIMA) обеспечивает общую основу для обработки этой информации с целью извлечения смысла и создания структурированных данных об информации. Программное обеспечение, создающее структуру, пригодную для машинной обработки, может использовать лингвистическую, слуховую и визуальную структуру, присущую всем формам человеческого общения. Алгоритмы могут выводить эту внутреннюю структуру из текста, например, путем анализа морфологии слов, синтаксиса предложений и других закономерностей различного масштаба. Неструктурированная информация может быть обогащена и размечена для устранения неоднозначности, а затем применяются методы, основанные на релевантности, для облегчения поиска и обнаружения. Примеры "неструктурированных данных" включают книги, журналы, документы, метаданные, медицинские записи, аудио-, видеоматериалы, аналоговые данные, изображения, файлы и неструктурированный текст, такой как текст электронного письма, веб-страница или документ текстового редактора. Хотя основное содержание не имеет определенной структуры, оно обычно упаковывается в объекты (например, файлы или документы), которые сами по себе имеют структуру и, следовательно, представляют собой смесь структурированных и неструктурированных данных, но в совокупности все равно называется "неструктурированными данными". Например, HTML-веб-страница размечена, но HTML-разметка обычно служит исключительно для отображения. Она не передает значение или функцию размеченных элементов таким образом, чтобы поддерживать автоматическую обработку информационного содержания страницы. Разметка XHTML позволяет машинной обработке элементов, хотя обычно не передает семантическое значение размеченных терминов. Поскольку неструктурированные данные часто встречаются в электронных документах, часто предпочтительнее использовать систему управления контентом или документами, которая может классифицировать целые документы, чем передавать и обрабатывать данные внутри документов. Таким образом, управление документами обеспечивает возможность придания структуры коллекциям документов. Поисковые системы стали популярными инструментами для индексации и поиска таких данных, особенно текста.
Подходы к обработке естественного языка
Были разработаны специализированные вычислительные процессы для структурирования неструктурированных данных, содержащихся в текстовых документах. Эти процессы обычно предназначены для обработки наборов, состоящих из тысяч или даже миллионов документов, что значительно превышает возможности ручной аннотации. Некоторые из этих подходов основаны на концепции онлайн-аналитической обработки (OLAP) и могут поддерживаться моделями данных, такими как текстовые кубы. Как только метаданные документов становятся доступными через модель данных, создание сводок для подмножеств документов (то есть ячеек в текстовом кубе) может быть выполнено с использованием фразовых подходов.
Подходы в медицине и биомедицинских исследованиях
Биомедицинские исследования являются одним из основных источников неструктурированных данных, поскольку исследователи часто публикуют свои результаты в научных журналах. Хотя язык в этих документах затрудняет выделение структурных элементов (например, из-за сложной технической терминологии и требуемых для полной контекстуализации наблюдений знаний в предметной области), результаты этих исследований могут выявить связи между техническими и медицинскими исследованиями, а также указать на новые методы лечения заболеваний. Недавние попытки структурировать биомедицинские документы включают использование самоорганизующихся карт для выявления тематик в документах, универсальные алгоритмы неконтролируемого обучения и применение рабочего процесса CaseOLAP. CaseOLAP определяет связи между категориями фраз точно (идентифицирует связи), последовательно (обеспечивает высокую воспроизводимость) и эффективно. Эта платформа повышает доступность и предоставляет биомедицинскому сообществу инструменты для извлечения фраз, что расширяет возможности их применения в биомедицинских исследованиях. Термин "неструктурированные данные" редко используется в ЕС после вступления в силу GDPR в 2018 году. GDPR не упоминает и не определяет "неструктурированные данные", но использует слово "структурированные" следующим образом (без определения): в части 15 Общих положений GDPR указано: "Защита физических лиц должна распространяться на обработку персональных данных, если они содержатся в системе хранения". В статье 4 GDPR определение "системы хранения" звучит так: "система хранения означает любой структурированный набор персональных данных, к которым можно получить доступ по определенным критериям". (CJEU, Todistajat v. Tietosuojavaltuutettu, Jehovan, пункт 61). Если персональные данные легко извлекаются, то это система хранения и, следовательно, подпадает под действие GDPR, независимо от того, являются они "структурированными" или "неструктурированными". Большинство современных электронных систем, при наличии доступа и соответствующего программного обеспечения, позволяют легко извлекать данные.
Parts of GDPR Recital 15, "The protection of natural persons should apply to the processing of personal data if contained in a filing system." GDPR Article 4, "‘filing system’ means any structured set of personal data which are accessible according to specific criteria "
GDPR Case law on what defines a "filing system"; "the specific criterion and the specific form in which the set of personal data collected by each of the members who engage in preaching is actually structured is irrelevant, so long as that set of data makes it possible for the data relating to a specific person who has been contacted to be easily retrieved, which is however for the referring court to ascertain in the light of all the circumstances of the case in the main proceedings.” (CJEU, Todistajat v. Tietosuojavaltuutettu, Jehovan, Paragraph 61). If personal data is easily retrieved then it is a filing system and then it is in scope for GDPR regardless of being "structured" or "unstructured". Most electronic systems today, subject to access and applied software, can allow for easy retrieval of data.