Введение
Процесс анализа текста для извлечения из него информации. Текстовый майнинг, текстовый анализ данных (TDM) или текстовая аналитика – это процесс получения высококачественной информации из текста. Он включает в себя «выявление компьютером новой, ранее неизвестной информации путем автоматического извлечения данных из различных письменных источников». Письменные источники могут включать веб-сайты, книги, электронные письма, отзывы и статьи. Высококачественная информация обычно получается путем выявления закономерностей и тенденций с использованием таких методов, как статистическое обучение. Согласно Hotho et al. (2005), можно выделить три различных подхода к текстовому майнингу: извлечение информации, анализ данных и процесс обнаружения знаний в базах данных (KDD). Текстовый майнинг обычно включает в себя структурирование входного текста (обычно синтаксический анализ, а также добавление и удаление определенных лингвистических признаков и последующее внесение в базу данных), выявление закономерностей в структурированных данных и, наконец, оценку и интерпретацию результатов. «Высокое качество» в текстовом майнинге обычно подразумевает сочетание релевантности, новизны и интересности. Типичные задачи текстового майнинга включают категоризацию текста, кластеризацию текста, извлечение понятий/сущностей, создание детализированных таксономий, анализ тональности, автоматическое реферирование документов и моделирование связей между сущностями (то есть изучение отношений между именованными сущностями). Текстовый анализ включает в себя информационный поиск, лексический анализ для изучения распределения частоты слов, распознавание образов, разметку/аннотацию, извлечение информации, методы анализа данных, включая анализ связей и ассоциаций, визуализацию и прогностическую аналитику. Основная цель – преобразовать текст в данные для анализа посредством применения обработки естественного языка (NLP), различных типов алгоритмов и аналитических методов. Важным этапом этого процесса является интерпретация собранной информации. Типичное применение – сканирование набора документов, написанных на естественном языке, с целью построения модели этого набора для задач прогнозной классификации или заполнения базы данных или поискового индекса извлеченной информацией. Документ является базовым элементом при начале текстового майнинга. Здесь мы определяем документ как единицу текстовых данных, которая обычно существует во многих типах коллекций.
Text mining, text data mining (TDM) or text analytics is the process of deriving high quality information from text. It involves "the discovery by computer of new, previously unknown information, by automatically extracting information from different written resources." Written resources may include websites, books, emails, reviews, and articles. High quality information is typically obtained by devising patterns and trends by means such as statistical pattern learning. According to Hotho et al. (2005) we can distinguish between three different perspectives of text mining: information extraction, data mining, and a knowledge discovery in databases (KDD) process. Text mining usually involves the process of structuring the input text (usually parsing, along with the addition of some derived linguistic features and the removal of others, and subsequent insertion into a database), deriving patterns within the structured data, and finally evaluation and interpretation of the output. 'High quality' in text mining usually refers to some combination of relevance, novelty, and interest. Typical text mining tasks include text categorization, text clustering, concept/entity extraction, production of granular taxonomies, sentiment analysis, document summarization, and entity relation modeling (i. e., learning relations between named entities). Text analysis involves information retrieval, lexical analysis to study word frequency distributions, pattern recognition, tagging/annotation, information extraction, data mining techniques including link and association analysis, visualization, and predictive analytics. The overarching goal is, essentially, to turn text into data for analysis, via the application of natural language processing (NLP), different types of algorithms and analytical methods. An important phase of this process is the interpretation of the gathered information. A typical application is to scan a set of documents written in a natural language and either model the document set for predictive classification purposes or populate a database or search index with the information extracted. The document is the basic element when starting with text mining. Here, we define a document as a unit of textual data, which normally exists in many types of collections.
Анализ текста
Текстовая аналитика описывает набор лингвистических, статистических и методов машинного обучения, которые моделируют и структурируют информационное содержание текстовых источников для бизнес-аналитики, разведочного анализа данных, исследований или расследований. Этот термин является примерно синонимом текстовой добычи данных (text mining); фактически, Ронен Фельдман в 2004 году модифицировал описание "текстовой добычи данных" 2000 года, чтобы описать "текстовую аналитику". Последний термин сейчас используется чаще в бизнес-среде, в то время как "текстовая добыча данных" применяется в некоторых из первых областей применения, начиная с 1980-х годов, особенно в исследованиях в области наук о жизни и в государственной разведке. Термин "текстовая аналитика" также описывает применение методов текстовой аналитики для решения бизнес-задач, как самостоятельно, так и в сочетании с запросами и анализом структурированных числовых данных. Общеизвестно, что 80 процентов информации, значимой для бизнеса, возникает в неструктурированном виде, преимущественно в текстовой форме. Эти методы и процессы выявляют и представляют знания – факты, бизнес-правила и взаимосвязи, которые в противном случае остаются скрытыми в тексте и недоступны для автоматизированной обработки.
Приложения
Технология интеллектуального анализа текста сейчас широко применяется для решения широкого спектра задач в государственных органах, научных исследованиях и бизнесе. Все эти группы могут использовать интеллектуальный анализ текста для управления документами и поиска информации, релевантной их повседневной деятельности. Юристы могут использовать интеллектуальный анализ текста для электронного обнаружения доказательств, например. Государственные органы и военные используют интеллектуальный анализ текста в целях национальной безопасности и разведки. Научные исследователи включают методы интеллектуального анализа текста в свои усилия по организации больших объемов текстовых данных (то есть для решения проблемы неструктурированной информации), для выявления идей, выраженных в тексте (например, анализ тональности в социальных сетях), и для поддержки научных открытий в таких областях, как биологические науки и биоинформатика. В бизнесе приложения используются для поддержки конкурентной разведки и автоматизированного размещения рекламы, а также для множества других задач.
Приложения безопасности
Многие программные пакеты для интеллектуального анализа текста предлагаются для применения в сфере безопасности, в частности для мониторинга и анализа открытых текстовых источников в сети Интернет, таких как новостные сайты, блоги и другие, в целях национальной безопасности. Они также используются в исследованиях, связанных с шифрованием и дешифрованием текста.
Биомедицинские применения
В биомедицинской литературе описан ряд приложений текстовой обработки данных, включая вычислительные подходы для поддержки исследований в области докинга белков, белковых взаимодействий и связей между белками и заболеваниями. Кроме того, благодаря наличию больших текстовых массивов данных о пациентах в клинической практике, наборов демографической информации в популяционных исследованиях и отчетов о неблагоприятных событиях, текстовая обработка данных может способствовать проведению клинических исследований и персонализированной медицины. Алгоритмы текстовой обработки данных позволяют проводить стратификацию и индексацию конкретных клинических событий в больших текстовых массивах данных о пациентах, содержащих информацию о симптомах, побочных эффектах и сопутствующих заболеваниях, полученную из электронных медицинских карт, отчетов о событиях и результатов диагностических тестов. Одним из онлайн-приложений текстовой обработки данных в биомедицинской литературе является PubGene – общедоступная поисковая система, объединяющая текстовую обработку данных в биомедицине с сетевой визуализацией. GoPubMed – это поисковая система, основанная на знаниях, для биомедицинских текстов. Методы текстовой обработки данных также позволяют извлекать новые знания из неструктурированных документов в клинической области.
Программные приложения
Методы и программное обеспечение для интеллектуального анализа текста также исследуются и разрабатываются крупными компаниями, включая IBM и Microsoft, для дальнейшей автоматизации процессов извлечения и анализа данных, а также различными компаниями, работающими в области поиска и индексации в целом, с целью повышения качества их результатов. В государственном секторе значительные усилия направлены на создание программного обеспечения для отслеживания и мониторинга террористической деятельности. Для учебных целей программное обеспечение Weka является одним из самых популярных вариантов в научном сообществе, служа отличной отправной точкой для начинающих. Для программистов на Python существует превосходный инструментарий NLTK для решения более общих задач. Для опытных программистов также доступна библиотека Gensim, специализирующаяся на представлении текста на основе векторных моделей слов.
Онлайн-приложения для медиа
Текстовый майнинг используется крупными медиакомпаниями, такими как Tribune Company, для выявления скрытых закономерностей в информации и улучшения поисковых возможностей для читателей, что повышает вовлеченность аудитории и увеличивает доход. Кроме того, редакторы получают возможность обмениваться, связывать и объединять новостные материалы на различных платформах, что значительно расширяет возможности монетизации контента.
Приложения для бизнеса и маркетинга
Текстовая аналитика используется в бизнесе, в частности, в маркетинге, например, в управлении взаимоотношениями с клиентами. Coussement и Van den Poel (2008) применяют её для улучшения прогностических моделей анализа оттока клиентов (ухода клиентов).
Анализ настроений
Анализ тональности может включать анализ продуктов, таких как фильмы, книги или отзывы об отелях, для оценки степени положительности отзыва о продукте. Для такого анализа может потребоваться размеченный набор данных или разметка аффективной окраски слов. Ресурсы для определения аффективной окраски слов и понятий были созданы для WordNet и ConceptNet соответственно. Текст использовался для выявления эмоций в смежной области аффективных вычислений. Текстовые подходы к аффективным вычислениям применялись к различным корпусам текстов, таким как оценки студентов, детские рассказы и новостные статьи.
Методы добычи научной литературы
Для получения информации из научной литературы разработаны вычислительные методы. Опубликованные подходы включают методы поиска, выявления новизны и разрешения омонимии в технических отчетах.
Программное обеспечение
Компьютерные программы для интеллектуального анализа текста доступны от многих коммерческих и открытых компаний и в различных источниках.
Ситуация в Соединенных Штатах
Законодательство США об авторском праве, и в особенности его положения о добросовестном использовании, означают, что текстовая обработка (text mining) в Америке, а также в других странах, допускающих добросовестное использование, таких как Израиль, Тайвань и Южная Корея, считается законной. Поскольку текстовая обработка носит преобразующий характер, то есть не заменяет исходное произведение, она признается правомерной в рамках добросовестного использования. Например, в рамках соглашения по делу Google Book председательствующий судья постановил, что проект Google по оцифровке книг, защищенных авторским правом, был законным, отчасти благодаря преобразующим возможностям, которые демонстрировал проект оцифровки, одной из которых является текстовая и информационная обработка данных.
Ситуация в Австралии
В австралийском законодательстве об авторском праве не предусмотрено исключений для извлечения текста и данных в соответствии с Законом об авторском праве 1968 года. Австралийская комиссия по реформе законодательства отметила, что вряд ли исключение, допускающее использование в целях "исследований и обучения", распространится и на эту область, поскольку это превысило бы требование "обоснованного объема".
Последствия
До недавнего времени веб-сайты в основном использовали поиск по тексту, который находил только документы, содержащие конкретные слова или фразы, заданные пользователем. Теперь, благодаря семантической сети, текстовый анализ позволяет находить контент, основываясь на значении и контексте (а не просто по конкретному слову). Кроме того, программное обеспечение для текстового анализа может использоваться для создания обширных информационных досье на конкретных людей и события. Например, можно создавать большие наборы данных, основанные на информации, извлеченной из новостных сообщений, для облегчения анализа социальных сетей или контрразведывательной деятельности. По сути, программное обеспечение для текстового анализа может выполнять функции, схожие с функциями аналитика разведданных или научного сотрудника библиотеки, хотя и с более узкой областью анализа. Текстовый анализ также применяется в некоторых спам-фильтрах электронной почты для определения характеристик сообщений, которые, вероятно, являются рекламой или другим нежелательным контентом. Текстовый анализ играет важную роль в определении настроений на финансовых рынках.