Введение

Биомедицинский анализ текста для извлечения релевантной информации и знаний. Биомедицинский анализ текста (включая биомедицинскую обработку естественного языка или BioNLP) охватывает методы и изучение возможностей применения анализа текста к текстам и литературе в биомедицинской области. Как область исследований, биомедицинский анализ текста объединяет идеи из обработки естественного языка, биоинформатики, медицинской информатики и вычислительной лингвистики. Методы, используемые в этой области, применяются к биомедицинской литературе, доступной через такие сервисы, как PubMed. В последние годы научная литература перешла на электронное издание, однако объем доступной информации может быть подавляющим. Эта революция в издательском деле привела к высокому спросу на методы анализа текста. Анализ текста обеспечивает поиск информации (IR) и распознавание сущностей (ER). IR позволяет находить релевантные публикации по интересующей теме, например, с помощью PubMed. ER используется для идентификации определенных биологических терминов (например, белков или генов) для последующей обработки.

Рассмотрение

Применение методов интеллектуального анализа текста к биомедицинским текстам требует учета специфических особенностей, характерных для данной области.

Доступность аннотированных текстовых данных

Большие аннотированные корпуса, используемые для разработки и обучения методов интеллектуального анализа текста общего назначения (например, наборы диалогов из фильмов, отзывы о товарах или текст статей Википедии), не предназначены для работы с биомедицинским языком. Хотя они могут демонстрировать общие свойства текста, такие как части речи, они редко содержат понятия, представляющие интерес для биологов или врачей-клиницистов. Разработка новых методов для выявления особенностей биомедицинских документов, следовательно, требует создания специализированных корпусов. Ресурсы, призванные помочь в разработке новых методов интеллектуального анализа биомедицинских текстов, были созданы в рамках конкурсов Informatics for Integrating Biology and the Bedside (i2b2) и биомедицинскими информатиками. Специалисты по интеллектуальному анализу текста часто комбинируют эти корпуса с контролируемыми словарями и онтологиями, доступными через Единую медицинскую языковую систему (UMLS) Национальной медицинской библиотеки и медицинские предметные рубрики (MeSH). Методы, основанные на машинном обучении, часто требуют очень больших наборов данных для обучения и построения полезных моделей. Ручная аннотация больших текстовых корпусов нереалистична. Поэтому обучающие данные могут быть получены с использованием слабого обучения или исключительно статистических методов.

Изменение структуры данных

Как и другие текстовые документы, биомедицинские документы содержат неструктурированные данные. Научные публикации представлены в различных форматах, содержат разные типы информации и перемежаются рисунками, таблицами и другим нетекстовым контентом. Важную информацию, подлежащую извлечению с помощью текстового анализа, можно найти как в неструктурированном тексте, так и в полуструктурированных элементах документов, таких как таблицы. Клинические документы могут различаться по структуре и языку в разных отделениях и учреждениях. Другие типы биомедицинского текста, например, инструкции к лекарственным препаратам, могут соответствовать общим структурным принципам, но при этом не содержать достаточной детализации.

Неопределенность

В биомедицинской литературе встречаются сообщения о наблюдениях, которые не всегда являются констатациями фактов. Текст может выражать сомнение или скептицизм относительно выдвигаемых утверждений. Без специальной адаптации методы интеллектуального анализа текста, предназначенные для выявления утверждений, могут ошибочно интерпретировать эти осторожные высказывания как факты.

Поддержка клинических потребностей

Приложения для биомедицинской текстовой обработки, разработанные для клинической практики, в идеале должны соответствовать потребностям и запросам врачей-клиницистов.

Совместимость с клиническими системами

Новые системы интеллектуального анализа текста должны работать с существующими стандартами, электронными медицинскими картами и базами данных, но требуют значительных организационных усилий для внедрения и поддержки.

Конфиденциальность пациентов

Системы интеллектуального анализа текста, работающие с конфиденциальными медицинскими данными, должны обеспечивать их защиту и гарантировать анонимизацию там, где это уместно.

Процессы

Особое внимание уделяется конкретным подзадачам при обработке биомедицинского текста. Химические соединения, лекарственные препараты и названия заболеваний часто используются в качестве именованных сущностей. Большинство методов распознавания именованных сущностей опираются на предопределенные лингвистические признаки или словари, хотя методы, использующие глубокое обучение и векторные представления слов, также показали хорошие результаты в биомедицинском NER.

Классификация и кластеризация документов

Биомедицинские документы могут быть классифицированы или сгруппированы в кластеры на основе их содержания и тематики. При классификации категории документов задаются вручную, а при кластеризации документы формируют отдельные группы, зависящие от используемого алгоритма. Обе эти задачи являются примерами задач с учителем и без учителя, соответственно, однако целью обеих является создание подмножеств документов, выделенных по их характерным признакам. Методы кластеризации биомедицинских документов часто используют алгоритм k-средних.

Определение сигналов хеджирования

Проблема выявления неопределенных или "ограниченных" утверждений решалась посредством обнаружения индикаторов смягчения в биомедицинской литературе. На практике этот процесс включает в себя выделение фраз и предложений, выражающих основные аргументы, выдвигаемые авторами документа (процесс, известный как извлечение аргументов, использующий инструменты, применяемые в таких областях, как политология), и сравнение этих аргументов для выявления потенциальных противоречий между ними. Биомедицинские базы знаний, содержащие подобные сведения, обычно создаются в результате трудоемкой ручной обработки, поэтому автоматизация этих усилий остается важным направлением исследований.

Поиск информации и ответы на вопросы

Биомедицинский текстовый анализ поддерживает приложения для выявления документов и концепций, соответствующих поисковым запросам. Поисковые системы, такие как поиск в PubMed, позволяют пользователям осуществлять поиск в литературных базах данных по словам или фразам, содержащимся в тексте документов, метаданных или индексах, например, MeSH. Аналогичные подходы могут использоваться для поиска медицинской литературы. Для получения более детализированных результатов некоторые приложения позволяют пользователям выполнять поиск, используя запросы на естественном языке, и выявлять конкретные биомедицинские взаимосвязи. 16 марта 2020 года Национальная медицинская библиотека и другие организации запустили набор открытых исследовательских данных COVID-19 (CORD-19) для обеспечения возможности текстового анализа текущей литературы о новом вирусе. Набор данных размещен в проекте Semantic Scholar Института искусственного интеллекта им. Аллена. Среди других участников – Google, Microsoft Research, Центр безопасности и новых технологий и инициатива Чан Цукерберг.

Корпора

В следующей таблице приведены выбор биомедицинских текстовых корпусов и их содержимое. Эти элементы включают аннотированные корпуса, источники биомедицинской исследовательской литературы и ресурсы, часто используемые в качестве ссылок на словарь и/или онтологию, такие как MeSH. Материалы, помеченные "Да" в разделе "Свободно доступны", могут быть загружены из общедоступного источника. +Biomedical Text CorporaCorpus NameAuthors or GroupContentsFreely AvailableCitation2019 Bacteria BiotopeBioNLP OSTАннотированные научные и учебные тексты для распознавания упоминаний микроорганизмов, микробных биотопов и фенотипов, для нормализации этих упоминаний в соответствии с ресурсами знаний в этой области и для извлечения взаимосвязей между ними. Да2006 i2b2 Deidentification and Smoking Challengei2b2889 деидентифицированных медицинских выписок с аннотациями для идентификации пациента и характеристик курения. Да, с регистрацией2008 i2b2 Obesity Challengei2b21,237 деидентифицированных медицинских выписок, аннотированных по наличию или отсутствию сопутствующих заболеваний ожирения. Да, с регистрацией2009 i2b2 Medication Challengei2b21,243 деидентифицированных медицинских выписок, аннотированных для названий и деталей лекарств, включая дозировку, режим, частоту, продолжительность, причину и присутствие в списке или повествовательной структуре. Да, с регистрацией2010 i2b2 Relations Challengei2b2Медицинские выписки с аннотациями медицинских проблем, тестов, лечения и взаимосвязей между этими понятиями. Только часть этих записей данных доступна для исследований из-за ограничений IRB. Да, с регистрацией2012 i2b2 Temporal Relations Challengei2b2310 деидентифицированных медицинских выписок, аннотированных для событий и временных отношений. Да, с регистрацией2014 i2b2 Heart Disease Risk Factors Challengei2b21,304 деидентифицированных продольных медицинских записей с аннотациями факторов риска сердечно-сосудистых заболеваний. Да, с регистрациейAIMedBunescu et al.200 рефератов с аннотациями для белко-белковых взаимодействий, а также отрицательные примеры рефератов, не содержащие белко-белковых взаимодействий. ДаBioC BioGRIDBioCreAtIvE120 полных текстов научных статей с аннотациями для белко-белковых взаимодействий. ДаBioCreAtIvE 1BioCreAtIvE15,000 предложений (10,000 для обучения и 5,000 для тестирования) с аннотациями для названий белков и генов. 1,000 полных текстов биомедицинских исследовательских статей с аннотациями названий белков и терминов генной онтологии. ДаBioCreAtIvE 2BioCreAtIvE15,000 предложений (10,000 для обучения и 5,000 для тестирования, отличающихся от первого корпуса) с аннотациями для названий белков и генов. 542 реферата, связанных с идентификаторами EntrezGene. Различные научные статьи с аннотациями по особенностям белко-белковых взаимодействий. ДаBioCreative V CDR Task Corpus (BC5CDR)BioCreAtIvE1,500 статей (заголовок и реферат), опубликованных в 2014 году или позже, с аннотациями для 4,409 химических веществ, 5,818 заболеваний и 3116 химико-заболевных взаимодействий. ДаBioInferPyysalo et al.1,100 предложений из рефератов биомедицинских исследований с аннотациями отношений, именованных сущностей и синтаксических зависимостей. НетBioScopeVincze et al.1,954 клинических отчета, 9 статей и 1,273 реферата с аннотациями для лингвистического охвата и терминов, обозначающих отрицание или неопределенность. ДаBioText Recognizing Abbreviation DefinitionsBioText Project1,000 рефератов на тему "дрожжи", с аннотациями для аббревиатур и их значений. ДаBioText Protein–Protein Interaction DataBioText Project1,322 предложения, описывающих белко-белковые взаимодействия между ВИЧ-1 и человеческими белками, с аннотациями типов взаимодействия. ДаComparative Toxicogenomics DatabaseDavis et al. База данных, содержащая курируемые вручную ассоциации между химическими веществами, генными продуктами, фенотипами, заболеваниями и воздействием окружающей среды. ДаCRAFTVerspoor et al.97 полных текстов биомедицинских публикаций с аннотациями лингвистических структур и биологических концепций. ДаGENIA CorpusGENIA Project1,999 биомедицинских исследовательских рефератов на темы "человек", "кровяные клетки" и "факторы транскрипции", с аннотациями для частей речи, синтаксиса, терминов, событий, отношений и корреференций. ДаFamPlexBachman et al. Имена и семейства белков, связанные с уникальными идентификаторами. Включает наборы аффиксов. ДаFlySlip AbstractsFlySlip82 реферата исследований на Drosophila с аннотациями названий генов. ДаFlySlip Full PapersFlySlip5 исследовательских статей о Drosophila с аннотациями анафорических отношений между именными фразами, относящимися к генам и биологически связанным сущностям. ДаFlySlip Speculative SentencesFlySlipБолее 1,500 предложений, аннотированных как спекулятивные или неспекулятивные. Включает аннотации предложений. ДаIEPADing et al.486 предложений из рефератов биомедицинских исследований с аннотациями для пар одновременно встречающихся химических веществ, включая белки. НетJNLPBA corpusKim et al. Расширенная версия версии 3 корпуса GENIA для задач NER. НетLearning Language in Logic (LLL)Nédellec et al.77 предложений из исследовательских статей о бактерии Bacillus subtilis, аннотированных для белко-генных взаимодействий. ДаMedical Subject Headings (MeSH)National Library of MedicineИерархически организованная терминология для индексирования и каталогизации биомедицинских документов. ДаMetathesaurusNational Library of Medicine / UMLS3.67 миллиона концепций и 14 миллионов названий концепций, сопоставленных между более чем 200 источниками биомедицинской лексики и идентификаторов. Да, с лицензионным соглашением UMLS MIMIC IIIMIT Lab for Computational PhysiologyДеидентифицированные данные, связанные с 53,423 отдельными госпитализациями взрослых пациентов. Требуется обучение и формальный запрос на доступODIE CorpusSavova et al.180 клинических заметок с аннотациями 5,992 пар корреференции. НетOHSUMEDHersh et al.348,566 биомедицинских исследовательских рефератов и информации об индексировании из MEDLINE, включая MeSH (по состоянию на 1991 год). ДаPMC Open Access SubsetNational Library of Medicine / PubMed CentralБолее 2 миллионов исследовательских статей, обновляемых еженедельно. ДаRxNormNational Library of Medicine / UMLSНормализованные названия клинических лекарств и упаковок лекарств, с комбинированными ингредиентами, концентрациями и формой, и присвоенными типами из семантической сети. Да, с лицензионным соглашением UMLS Semantic NetworkNational Library of Medicine / UMLSСписки 133 семантических типов и 54 семантических отношений, охватывающих биомедицинские концепции и лексику. Да, с лицензионным соглашением UMLS SPECIALIST LexiconNational Library of Medicine / UMLSСинтаксический лексикон биомедицинского и общего английского языка. ДаWord Sense Disambiguation (WSD)National Library of Medicine / UMLS203 неоднозначных слова и 37,888 автоматически извлеченных экземпляров их использования в биомедицинских исследовательских публикациях. Да, с лицензионным соглашением UMLS YapexFranzén et al.200 биомедицинских исследовательских рефератов с аннотациями названий белков. Нет

Вставки слов

Несколько групп разработали наборы биомедицинской лексики, сопоставленные с векторами вещественных чисел, известные как векторы слов или векторные представления слов. Источники предварительно обученных векторных представлений, специфичных для биомедицинской лексики, перечислены в таблице ниже. Большинство из них являются результатами модели word2vec, разработанной Миколовым и др., или её вариациями. +Biomedical word embeddingsНазвание набораАвторы или группаСодержание и источникСсылкаBioASQword2vecBioASQВекторы, полученные с помощью word2vec из 10 876 004 английских аннотаций PubMed. bio.nlplab.org/resourcesPyysalo et al. Коллекция векторов слов, полученных различными подходами и обученных на текстах из PubMed и PubMed Central. BioVecAsgari и MofradВекторы для последовательностей генов и белков, обученные на данных Swiss-Prot. RadiologyReportEmbeddingBanerjee et al. Векторы, полученные с помощью word2vec из текста 10 000 радиологических заключений.

Приложения

Приложения интеллектуального анализа текста в биомедицинской области включают вычислительные подходы, помогающие в исследованиях докинга белков и ассоциаций между белками и заболеваниями. Методы интеллектуального анализа текста обладают рядом преимуществ по сравнению с традиционной ручной курацией при выявлении ассоциаций. Алгоритмы интеллектуального анализа текста способны идентифицировать и извлекать информацию из огромного объема литературы более эффективно, чем при ручной курации. Это включает интеграцию данных из различных источников, таких как литература, базы данных и экспериментальные результаты. Эти алгоритмы коренным образом изменили процесс идентификации и приоритизации новых генов и ассоциаций генов с заболеваниями, которые ранее оставались незамеченными. Эти методы закладывают основу для систематического поиска в упущенной научной и биомедицинской литературе, которая может содержать важные связи между исследованиями. Комбинирование информации может привести к новым открытиям и гипотезам, особенно при интеграции наборов данных. Важно отметить, что качество базы данных не менее важно, чем ее размер. Разработаны перспективные методы интеллектуального анализа текста, такие как iProLINK (интегрированная информация и знания о белковой литературе), для курации источников данных, которые могут способствовать исследованиям в области интеллектуального анализа текста, включая картографирование библиографии, извлечение аннотаций, распознавание именованных сущностей белков и разработку онтологии белков. Курируемые базы данных, такие как UniProt, могут ускорить доступ к целевой информации не только для генетических последовательностей, но и для литературы и филогенетических данных.

Идентификация генов кластера

Разработаны методы определения связи между группами генов, выявленными в экспериментах с использованием микромассивов, и биологическим контекстом, представленным в соответствующей литературе.

Взаимодействие с белками

Было изучено автоматическое извлечение белковых взаимодействий и ассоциаций белков с функциональными концепциями (например, термины генной онтологии). Поисковая система PIE была разработана для идентификации и извлечения упоминаний о взаимодействиях между белками из статей, проиндексированных в MEDLINE. Извлечение кинетических параметров из текста, а также определение субклеточного расположения белков также решались с использованием технологий извлечения информации и текстовой обработки.

Генетические ассоциации

Компьютерная приоритизация генов — важный этап в понимании генетической основы заболеваний, особенно в анализе генетической связи. Текстовая добыча и другие вычислительные инструменты извлекают релевантную информацию, включая ассоциации генов с заболеваниями и другие данные, из множества источников, а затем применяют различные алгоритмы ранжирования для определения приоритетности генов на основе их значимости для конкретного заболевания. Текстовая добыча и приоритизация генов позволяют исследователям сосредоточить усилия на наиболее перспективных кандидатах для дальнейшего изучения. Вычислительные инструменты для приоритизации генов продолжают разрабатываться и анализироваться. Одна группа исследовала эффективность различных методов текстовой добычи для приоритизации генов, связанных с заболеваниями. Они изучили различные предметные словари, схемы представления текста и алгоритмы ранжирования, чтобы найти оптимальный подход к выявлению генов, вызывающих заболевания, и установить эталонные показатели.

Ассоциации генетических признаков

Группа сельскохозяйственной геномики идентифицировала гены, связанные с репродуктивными признаками крупного рогатого скота, используя, в частности, текстовый майнинг.

Применение фразовой майнинга к ассоциациям болезней

В исследовании по анализу текстов была собрана коллекция из 709 основных белков внеклеточного матрикса и ассоциированных с ними белков, на основе двух баз данных: MatrixDB (matrixdb. univ lyon1. fr) и UniProt. Этот набор белков обладал удобным размером и богатым объемом сопутствующей информации, что делало его подходящим для применения инструментов анализа текстов. Исследователи провели анализ фразового майнинга для сопоставления отдельных белков внеклеточного матрикса в биомедицинской литературе, касающейся шести категорий сердечно-сосудистых заболеваний. Они использовали конвейер фразового майнинга – Context aware Semantic Online Analytical Processing (CaseOLAP) – и затем семантически оценили все 709 белков по критериям целостности, популярности и уникальности, используя конвейер CaseOLAP. Исследование анализа текстов подтвердило известные взаимосвязи и выявило ранее не установленные биологические процессы в сердечно-сосудистой патофизиологии. Кроме того, были разработаны поисковые системы и системы индексации, специализированные для биомедицинских данных, включая DataMed и OmicsDI. Некоторые поисковые системы, такие как Essie, OncoSearch, PubGene и GoPubMed, ранее были общедоступны, но впоследствии были закрыты, устарели или интегрированы в коммерческие продукты.

Системы анализа медицинских записей

Электронные медицинские карты (ЭМК) и электронные истории болезни (ЭИБ) собираются медицинским персоналом в процессе диагностики и лечения. Хотя эти карты обычно включают структурированные компоненты с предсказуемыми форматами и типами данных, остальная часть отчетов часто представлена в виде свободного текста, что затрудняет поиск и создает проблемы в оказании помощи пациентам. Для анализа этих фрагментов свободного текста разработано множество комплексных систем и инструментов. Система MedLEE изначально разрабатывалась для анализа отчетов о рентгенологии органов грудной клетки, но впоследствии была расширена для работы с другими типами отчетов. Система клинического анализа текста и извлечения знаний, или cTAKES, выполняет аннотацию клинического текста с использованием словаря понятий. Система CLAMP предлагает аналогичную функциональность с удобным пользовательским интерфейсом.

Рамки

Были разработаны вычислительные платформы для быстрой разработки инструментов для задач биомедицинского текстового анализа. SwellShark – это платформа для биомедицинского NER, не требующая размеченных человеком данных, но использующая ресурсы для слабого обучения (например, семантические типы UMLS). Фреймворк SparkText использует потоковую обработку данных Apache Spark, NoSQL базу данных и базовые методы машинного обучения для построения предиктивных моделей на основе научных статей.

АПИ

Некоторые инструменты биомедицинского анализа текстов и обработки естественного языка доступны через программные интерфейсы приложений, или API. NOBLE Coder осуществляет распознавание концептов посредством API.

Журналы

В ряде академических журналов, публикующих статьи по биологии и медицине, рассматриваются вопросы, связанные с интеллектуальным анализом текста и программным обеспечением для обработки естественного языка. Некоторые журналы, такие как Journal of the American Medical Informatics Association (JAMIA) и Journal of Biomedical Informatics, пользуются популярностью среди публикаций по этим темам.