Введение
Онлайн-сборник по биоинформатике и сопутствующим программным средствам. Единая медицинская языковая система (UMLS) – это сборник множества контролируемых словарей в биомедицинских науках (создана в 1986 году). Она предоставляет структуру сопоставления между этими словарями и, таким образом, позволяет осуществлять перевод между различными терминологическими системами; её также можно рассматривать как исчерпывающий тезаурус и онтологию биомедицинских понятий. UMLS также предоставляет средства для обработки естественного языка. Она предназначена главным образом для разработчиков систем в области медицинской информатики. UMLS состоит из источников знаний (баз данных) и набора программных инструментов. UMLS разработана и поддерживается Национальной медицинской библиотекой США, обновляется ежеквартально и доступна для бесплатного использования. Проект был инициирован в 1986 году Дональдом А. Б. Линдбергом, доктором медицинских наук, в то время директором Медицинской библиотеки, и руководился Бетси Хамфрис.
The Unified Medical Language System (UMLS) is a compendium of many controlled vocabularies in the biomedical sciences (created 1986). It provides a mapping structure among these vocabularies and thus allows one to translate among the various terminology systems; it may also be viewed as a comprehensive thesaurus and ontology of biomedical concepts. UMLS further provides facilities for natural language processing. It is intended to be used mainly by developers of systems in medical informatics. UMLS consists of Knowledge Sources (databases) and a set of software tools. The UMLS was designed and is maintained by the US National Library of Medicine, is updated quarterly and may be used for free. The project was initiated in 1986 by Donald A. B. Lindberg, M. D., then Director of the Library of Medicine, and directed by Betsy Humphreys.
Цель и применения
Количество биомедицинских ресурсов, доступных исследователям, огромно. Зачастую это создает проблему из-за большого объема документов, получаемых при поиске в медицинской литературе. Цель UMLS – улучшить доступ к этой литературе, способствуя разработке компьютерных систем, способных понимать биомедицинский язык. Это достигается путем преодоления двух основных препятствий: "разнообразие способов выражения одних и тех же понятий в различных машиночитаемых источниках и разными авторами" и "распределенность полезной информации между множеством разрозненных баз данных и систем".
Лицензирование
Пользователи системы обязаны подписать "соглашение UMLS" и предоставлять краткие ежегодные отчеты об использовании. Академические пользователи могут использовать UMLS бесплатно для исследовательских целей. Коммерческое или производственное использование требует лицензирования авторских прав на некоторые из входящих в состав исходных словарей.
Метатезавр
Метатезаурус является основой UMLS и содержит более 1 миллиона биомедицинских концептов и 5 миллионов названий концептов, все из которых происходят из более чем 100 включенных контролируемых словарей и систем классификации. Примеры включенных контролируемых словарей: CPT, ICD-10, MeSH, SNOMED CT, DSM-IV, LOINC, Терминология ВОЗ по неблагоприятным реакциям на лекарственные средства, UK Clinical Terms, RxNorm, Генная онтология и OMIM (см. полный список). Метатезаурус организован вокруг концептов, и каждый концепт имеет специфические атрибуты, определяющие его значение, и связан с соответствующими названиями концептов в исходных словарях. Представлены многочисленные связи между концептами, в том числе иерархические, такие как «является подклассом» для подклассов и «является частью» для субъединиц, а также ассоциативные, такие как «вызывается» или «в литературе часто встречается в контексте» (последнее получено из Medline). Область применения Метатезауруса определяется областью применения исходных словарей. Если различные словари используют разные названия для одного и того же концепта, или если они используют одно и то же название для разных концептов, это точно отражается в Метатезауре. Вся иерархическая информация из исходных словарей сохраняется в Метатезауре. Концепты Метатезауруса также могут быть связаны с ресурсами вне базы данных, например, с базами данных последовательностей генов.
Несоответствия и другие ошибки
Учитывая размер и сложность UMLS и его либеральную политику интеграции терминов, ошибки неизбежны. Эти ошибки включают в себя неоднозначность и избыточность, циклы в иерархических отношениях (когда концепция одновременно является предком и потомком другой), отсутствие предков (когда семантические типы родительской и дочерней концепций не связаны между собой) и семантическую инверсию (когда связь родитель-потомок с семантическими типами не соответствует самим концепциям). Эти ошибки выявляются и устраняются в процессе аудита UMLS. Ручной аудит может быть очень трудоемким и дорогостоящим. Исследователи пытались решить эту проблему различными способами. Для обнаружения этих ошибок можно использовать автоматизированные инструменты. Для структурных несоответствий (например, циклов) подойдет простое решение, основанное на порядке следования. Однако это не применимо, когда несоответствие возникает на уровне термина или концепции (связано с контекстуальным значением термина). В этом случае требуется использовать обоснованную стратегию поиска (представление знаний).
Поддерживающие программные инструменты
В дополнение к источникам знаний, Национальная медицинская библиотека также предоставляет дополнительные инструменты и ресурсы.