Введение

Онлайн-биомедицинская база данных PubMed — это бесплатная база данных, включающая в основном базу данных MEDLINE, содержащую ссылки и аннотации по наукам о жизни и биомедицинским темам. Национальная медицинская библиотека США (NLM) при Национальных институтах здоровья поддерживает эту базу данных в рамках системы поиска информации Entrez. С 1971 по 1997 год доступ к базе данных MEDLINE осуществлялся преимущественно через институциональные ресурсы, такие как университетские библиотеки. PubMed, впервые представленный в январе 1996 года, ознаменовал начало эпохи частного, бесплатного поиска по MEDLINE из дома и офиса. Система PubMed стала общедоступной и бесплатной с июня 1997 года. Ссылки PMC NCBI Bookshelf.

Многие записи PubMed содержат ссылки на полные тексты статей, некоторые из которых находятся в свободном доступе, часто в PubMed Central и локальных зеркалах, таких как Europe PubMed Central. Информацию о журналах, индексируемых в MEDLINE и доступных через PubMed, можно найти в каталоге NLM. По состоянию на 2023 год PubMed содержит более 35 миллионов цитат и аннотаций, начиная с 1966 года, выборочно – до 1865 года и в очень ограниченном объеме – до 1809 года. На ту же дату 24,6 миллиона записей PubMed содержат аннотации, а 26,8 миллиона записей имеют ссылки на полные текстовые версии (из которых 10,9 миллиона статей доступны в полном объеме и бесплатно). За последние 10 лет (до 31 декабря 2019 года) ежегодно добавлялось в среднем около одного миллиона новых записей. В 2016 году NLM изменила систему индексации, предоставив издателям возможность напрямую исправлять опечатки и ошибки в статьях, индексируемых в PubMed. Сообщалось, что PubMed включает некоторые статьи, опубликованные в недобросовестных (хищнических) журналах. Политика MEDLINE и PubMed в отношении отбора журналов для включения в базу данных несколько различается. Недостатки в критериях и процедурах индексации журналов в PubMed Central могут приводить к попаданию публикаций из недобросовестных журналов в PubMed. Национальная медицинская библиотека заявила, что отдельные статьи журналов могут быть включены в PMC для поддержки политики открытого доступа к результатам исследований, финансируемых государством, и что строгие правила в отношении журналов и издателей обеспечивают целостность литературных баз данных NLM.

Дизайн сайта

В октябре 2009 года был запущен новый интерфейс PubMed, который способствовал использованию быстрых поисковых запросов, напоминающих запросы в Google; их также описывали как поиски "телеграфного" типа. По умолчанию результаты сортируются по дате добавления, но можно изменить порядок сортировки на наилучшее соответствие, дату публикации, первого автора, последнего автора, журнал или название. Дизайн и домен веб-сайта PubMed были обновлены в январе 2020 года и стали настройками по умолчанию 15 мая 2020 года вместе с обновленными и новыми функциями. Многие исследователи, часто использующие этот сайт, отреагировали на изменения критически.

PubMed для портативных/мобильных устройств

PubMed/MEDLINE доступен на портативных устройствах, например, с помощью опции "PICO" (для формулирования клинических вопросов), разработанной NLM. Также доступна опция "PubMed Mobile", обеспечивающая доступ к упрощенной версии PubMed, оптимизированной для мобильных устройств.

Всесторонний поиск

Для оптимального поиска в PubMed необходимо понимать его основную составляющую, MEDLINE, и особенно контролируемый словарь MeSH (Medical Subject Headings – медицинские предметные рубрики), используемый для индексации статей MEDLINE. Могут также потребоваться сложные стратегии поиска, использование названий полей (тегов), правильное применение ограничений и других функций; услуги по поиску предлагают справочные библиотекари и специалисты по поиску. Поиск непосредственно в окне поиска PubMed рекомендуется только для поиска однозначных тем или новых вмешательств, для которых еще не создан заголовок MeSH, а также для поиска коммерческих названий лекарственных средств и собственных имен. Это также полезно, когда нет подходящего заголовка или дескриптор отражает лишь частичный аспект темы. Поиск с использованием тезауруса MeSH более точен и обеспечивает меньше нерелевантных результатов. Кроме того, он позволяет избежать недостатков поиска по свободному тексту, где необходимо учитывать различия в написании, единственном и множественном числе, а также сокращениях. Однако, статьи, недавно добавленные в базу данных и еще не снабженные дескрипторами, не будут найдены. Поэтому, для гарантии исчерпывающего поиска, необходимо использовать комбинацию заголовков контролируемой терминологии и свободных текстовых запросов.

Параметры статьи журнала

Когда статья журнала индексируется, извлекается и сохраняется в виде структурированных данных множество параметров статьи. К таким параметрам относятся: тип статьи (термины MeSH, например, «клиническое исследование»), вторичные идентификаторы (термины MeSH), язык, страна издания журнала или история публикации (дата электронной публикации, дата публикации в печатном журнале).

Тип публикации: клинические запросы/систематические обзоры

Параметр типа публикации позволяет искать по типу публикации, в том числе отчеты о различных видах клинических исследований.

Вторичный идентификатор

С июля 2005 года процесс индексации статей MEDLINE извлекает идентификаторы из аннотации статьи и помещает их в поле под названием Вторичный идентификатор (SI). Поле вторичного идентификатора предназначено для хранения номеров доступа к различным базам данных молекулярных последовательностей, экспрессии генов или химических соединений, а также идентификаторов клинических испытаний. Для клинических испытаний PubMed извлекает идентификаторы испытаний из двух крупнейших реестров: ClinicalTrials.gov (идентификатор NCT) и Международного реестра рандомизированных контролируемых исследований (идентификатор IRCTN).

Картирование на MeSH

PubMed автоматически связывает запросы с терминами и подразделами MeSH. Например, запрос "bad breath" (неприятный запах изо рта) связывается (и включается в поиск) с термином "halitosis" (галитоз), "heart attack" (инфаркт сердца) – с "myocardial infarction" (инфаркт миокарда), "breast cancer" (рак молочной железы) – с "breast neoplasms" (новообразования молочной железы). При необходимости эти термины MeSH автоматически "расширяются", то есть включают более специфичные термины. Такие запросы, как "nursing" (сестринское дело), автоматически связываются с "Nursing [MeSH]" (МеSH: сестринское дело) или "Nursing [Subheading]" (Подраздел: сестринское дело). Эта функция называется Auto Term Mapping (автоматическое сопоставление терминов) и включена по умолчанию при свободном текстовом поиске, но не при поиске точной фразы (то есть при заключении поискового запроса в двойные кавычки). Эта функция повышает чувствительность поиска в PubMed и позволяет избежать ложноотрицательных результатов, компенсируя разнообразие медицинской терминологии. Доступ к разделу "My NCBI" (Мой НКБИ) можно получить с любого компьютера, имеющего доступ в Интернет. Ранее "My NCBI" назывался "PubMed Cubby".

Ссылка

LinkOut – это сервис NLM, обеспечивающий связь и доступ к полным текстам локальных журнальных изданий. По состоянию на 2010 год в этом сервисе NLM участвуют около 3200 организаций (в основном учебных заведений), от университета Ольборг в Дании до ZymoGenetics в Сиэтле. Пользователи этих организаций видят логотип своего учреждения в результатах поиска PubMed (если журнал имеется в фонде этого учреждения) и могут получить доступ к полному тексту. В рамках крупного обновления платформы, запланированного на лето 2019 года, LinkOut будет объединен с инструментом Outside Tool.

Пубмедиа

В 2016 году PubMed предоставил авторам статей возможность комментировать статьи, проиндексированные в PubMed. Эта функция изначально тестировалась в пилотном режиме (с 2013 года) и стала постоянной в 2016 году. В феврале 2018 года PubMed Commons был закрыт в связи с тем, что "активность пользователей оставалась незначительной".

askMEDLINE

askMEDLINE, инструмент для поиска по MEDLINE/PubMed на естественном языке в свободной форме, разработанный NLM, также подходит для портативных устройств.

Добыча данных PubMed

Альтернативные методы извлечения данных из PubMed используют среды программирования, такие как Matlab, Python или R. В этих случаях запросы к PubMed записываются в виде строк кода и отправляются в PubMed, а затем ответ обрабатывается непосредственно в среде программирования. Код может быть автоматизирован для систематического запроса по различным ключевым словам, таким как заболевание, год, органы и т.п. Помимо своей традиционной роли биомедицинской базы данных, PubMed стал распространенным ресурсом для обучения биомедицинских языковых моделей. Недавние достижения в этой области включают разработку моделей, таких как PubMedGPT – модель с 2,7 миллиардами параметров, обученная на данных PubMed Стэнфордским CRFM, и Microsoft BiomedCLIP PubMedBERT, использующая пары подписей к рисункам из PubMed Central для задач обработки изображений и текста. Эти модели демонстрируют значительный потенциал данных PubMed для расширения возможностей ИИ в медицинских исследованиях и здравоохранении. Эти достижения подчеркивают растущую взаимосвязь между крупномасштабным извлечением данных и разработкой ИИ в биомедицинской сфере. Данные, доступные в PubMed, можно локально зеркалировать с помощью неофициального инструмента, такого как MEDOC. Миллионы записей PubMed дополняют различные открытые наборы данных об открытом доступе, такие как Unpaywall. Инструменты анализа данных, такие как Unpaywall Journals, используются библиотеками для помощи в отказе от крупных подписок: библиотеки могут избежать оплаты за материалы, которые уже доступны в режиме открытого доступа через открытые архивы, такие как PubMed Central.