Введение
Инструмент профилирования последовательностей в биоинформатике – это тип программного обеспечения, который предоставляет информацию, относящуюся к генетической последовательности, названию гена или ключевому слову, введенному в качестве запроса. Как правило, такие инструменты принимают запрос, например, последовательность ДНК, РНК или белка, или ключевое слово, и осуществляют поиск в одной или нескольких базах данных для получения информации, связанной с этим запросом. Сводки и обобщенные результаты представляются в стандартизированном формате, описывая информацию, сбор которой в противном случае потребовал бы посещения множества небольших веб-сайтов или непосредственного поиска в научной литературе. Многие инструменты профилирования последовательностей являются программными порталами или шлюзами, упрощающими процесс поиска информации о запросе в постоянно растущем числе баз данных биоинформатики. Доступ к этим инструментам возможен как через веб-интерфейс, так и посредством локально загружаемых исполняемых файлов.
Введение и использование
Эпоха "постгеномики" привела к появлению множества веб-инструментов и программного обеспечения для сбора, организации и предоставления больших объемов информации о первичной последовательности, а также белковых структурах, аннотациях генов, выравниваниях последовательностей и других распространенных биоинформатических задач. В целом, существует три типа баз данных и поставщиков услуг. Первый включает в себя популярные общедоступные или базы данных с открытым доступом, поддерживаемые финансированием и грантами, такие как NCBI, ExPASy, Ensembl и PDB. Второй включает в себя более мелкие или специализированные базы данных, организованные и составленные отдельными исследовательскими группами. Примерами служат база данных генома дрожжей и база данных РНК. Третий, последний тип – это частные корпоративные или институциональные базы данных, доступ к которым требует оплаты или институциональной принадлежности. Такие примеры встречаются редко, учитывая глобализацию общедоступных баз данных, если только предлагаемая услуга находится в разработке или конечная точка анализа имеет коммерческую ценность. Типичные сценарии профилирования становятся актуальными, особенно в случаях первых двух групп, когда исследователи часто стремятся объединить информацию, полученную из нескольких источников, об одной запрошенной или целевой последовательности. Например, пользователи могут использовать инструмент выравнивания последовательностей и поиска BLAST для идентификации гомологов интересующего гена в других видах, а затем использовать эти результаты для поиска известной структуры белка для одного из гомологов. Аналогично, они также могут захотеть узнать вероятную вторичную структуру мРНК, кодирующей интересующий ген, или узнать, продает ли какая-либо компания ДНК-конструкцию, содержащую этот ген. Инструменты профилирования последовательностей служат для автоматизации и интеграции процесса поиска такой разнородной информации, делая процесс поиска в нескольких различных внешних базах данных прозрачным для пользователя. Многие общедоступные базы данных уже тесно связаны между собой, так что дополнительная информация из другой базы данных легко доступна; например, Genbank и PDB тесно взаимосвязаны. Однако специализированные инструменты, организованные и поддерживаемые конкретными исследовательскими группами, бывает трудно интегрировать в эти усилия по установлению связей, поскольку они узкоспециализированы, часто модифицируются или используют нестандартные версии общих форматов файлов. Преимущества инструментов профилирования последовательностей включают возможность использования нескольких таких специализированных инструментов в одном запросе и представления результатов с помощью единого интерфейса, возможность направлять результаты работы одного набора инструментов или поиска в базе данных на вход другого, а также возможность распределить задачи по хостингу и компиляции между сетью исследовательских групп и учреждений, а не сосредотачивать их в одном централизованном репозитории.
Профилирующие инструменты на основе ключевых слов
Большинство инструментов профилирования, доступных в сети сегодня, относятся к этой категории. Пользователь, посетив сайт или инструмент, вводит соответствующую информацию, такую как ключевое слово, например, дистрофия, диабет и т. д., или номера доступа GenBank, идентификатор PDB. Все релевантные результаты поиска представляются в формате, уникальном для основной направленности каждого инструмента. Инструменты профилирования, основанные на поиске по ключевым словам, по сути являются специализированными поисковыми системами для биоинформатики, что позволяет исключить множество нерелевантных или ненаучных результатов, которые могут возникнуть при использовании традиционной поисковой системы, такой как Google. Большинство инструментов профилирования на основе ключевых слов допускают различные типы ввода ключевых слов, номера доступа из проиндексированных баз данных, а также традиционные дескрипторы ключевых слов. Каждый инструмент профилирования имеет свою специфику и область применения. Например, поисковая система NCBI Entrez разделяет результаты по категориям, позволяя пользователям, ищущим информацию о структуре белка, отсеивать последовательности без соответствующей структуры, а интересующимся изучением литературы по теме – просматривать аннотации статей, опубликованных в научных журналах, без отвлечения на результаты по генам или последовательностям. База данных биомедицинской литературы PubMed является популярным инструментом для поиска литературы, хотя по своим возможностям она почти не уступает более универсальной Google Scholar. Сервисы агрегации данных на основе ключевых слов, такие как Bioinformatic Harvester, предоставляют отчеты с различных сторонних серверов в исходном формате, избавляя пользователей от необходимости посещать веб-сайты или устанавливать программное обеспечение для каждого отдельного компонента. Это особенно ценно, учитывая быстрое появление различных сайтов, предлагающих различные инструменты анализа и манипулирования последовательностями. Другой агрегирующий веб-портал, Human Protein Reference Database (Hprd), содержит вручную аннотированные и курированные записи для человеческих белков. Таким образом, предоставляемая информация является одновременно отборной и исчерпывающей, а формат запроса – гибким и интуитивно понятным. Преимущества разработки вручную курируемых баз данных включают в себя представление проверенного материала и концепцию «авторитетов по молекулам», которые берут на себя ответственность за конкретные белки. Однако их недостатки заключаются в том, что они обычно обновляются медленнее и могут не содержать самую свежую или спорную информацию.
Профилирующие устройства, основанные на данных последовательности
Типичный инструмент профилирования последовательностей идет еще дальше, используя фактическую последовательность ДНК, РНК или белка в качестве входных данных и позволяя пользователю обращаться к различным веб-инструментам анализа для получения необходимой информации. Такие инструменты часто поставляются вместе с коммерческим лабораторным оборудованием, например, с секвенаторами генов, или продаются как программные приложения для молекулярной биологии. В качестве другого примера публичной базы данных, отчет о поиске последовательностей BLAST от NCBI содержит ссылку из своего отчета о выравнивании на другую релевантную информацию в своих собственных базах данных, если такая конкретная информация существует. Например, извлеченная запись, содержащая человеческую последовательность, будет содержать отдельную ссылку, ведущую к ее местоположению на карте генома человека; запись, содержащая последовательность, для которой была определена трехмерная структура, будет содержать ссылку, ведущую к ее базе данных структур. Sequerome, инструмент общедоступной службы, связывает весь отчет BLAST со многими сторонними серверами/сайтами, предоставляющими высокоспециализированные услуги по манипулированию последовательностями, такие как карты рестрикционных ферментов, анализ открытых областей считывания для нуклеотидных последовательностей и предсказание вторичной структуры. Инструмент предоставляет дополнительное преимущество в виде ведения журнала операций, выполненных пользователем, который затем можно удобно архивировать с помощью функций «отправить по почте», «распечатать» или «сохранить». Таким образом, весь процесс исследования последовательности с использованием различных исследовательских инструментов и, следовательно, завершения проекта может быть выполнен в одном интерфейсе браузера. Следовательно, будущие поколения инструментов профилирования последовательностей будут включать возможность онлайн-сотрудничества с исследователями для обмена журналами проектов и исследовательскими инструментами, аннотирования результатов анализа последовательностей или лабораторных работ, настройки и автоматизации обработки наборов данных последовательностей и т. д. InstaSeq — это поисковый инструмент на базе Google, который позволяет пользователю напрямую вводить последовательность и искать по всему World Wide Web. Эта уникальная поисковая система, единственная в своем роде, отличается от поиска в конкретных базах данных, например, GenBank. В результате пользователь может получить доступ к частному документу или странице из менее известной базы данных практически из любой точки мира. Хотя в настоящее время профилировщиков на основе последовательностей немного, их ключевая роль станет очевидной, когда потребуется перекрестная обработка огромных объемов данных о последовательностях через различные порталы и домены.
Будущий рост и направления
Распространение биоинформатических инструментов для генетического анализа помогает исследователям выявлять и классифицировать гены и наборы генов, представляющие интерес для их работы; однако большое разнообразие инструментов, выполняющих в значительной степени схожие агрегативные и аналитические функции, может также дезориентировать и разочаровывать новых пользователей. Децентрализация, стимулируемая агрегирующими инструментами, позволяет отдельным исследовательским группам поддерживать специализированные серверы, предназначенные для конкретных типов анализа данных, с ожиданием, что их результаты будут включены в более полный отчет о гене или белке, представляющем интерес для других исследователей. Данные, полученные в результате экспериментов с использованием микрочипов, двухгибридного скрининга и других высокопроизводительных биологических экспериментов, являются объемными и сложными для ручного анализа; усилия коллабораций в области структурной геномики, направленные на быстрое определение большого количества разнообразных белковых структур, также повышают необходимость интеграции между базами данных и порталами последовательностей и структур. Этот стимул к разработке более комплексных и удобных методов профилирования последовательностей делает эту область активным направлением исследований среди современных геномистов.