Введение

Биоинформатика

Позиционная матрица весов (PWM), также известная как матрица весов, специфичных для позиции (PSWM), или матрица баллов, специфичных для позиции (PSSM), является распространенным способом представления мотивов (паттернов) в биологических последовательностях. PWM часто выводятся из набора выровненных последовательностей, которые, как считается, функционально связаны, и стали важной частью многих программных средств для вычислимого поиска мотивов.

Преобразование матрицы вероятности положения в матрицу веса положения

Чаще всего элементы в PWM рассчитываются как логарифмические отношения шансов. То есть, элементы PPM преобразуются с использованием фоновой модели так, что:

описывает, как элемент в PWM (слева), , может быть рассчитан. Самая простая фоновая модель предполагает, что каждая буква встречается в наборе данных с одинаковой частотой. То есть, значение для всех символов алфавита равно (0,25 для нуклеотидов и 0,05 для аминокислот). Применение этого преобразования к PPM M, указанной выше (без добавления псевдосчетов), дает:

Значения в матрице наглядно демонстрируют преимущество добавления псевдосчетов, особенно при использовании небольших наборов данных для построения M. Фоновая модель не обязательно должна иметь одинаковые значения для каждого символа: например, при изучении организмов с высоким содержанием GC, значения для и могут быть увеличены с соответствующим уменьшением значений для и . Когда элементы PWM рассчитываются с использованием логарифмов правдоподобия, оценка последовательности может быть вычислена путем сложения (а не умножения) соответствующих значений в каждой позиции PWM. Оценка последовательности дает представление о том, насколько данная последовательность отличается от случайной. Оценка равна 0, если последовательность имеет одинаковую вероятность быть функциональным участком и случайным участком. Оценка больше 0, если она с большей вероятностью является функциональным участком, чем случайным, и меньше 0, если она с большей вероятностью является случайным участком, чем функциональным (например, мотив ATAT содержит гораздо больше информации, чем мотив CCGG). Таким образом, уравнение для информационного содержания принимает вид:

где – фоновая частота буквы . Это соответствует расхождению Калбака–Лейблера или относительной энтропии. Однако было показано, что при использовании PSSM для поиска геномных последовательностей (см. ниже) эта равномерная коррекция может приводить к переоценке важности различных оснований в мотиве из-за неравномерного распределения n-меров в реальных геномах, что приводит к значительно большему количеству ложноположительных результатов.

Применение

Существуют различные алгоритмы для поиска совпадений PWM в последовательностях. Одним из примеров является алгоритм MATCH, реализованный в ModuleMaster. Более сложные алгоритмы для быстрого поиска по базам данных с использованием нуклеотидных и аминокислотных PWM/PSSM реализованы в программе possumsearch. Базовый PWM/PSSM не способен учитывать вставки и делеции. PSSM с дополнительными вероятностями вставки и делеции в каждой позиции может быть интерпретирована как скрытая марковская модель. Такой подход используется в Pfam.