Кіріспе
Биоинформатика
Позициялық салмақ матрицасы (PWM), сондай-ақ позицияға қарай салмақ матрицасы (PSWM) немесе позицияға қарай бағалау матрицасы (PSSM) деп те аталады, биологиялық тізбектердегі мотивтерді (үлгілерді) көрсетудің кең таралған тәсілі болып табылады. PWM көбінесе функционалды байланысты деп саналатын, сәйкестендірілген тізбектер жиынтығынан туындайды және есептеу мотивтерін анықтауға арналған көптеген бағдарламалық құралдардың маңызды бөлігіне айналды.
Орындық ықтималдығы матрицасының орындық салмақ матрицасына түрленуі
Көбінесе PWM элементтері логарифмдік коэффициенттер ретінде есептеледі. Яғни, PPM элементтері фондық модельді пайдалана отырып түрлендіріледі, сондықтан: PWM элементінің (сол жақтағы), , қалай есептелетінін сипаттайды. Ең қарапайым фондық модельде әрбір әріп деректер жиынтығында бірдей жиілікпен кездеседі деп есептеледі. Яғни, алфавиттегі барлық символдар үшін (нуклеотидтер үшін 0,25 және аминқышқылдары үшін 0,05) мәні бірдей болады. Бұл түрлендіруді жоғарыдағы PPM M-ге (псевдосандар қосылмай) қолданғанда мына нәтиже шығады: Матрицадағы жазбалар псевдосандарды қосудың артықшылығын көрсетеді, әсіресе M-ді құру үшін кішкентай деректер жиынтығы қолданғанда. Фондық модельде әрбір символ үшін мәндер бірдей болуы міндетті емес: мысалы, жоғары GC-мазмұнына ие организмдерді зерттегенде, және мәндері, ал және мәндері сәйкес төмендетілуі мүмкін. Егер PWM элементтері логарифмдік ықтималдықтарды пайдалана отырып есептелсе, тізбектің ұпай санын PWM-дегі әрбір позициядағы тиісті мәндерді қосу (көбейтудің орнына) арқылы есептеуге болады. Тізбек ұпайы тізбектің кездейсоқ тізбектен қаншалықты ерекшеленедін көрсетеді. Егер тізбектің функционалдық сайт және кездейсоқ сайт болу ықтималдығы бірдей болса, ұпай 0-ге тең болады. Егер тізбек кездейсоқ сайтқа қарағанда функционалдық сайт болуы ықтимал болса, ұпай 0-ден жоғары, ал кездейсоқ сайтқа қарағанда функционалдық сайт болуы ықтимал болса, 0-ден төмен болады (осылайша, ATAT мотиві CCGG мотивіне қарағанда әлдеқайда көп ақпаратты қамтиды). Ақпарат мазмұны үшін теңдеу мынадай болады, мұнда – әріптің фондық жиілігі. Бұл Куллбак-Лейблер дивергенциясына немесе салыстырмалы энтропияға сәйкес келеді. Алайда, геномдық тізбектерді іздеу үшін PSSM қолданғанда (төменде қараңыз), бұл біркелкі түзету нақты геномдардағы n-мерлердің тең емес таралуына байланысты мотивтегі әртүрлі негіздердің маңыздылығын жоғары бағалауға әкелуі мүмкін, бұл көптеген жалған оң нәтижелерге алып келеді.
describes how an element in the PWM (left), , can be calculated. The simplest background model assumes that each letter appears equally frequently in the dataset. That is, the value of for all symbols in the alphabet (0.25 for nucleotides and 0.05 for amino acids). Applying this transformation to the PPM M from above (with no pseudocounts added) gives:
The entries in the matrix make clear the advantage of adding pseudocounts, especially when using small datasets to construct M. The background model need not have equal values for each symbol: for example, when studying organisms with a high GC content, the values for and may be increased with a corresponding decrease for the and values. When the PWM elements are calculated using log likelihoods, the score of a sequence can be calculated by adding (rather than multiplying) the relevant values at each position in the PWM. The sequence score gives an indication of how different the sequence is from a random sequence. The score is 0 if the sequence has the same probability of being a functional site and of being a random site. The score is greater than 0 if it is more likely to be a functional site than a random site, and less than 0 if it is more likely to be a random site than a functional site. thus a motif of ATAT would contain much more information than a motif of CCGG). The equation for information content thus becomes
where is the background frequency for letter This corresponds to the Kullback–Leibler divergence or relative entropy. However, it has been shown that when using PSSM to search genomic sequences (see below) this uniform correction can lead to overestimation of the importance of the different bases in a motif, due to the uneven distribution of n mers in real genomes, leading to a significantly larger number of false positives.
Қолданылуы
Тізбектерде PWM сәйкестіктерін табу үшін әртүрлі алгоритмдер бар. Мысалы, MATCH алгоритмі, ол ModuleMaster-де іске асырылған. Нуклеотидтермен де, аминқышқылдарымен де жұмыс жасайтын PWM/PSSM-дерді жылдам дерекқорда іздеуге арналған күрделі алгоритмдер possumsearch бағдарламалық құралында іске асырылған. Негізгі PWM/PSSM енгізулер мен жоюларды өңдей алмайды. Әрбір позицияда енгізу және жою ықтималдықтары қосылған PSSM жасырын Марков моделі ретінде қарастырылуы мүмкін. Осы тәсілді Pfam қолданады.