Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
Топология трансмембранного белка относится к расположению N- и C-концов полипептидной цепи, пронизывающей мембрану, относительно внутренней или внешней стороны биологической мембраны, занимаемой белком. Существует несколько баз данных, предоставляющих экспериментально определенные топологии мембранных белков, включая Uniprot, TOPDB, OPM и ExTopoDB. Также существует база данных доменов, консервативно расположенных на определенной стороне мембраны – TOPDOM. Было разработано несколько вычислительных методов для предсказания трансмембранных альфа-спиралей и их топологии, однако с ограниченным успехом. Первоначальные методы использовали тот факт, что мембранопроникающие области содержат больше гидрофобных аминокислотных остатков, чем другие части белка, однако применение различных гидрофобных шкал влияло на результаты предсказания. Позже были разработаны статистические методы для улучшения предсказания топологии, а также введен специальный метод выравнивания. Согласно правилу положительного заряда внутри клетки, цитозольные петли вблизи липидного бислоя содержат больше положительно заряженных аминокислот. Применение этого правила привело к созданию первых методов предсказания топологии. Существует также правило отрицательного заряда снаружи для трансмембранных альфа-спиралей в однопроходных белках, хотя отрицательно заряженные остатки встречаются реже, чем положительно заряженные в трансмембранных сегментах белков. С увеличением количества определенных структур появились алгоритмы машинного обучения. Методы обучения с учителем обучаются на наборе экспериментально определенных структур, однако сильно зависят от обучающей выборки. Методы обучения без учителя основаны на принципе, что топология зависит от максимального различия в распределении аминокислот в различных структурных частях. Также было показано, что фиксация расположения сегмента на основе априорных знаний о структуре повышает точность предсказания. Эта функция была добавлена в некоторые существующие методы предсказания и позволяет автоматически учитывать ранее определенную экспериментальную информацию. База данных HTP предоставляет коллекцию топологий, вычислительно предсказанных для трансмембранных белков человека. Различение сигнальных пептидов и трансмембранных сегментов является дополнительной проблемой в предсказании топологии, которую различные методы решают с ограниченным успехом. И сигнальные пептиды, и трансмембранные сегменты содержат гидрофобные области, формирующие альфа-спирали, что приводит к перекрестному предсказанию между ними – слабости многих предсказателей трансмембранной топологии. Одновременное предсказание сигнальных пептидов и трансмембранных спиралей (Phobius).
Topology of a transmembrane protein refers to locations of N and C termini of membrane spanning polypeptide chain with respect to the inner or outer sides of the biological membrane occupied by the protein. Several databases provide experimentally determined topologies of membrane proteins. They include Uniprot, TOPDB, OPM, and ExTopoDB. There is also a database of domains located conservatively on a certain side of membranes, TOPDOM. Several computational methods were developed, with a limited success, for predicting transmembrane alpha helices and their topology. Pioneer methods utilized the fact that membrane spanning regions contain more hydrophobic residues than other parts of the protein, however applying different hydrophobic scales altered the prediction results. Later, several statistical methods were developed to improve the topography prediction and a special alignment method was introduced. According to the positive inside rule, cytosolic loops near the lipid bilayer contain more positively charged amino acids. Applying this rule resulted in the first topology prediction methods. There is also a negative outside rule in transmembrane alpha helices from single pass proteins, although negatively charged residues are rarer than positively charged residues in transmembrane segments of proteins. As more structures were determined, machine learning algorithms appeared. Supervised learning methods are trained on a set of experimentally determined structures, however, these methods highly depend on the training set. Unsupervised learning methods are based on the principle that topology depends on the maximum divergence of the amino acid distributions in different structural parts. It was also shown that locking a segment location based on prior knowledge about the structure improves the prediction accuracy. This feature has been added to some of the existing prediction methods. and automatically incorporate previously determined experimental informations. HTP database provides a collection of topologies that are computationally predicted for human transmembrane proteins. Discrimination of signal peptides and transmembrane segments is an additional problem in topology prediction treated with a limited success by different methods. Both signal peptides and transmembrane segments contain hydrophobic regions which form α helices. This causes the cross prediction between them, which is a weakness of many transmembrane topology predictors. By predicting signal peptides and transmembrane helices simultaneously (Phobius