Введение

Участок ДНК, обозначенный кодоном старта и кодоном стопа различной длины.

В молекулярной биологии рамки считывания определяются как участки последовательности ДНК между кодонами старта и стопа. Обычно это рассматривается в пределах изучаемого региона прокариотической последовательности ДНК, где только одна из шести возможных рамок считывания будет "открытой" (при этом "считывание" относится к РНК, произведенной транскрипцией ДНК и ее последующим взаимодействием с рибосомой при трансляции). Такой ORF может начинаться с кодона старта (не обязательно первого), который указывает, где может начаться трансляция. Участок завершения транскрипции расположен после ORF, за кодоном стопа трансляции. Если транскрипция прекратится до кодона стопа, в ходе трансляции будет синтезирован неполный белок. В эукариотических генах, содержащих несколько экзонов, интроны удаляются, а экзоны затем соединяются после транскрипции, образуя конечную мРНК для трансляции белка. В контексте поиска генов определение ORF по кодонам старта и стопа применимо только к сплайсированным мРНК, а не к геномной ДНК, поскольку интроны могут содержать стоп-кодоны и/или вызывать сдвиг рамок считывания. Альтернативное определение гласит, что ORF – это последовательность, длина которой кратна трем и ограниченная стоп-кодонами. Это более общее определение может быть полезно в контексте транскриптомики и метагеномики, где кодон старта или стопа может отсутствовать в полученных последовательностях. Такой ORF соответствует частям гена, а не целому гену.

Биологическое значение

Одно из распространенных применений открытых кадров чтения (ORF) – использование их в качестве одного из доказательств, помогающих в предсказании генов. Длинные ORF часто используются, наряду с другими данными, для первоначальной идентификации потенциальных областей кодирования белков или функциональных областей кодирования РНК в последовательности ДНК, длиной более 150 кодонов. Сам по себе даже длинный открытый кадр чтения не является окончательным доказательством наличия гена. Короткие ORF, обычно длиной менее 100 кодонов, которые не обладают классическими признаками генов, кодирующих белки (как из некодирующих РНК, так и из мРНК), могут производить функциональные пептиды. Известно, что 5'-UTR примерно 50% мРНК млекопитающих содержит один или несколько sORF, также называемых восходящими ORF или uORF. Однако, менее 10% мРНК позвоночных, исследованных в более раннем исследовании, содержали кодоны AUG перед основным ORF. Интересно, что uORF были обнаружены в двух третях протоонкогенов и связанных с ними белков. 64–75% экспериментально определенных сайтов инициации трансляции sORF консервативны в геномах человека и мыши и могут указывать на их функциональную роль. Однако sORF часто встречаются только в минорных формах мРНК и избегают отбора; высокая консервация сайтов инициации может быть связана с их расположением внутри промоторов соответствующих генов. Это характерно, например, для гена SLAMF1.

Перевод в шесть кадров

Поскольку ДНК интерпретируется группами из трех нуклеотидов (кодонов), цепь ДНК имеет три различных рамки считывания. Двойная спираль молекулы ДНК состоит из двух антипараллельных цепей; поскольку каждая из двух цепей имеет по три рамки считывания, существует шесть возможных вариантов трансляции. Это графический инструмент анализа, который находит все открытые рамки считывания минимального заданного размера в последовательности пользователя или в последовательности, уже находящейся в базе данных. Этот инструмент идентифицирует все открытые рамки считывания, используя стандартный или альтернативный генетический код. Выведенная аминокислотная последовательность может быть сохранена в различных форматах и исследована в базе данных последовательностей с использованием сервера BLAST (Basic Local Alignment Search Tool). ORF Finder будет полезен при подготовке полных и точных представлений последовательностей. Он также поставляется в комплекте с программным обеспечением Sequin для представления последовательностей (анализатор последовательностей).

Следователь

ORF Investigator – это программа, которая предоставляет информацию не только о кодирующих и некодирующих последовательностях, но и выполняет глобальное попарное выравнивание последовательностей различных участков генов/ДНК. Инструмент эффективно находит открытые рамки считывания (ORF) для соответствующих аминокислотных последовательностей, преобразует их в однобуквенный код аминокислот и указывает их положение в последовательности. Попарное глобальное выравнивание последовательностей облегчает обнаружение различных мутаций, включая однонуклеотидные полиморфизмы. Для выравнивания генов используются алгоритмы Нидлмана–Вунша. ORF Investigator написан на переносимом языке программирования Perl и, следовательно, доступен пользователям всех распространенных операционных систем.

Предсказатель

OrfPredictor – это веб-сервер, предназначенный для идентификации областей кодирования белков в последовательностях, полученных из экспрессированных тегов последовательности (EST). Для запросных последовательностей, имеющих соответствие в BLASTX, программа предсказывает кодирующие области на основе кадров считывания, выявленных при выравнивании BLASTX. В противном случае, она предсказывает наиболее вероятную кодирующую область, основываясь на собственных сигналах запросной последовательности. Результатом являются предсказанные пептидные последовательности в формате FASTA и строка определения, включающая идентификатор запроса, кадр считывания трансляции, а также нуклеотидные позиции начала и конца кодирующей области. OrfPredictor облегчает аннотацию последовательностей, полученных из EST, особенно в рамках крупномасштабных EST-проектов. ORF Predictor использует комбинацию двух различных подходов к определению ORF, описанных выше. Он ищет фрагменты, начинающиеся с инициирующего кодона и заканчивающиеся стоп-кодоном. В качестве дополнительного критерия, программа ищет стоп-кодон в 5'-нетранслируемой области (UTR или NTR).

ОРФик

ORFik — это пакет R в Bioconductor для поиска открытых кадров считывания и подтверждения ORF с использованием технологий секвенирования нового поколения.

илифипи

orfipy – это инструмент, написанный на Python / Cython, для извлечения ORF чрезвычайно быстро, гибко и эффективно. orfipy может работать с обычными или сжатыми (gzipped) последовательностями в форматах FASTA и FASTQ, а также предоставляет множество опций для точной настройки поиска ORF, включая указание стартовых и стоп-кодонов, вывод частичных ORF и использование пользовательских таблиц трансляции. Результаты можно сохранить в различных форматах, в том числе в компактном формате BED. orfipy особенно эффективен при работе с данными, содержащими множество небольших последовательностей FASTA, например, при de novo сборке транскриптома.