Кіріспе
Биоинформатикада тізбекті құрастыру – түпнұсқа тізбекті қайта құру үшін ұзақ ДНК тізбектерінің фрагменттерін туралау және біріктіру процесі. ДНК секвенирлеу технологиясы бірден толық геномды "оқуға" қабілетсіз болуы мүмкін, сондықтан қолданылатын технологияға байланысты 20 мен 30 000 негіз аралығындағы кішігірім бөліктерді оқиды. Әдетте, қысқа фрагменттер (оқылымдар) геномдық ДНК немесе ген транскрипттерінен (EST) алынады. Тізбекті құрастыру мәселесін, бір кітаптың көптеген данасын көшіріп, әрқайсысын әртүрлі кескішпен тізбектеп, тек тізбектелген бөліктерге қарап кітаптың мәтінін қайта құраумен салыстыруға болады. Бұл міндеттің айқын қиындықтарынан өзге, қосымша практикалық мәселелер де бар: түпнұсқада көптеген қайталанатын абзацтар болуы мүмкін, ал кейбір тізбектелген бөліктер тізбектеу кезінде қателерге ұшырауы мүмкін. Сонымен қатар, басқа кітаптан алынған үзінділер де қосылуы мүмкін, ал кейбір бөліктерді мүлдем тану мүмкін болмайды.
EST құрастырушы
Экспрессияланған тізбекті тег немесе EST құрастыру – 1990 жылдардың ортасынан 2000 жылдардың ортасына дейінгі кезеңде бүкіл геном емес, жеке гендерді құрастыруға бағытталған ерте стратегия еді. Бұл мәселе геном құрастырудан бірнеше жағынан өзгеше. EST құрастыруға берілетін тізбектер – жасушаның транскрипцияланған мРНК-сының фрагменттері және олар бүкіл геномның тек бір бөлігін құрайды. Геном және EST құрастыру арасында бірқатар алгоритмдік мәселелер де ерекшеленеді. Мысалы, геномдарда көбінесе интергендік аймақтарда шоғырланған, көптеген қайталама тізбектер кездеседі. Ал транскрипцияланған гендерде қайталау саны анағұрлым аз болғандықтан, құрастыру сәл оңайырақ. Дегенмен, кейбір гендер өте көп мөлшерде экспрессияланады (транскрипцияланады) (мысалы, «үй шаруашылығы» гендері), сондықтан бүкіл геномды секвенирлеуден айырмашылығы, оқулар геном бойынша біркелкі үлгіленбейді. EST құрастыру (cis) баламалы сплайсинг, транс-сплайсинг, жалғыз нуклеотидтік полиморфизм және транскрипциядан кейінгі модификация сияқты факторлардың салдарынан күрделене түседі. 2008 жылы РНК-секвенирлеу (RNA Seq) ойда келгеннен кейін EST-секвенирлеу осы әлдеқайда тиімді технологиямен алмастырылды, ол de novo транскриптом құрастыру арқылы сипатталған.
Де-ново мен карталау құралы
Құрылыстың күрделілігі және уақыт талаптары тұрғысынан, de novo жиналымдары карталау жиналымдарынан әлдеқайда баяу және көбірек жадты қажет етеді. Бұл негізінен жиналым алгоритмінің әрбір оқылымды басқа әрбір оқылыммен салыстыру қажеттігіне байланысты (бұл операцияның қарапайым уақыт күрделілігі O(n²)). Қазіргі de novo геном жинағыштар түрлі график негізделген алгоритмдерді қолдануы мүмкін, мысалы: Сангер деректері жинағыштарға тән және шоғырланған графқа негізделген, жабысу/орналасу/келісім (OLC) тәсілі. Solexa және SOLiD платформаларынан алынған қысқа оқылымдарға ең көп қолданылатын de Bruijn Graph (DBG) тәсілі. Ол K-мер графтарына сүйенеді, ол қысқа оқылымдардың көп мөлшерімен жақсы жұмыс істейді. Сондай-ақ OLC немесе DBG тәсілдерінің бірін қолдана алатын ашкөз график негізделген тәсіл. Ашкөз график негізделген алгоритмдерде контигтер ашкөз кеңейту арқылы өседі, әрқашан ең жоғары балл жинаған оқылымды қабылдайды. Кіріспеде қиратылған кітаптарға жасалған салыстыруға сілтеме жасай отырып: карталау жиналымдарында үлгі ретінде өте ұқсас кітап болады (әлдебір басты кейіпкерлердің аттары мен бірнеше орындар өзгертілген болуы мүмкін), ал de novo жиналымдары одан да қиын міндетті ұсынады, себебі бұл ғылыми кітап, роман, каталог немесе тіпті бірнеше кітапқа айналатынын алдын ала білу мүмкін емес. Сонымен қатар, әрбір кескіш басқа кескішпен салыстырылады. De novo жиналымындағы қайталауларды өңдеу үшін көрші қайталауларды көрсететін граф құру қажет. Мұндай ақпаратты қайталауларды толығымен немесе тек екі ұшын қамтитын ұзын фрагментті оқу арқылы алуға болады. Екінші жағынан, карталау жиналымында, бірнеше немесе ешқандай сәйкестігі жоқ бөліктер әдетте басқа жиналым техникасын қарау үшін қалдырылады.
Overlap/Layout/Consensus (OLC) approach, which was typical of the Sanger data assemblers and relies on an overlap graph. de Bruijn Graph (DBG) approach, which is most widely applied to the short reads from the Solexa and SOLiD platforms. It relies on K mer graphs, which performs well with vast quantities of short reads. Greedy graph based approach, which may also use one of the OLC or DBG approaches. With greedy graph based algorithms, the contigs grow by greedy extension, always taking on the read that is found by following the highest scoring overlap. Referring to the comparison drawn to shredded books in the introduction: while for mapping assemblies one would have a very similar book as a template (perhaps with the names of the main characters and a few locations changed), de novo assemblies present a more daunting challenge in that one would not know beforehand whether this would become a science book, a novel, a catalogue, or even several books. Also, every shred would be compared with every other shred. Handling repeats in de novo assembly requires the construction of a graph representing neighboring repeats. Such information can be derived from reading a long fragment covering the repeats in full or only its two ends. On the other hand, in a mapping assembly, parts with multiple or no matches are usually left for another assembling technique to look into.
Сапаны бақылау
Көптеген тізбекті құрастырғыштарда Phred сияқты сапаны бақылауға арналған алгоритмдер бар. Дегенмен, мұндай өлшемдер гендік құрамын ескере отырып, құрастырудың толықтығын бағаламайды. Кейбір құралдар құрастыру аяқталғаннан кейін оның сапасын бағалайды. Мысалы, BUSCO (Benchmarking Universal Single Copy Orthologs) геномда, гендер жиынтығында немесе транскриптомда гендердің толықтығын бағалауға арналған өлшем. Ол көптеген гендердің көптеген геномдарда тек бір дана ретінде кездесетінін пайдаланады. Алғашқы BUSCO жиынтығы омыртқалы жануарлар үшін 3023 генді, бунақденелілер үшін 2675, метазоалар үшін 843, саңырауқұлақтар үшін 1438 және эукариоттар үшін 429 генді құрады. Төменде адам және жеміс шыбығы геномдарының мысалы келтірілген: +BUSCO белгілеуі бойынша бағалау нәтижелері (C,D,F,M %) Түрлер гендері C:D:F:M:n: Homo sapiens 20,364 99 1.7 0.0 0.0 3,023 Drosophila melanogaster 13,918 99 3.7 0.2 0.0 2,675
+BUSCO notation assessment results (C,D,F, M in %)SpeciesgenesC:D:F:M:n:Homo sapiens20,364 991.70.00.03,023Drosophila melanogaster13,918993.70.20.02,675