Кіріспе

Биологиялық деректердің үлкен, күрделі жиынтықтарының есептеулік талдауы

жрналы

Биоинформатика (/audio=en us bioinformatics. ogg/,/b//aɪ//.//oʊ/,/ɪ//n//f//ɚ/'/m//æ//t//ɪ//k//s/) – биологиялық деректерді түсінуге арналған әдістер мен бағдарламалық құралдарды әзірлейтін ғылымның салааралық саласы, әсіресе деректер жиынтығы үлкен және күрделі болған кезде. Биоинформатика биологиялық деректерді талдау және интерпретациялау үшін биология, химия, физика, компьютерлік ғылым, компьютерлік бағдарламалау, ақпараттық инженерия, математика және статистиканы пайдаланады. Деректерді талдау және интерпретациялаудың келесі процесі есептеу биологиясы деп аталады. Биологиялық сұрақтарды компьютерлік симуляциялау талдаулары үшін есептеу, статистикалық және компьютерлік бағдарламалау техникалары қолданылған. Олар, әсіресе геномика саласында, гендерді және жалғыз нуклеотидтік полиморфизмдерді (ЖНП) анықтау сияқты, қайта пайдаланылатын нақты талдау "құбырларын" қамтиды. Бұл құбырлар аурудың генетикалық негізін, бірегей бейімделуін, қажетті қасиеттерін (әсіресе ауыл шаруашылығы түрлерінде) немесе популяциялар арасындағы айырмашылықтарды жақсырақ түсіну үшін қолданылады. Биоинформатикаға нуклеин қышқылы мен ақуыз тізбектеріндегі ұйымдық принциптерді түсінуге тырысатын протеомика да кіреді. Кескін және сигналды өңдеу үлкен көлемдегі шикі деректерден пайдалы нәтижелерді алуға мүмкіндік береді. Генетика саласында ол геномдарды және олардың байқалған мутацияларын тізбектеп, түсіндіруге көмектеседі. Биоинформатика биологиялық әдебиеттің мәтінін өндіруді және биологиялық деректерді ұйымдастыру және сұрау үшін биологиялық және гендік онтологияларды дамытуды қамтиды. Сондай-ақ, гендер мен ақуыздардың экспрессиясы мен реттелуін талдауда маңызды рөл атқарады. Биоинформатика құралдары генетикалық және геномдық деректерді салыстыруға, талдауға және интерпретациялауға, жалпы алғанда, молекулалық биологияның эволюциялық аспектілерін түсінуге көмектеседі. Интеграциялық деңгейде жүйелік биологияның маңызды бөлігі болып табылатын биологиялық жолдар мен желілерді талдау мен каталогтауға көмектеседі. Құрылымдық биологияда ол ДНК, РНК, ақуыздарды, сондай-ақ биомолекулалық өзара әрекеттесулерді симуляциялау мен модельдеуге көмектеседі.

Тарих

Биоинформатика терминінің алғашқы анықтамасын Паулин Хогевег пен Бен Геспер 1970 жылы биотикалық жүйелердегі ақпараттық процестерді зерттеу үшін ұсынды. Бұл анықтама биоинформатиканы биохимиямен (биологиялық жүйелердегі химиялық процестерді зерттеу) қатарласатын сала ретінде қарастырды. 1950 жылдардың басында Фредерик Сангер инсулиннің тізбегін анықтағаннан кейін, ақуыз тізбектері қолжетімді болғанда молекулалық биологияда компьютерлердің маңызы артты. Көптеген тізбектерді қолмен салыстыру тиімсіз болып шықты. Осы саланың алғашқы зерттеушісі Маргарет Оукли Дейхофф алғашқы ақуыз тізбектерінің дерекқорын құрастырып, оны бастапқыда кітаптар түрінде, сондай-ақ тізбектерді салыстыру және молекулалық эволюция әдістері ретінде жариялады. Биоинформатикаға үлес қосқан тағы бір ертегі ғалым – Эльвин А. Кабат, ол 1970 жылы биологиялық тізбектерді талдауды бастады, ал 1980 мен 1991 жылдар аралығында Тай Те Вумен бірге антидене тізбектерінің толық жинағын онлайн жариялады. 1970 жылдары бактериофаг MS2 және øX174 үшін ДНК тізбектеудің жаңа әдістері қолданылды, ал ұзартылған нуклеотидтік тізбектер ақпараттық және статистикалық алгоритмдермен талданды. Бұл зерттеулер кодтау сегменттері және үштік код сияқты жақсы белгілі ерекшеліктер қарапайым статистикалық талдауларда анықталатынын көрсетті және биоинформатиканың пайдалы екенін дәлелдеді.

Реттік талдау

1977 жылы бактериофаг Φ X174 секвенирленгеннен бері мыңдаған организмнің ДНК тізбегі анықталды және деректер базасында сақталды. Бұл тізбектік ақпарат ақуыздарды кодтайтын гендерді, РНК гендерін, реттеуші тізбектерді, құрылымдық элементтерді және қайталанатын тізбектерді анықтау үшін талданады. Бір түр ішіндегі немесе түрлі түрлер арасындағы гендерді салыстыру, ақуыз функцияларының ұқсастығын немесе түрлер арасындағы туыстық байланысты (филогенетикалық ағаштарды құру үшін молекулалық систематиканы қолдану) көрсетуі мүмкін. Деректер көлемінің артуына байланысты ДНК тізбектерін қолмен талдау ұзақ бұрыннан қанағаттандырмайтын нәрсеге айналды. BLAST сияқты компьютерлік бағдарламалар 2008 жылдан бері 260 000-нан астам организмнен, 190 миллиардтан астам нуклеотидтен тұратын тізбектерді іздеу үшін жүйелі түрде қолданылады.

ДНК тізбектеу

Тізбектерді талдау алдында, олар GenBank сияқты деректер сақтағыштан алынады. ДНҚ тізбектеу әлі де оңай емес мәселе болып табылады, себебі бастапқы деректерде бұрмалаулар немесе әлсіз сигналдар болуы мүмкін. ДНҚ тізбектеудің әртүрлі тәжірибелік әдістері үшін базаларды анықтауға арналған алгоритмдер жасалған.

Тізбелік құрастыру

Көптеген ДНҚ тізбектеу әдістері толық ген немесе геном тізбектерін алу үшін жинақталуы қажет қысқа тізбек фрагменттерін шығарады. Шатгундтық тізбектеу әдісі (Геномдық зерттеулер институты (TIGR) алғашқы бактериялық геном, Haemophilus influenzae-ді тізбектеу үшін қолданған) мыңдаған шағын ДНК фрагменттерінің тізбектерін жасайды (тізбектеу технологиясына байланысты 35-ден 900 нуклеотидке дейін). Бұл фрагменттердің ұштары бір-бірімен тоғысады және геномды құрастыру бағдарламасымен дұрыс реттелгенде, толық геномды қайта құруға мүмкіндік береді. Шатгундтық тізбектеу деректерді жылдам қамтамасыз етеді, бірақ үлкен геномдар үшін фрагменттерді жинау өте күрделі болуы мүмкін. Адам геномы сияқты үлкен геном үшін фрагменттерді құрастыруға үлкен жадты, көп процессорлы компьютерлерде көп күн CPU уақыты жұмсалуы мүмкін, ал нәтижесіндегі құрастыруда кейін толтырылуы тиіс көптеген үзілістер болады. Шатгундтық тізбектеу – тізбектелетін барлық геномдар үшін таңдау әдісі (тізбек тоқтату немесе химиялық ыдырау әдістерінен гөрі), ал геномды құрастыру алгоритмдері биоинформатика зерттеулерінің маңызды саласы болып табылады.

Салыстырмалы геномика

Салыстырмалы геномдық талдаудың негізі – әртүрлі организмдердегі гендердің (ортологиялық талдау) немесе басқа геномдық ерекшеліктердің сәйкестігін анықтау болып табылады. Екі геномның эволюциялық айырмашылықтарына жауапты процестерді іздеу үшін генаралық карталар құрылады. Геном эволюциясын қалыптастыратын түрлі ұйымдық деңгейде әрекет ететін көптеген эволюциялық оқиғалар бар. Ең төменгі деңгейде, нүктелік мутациялар жеке нуклеотидтерге әсер етеді. Жоғары деңгейде, үлкен хромосомалық сегменттер дупликация, бүйірлік трансфер, инверсия, транспозиция, жою және енгізілу процестерінен өтеді. Бүкіл геномдар гибридтесу, полиплоидизация және эндосимбиоз сияқты процестерге қатысады, бұл тез түр түзілуге алып келеді. Геном эволюциясының күрделілігі математикалық модельдер мен алгоритмдерді әзірлеушілерге көптеген қызықты міндеттер қояды, олар парсимония модельдеріне негізделген мәселелер үшін нақты, эвристикалық, белгілі параметрлі және жуықтау алгоритмдерден бастап, ықтималдық модельдерге негізделген мәселелерді Байес талдауы үшін Марков тізбегі Монте-Карло алгоритмдеріне дейін алгоритмикалық, статистикалық және математикалық әдістердің кең спектрін пайдаланады. Осы зерттеулердің көптегені тізбектік гомологияны анықтауға негізделген, осы арқылы тізбектерді белок отбасыларына жатқызады.

Пангеномдық

Пангеномика – 2005 жылы Теттелин мен Медини енгізген ұғым. Пангеном – белгілі бір монофилеттік таксономиялық топтың толық гендік жиынтығы. Алғашқыда бір түрдің жақын туысқан штамдарына қолданылғанмен, оны тұқым, тип және т.б. сияқты кеңірек контексте де қолдануға болады. Ол екі бөлікке бөлінеді: негізгі геном – зерттелетін барлық геномдарға ортақ гендер жиынтығы (көбінесе тіршілікке қажетті гендер), және қосымша/өзгермелі геном – зерттелетін геномдардың бірінде немесе кейбіреуінде ғана кездесетін гендер жиынтығы. Бактерия түрлерінің пангеномын сипаттау үшін BPGA биоинформатикалық құралын пайдалануға болады.

Аурудың генетикасы

2013 жылдан бастап, тиімді, жоғары өнімді келесі буын секвенирлеу технологиясының болуы адамның көптеген түрлі ауруларының себептерін анықтауға мүмкіндік береді. 3000-нан астам аурулар үшін қарапайым мендельдік тұқым қуалаушылық Онлайн Мендельдік Тұқым қуалаушылық Адам дерекқорында анықталған, бірақ күрделі ауруларды анықтау қиын. Қауымдастыру зерттеулері күрделі аурулармен (мысалы, сүйексіздік, сүт безі қатерлі ісігі және Альцгеймер ауруы) әлсіз байланысы бар көптеген жеке генетикалық аймақтарды анықтады, бірақ жалғыз себеп емес. Қазіргі уақытта гендерді диагностика және емдеу үшін пайдалануда көптеген қиындықтар бар, мысалы, қандай гендер маңызды екенін немесе алгоритм қандай тұрақты таңдау жасайтынын білмейміз. Геномдық ауқымды қауымдастыру зерттеулері күрделі аурулар мен белгілер үшін мыңдаған жалпы генетикалық варианттарды табысты анықтады; алайда, бұл жалпы варианттар тұқым қуалаушылықтың шағын бөлігін ғана түсіндіреді. Сирек кездесетін варианттар жоғалған тұқым қуалаушылықтың бір бөлігін құрауы мүмкін. Ірі масштабты геномдық секвенирлеу зерттеулері миллиондаған геномдарды жылдам секвенирледі және мұндай зерттеулер жүздеген миллион сирек кездесетін варианттарды анықтады. Функционалдық түсіндірмелер генетикалық варианттың әсерін немесе функциясын болжайды және сирек кездесетін функционалдық варианттарды басымдыққа ие етуге көмектеседі, ал осы түсіндірмелерді қосу геномдық секвенирлеу зерттеулерінде сирек кездесетін варианттардың генетикалық қауымдастығының күшін тиімді түрде арттыра алады. Кейбір құралдар генотип деректерін және олардың функционалдық түсіндірмелерін интеграциялау, қауымдастыру талдауы, нәтижелерді қорыту және визуализациялауды қамтитын, геномдық секвенирлеу деректері үшін бір іздік сирек кездесетін варианттар қауымдастыру талдауын жүргізу үшін әзірленді. Геномдық секвенирлеу зерттеулерінің мета-талдауы күрделі фенотиптермен байланысты сирек варианттарды анықтау үшін үлкен үлгілер жинау мәселесіне тартымды шешім ұсынады.

Қатерлі ісік мутацияларының талдауы

Қатерлі ісік кезінде зардап шеккен жасушалардың геномдары күрделі немесе болжамсыз жолмен қайта ұйымдастырылады. Ракты тудыратын нүктелік мутацияларды анықтайтын жалғыз нуклеотидтік полиморфизм тізімдерімен қатар, хромосомалық күшейістер мен жоғалтуларды анықтау үшін олигонуклеотидтік микротізімдерді де қолдануға болады (салыстырмалы геномдық гибридтеу деп аталады). Бұл анықтау әдістері әр тәжірибеде терабайт мөлшерінде деректерді тудырады. Деректерде көбінесе айтарлықтай өзгергіштік немесе шу кездеседі, сондықтан нақты көшірме санының өзгеруін анықтау үшін жасырын Марков модельдері және өзгеріс нүктесін талдау әдістері жасалып жатыр. Экзомадағы мутациялар арқылы қатерлі ісікті анықтау үшін екі маңызды қағида қолданылуы мүмкін. Біріншіден, қатерлі ісік – гендердегі жинақталған соматикалық мутациялардың салдарынан туындайтын ауру. Екіншіден, қатерлі ісікте драйверлік мутациялар болады, оларды "жолаушы" мутациялардан ажырату қажет. Биоинформатиканың одан әрі дамуы геномдағы қатерлі ісіктің себебін тудыратын мутацияларды талдау арқылы қатерлі ісіктің түрлерін жіктеуге мүмкіндік беруі мүмкін. Сонымен қатар, болашақта науқастардың аурудың прогрестік дамуы кезіндегі ісік үлгілерінің тізбегін қадағалауға болады. Тағы бір дерек түрі, жаңа информатикалық әзірлемелерді қажет ететін дерек – көптеген ісіктерде қайталап кездесетін зақымдануларды талдау.

Гендік экспрессияны талдау

Көптеген гендердің экспрессиясын мРНК деңгейін өлшеу арқылы түрлі әдістермен анықтауға болады, оның ішінде микромассивтер, экспрессияланған кДНК реттілік белгісі (EST) реттілігі, гендік экспрессияның сериялық талдауы (SAGE) тегті реттілігі, массалық қатарлас қолтаңба реттілігі (MPSS), РНК Seq, сондай-ақ "Толық транскриптомдық оқ-дәрі реттілігі" (WTSS) деп те аталатын, немесе мультиплекстелген in situ гибридтеудің әртүрлі қолданбалары. Бұл әдістердің бәрі де қатты шуға ұшырайды және/немесе биологиялық өлшеулерде қателіктерге бейім, сондықтан есептеу биологиясының маңызды саласы – жоғары өнімді ген экспрессиясын зерттеуде сигналды шудан бөліп шығаруға арналған статистикалық құралдарды жасау. Мұндай зерттеулер жиі ауруға қатысты гендерді анықтау үшін қолданылады: мысалы, қатерлі эпителий жасушаларының микромассивтерінен алынған деректерді қатерлі емес жасушалардан алынған деректермен салыстыру арқылы, белгілі бір қатерлі жасушалар тобында жоғары және төмен реттелген транскрипттерді анықтауға болады.

Белсенің экспрессиясын талдау

Белсенді микромассивтер және жоғары өнімділіктегі (HT) массалық спектрометрия (MS) биологиялық үлгідегі ақуыздардың жалпы картинасын ұсынуы мүмкін. Алғашқы тәсіл мРНК-ға бағытталған микромассивтердегідей ұқсас мәселелерге кезеседi, ал екіншісі ақуыз тізбегі деректер базасынан күтілетін массалармен үлкен көлемдегі массалық деректерді салыстыру және әрбір ақуыздан анықталған көптеген толық емес пептидтерді статистикалық түрде талдау қиындықтарын қамтиды. Тін контекстіндегі жасушалық ақуыздардың орналасуын иммуногистохимия және тін микромассивтеріне негізделген кеңістіктік деректер түрінде көрсетілген аффинитеттік протеомика арқылы анықтауға болады.

Регламенттің талдауы

Гендік реттеу – бұл күрделі процесс, онда гормон сияқты жасушадан тыс сигнал бір немесе бірнеше белоктардың активтілігін арттыруға немесе азайтуға әкеледі. Осы процестің әртүрлі қадамдарын зерттеу үшін биоинформатикалық әдістер қолданылған. Мысалы, гендік экспрессия геномдағы жақын орналасқан элементтермен реттелуі мүмкін. Промоторлық талдау – геннің ақуызды кодтау аймағын қоршаған ДНК-дағы тізбекті мотивтерді анықтау және зерттеу. Бұл мотивтер аймақтың мРНК-ға транскрипциялану деңгейіне әсер етеді. Промотордан алыс орналасқан күштілендіретін элементтер үш өлшемді циклдік өзара әрекеттесу арқылы гендік экспрессияны реттеуі мүмкін. Мұндай өзара әрекеттесулерді хромосома конформациясын түсіру эксперименттерінің биоинформатикалық талдауы арқылы анықтауға болады. Гендік реттеуді болжау үшін экспрессиялық деректерді пайдалануға болады: организмнің әртүрлі күйлерінен алынған микроаррай деректерін салыстыру арқылы әрбір күйге қатысты гендер туралы гипотезалар жасауға болады. Бір жасушалы организмде жасуша циклінің кезеңдерін, сондай-ақ әртүрлі стресс жағдайларын (жылу соққысы, аштық және т.б.) салыстыруға болады. Экспрессиялық деректерге кластерлеу алгоритмдерін қолдану арқылы бірдей экспрессияланатын гендерді анықтауға болады. Мысалы, бірдей экспрессияланатын гендердің промоторлық аймақтарын іздеу арқылы артық өкілдік етілген реттеуші элементтерді табуға болады. Гендерді кластерлеуде қолданылатын кластерлеу алгоритмдерінің мысалдары: k-орталықтар кластерлеуі, өзін-өзі ұйымдастыру карталары (SOM), иерархиялық кластерлеу және консенсус кластерлеу әдістері.

Ұяшықтық ұйымды талдау

Жасуша ішіндегі органеллалардың, гендердің, ақуыздардың және басқа да құралымдардың орналасуын талдау үшін бірнеше әдіс әзірленді. Көптеген биологиялық дерекқорларда субклеткалық локализацияны сипаттау үшін гендік онтологияның "жасушалық компонент" санаты құрылды.

Микроскопия және суретті талдау

Микроскоптық суреттер органеллалардың және молекулалардың орналасқан жерін анықтауға, сондай-ақ аурулардағы бұзылыстардың себебі болуы мүмкін нәрселерді табуға мүмкіндік береді.

Белоктың орналасуы

Ақуыздың орналасқан жерін табу бізге оның не істейтінін болжауға мүмкіндік береді. Бұл ақуыз функциясын болжау деп аталады. Мысалы, егер ақуыз ядрода табылса, ол гендік реттеуге немесе дәнекерлеуге қатысуы мүмкін. Керісінше, егер ақуыз митохондрияда табылса, ол тыныс алуға немесе басқа да метаболизм процестеріне қатысуы мүмкін. Ақуыздың жасуша ішіндегі орналасуын болжауға арналған, ақуыздың жасуша ішіндегі орналасуы туралы деректер базалары мен болжау құралдарын қамтитын, жақсы дамыған ресурстар бар.

Хроматиннің ядролық құрылысы

Жоғары өнімді хромосома конформациясын түсіру эксперименттерінен, мысалы Hi C (эксперимент) және ChIA PET-тен алынған деректер хроматиннің үш өлшемді құрылымы және ядролық ұйымы туралы ақпарат бере алады. Бұл саланың биоинформатикалық қиындықтары геномды үш өлшемді кеңістікте ұйымдасқан Топологиялық байланысқан домендер (TAD) сияқты домендерге бөлуді қамтиды.

Құрылымдық биоинформатика

Белгілердің құрылымын табу биоинформатиканың маңызды қолданысы болып табылады. Белгі құрылымын болжаудың сыни бағалауы (CASP) – әлемдік зерттеу топтарының белгісіз белгі модельдерін бағалау үшін белгі модельдерін ұсынатын ашық бәйге.

Амин қышқылдарының реті

Белоктың тізбекті аминқышқылдарының реті негізгі құрылым деп аталады. Негізгі құрылымды оны кодтайтын ДНК геніндегі кодондар тізбегінен оңай анықтауға болады. Көптеген ақуыздарда негізгі құрылым ақуыздың табиғи ортадағы үш өлшемді құрылымын бірегей түрде анықтайды. Бірақ, ірі қараның губка тәрізді энцефалопатиясына қатысты дұрыс бүлінбеген ақуыз – бұл ерекшелік. Бұл құрылым ақуыздың функциясымен байланысты. Қосымша құрылымдық ақпаратқа екінші, үшінші және төртінші құрылымдар жатады. Ақуыздың функциясын болжауға қатысты тиімді жалпы шешім әлі де ашық мәселе болып қала береді. Көбінесегі күш-жігерлер көбінесе нәтиже беретін эвристикалық тәсілдерге бағытталған.

Гомология

Биоинформатиканың геномдық саласында гомология геннің қызметін болжау үшін қолданылады: егер функциясы белгілі А генінің тізбегі, функциясы белгісіз В генінің тізбегіне гомолог болса, онда В гені А генінің қызметін бөлісуі мүмкін деген қорытынды жасауға болады. Құрылымдық биоинформатикада гомология ақуыздың құрылымын қалыптастыруда және басқа ақуыздармен өзара әрекеттесуде қандай бөліктері маңызды екенін анықтау үшін қолданылады. Гомологиялық модельдеу белгілі бір ақуыздың құрылымын, бұрыннан белгілі гомологты ақуыздардан болжау үшін пайдаланылады. Мұның бір мысалы – адам гемоглобині мен бұршақтардағы гемоглобин (легемоглобин), олар бір ақуыз суперотбасынан шыққан алыс туыстар. Екеуі де организмде оттегі тасымалдаудың бірдей мақсатына қызмет етеді. Бұл екі ақуыздың да аминоқышқылдық тізбегі мүлдем әртүрлі болғанымен, олардың ақуыздық құрылымдары дерлік бірдей, бұл олардың ұқсас мақсаттары мен ортақ ата-бабаларынан шыққандығын көрсетеді. Ақуыз құрылымын болжаудың басқа әдістеріне ақуыздық жіптеу және физикалық негіздегі де ново модельдеу (бастапқыдан модельдеу) жатады. Құрылымдық биоинформатиканың тағы бір аспектісі – виртуалды скрининг модельдері үшін, мысалы, сандық құрылым-белсенділік қатынас модельдері (QSAR) және протеохимиметриялық модельдерді (PCM) пайдалану үшін ақуыз құрылымдарын қолдану. Сонымен қатар, ақуыздың кристалдық құрылымын, мысалы, лиганд байланысын зерттеулерде және in silico мутациялық зерттеулерде модельдеу үшін пайдалануға болады. 2021 жылы Google DeepMind әзірлеген, терең оқыту алгоритміне негізделген AlphaFold бағдарламалық құралы, барлық басқа болжау әдістерінен әлдеқайда жоғары нәтижелер көрсетіп, AlphaFold ақуыз құрылымы дерекқорында жүздеген миллион ақуыздың болжалған құрылымдарын жариялады.

Желілер мен жүйелер биологиясы

Желілік талдау биологиялық желілердегі, мысалы, метаболизмдік немесе белок-белок өзара әрекеттесу желілеріндегі қарым-қатынастарды түсінуге бағытталған. Биологиялық желілер бір типті молекуладан немесе элементтен (мысалы, гендерден) құрастырылуы мүмкін, бірақ желілік биология көбінесе әртүрлі дерек түрлерін біріктіруге тырысады, соның ішінде ақуыздар, кіші молекулалар, гендік экспрессия деректері және тағы басқалары – олардың барлығы физикалық, функционалдық немесе екеуі де байланысты. Жүйелік биология жасушалық ішкі жүйелердің (мысалы, метаболиттер мен ферменттердің метаболизмді, сигналдық жолдарды және гендік реттеу желілерін құрайтын желілерін) компьютерлік модельдеуін пайдаланып, осы жасушалық процестердің күрделі байланыстарын талдау және визуализациялауға мүмкіндік береді. Жасанды өмір немесе виртуалды эволюция эволюциялық процестерді қарапайым (жасанды) тіршілік нысандарының компьютерлік модельдеуі арқылы түсінуге ұмтылады.

Молекулалық өзара іс-қимыл желілері

Он мыңдаған үш өлшемді белок құрылымдары рентген кристаллографиясы және белок ядролық магниттік резонанс спектроскопиясы (белок ЯМР) арқылы анықталды. Құрылымдық биоинформатикадағы басты мәселе – осы 3D пішіндерге сүйене отырып, белок-белок өзара әрекеттесу эксперименттерін жүргізбей, белок-белок өзара әрекеттесуін болжаудың мүмкіндігі. Белок-белок байланысын болжау мәселесін шешу үшін түрлі әдістер әзірленді, алайда бұл сала бойынша тағы көп жұмыс жасау қажет. Бұл салаға белок-лиганд (соның ішінде дәрілік заттар) және белок-пептид сияқты өзара әрекеттесулер де жатады. Молекулалық динамикалық модельдеу, молекулалық өзара әрекеттесуді зерттеуге арналған есептеу алгоритмдерінің, яғни доктау алгоритмдерінің негізгі принципі болып табылады, ол айналмалы байланыстардағы атомдардың қозғалысын сипаттайды.

Биологиялық әртүрлілік туралы информатика

Биологиялық әртүрлілік информатикасы биологиялық әртүрлілік деректерін, мысалы таксономиялық деректер базаларын немесе микробиомдық деректерді жинау және талдаумен айналысады. Мұндай талдаулардың мысалдары: филогенетика, экологиялық нишаны модельдеу, түрлердің көптігін картаға түсіру, ДНК штрих-кодтау немесе түрлерді анықтау құралдары. Мақроэкология да қарқынды дамып келе жатқан сала, яғни биологиялық әртүрліліктің экологиямен және климаттық өзгерістер сияқты адамның әсерімен қалай байланысты екендігін зерттеу.

Жоғары өнімділігі бар бір жасушалы деректерді талдау

Есептеу әдістері жоғары өнімділіктегі, төмен дәлдіктегі жеке жасуша деректерін талдау үшін қолданылады, мысалы, ағын цитометриясынан алынған деректер сияқты. Бұл әдістер көбінесе нақты бір ауру жағдайына немесе тәжірибелік жағдайға қатысты жасушалардың топтарын анықтауды қамтиды.

Онтологиялар мен деректерді интеграциялау

Биологиялық онтологиялар – басқарылатын сөздіктердің бағытталған ациклдік графиктері. Олар биологиялық ұғымдар мен сипаттамалар үшін санаттар құрады, осылайша оларды компьютерлермен оңай талдауға болады. Осылай жіктеу арқасында, жүйелі және біріктірілген талдаудан қосымша пайда алу мүмкін. OBO Foundry – белгілі бір онтологияларды стандартизациялауға бағытталған жоба. Ең көп тарағандарының бірі – гендердің қызметін сипаттайтын Гендік онтология. Сонымен қатар, фенотиптерді сипаттайтын онтологиялар да бар.

Бағдарламалық қамтамасыз ету және құралдар

Биоинформатикаға арналған бағдарламалық құралдарға қарапайым командалық жол құралдары, күрделі графикалық бағдарламалар және дербес веб-қызметтер жатады. Олар биоинформатикалық компаниялар немесе мемлекеттік ұйымдар жасап шығарады.

Биоинформатикадағы веб-қызметтер

SOAP және REST негізіндегі интерфейстер клиенттік компьютерлерге әлемнің басқа бөліктеріндегі серверлерден алгоритмдерді, деректерді және есептеу ресурстарын пайдалануға мүмкіндік беру үшін жасалған. Басты артықшылығы – соңғы пайдаланушылар бағдарламалық қамтамасыз етуді және деректер базасын күтіп-ұстауға байланысты ауыртпалықпен айналысу қажеттілігінен босатылады. EBI негізгі биоинформатикалық қызметтерді үш санатқа бөледі: SSS (Тізбек іздеу қызметтері), MSA (Көптік тізбектерді салыстыру) және BSA (Биологиялық тізбектерді талдау). Осы қызметке бағытталған биоинформатикалық ресурстардың болуы веб-негізгі биоинформатикалық шешімдердің қолданылу мүмкіндігін көрсетеді, және олар бірыңғай веб-интерфейс астында ортақ деректер форматы бар дербес құралдар жиынтығынан бастап, интеграцияланған, таратылған және кеңейтілген биоинформатикалық жұмыс ағынын басқару жүйелеріне дейін жетеді.

Биокомпьютер және биокомпьютер объектілері

2014 жылы АҚШ-тың Тамақ және дәрі-дәрмек басқармасы биоинформатикадағы қайта жаңғырту мәселелерін талқылау үшін Ұлттық денсаулық сақтау институттарының Бетесда кампусында конференция өткізді. Келесі үш жыл ішінде мүдделі тараптардың консорциумы BioCompute парадигмасы қалыптасуына қатысты мәселелерді үнемі талқылады. Бұл мүдделі тараптардың ішінде үкіметтік, индустриялық және академиялық ұйымдардың өкілдері болды. Сессия жетекшілері FDA және NIH институттары мен орталықтарының көптеген бөлімшелерін, Адам вариомы жобасы және Медициналық информатика жөніндегі Еуропалық федерация сияқты коммерциялық емес ұйымдарды, сондай-ақ Стэнфорд, Нью-Йорк геном орталығы және Джордж Вашингтон университеті сияқты ғылыми-зерттеу институттарын қамтыды. BioCompute парадигмасы биоинформатикалық хаттамаларды қайта жаңғыртуға, көшіруге, қарауға және қайта пайдалануға мүмкіндік беретін цифрлық «зертханалық күнделіктер» түрінде болады деп шешілді. Бұл зерттеу тобының штаттық құрамындағы нормативтік өзгерістер кезеңінде үздіксіздікті сақтауға және топтар арасындағы идеялар алмасуын жандандыруға бағытталған. АҚШ FDA бұл жұмысты құбырлар туралы ақпараттың ашықтығын арттыру және оны реттеуші қызметкерлеріне қолжетімді ету үшін қаржылады. 2016 жылы топ Бетесдадағы NIH-де қайта жиналып, BioCompute парадигмасының бір нысаны – BioCompute Object-тің мүмкіндіктерін талқылады. Бұл жұмыс «стандартты сынаққа қолдану» құжаты және bioRxiv-ке жүктелген препринт түрінде көшірілді. BioCompute Object JSON форматындағы жазбаны қызметкерлермен, серіктестермен және реттеушілермен бөлісуге мүмкіндік береді.

Білім беру платформалары

Биоинформатика көптеген университеттерде тек қана күндізгі стационарлық магистратура бағдарламасы ретінде оқытылмайды. Биоинформатиканың есептеуге негізделген табиғаты компьютерлік көмекпен және онлайн оқытуға мүмкіндік береді. Биоинформатиканың түсініктері мен әдістерін оқытуға арналған бағдарламалық платформаларға Rosalind және Швейцария биоинформатика институтының оқу порталы арқылы ұсынылатын онлайн курстар жатады. Канадтық биоинформатика семинарлары өз веб-сайтында Creative Commons лицензиясы бойынша оқу семинарларынан видеолар мен слайдтарды ұсынады. 4273π жобасы немесе 4273pi жобасы да тегін ашық оқу материалдарын ұсынады. Курс төмен құнмен алынатын Raspberry Pi компьютерлерінде жүргізіледі және ересектер мен мектеп оқушыларын оқыту үшін қолданылады. 4273 консорциумы, ғалымдар мен зерттеу қызметкерлері Raspberry Pi компьютерлері мен 4273π операциялық жүйесін пайдаланып, ғылыми-зерттеу деңгейіндегі биоинформатиканы жүргізіп, белсенді түрде дамытуда. MOOC платформалары биоинформатика және оған қатысты салалар бойынша онлайн сертификаттарды да ұсынады, оның ішінде Coursera-ның Bioinformatics Specialization (UC San Diego) және Genomic Data Science Specialization (Johns Hopkins), сондай-ақ EdX-тің Data Analysis for Life Sciences XSeries (Гарвард).

Конференциялар

Биоинформатика саласында бірнеше ірі конференциялар өтеді. Олардың ең белгілілері – Молекулалық биологияның интеллектуалды жүйелері (ISMB), Еуропалық есептеу биологиясы конференциясы (ECCB) және Есептеу молекулалық биологиясы зерттеулері (RECOMB).