Кіріспе
Биомедициналық мәтіндік талдау – тиісті ақпарат пен білімді алуға арналған. Биомедициналық мәтіндік қазбалау (биомедициналық табиғи тілді өңдеуді немесе BioNLP-ні қоса алғанда) – биомедициналық саланың мәтіндері мен әдебиетіне мәтіндік қазбалау әдістерін қалай қолдануға болатынын зерттеудің әдістері мен оқулары. Зерттеу саласы ретінде биомедициналық мәтіндік қазбалауға табиғи тілді өңдеу, биоинформатика, медициналық информатика және есептеу лингвистикасының идеялары кіреді. Бұл саладағы стратегиялар PubMed сияқты қызметтер арқылы қолжетімді биомедициналық әдебиетке қолданылған. Соңғы жылдары ғылыми әдебиеттер электронды жариялануға көшті, бірақ қолжетімді ақпарат көлемі тым көп болуы мүмкін. Жарияланудағы осы революция мәтіндік қазбалау техникаларына жоғары сұраныс тудырды. Мәтіндік қазбалау ақпаратты іздеу (IR) және нысанды тану (ER) мүмкіндіктерін ұсынады. IR қызығушылық тудыратын тақырып бойынша, мысалы, PubMed арқылы тиісті мақалаларды табуға мүмкіндік береді. ER белгілі бір биологиялық терминдер (мысалы, ақуыздар немесе гендер) одан әрі өңдеу үшін танылған кезде қолданылады.
Biomedical text mining (including biomedical natural language processing or BioNLP) refers to the methods and study of how text mining may be applied to texts and literature of the biomedical domain. As a field of research, biomedical text mining incorporates ideas from natural language processing, bioinformatics, medical informatics and computational linguistics. The strategies in this field have been applied to the biomedical literature available through services such as PubMed. In recent years, the scientific literature has shifted to electronic publishing but the volume of information available can be overwhelming. This revolution of publishing has caused a high demand for text mining techniques. Text mining offers information retrieval (IR) and entity recognition (ER). IR allows the retrieval of relevant papers according to the topic of interest, e. g. through PubMed. ER is practiced when certain biological terms are recognized (e. g. proteins or genes) for further processing.
Қарастырылатын мәселелер
Биомедициналық мәтіндерге мәтін табу әдістерін қолдану доменге тән нақты ескеретін жағдайларды қажет етеді.
Түсініктемелі мәтіндік деректердің болуы
Жалпы мақсаттағы мәтін өндіру әдістерін әзірлеу және оқыту үшін қолданылатын үлкен, түсіндірмелі мәтіндік жиынтықтар (мысалы, фильмдердегі әңгімелер, өнім туралы пікірлер немесе Wikipedia мақалаларының мәтіні) биомедициналық тілге арналмаған. Олар сөздердің түрлері сияқты жалпы мәтіндік ерекшеліктерді көрсетуі мүмкін, бірақ биологтар мен клиникалық дәрігерлерге қызығушылық тудыратын түсініктерді сирек қамтиды. Сондықтан, биомедициналық құжаттарға тән ерекшеліктерді анықтау үшін жаңа әдістерді әзірлеу арнайы мәтіндік жиынтықтарды құрастыруды талап етеді. Биология мен клиникалық тәжірибені біріктіруге арналған информатика (i2b2) сынды жобалар мен биомедициналық информатика зерттеушілері жаңа биомедициналық мәтін өндіру әдістерін құруға көмектесетін ресурстарды жасады. Мәтін өндіру зерттеушілері осы жиынтықтарды Ұлттық медицина кітапханасының Бірыңғай медициналық тіл жүйесі (UMLS) және Медициналық тақырыптар (MeSH) арқылы қолжетімді бақыланатын сөздіктер мен онтологиялармен жиі үйлестіреді. Машиналық оқытуға негізделген әдістерге пайдалы модельдерді құру үшін өте үлкен деректер жиынтығы оқыту деректері ретінде қажет. Үлкен мәтіндік жиынтықтарды қолмен түсіндіру іс жүзінде мүмкін емес. Сондықтан оқыту деректері әлсіз бақылаудың немесе таза статистикалық әдістердің нәтижесі болуы мүмкін.
Деректер құрылымының өзгеруі
Басқа мәтіндік құжаттар сияқты, биомедициналық құжаттар да құрылымдалмаған деректерді қамтиды. Зерттеу жарияланымдары әртүрлі форматтарда болып, әртүрлі ақпарат түрлерін ұсынады және суреттермен, кестелермен және басқа мәтіндік емес мазмұнмен араласады. Құрылымдалмаған мәтін де, кестелер сияқты жартылай құрылымдалған құжат элементтері де мәтіннен іздеуге болатын маңызды ақпаратты қамтуы мүмкін. Клиникалық құжаттар бөлімдер мен орналасқан жерлер арасында құрылымы мен тілі жағынан өзгеше болуы мүмкін. Дәрі-дәрмек сияқты биомедициналық мәтіннің басқа түрлері жалпы құрылымдық ережелерге сәйкес келуі мүмкін, бірақ толыққанды мәліметтерден мұқаяп болмайды.
Белгісіздік
Биомедициналық әдебиетте факті емес, байқаулар туралы мәлімдемелер кездеседі. Мұндай мәтін нақтылыққа сенімсіздікпен немесе күдікпен қарауы мүмкін. Нақты бейімдемелер жасалмаса, мәтіннен деректерді іздеуге арналған әдістер осы "күмәнді" мәлімдемелерді факті ретінде қате түсінуі мүмкін.
Клиникалық қажеттіліктерді қолдау
Клиникалық қолдануға арналған биомедициналық мәтін табу қолданбалары дәрігерлердің қажеттіліктері мен сұраныстарын ең жақсырақ бейнелеуі тиіс.
Клиникалық жүйелермен өзара іс-қимыл
Жаңа мәтін өндіру жүйелері қолданыстағы стандарттармен, электрондық медициналық жазбалармен және деректер базаларымен жұмыс істеуі тиіс. Бірақ оларды іске қосу және қолдау үшін кең ауқымды ұйымдық жұмыс қажет.
Науқастың жеке өмірі
Жеке медициналық деректермен жұмыс істейтін мәтіндік талдау жүйелері олардың қауіпсіздігін қамтамасыз етуі және қажет болған жағдайда оларды анонимді етуі керек.
Процестер
Биомедициналық мәтінді өңдеу кезінде нақты қосалқы міндеттерге ерекше мән беріледі. Химиялық қосылыстар, дәрілер және ауру атаулары бәрі де объектілер ретінде қолданылған. Көптеген объектіні тану әдістері алдын ала анықталған тілдік ерекшеліктерге немесе сөздіктерге сүйенеді, алайда терең оқыту және сөздерді ендіруді қолданатын әдістер биомедициналық NER саласында да табысқа жеткен.
Құжаттарды жіктеу және кластерлеу
Биомедициналық құжаттар мазмұны мен тақырыптары бойынша жіктелуі немесе топтастырылуы мүмкін. Жіктеуде құжат санаттары қолмен белгіленеді, ал топтастыруда құжаттар алгоритмге байланысты ерекше топтарға бөлінеді. Бұл екі міндет сәйкесінше бақыланатын және бақыланбайтын әдістердің мысалы болып табылады, алайда екеуінің де мақсаты – құжаттарды оларды ерекшелендіретін белгілеріне сүйене отырып, ішкі жиынтықтарға бөлу. Биомедициналық құжаттарды топтастыру әдістері көбінесе k-орталықтар кластерлеуіне негізделген.
Қоршау белгісін анықтау
Белгісіз немесе "қорғалған" мәлімдемелерді анықтау қиындығы биомедициналық әдебиетте қорғау белгілерін анықтау арқылы шешілді. Іс жүзінде, бұл процесс құжат авторларының негізгі аргументтерін көрсететін тіркестер мен сөйлемдерді бөліп алуды (бұл аргументтерді табу деп аталады, және саяси ғылым сияқты салаларда қолданылатын құралдар қолданылады) және олардың арасындағы қарама-қайшылықтарды табу үшін талаптарды салыстыруды қамтиды. Мұндай ақпаратты қамтитын биомедициналық білім базалары көбінесе кең көлемді қолмен түзету нәтижесінде жасалады, сондықтан қолмен атқарылатын жұмысты автоматтандырылған әдістермен алмастыру зерттеудің маңызды бағыты болып табылады.
Ақпаратты алу және сұрақтарға жауап беру
Биомедициналық мәтін өндіру іздеу сұраныстарына сәйкес келетін құжаттар мен түсініктерді анықтауға арналған қолданбаларды қолдайды. PubMed сияқты іздеу жүйелері пайдаланушыларға құжат мазмұнында, метадеректерде немесе MeSH сияқты көрсеткіштерде кездесетін сөздермен немесе сөз тіркестерімен әдебиет дерекқорына сұраныс жасауға мүмкіндік береді. Медициналық әдебиетті іздеу үшін де ұқсас тәсілдер қолданылуы мүмкін. Ерекше нәтижелер алу үшін кейбір қолданбалар пайдаланушыларға табиғи тілмен сұраныс жасауға және нақты биомедициналық қарым-қатынастарды анықтауға мүмкіндік береді. 2020 жылдың 16 наурызында Ұлттық медицина кітапханасы және басқалары COVID-19 ашық зерттеулер жинағын (CORD-19) жаңа вирус туралы ағымдағы әдебиеттен мәтін өндіруді жеңілдету үшін іске қосты. Деректер жинағын Ален институтының жасанды интеллекті жобасы – Семантикалық ғалым ұйымдастырды. Басқа қатысушылардың арасында Google, Microsoft Research, Қауіпсіздік және жаңа технологиялар орталығы және Чан Цукерберг бастамасы бар.
Денесі
Келесі кестеде биомедициналық мәтін корпустарының таңдауы және олардың мазмұны көрсетілген. Бұл элементтерге түсіндірілген корпустар, биомедициналық зерттеу әдебиеттерінің көздері және жиі сөздік және/немесе онтология анықтамалары ретінде қолданылатын ресурстар, мысалы MeSH кіреді. "Еркін қолжетімді" деген бағанда "Иә" деп белгіленген элементтерді қоғамдық жерден жүктеуге болады. +Биомедициналық мәтін корпустарыКорпус атауыАвторлар немесе топтарМазмұныЕркін қолжетімді Сілтеме2019 Bacteria BiotopeBioNLP OSTМикроорганизмдер, микробтық биотоптар және фенотиптерді тану, осы атауларды саланың білім ресурстарына сәйкес келтіру және олардың арасындағы қатынастарды анықтау үшін ғылыми және оқулық мәтіндерді түсіндіру.Иә2006 i2b2 Туыс белгісін жою және темекі шегуге қарсы күресi2b2889 пациенттің жеке басын анықтау және темекі шегу статусының ерекшеліктері үшін түсіндірілген аурудан босату туралы қорытындылар.Иә, тіркеумен2008 i2b2 Семіздікке қатысты сынақi2b2Семиздікпен байланысты аурулардың болуы немесе болмауы туралы түсіндірілген 1,237 медициналық шығарылымдар.Иә, тіркеумен2009 i2b2 Дәрілік заттарға қатысты сынақi2b2Дәрілік заттардың атаулары мен егжей-тегжейлері, соның ішінде дозасы, қабылдау тәсілі, жиілігі, ұзақтығы, себебі және тізімде немесе баяндама түрінде болуы туралы түсіндірілген 1,243 медициналық шығарылымдар.Иә, тіркеумен2010 i2b2 Қатынастарға қатысты сынақi2b2Медициналық проблемалар, сынақтар, емдеу және осы ұғымдар арасындағы қатынастар үшін түсіндірілген медициналық шығарылымдар. IRB шектеулеріне байланысты осы деректердің тек бір бөлігі ғана зерттеу үшін қолжетімді.Иә, тіркеумен2012 i2b2 Уақытша қатынастарға қатысты сынақi2b2Оқиғалар мен уақытша қатынастар үшін түсіндірілген 310 медициналық шығарылымдар.Иә, тіркеумен2014 i2b2 Жүрек ауруының тәуекел факторларына қатысты сынақi2b2Жүрек артериясы ауруының тәуекел факторлары үшін түсіндірілген 1,304 ұзақ мерзімді медициналық жазбалар.Иә, тіркеуменAIMedBunescu және басқаларАқуыз-ақуыз өзара әрекеттесуіне арналған 200-ге дейін реферат, сондай-ақ ақуыз-ақуыз өзара әрекеттесуін қамтымайтын рефераттардың теріс мысалдары.ИәBioC BioGRIDBioCreAtIvE120 толық мәтінді зерттеу мақалалары ақуыздар мен ақуыздардың өзара әрекеттесуіне арналған.ИәBioCreAtIvE 1BioCreAtIvEАқуыздар мен гендер атаулары үшін түсіндірілген 5,000 сөйлем (10,000 оқу және 5,000 тест). Ақуыз атауларымен және гендік онтология терминдерімен түсіндірілген 1,000 толық мәтінді биомедициналық зерттеу мақалалары.ИәBioCreAtIvE 2BioCreAtIvEАқуыздар мен гендер атаулары үшін түсіндірілген 5,000 сөйлем (10,000 оқу және 5,000 тест, бірінші корпустан өзгеше). EntrezGene идентификаторларына байланысты 542 реферат. Ақуыз-ақуыз өзара әрекеттесуінің ерекшеліктері туралы түрлі ғылыми мақалалар.ИәBioCreative V CDR Task Corpus (BC5CDR)BioCreAtIvE2014 жылғы немесе одан кейінгі жылдары жарияланған 1,500 мақаланың (тақырыбы мен түйіндемесі) 4,409 химиялық зат, 5,818 ауру және 3,116 химиялық-ауру өзара әрекеттесуі үшін түсіндірілген.ИәBioInferPyysalo және басқаларҚатынастар, атаулы субъектілер және синтаксистік тәуелділіктер үшін түсіндірілген биомедициналық зерттеулер жинақтамаларынан 1,100 сөйлем.ЖоқBioScopeVincze және басқаларТілдік ауқымы және теріске шығаруды немесе белгісіздікті білдіретін терминдер үшін түсіндірілген 1,954 клиникалық есеп, 9 мақала және 1,273 түйіндеме.ИәBioText Атауларды анықтауBioText Project"ашытқы" тақырыбындағы 1,000 абстракт, олардың қысқартылған атаулары мен мағыналары туралы түсініктеме.ИәBioText Ақуыз-ақуыз өзара әрекеттесу деректеріBioText ProjectВИЧ-1 және адам ақуыздары арасындағы ақуыздар арасындағы өзара әрекеттесуді сипаттайтын 1,322 сөйлем, өзара әрекеттесу түрлерімен түсіндірілген.ИәComparative Toxicogenomics DatabaseDavis және басқаларХимиялық заттар, гендік өнімдер, фенотиптер, аурулар және қоршаған ортаның әсері арасындағы қолмен жинақталған қауымдастықтардың дерекқоры.ИәCRAFTVerspoor және басқаларТілдік құрылымдар мен биологиялық ұғымдармен түсіндірілген 97 толық мәтінді биомедициналық басылымдар.ИәGENIA CorpusGENIA Project"адам", "қан жасушалары" және "транскрипция факторлары" тақырыптары бойынша сөйлеу, синтаксис, терминдер, оқиғалар, қатынастар және кореференциялар бөліктері үшін түсіндірілген 1,999 биомедициналық зерттеулер.ИәFamPlexBachman және басқаларАқуыз атаулары мен отбасылары бірегей идентификаторларға байланысты. Афикс жиынтығын қамтиды.ИәFlySlip AbstractsFlySlipDrosophila гендерінің атауларымен түсіндірілген 82 зерттеулер жинақтамасы.ИәFlySlip Толық мақалаларыFlySlipГендерге қатысты есімдіктер арасындағы қатынастармен түсіндірілген 5 зерттеу мақаласы Drosophila.ИәFlySlip Спекуляциялық сөйлемдерFlySlipКлаус туралы түсініктемелерді қамтитын 1,500-нан астам сөйлем, спекуляциялық немесе спекуляциялық емес деп белгіленген.ИәIEPADing және басқаларПротеинмен қоса, бірге кездесетін химиялық заттар жұптары үшін түсіндірілген биомедициналық зерттеулер жинақтамаларынан 486 сөйлем.ЖоқJNLPBA corpusKim және басқаларNER тапсырмалары үшін GENIA корпусының 3-ші нұсқасының кеңейтілген нұсқасы.ЖоқLearning Language in Logic (LLL)Nédellec және басқаларПротеин-ген өзара әрекеттесуі үшін түсіндірілген Bacillus subtilis бактериясы туралы зерттеу мақалаларынан 77 сөйлем.ИәMedical Subject Headings (MeSH)National Library of MedicineБиомедициналық құжаттарды индекстеу және каталогтау үшін иерархиялық түрде ұйымдастырылған терминология.ИәMetathesaurusNational Library of Medicine / UMLS200-дан астам биомедициналық сөздік көздері мен идентификаторлар арасында карталанған 3.67 миллион ұғым және 14 миллион ұғым атауы.Иә, UMLS лицензиялық келісіміменMIMIC IIIMIT Компьютерлік физиологиялық зерттеулер зертханасыЕресек пациенттердің 53,423 жеке ауруханаға жатқан жағдайларымен байланысты жеке басы жойылған деректер. Оқу және ресми қолжетімділік сұрауы қажет.ODIE CorpusSavova және басқалар5,992 кореференциялық жұптармен түсіндірілген 180 клиникалық жазба.ЖоқOHSUMEDHersh және басқаларMEDLINE деректерінен 348,566 биомедициналық зерттеулер жинақтамалары және индекстеу ақпараты, соның ішінде MeSH (1991 жылға дейін).ИәPMC Open Access SubsetNational Library of Medicine / PubMed Central2 миллионнан астам зерттеу мақалалары, апта сайын жаңартылады.ИәRxNormNational Library of Medicine / UMLSСемантикалық желіден алынған түрлерімен бірге клиникалық дәрілер мен дәрілік пакеттердің нормаланған атаулары.Иә, UMLS лицензиялық келісіміменSemantic NetworkNational Library of Medicine / UMLSБиомедициналық ұғымдар мен сөздіктерді қамтитын 133 семантикалық түрлер мен 54 семантикалық қатынастар тізімі.Иә, UMLS лицензиялық келісіміменSPECIALIST LexiconNational Library of Medicine / UMLSБиомедициналық және жалпы ағылшын тілінің синтаксистік сөздігі.ИәWord Sense Disambiguation (WSD)National Library of Medicine / UMLSБиомедициналық зерттеу жарияланымдарында олардың қолданылуының 203 мәнді сөздері және 37,888 автоматты түрде алынған мысалдары.Иә, UMLS лицензиялық келісіміменYapexFranzén және басқаларАқуыз атауларымен түсіндірілген 200 биомедициналық зерттеулер жинақтамасы.Жоқ
Сөздерді ендіру
Бірнеше топтар нақты сандар векторларына бейімделген биомедициналық сөздік жиынтығын жасады, олар сөз векторлары немесе сөздердің кіріктірілуі деп аталады. Биомедициналық сөздік үшін алдын ала дайындалған кіріктірулердің көздері төмендегі кестеде көрсетілген. Көпшілігі Миколов және авторлар тобы әзірлеген word2vec моделінің немесе word2vec түрлерінің нәтижесі болып табылады. +Биомедициналық сөздерді кіріктіру АтауыАвторы немесе ТопМазмұны және Көзі СілтемеBioASQword2vecBioASQ10,876,004 ағылшын тіліндегі PubMed аннотацияларынан word2vec арқылы жасалған векторлар. bio.nlplab.org ресурстары Pyysalo және басқалар. PubMed және PubMed Central мәтінінде оқытылған әртүрлі тәсілдермен жасалған сөз векторларының жиынтығы. Swiss-Prot қолданылып гендер мен белоктар тізбектері үшін оқытылған векторлар BioVecAsgari және MofradVectors. Радиологиялық есептерEmbeddingBanerjee және басқалар. 10,000 радиологиялық есептің мәтінінен word2vec арқылы алынған векторлар.
Қолданбалар
Биомедициналық салада мәтіндік тау-кенді қолдану ақуыздық байланыстыру және ақуыз-ауру қатынастарын зерттеуге көмектесетін есептеу әдістерін қамтиды. Мәтіндік тау-кендік әдістер қатынастарды анықтау үшін дәстүрлі қолмен іздеуге қарағанда бірнеше артықшылықтарға ие. Мәтіндік тау-кендік алгоритмдер әдебиеттің көп көлемінен ақпаратты анықтап, қолмен іздеуге қарағанда тиімдірек өңдейді. Бұл әдебиет, деректер базасы және тәжірибелік нәтижелер сияқты әртүрлі көздерден алынған деректерді интеграциялауды қамтиды. Бұл алгоритмдер бұрын назардан тыс қалған жаңа гендер мен ген-ауру қатынастарын анықтау және басымдық беру процесін өзгертті. Бұл әдістер ғылыми және биомедициналық әдебиеттердегі зерттеулер арасындағы маңызды байланыстарды табуға мүмкіндік беретін жүйелі іздестірулерді жеңілдетуге негіз болады. Ақпаратты біріктіру, әсіресе деректер жиынтығын интеграциялау арқылы, жаңа жаңалықтар мен гипотезаларға әкелуі мүмкін. Деректер базасының сапасы оның мөлшерімен бірдей маңызды екенін атап өту қажет. iProLINK (интеграцияланған ақуыз әдебиеттері туралы ақпарат және білім) сияқты перспективті мәтіндік тау-кендік әдістер библиографиялық карта жасау, түсіндірмелерді алу, ақуыз атауларын анықтау және ақуыз онтологиясын дамыту салаларында мәтіндік тау-кендік зерттеулерге көмектесетін деректерді жинақтау үшін әзірленді. UniProt сияқты жинақталған деректер базалары генетикалық тізбектерге ғана емес, сонымен қатар әдебиет пен филогенез үшін де мақсатты ақпаратқа қол жеткізуді жеделдете алады.
Гендер кластерін анықтау
Микроаррей эксперименттері нәтижесінде алынған ген кластерлерінің сәйкес әдебиеттерде келтірілген биологиялық контекстпен байланысын анықтау әдістері жасалды.
Белсенді өзара әсерлесулері
Ақуыз өзара әрекеттесулерін және ақуыздардың функционалдық ұғымдармен (мысалы, гендік онтология терминдері) байланыстарын автоматты түрде анықтау зерттелді. PIE іздеу жүйесі MEDLINE индекстелген мақалалардан ақуыз-ақуыз өзара әрекеттесулері туралы айтылымдарды анықтап, беру үшін әзірленді. Мәтіннен кинетикалық параметрлерді немесе ақуыздардың субклеткалық орналасуын алу да ақпараттық іздеу және мәтін өңдеу технологиялары арқылы қарастырылды.
Генетикалық аурулар арасындағы байланыстар
Компьютерлік гендерді басымдыққа қою – аурулардың генетикалық негізін түсінудегі маңызды қадам, әсіресе генетикалық байланыс талдауында. Мәтіндік талдау және басқа да есептеу құралдары көптеген дерек көздерінен қатысты ақпаратты, оның ішінде ген-ауру байланыстарын және тағы да басқаларын шығарып алады, содан кейін әртүрлі рейтингтік алгоритмдерді қолданып, гендерді нақты ауруға қатыстылығына сәйкес басымдыққа бөледі. Мәтіндік талдау және гендерді басымдыққа қою зерттеушілерге одан әрі зерттеу үшін ең перспективалы кандидаттарға күш-жігерін жұмылдыруға мүмкіндік береді. Гендерді басымдыққа қоюға арналған есептеу құралдары жасалып, талдануда. Бір топ зерттеушілер ауруға байланысты гендерді басымдыққа қою үшін әртүрлі мәтіндік талдау техникаларының тиімділігін зерттеді. Олар әртүрлі салалық сөздіктерді, мәтіндік бейнелеу схемаларын және рейтингтік алгоритмдерді зерттеу арқылы ауруды тудыратын гендерді анықтаудың ең жақсы тәсілін табуға және эталондық деңгейді орнатуға тырысты.
Генетикалық қасиеттер қауымдастығы
Ауыл шаруашылығы геномикасы тобы мәтіндік талдау және басқа да әдістерді пайдаланып, сиырлардың репродуктивтік белгілеріне байланысты гендерді анықтады.
Фразалы тау-кенді аурулар қауымдастығына қолдану
Мәтінді өндіру зерттеуі екі дерекқорға негізделген 709 ядролық клеткадан тыс матрицалық ақуыз бен байланысты ақуыздардың жиынтығын құрастырды: MatrixDB (matrixdb.univ-lyon1.fr) және UniProt. Бұл ақуыздар жиынтығы басқаруға ыңғайлы көлемде болды және байланысты ақпараттың мол жиынтығына ие болды, бұл оны мәтінді өндіру құралдарын қолдануға қолайлы етті. Зерттеушілер жүрек-қан тамырлары ауруларының алты санатына қатысты биомедициналық әдебиеттердегі жеке клеткадан тыс матрицалық ақуыздарды салыстыру үшін фразалық талдау жүргізді. Олар фразалық талдау құбыржолын, Контекстке бейім Семантикалық Онлайн-Аналитикалық Өңдеуді (CaseOLAP) пайдаланды, содан кейін CaseOLAP құбыржолын қолдана отырып, барлық 709 ақуызды олардың Тұтастығы, Танымалдылығы және Ерекшелігі бойынша семантикалық түрде бағалады. Мәтінді өндіру зерттеуі қолданыстағы қатынастарды растады және жүрек-қан тамырлары патофизиологиясындағы бұрын танылмаған биологиялық процестер туралы мәліметтер берді. Сол сияқты, биомедициналық деректерге арналған іздеу жүйелері мен индекстеу жүйелері, соның ішінде DataMed және OmicsDI әзірленді. Кейбір іздеу жүйелері, мысалы Essie, OncoSearch, PubGene және GoPubMed бұрын көпшілікке қолжетімді болған, бірақ кейін тоқтатылды, ескірді немесе коммерциялық өнімдерге енгізілді.
Медициналық деректерді талдау жүйелері
Электрондық медициналық жазбалар (ЭМЖ) және электрондық денсаулық сақтау жазбалары (ЭДССЖ) клиникалық қызметкерлер диагностика және емдеу процесінде жиналады. Бұл жазбалар көбінесе болжамды форматтары мен дерек түрлері бар құрылымдық компоненттерді қамтиды, бірақ есептердің қалған бөлігі көбінесе бос мәтін түрінде болады және іздеу қиын, бұл пациенттерге көмек көрсетуде мәселелер тудырады. Осы бос мәтін бөлімдерін талдау үшін көптеген толыққанды жүйелер мен құралдар әзірленді. MedLEE жүйесі бастапқыда кеуде рентгенологиялық есептерін талдау үшін жасалған, бірақ кейіннен басқа тақырыптарға да қолданылды. Клиникалық мәтінді талдау және білімді алу жүйесі, немесе cTAKES, клиникалық мәтінді түсініктер сөздігін пайдаланып түсіндіреді. CLAMP жүйесі де пайдаланушыға ыңғайлы интерфейспен ұқсас мүмкіндіктер ұсынады.
Нысандар
Биомедициналық мәтін талдау міндеттері үшін құралдарды жылдам құруға арналған есептеулік платформалар жасалған. SwellShark – адам қолмен белгіленген деректерді қажет етпейтін, бірақ әлсіз бақылауға арналған ресурстарды пайдаланатын (мысалы, UMLS семантикалық түрлері) биомедициналық аталған объектілерді тану (NER) үшін платформа. SparkText платформасы Apache Spark дерек ағыны, NoSQL дерекқоры және ғылыми мақалалардан болжамдық модельдер құру үшін негізгі машиналық оқыту әдістерін қолданады.
АПИ
Кейбір биомедициналық мәтін өндіру және табиғи тілді өңдеу құралдары қолданбалы бағдарламалау интерфейстері, яғни API арқылы қолжетімді. NOBLE Coder тұжырымдамаларды тануды API арқылы іске асырады.
Журналдар
Биология және медицина салаларындағы қолжазбаларды жариялайтын көптеген академиялық журналдар мәтіндік талдау және табиғи тілді өңдеу бағдарламалық қамтамасы туралы материалдарды қамтиды. Американдық медициналық ақпараттану қауымдастығының журналы (JAMIA) және Биомедициналық ақпараттану журналы сияқты кейбір журналдар осы тақырыптар бойынша кең таралған басылымдар болып табылады.