Кіріспе

Мәтінді қорытындылаудың компьютерлік әдісі. Автоматты қорытындылау – бастапқы мазмұндағы ең маңызды немесе қажетті ақпаратты көрсететін кіші жиынтық (қорытынды) жасау үшін деректерді есептеу арқылы қысқарту процесі. Мұны іске асыру үшін әртүрлі дерек түрлеріне мамандандырылған жасанды интеллект алгоритмдері жиі жасалады және қолданылады. Мәтінді қорытындылау әдетте, белгілі бір құжаттағы ең маңызды сөйлемдерді анықтауға арналған табиғи тілді өңдеу әдістерімен жүзеге асырылады. Ал, бейне мазмұнын компьютерлік көру алгоритмдерін пайдалану арқылы қорытындылауға болады. Кескіндерді қорытындылау – үздіксіз жүріп жатқан зерттеулердің тақырыбы; қолданыстағы тәсілдер көбінесе берілген кескіндер жинағынан ең өкілді кескіндерді көрсетуге немесе бүкіл жинақтан ең маңызды мазмұнды ғана қамтитын бейнені жасауға тырысады. Бейнені қорытындылау алгоритмдері бастапқы бейне мазмұнынан ең маңызды кадрларды (негізгі кадрлар) және/немесе ең маңызды бейне сегменттерін (негізгі түсірілімдер) анықтап, әдетте уақыт ретімен шығарады. Бейне қорытындылары бастапқы бейне кадрларының мұқият таңдалған кіші жинағын ғана сақтайды, сондықтан олар жаңа бейне кадрлары бастапқы бейне мазмұнына негізделген синтезделген бейне түсініктеме алгоритмдерінің нәтижесінен өзгеше.

Коммерциялық өнімдер

2022 жылы Google Docs автоматты түрде қорытындылау мүмкіндігін ұсынды.

Қадамдар

Автоматты қорытындылаудың екі негізгі тәсілі бар: шығару және түйіндеу.

Экстракция негізінде қорытындылау

Мұнда мазмұн бастапқы деректерден алынады, бірақ алынған мазмұн ешқандай өзгеріске ұшырамайды. Алынған мазмұнға мысал ретінде мәтіндік құжатты "белгілеу" немесе индекстеу үшін қолданылатын негізгі сөз тіркестері, немесе жоғарыда айтылғандай, жиынтық құрамындағы абстрактты және бейне суреттер немесе бейне фрагменттерін құрайтын негізгі сөйлемдер (тақырыптарды қоса алғанда) жатады. Мәтін үшін ақтару процесі, беткейлеп оқуға ұқсас, онда мазмұны (бар болса), тақырыптар мен кішітақырыптар, суреттер, бөлімнің бірінші және соңғы абзацтары, сондай-ақ параграфтың бірінші және соңғы сөйлемдері толық оқуды таңдамас бұрын қарастырылады. Клиникалық маңыздылығы бар мәтіннің негізгі тізбектерін қамтитын ақтарудың басқа мысалдары да бар (мысалы, пациент/проблема, араласу және нәтиже). Бұл әдіс көбінесе мәтінге қолданылады. Абстрактивті әдістер бастапқы мазмұнның ішкі семантикалық өрнегін (көбінесе тілдік модель деп аталады) құрастырып, содан кейін осы өрнек арқылы адам айта алатын мазмұнға жақын жиынтық жасайды. Абстракция алынған мазмұнды бастапқы құжаттың бөлімдерін қайта баяндау арқылы өзгерте алады, бұл мәтінді ақтаруға қарағанда күрт қысқартуға мүмкіндік береді. Алайда, мұндай түрлендіру есептеу жағынан ақтарудан әлдеқайда қиын, ол табиғи тілді өңдеуді және түпнұсқа құжат білімнің арнайы саласына қатысты болған жағдайларда бастапқы мәтіннің доменін терең түсінуді қамтиды. "Қайта баяндау" суреттер мен бейнелерге қолдануға одан да қиын, сондықтан көптеген жиынтықтау жүйелері ақтарушы болып табылады.

Қорытындылау көмегімен

Қорытындылау сапасын арттауға бағытталған тәсілдер бағдарламалық қамтамасыз ету мен адам күшін үйлестіруге негізделген. Машиналық көмекпен адам жасаған қорытындылауда, шығару (экстракциялық) техникалары кіріктірілуге болатын үміткер кестелерді бөліп көрсетеді (сонда адам мәтін қосады немесе жояды). Адамның көмегімен машиналық қорытындылауда, адам бағдарламалық жасақтаманың нәтижесін өңдейді, дәл Google Translate-тің автоматты аудармасын өңдегендей.

Қорытындылау үшін қолданбалар мен жүйелер

Жалпы алғанда, қорытындылау бағдарламасы ненің үстіне назар аударатынына байланысты, экстрактивті қорытындылау тапсырмаларының екі түрі бар. Біріншісі – жалпы қорытындылау, ол жинақтың (құжаттар, суреттер жиынтығы, бейнелер, жаңалықтар сияқты) жалпы мазмұнын немесе тұжырымдамасын алуға бағытталған. Екіншісі – сұранысқа қатысты қорытындылау, кейде сұраныс негізіндегі қорытындылау деп те аталады, ол нақты сұранысқа жауап беретін объектілерді қорытындылайды. Қорытындылау жүйелері пайдаланушының қажеттілігіне қарай, сұранысқа сәйкес мәтіндік қорытындыларды және жалпы машина жасаған қорытындыларды құра алады. Қорытындылау мәселесінің бір мысалы – құжатты қорытындылау, ол берілген құжаттан автоматты түрде тұжырымдама жасауға тырысады. Кейде бір дереккөзден қорытынды жасауға қызығушылық туындаса, ал кейде бірнеше дереккөзді пайдалануға болады (мысалы, бір тақырыптағы мақалалар жиынтығы). Бұл мәселе көп құжатты қорытындылау деп аталады. Осыған ұқсас қолданыс – жаңалықтарды қорытындылау. Бір тақырыптағы жаңалықтарды (интернеттен) автоматты түрде жинап, соңғы жаңалықтарды қысқаша түйіндеп беруге қабілетті жүйе туралы ойлаңыз. Суреттер жинағын қорытындылау – автоматты қорытындылаудың тағы бір қолданыс мысалы. Ол үлкен суреттер жинағынан өкілді суреттерді таңдаудан тұрады. Мұндай қорытынды, суреттер жинағын зерттеу жүйесіндегі нәтижелердің ең маңызды суреттерін көрсету үшін пайдалы. Видеоны қорытындылау – бұл жүйе ұзақ видеоның трейлерін автоматты түрде жасайтын ұқсас сала. Бұл тұтынушылардың немесе жеке бейнелердегі жалықтыратын немесе қайталама әрекеттерді өткіріп жіберуге мүмкіндік береді. Сол сияқты, бақылау видеоларында маңызды және күдікті оқиғаларды анықтауға болады, ал қажетсіз кадрларды елеуге болмайды. Жоғары деңгейде, қорытындылау алгоритмдері барлық жиынтықтың ақпаратын қамтитын нысандардың (мысалы, сөйлемдер жиынтығы немесе суреттер жиынтығы) ішкі жиынтықтарын табуға тырысады. Бұл негізгі жиын деп те аталады. Бұл алгоритмдер әртүрлілік, қамту, ақпараттылық және қорытындының өкілдігі сияқты ұғымдарды модельдейді. Сұраныс негізіндегі қорытындылау әдістері қосымша түрде қорытындының сұранысқа сәйкестігін де модельдейді. TextRank және PageRank, субмодульдік жиын функциясы, детерминантты нүкте процесі, максималды маргиналды релеванттылық (MMR) және т.б. сияқты кейбір әдістер мен алгоритмдер қорытындылау мәселелерін табиғи түрде модельдейді.

Бақылаумен оқыту әдістері

Тернидің жұмысынан бастап көптеген зерттеушілер кілт тіркесін алуды бақыланатын машиналық оқыту мәселесі ретінде қарастырды. Берілген құжат үшін, мәтінде кездесетін әрбір униграмма, биграмма және триграмма үшін мысал құрастырамыз (әрине, төменде талқыланғандай, басқа мәтін бірліктері де қолданылуы мүмкін). Содан кейін, әр мысалдың әртүрлі ерекшеліктерін есептейміз (мысалы, тіркес үлкен әріппен бастала ма?). Оқу үшін белгілі бір кілт тіркестері бар дайындық құжаттары жинағы бар деп есептейміз. Белгілі кілт тіркестерін пайдаланып, мысалдарға оң немесе теріс белгілер тағайындауға болады. Содан кейін, оң және теріс мысалдарды ерекшеліктері бойынша ажырата алатын жіктегішті оқытамыз. Кейбір жіктегіштер тесттік мысал үшін екілік жіктеме жасайды, ал басқалары тіркестің кілт тіркес болу ықтималдығын анықтайды. Мысалы, жоғарыдағы мәтінде үлкен әріппен басталатын тіркестер кілт тіркестер болуы мүмкін деген ережені оқытуға болады. Оқушыны оқытқаннан кейін, тест құжаттары үшін кілт тіркестерін келесідей таңдауға болады. Тест құжаттарына дамысалдарды жасаудың осы әдісін қолданамыз, содан кейін әр мысалды оқушыдан өткіземіз. Біз жіктегіштен алынған екілік жіктеу шешімдерін немесе ықтималдықтарды қарастыра отырып кілт тіркестерін анықтай аламыз. Егер ықтималдықтар берілген болса, кілт тіркестерін таңдау үшін шекті мән қолданылады. Кілт тіркесін іздеу құралдары әдетте дәлдік және толықтық көрсеткіштерімен бағаланады. Дәлдік – ұсынылған кілт тіркестерінің қаншасы дұрыс екенін көрсетеді. Толықтық – жүйеңіз ұсынған нақты кілт тіркестерінің санын өлшейді. Екі көрсеткішті F-көрсеткішімен біріктіруге болады, ол екеуінің гармониялық орташасы (F = 2PR/(P + R)). Ұсынылған және белгілі кілт тіркестерінің сәйкестігін морфологиялық талдау немесе басқа мәтіндік нормализациядан кейін тексеруге болады. Бақыланатын кілт тіркесін іздеу жүйесін жобалау кезінде бірнеше шешім қабылдау қажет (олардың кейбіреулері бақыланбайтын жүйелерге де қатысты). Бірінші шешім – мысалдарды қалай жасау. Терни және басқалар барлық мүмкін униграммаларды, биграммаларды және триграммаларды аралық тыныш белгілерсіз және тоқтату сөздерін алып тастағаннан кейін қолданды. Халт сөйлеу бөліктерінің белгілі бір үлгілеріне сәйкес келетін сөздер тізбегін мысал ретінде таңдау арқылы жақсартуға болатынын көрсетті. Идеалды жағдайда, мысалдарды жасау механизмі барлық белгілі таңбаланған кілт тіркестерін кандидаттар ретінде шығаруы керек, бірақ бұл көбінесе орындалмайды. Мысалы, егер біз тек униграммаларды, биграммаларды және триграммаларды қолдансақ, онда төрт сөзден тұратын белгілі кілт тіркесін ешқашан іздеуге болмайды. Осылайша, толықтық көрсеткіші төмендеуі мүмкін. Дегенмен, тым көп мысал жасау дәлдіктің төмендеуіне әкелуі мүмкін. Мысалдарды сипаттайтын және оқу алгоритміне кілт тіркестерін кілт емес тіркестерден ажыратуға жеткілікті ақпарат беретін ерекшеліктерді жасауымыз қажет. Әдетте, ерекшеліктерге әртүрлі терминдердің жиілігі (сөз тіркесі ағымдағы мәтінде немесе үлкен корпуста қанша рет кездеседі), мысалдың ұзындығы, бірінші кездесуінің салыстырмалы орны, әртүрлі логикалық синтаксистік ерекшеліктер (мысалы, тек үлкен әріптерден тұрады) және т.б. кіреді. Тернидің мақаласында осындай 12-ге жуық ерекшелік қолданылған. Халт Тернидің негізгі жұмысынан туындаған KEA (Кілт тіркесін іздеу алгоритмі) жұмысында ең сәтті деп табылған ерекшеліктер жиынтығын азайтты. Соңында, жүйе тест құжаты үшін кілт тіркестерінің тізімін қайтарады, сондықтан олардың санын шектеудің жолын табуымыз керек. Бірнеше жіктегіштердің дауыстарын пайдалану (яғни, ансамбльдік әдістер) пайдаланушымен берілген кілт тіркестерінің санын анықтау үшін шектік мәнге дейін айналдырылатын сандық бағаларды алу үшін қолданылды. Бұл Тернидің C4.5 шешім ағаштарымен қолданған әдісі. Халт бір ғана екілік жіктегішті қолданды, сондықтан оқу алгоритмі тиісті санды анықтайды. Мысалдар мен ерекшеліктер жасалғаннан кейін, кілт тіркестерін болжауды оқытудың қажеттілігі туындайды. Шешім ағаштары, Наив Байес және ережелерді индукциялау сияқты кез келген бақыланатын оқыту алгоритмін қолдануға болады. Тернидің GenEx алгоритмі жағдайында, доменге қатысты кілт тіркесін іздеу алгоритмінің параметрлерін оқыту үшін генетикалық алгоритм қолданылады. Кілт тіркесін іздеу құралы кілт тіркестерін анықтау үшін эвристикалық ережелер жиынтығын қолданады. Генетикалық алгоритм оқу құжаттарындағы көрсеткіштерге қатысты осы эвристикалық ережелердің параметрлерін оңтайландырады.

Бақылаусыз тәсіл: TextRank

TextRank – тағы бір кілт сөз тіркесін табу алгоритмі. Бақыланатын әдістердің пайдалы қасиеттері бар, мысалы, кілт сөз тіркесін сипаттайтын белгілерге қатысты түсіндірілетін ережелерді құру мүмкіндігі, бірақ олар көп мөлшерде оқу деректерін қажет етеді. Белгілі кілт сөз тіркестері бар көптеген құжаттар қажет. Сонымен қатар, нақты бір сала бойынша оқыту, кілт сөзді табу процесін сол салаға бейімдейді, нәтижеде алынған классификатор міндетті түрде басқа салаларға көшірілмейді, бұл Турнидің нәтижелерінде көрсетілген. Бақылаусыз кілт сөз тіркесін табу оқу деректерін қажет етпейді. Бұл мәселеге басқа көзқараспен келеді. Кілт сөз тіркестерін сипаттайтын нақты белгілерді үйренуге тырысудың орнына, TextRank алгоритмі мәтіннің құрылымын пайдаланып, мәтінге «орталық» болып көрінетін кілт сөз тіркестерін анықтайды, дәл сол сияқты PageRank да маңызды веб-беттерді таңдайды. Бұл әлеуметтік желілердегі «абырой» немесе «ұсыныс» ұғымына негізделгенін еске түсірейік. Осылайша, TextRank бұрынғы оқу деректеріне тәуелді емес, кез келген мәтінге қолданылады және тек мәтіннің ішкі қасиеттеріне негізделген нәтиже бере алады. Сондықтан алгоритмді жаңа салалар мен тілдерге оңай көшіруге болады. TextRank – NLP үшін жалпы мақсаттағы, граф негізіндегі рейтинг беру алгоритмі. Негізінде, ол PageRank-ты белгілі бір NLP міндеті үшін арнайы жасалған граф бойынша іске қосады. Кілт сөз тіркесін табу үшін ол мәтін бөліктерінен граф құрайды, олар графтың түйіндері болып табылады. Графтың қабырғалары мәтін бөліктері арасындағы семантикалық немесе лексикалық ұқсастықтың өлшеміне негізделген. PageRank-тан айырмашылығы, қабырғалар әдетте бағытталмайды және ұқсастық дәрежесін көрсету үшін салмақталған болуы мүмкін. Граф құрылғаннан кейін, ол демпингтік фактормен (мысалы, «кездейсоқ серфер моделі») біріктірілген стохастикалық матрицаны құру үшін қолданылады, ал түйіндердегі рейтинг 1-ге сәйкес келетін өзіндік векторды табу арқылы алынады (яғни, граф бойынша кездейсоқ жүрістің стационарлық үлестірімі). Түйіндер біз бағалауға тырысатын нәрсеге сәйкес келуі керек. Біз бақыланатын әдістерге ұқсас нәрсені жасай аламыз және әрбір бір әріпті сөз, екі әріпті сөз, үш әріпті сөз және т.б. үшін түйін құрай аламыз. Алайда, графты кішірек ұстау үшін авторлар жеке бір әріпті сөздерді бірінші қадамда бағалауды, содан кейін жоғары бағаланған көршілес бір әріпті сөздерді біріктіріп, көп сөзді тіркестер құрайтын екінші қадамды қосуды шешеді. Бұл бізге кез келген ұзындықтағы кілт сөз тіркестерін жасауға мүмкіндік береді. Мысалы, егер біз бір әріпті сөздерді бағаласақ және «жетілді», «табиғи», «тіл» және «өңдеу» сөздерінің жоғары бағаланғанын анықтасақ, онда түпнұсқа мәтінді қарап, осы сөздердің қатарынан келгенін көріп, барлығын біріктіріп соңғы кілт сөз тіркесін құрастырамыз. Графқа орналастырылған бір әріпті сөздерді сөздердің сөйлеу бөлігі бойынша сүзуге болады. Авторлар сын есімдер мен зат есімдерді қосудың ең жақсы екенін анықтады. Осылайша, бұл қадамда кейбір тілдік білім қолданылады. TextRank-тің осы қолданбасында қабырғалар сөздердің бірге пайда болуына негізделген. Егер бір әріпті сөздер түпнұсқа мәтінде N өлшемді терезеде пайда болса, екі түйін қабырғамен жалғастырылады. N әдетте 2–10 шамасында болады. Осылайша, «табиғи» және «тіл» сөздері NLP туралы мәтінде байланысты болуы мүмкін. «Табиғи» және «өңдеу» сөздері де байланысты болады, өйткені олар екеуі де N сөз тізбегінде пайда болады. Бұл қабырғалар «мәтіннің байланыстылығы» ұғымына және бір-біріне жақын келетін сөздер мағыналы түрде байланысты және оқырманға бір-бірін «ұсынады» деген ойға негізделген. Бұл әдіс тек жеке түйіндерді бағалайтындықтан, біз кілт сөз тіркестерінің шектеулі санын шектеуіміз немесе шығаруымыз керек. Таңдалған әдіс – графиктегі түйіндердің жалпы санының пайдаланушы белгілеген үлесіне тең T санын орнату. Содан кейін ең жоғары T түйін/бір әріпті сөз олардың стационарлық ықтималдықтарына сәйкес таңдалады. Содан кейін осы T бір әріпті сөздердің көршілес мысалдарының біріктірілуі үшін қосымша өңдеу қадамы қолданылады. Нәтижесінде, T-ден көп немесе аз соңғы кілт сөз тіркестері шығарылуы мүмкін, бірақ олардың саны бастапқы мәтіннің ұзындығына шамамен пропорционал болуы керек. PageRank-ты бірге пайда болған графқа қолданудың пайдалы кілт сөз тіркестерін неге шығаратыны бастапқыда анық емес. Мұны келесідей қарастыруға болады. Мәтінде бірнеше рет кездесетін сөздің көптеген әртүрлі бірге пайда болатын көршілері болуы мүмкін. Мысалы, машиналық оқыту туралы мәтінде «оқыту» деген бір әріпті сөз «машиналық», «бақыланатын», «бақыланбайтын» және «жартылай бақыланатын» сөздерімен төрт түрлі сөйлемде бірге пайда болуы мүмкін. Осылайша, «оқыту» түйіні осы басқа өзгертетін сөздерге байланысты орталық «хаб» болады. Граф бойынша PageRank/TextRank-ты іске қосу «оқыту» сөзін жоғары бағалауы мүмкін. Сол сияқты, егер мәтінде «бақыланатын жіктеу» фразасы болса, онда «бақыланатын» және «жіктеу» сөздері арасында қабырға болады. Егер «жіктеу» сөзі басқа да көп орындарда пайда болса және осылайша көптеген көршілері болса, оның маңыздылығы «бақыланатын» сөзінің маңыздылығына үлес қосады. Егер ол жоғары бағаланса, онда ол «оқыту» және, мүмкін, «жіктеу» сөздерімен қатар ең жоғары T бір әріпті сөздердің бірі ретінде таңдалады. Соңғы қосымша өңдеу қадамында біз «бақыланатын оқыту» және «бақыланатын жіктеу» кілт сөз тіркестерін аламыз. Қысқасы, бірге пайда болатын граф жиі және әртүрлі контексттерде пайда болатын терминдер үшін тығыз байланысты аймақтарды қамтиды. Осы граф бойынша кездейсоқ жүріс кластерлердің ортасындағы терминдерге үлкен ықтималдықтарды тағайындайтын стационарлық үлестірілімге ие болады. Бұл PageRank-тың тығыз байланысты веб-беттерді жоғары бағалауына ұқсас. Бұл тәсіл құжатты қорытындылау үшін де қолданылған, бұл төменде қарастырылады.

Құжаттың қысқаша мазмұны

Кілт сөз тіркесін табу сияқты, құжатты қорытындылау мақсаты – мәтіннің мәнін анықтау. Басты айырмашылық – енді біз сөздер мен тіркестердің орнына толық сөйлемдер сияқты үлкен мәтіндік бөліктермен жұмыс істейміз.

Бақылаумен оқыту әдістері

Бақыланатын мәтін түйіндемесі, бақыланатын кілт сөздерді бөліп алу сияқты. Құжаттар жинағы мен оларға жазылған адам жасаған түйіндемелер болған жағдайда, түйіндемеге енгізуге жарамды сөйлемдердің қандай белгілері бар екенін анықтауға болады. Мұндай белгілерге құжаттағы орны (яғни, алғашқы бірнеше сөйлемдер маңызды болуы мүмкін), сөйлемдегі сөздер саны және тағы басқалары жатуы мүмкін. Бақыланатын шығару арқылы түйіндеме жасаудағы ең қиын мәселе – белгілі түйіндемелерді сөйлемдерді бөліп алып қолмен жасау қажеттігінде. Сондықтан, бастапқы оқу құжатындағы сөйлемдер "түйіндемеде бар" немесе "түйіндемеде жоқ" деп белгіленеді. Адамдар көбінесе осылай түйіндеме жасамайды, сондықтан ғылыми мақалалардың аннотацияларын немесе қолданыстағы түйіндемелерді пайдалану көбінесе жеткіліксіз. Мұндай түйіндемелердегі сөйлемдер түпнұсқа мәтіндегі сөйлемдермен сәйкес келмеуі мүмкін, сондықтан оқыту үшін үлгілерге белгі қою қиынға соғады. Дегенмен, бұл табиғи түйіндемелерді бағалау үшін пайдалануға болады, себебі ROUGE 1 бағалауы тек жеке сөздерді (униграммаларды) қарастырады.

Энтропияға негізделген жиынтық

2001 және 2002 жылғы DUC бағалау семинарларында TNO жаңалықтар саласында көп құжатты қорытындылау үшін сөйлемдерді бөліп алу жүйесін әзірледі. Жүйе гибридтік жүйе негізінде құрылған, онда Naive Bayes жіктегіші және статистикалық тілдік модельдер маңыздылықты модельдеу үшін қолданылды. Жүйе жақсы нәтижелер көрсеткенімен, зерттеушілер кездесулерді қорытындылау міндеті үшін максималды энтропия (ME) жіктегішінің тиімділігін зерттеуге ниеттенді, себебі ME мүмкіндіктердің өзара байланысына төтеп беруге қабілетті деп белгілі. Максималды энтропия хабар тарату саласында қорытындылау үшін де табысты қолданылған.

Өзгермелі қорытындылау

Үміт беретін тәсіл – бейімделіп құжаттарды/мәтіндерді қысқарту. Ол ең алдымен мәтіннің жанрын анықтауды, содан кейін осы жанрға арналған қорытындылау алгоритмдерін қолдануды қамтиды. Мұндай бағдарламалық құралдар жасалған.

TextRank және LexRank

Бақылаусыз қорытындылау тәсілі де кілт сөздерді бақылаусыз іздеумен ұқсас және қымбат оқу деректері қажеттігін жояды. Кейбір бақылаусыз қорытындылау тәсілдері "орталық" сөйлемді табуға негізделген, ол құжаттағы барлық сөйлемдердің орташа сөз векторы болып табылады. Содан кейін сөйлемдер осы орталық сөйлемге ұқсастығы бойынша реттеледі. Сөйлемнің маңыздылығын бағалаудың негізді әдісі – кездейсоқ саяхаттар және өзіндік векторлық орталықтық. LexRank алгоритмі TextRank-ке өте ұқсас, екеуі де құжатты қорытындылау үшін осы тәсілді қолданады. Екі тәсіл де әртүрлі топтармен бір уақытта әзірленді, ал LexRank қорытындылауға ғана назар аударды, бірақ оны кілт сөздерді іздеуге немесе кез келген басқа NLP тапсырмасына да қолдануға болады. LexRank және TextRank екеуінде де құжаттағы әрбір сөйлем үшін төбе құрылып, граф жасалады. Сөйлемдер арасындағы қабырғалар семантикалық ұқсастыққа немесе мазмұндық жабылуға негізделген. LexRank TF-IDF векторларының косинус ұқсастығын пайдаланса, TextRank екі сөйлемдегі ортақ сөздер санына негізделген ұқсас өлшемді қолданады (сөйлемдердің ұзындығына қарай нормаланған). LexRank мақаласында косинус мәндеріне шекті мән қолданғаннан кейін салмақталмаған қабырғаларды пайдалану зерттелді, сондай-ақ ұқсастық балына тең салмақты қабырғаларды пайдалану тәжірибесі жүргізілді. TextRank салмақ ретінде үздіксіз ұқсастық баллдарын қолданады. Екі алгоритмде де сөйлемдер PageRank арқылы реттеледі. Қорытынды нұсқау ең жоғары реттелген сөйлемдерді біріктіру арқылы жасалады, сондай-ақ қорытындының көлемін шектеу үшін шекті немесе ұзындық шегі қолданылады. TextRank осы жерде сипатталғандай қорытындылауға қолданылғанын, ал LexRank үлкен қорытындылау жүйесінің (MEAD) бөлігі ретінде қолданылғанын атап өту керек, ол LexRank балын (стационарлық ықтималдық) сөйлемнің орны және ұзындығы сияқты басқа да ерекшеліктермен сызықтық комбинация арқылы біріктіреді, бұл үшін пайдаланушы белгілеген немесе автоматты түрде реттелген салмақтар қолданылады. Бұл жағдайда кейбір оқу құжаттары қажет болуы мүмкін, бірақ TextRank нәтижелері қосымша мүмкіндіктердің қажет еместігін көрсетеді. TextRank-тен айырмашылығы, LexRank көп құжатты қорытындылауға қолданылады.

Көп құжат жинақтау

Көп құжатты қорытындылау – бір тақырыпқа арналған бірнеше мәтіннен ақпаратты іздеуге бағытталған автоматты процедура. Нәтижесіндегі қорытынды есеп жеке пайдаланушыларға, мысалы, кәсіби ақпаратты тұтынушыларға, үлкен құжаттар жинағындағы ақпаратпен жылдам танысуға мүмкіндік береді. Осылайша, көп құжатты қорытындылау жүйелері ақпараттық жүктемені жеңілдету жолындағы келесі қадамды жасап, жаңалықтар жинақтағыштарын толықтырады. Көп құжатты қорытындылау сұраққа жауап беру мақсатында да жасалуы мүмкін. Көп құжатты қорытындылау ықшам да, жан-жақты да ақпараттық есептерді құрайды. Әртүрлі пікірлер біріктіріліп, баяндалғандықтан, әрбір тақырып бір құжатта бірнеше тұрғыдан сипатталады. Қысқаша қорытындының мақсаты – ақпаратты іздеуді жеңілдету және ең маңызды бастапқы құжаттарға сілтеме жасау арқылы уақытты үнемдеу болса, жан-жақты көп құжатты қорытынды өзінде қажетті ақпаратты қамтуы керек, демек түпнұсқа файлдарға тек қана нақтылау қажет болған жағдайларда ғана жүгіну қажеттігі туындайды. Автоматты қорытындылар редакторлық түзетулерсіз немесе субъективті адамдық араласусыз, алгоритмдік түрде бірнеше көзден алынған ақпаратты ұсынады, осылайша оларды толығымен бейтарап етеді.

Түрлілігі

Көп құжаттан мәтін жинақтау артық ақпарат проблемасына тап болады. Идеалды жағдайда, біз негізгі идеяларды қамтитын ("орталық") және бір-бірінен ерекшеленетін ("әртүрлі") сөйлемдерді таңдауға тырысамыз. Мысалы, бір оқиға туралы жаңалықтар жинағында әр мақалада көптеген ұқсас сөйлемдер болуы мүмкін. Бұл мәселені шешу үшін LexRank сөйлемдерді рейтинг бойынша біртіндеп қосады, бірақ қорытындыдағы сөйлемдерге тым ұқсас сөйлемдерді жояды. Бұл әдіс Cross Sentence Information Subsumption (CSIS) деп аталады. Бұл әдістер сөйлемдердің оқырманға басқа ұқсас сөйлемдерді "ұсынуы" қағидасына негізделген. Сондықтан, егер бір сөйлем көптеген басқа сөйлемдерге өте ұқсас болса, онда ол маңызды сөйлем болуы мүмкін. Оның маңыздылығы оны "ұсынған" сөйлемдердің маңыздылығынан да туындайды. Осылайша, жоғары рейтинг алып, қорытындыға ену үшін сөйлем көптеген сөйлемдерге ұқсас болуы керек, ал олар өз кезегінде көптеген басқа сөйлемдерге ұқсас болуы керек. Бұл интуитивті және алгоритмдерді кез келген жаңа мәтінге қолдануға мүмкіндік береді. Әдістер доменге тәуелсіз және оңай көшіріледі. Жаңалықтар саласындағы маңызды сөйлемдерді анықтайтын белгілер биомедициналық саладан едәуір өзгеше болуы мүмкін. Дегенмен, бақылаусыз "ұсынуға" негізделген тәсіл кез келген доменге қолданылады. Байланысты әдіс – Maximal Marginal Relevance (MMR), ол "орталықтық" және "әртүрлілікті" біріктірілген математикалық модельде, сіңірілетін Марков тізбегінің кездейсоқ жүрісіне негізделген Page/Lex/TextRank сияқты жалпы мақсаттағы график негізіндегі рейтинг беру алгоритмін пайдаланады (кейбір күйлер жүрісті аяқтайтын кездейсоқ жүріс). Алгоритм GRASSHOPPER деп аталады. Рейтинг беру процесінде әртүрлілікті нақты түрде қолданудан басқа, GRASSHOPPER алдын ала рейтингті де қосады (жинақтау жағдайында сөйлемнің орнына негізделген). Көп құжатты жинақтау бойынша соңғы нәтижелер субмодульдік функциялардың қоспаларын қолдану арқылы алынды. Бұл әдістер DUC 04–07 құжаттар жинақтау корпусы үшін ең жақсы нәтижелерге қол жеткізді. DUC 04 үшін детерминанттық нүктелік процестерді (субмодульдік функциялардың ерекше жағдайы) қолдану арқылы ұқсас нәтижелер алынды. Көп тілді көп құжатты жинақтаудың жаңа әдісі артық ақпаратты болдырмайды, әр құжаттағы әр сөйлемнің мағынасын көрсететін идеограммалар жасайды, содан кейін идеограмманың пішіні мен орнын салыстыру арқылы ұқсастықты бағалайды. Ол сөздердің жиілігін, оқытуды немесе алдын ала өңдеуді пайдаланбайды. Ол пайдаланушы берген екі параметрді қолданады: эквиваленттілік (екі сөйлемді эквивалентті деп қашан қарау керек?) және маңыздылық (қорытынды қаншалықты ұзын болуы керек?).

Субмодульдік функциялар қорытындылаудың жалпы құралдары ретінде

Субмодульдік жиынтық функция идеясы жақында әртүрлі қорытындылау мәселелері үшін қуатты модельдеу құралы ретінде пайда болды. Субмодульдік функциялар табиғи түрде қамту, ақпарат, өкілдік және әртүрлілік ұғымдарын қалыптастырады. Сонымен қатар, бірнеше маңызды комбинаторлық оңтайландыру мәселелері субмодульдік оңтайландырудың арнайы жағдайлары ретінде пайда болады. Мысалы, жиынтық жабу мәселесі субмодульдік оңтайландырудың ерекше жағдайы болып табылады, өйткені жиынтық жабу функциясы субмодульді. Жинақ жабу функциясы берілген ұғымдар жиынтығын қамтитын нысандардың кіші жиынтығын табуға тырысады. Мысалы, құжат қорытындысында, қорытынды құжаттың барлық маңызды және тиісті тұжырымдамаларын қамтуы қажет. Бұл – жиынтық жабудың мысалы. Сол сияқты, объектінің орналасу мәселесі субмодульдік функциялардың ерекше жағдайы болып табылады. Объектінің орналасу функциясы да табиғи түрде қамту мен әртүрлілікті үлгілейді. Субмодульдік оптимизациялау мәселесінің тағы бір мысалы – әртүрлілікті модельдеу үшін детерминанттық нүкте процесін пайдалану. Сондай-ақ, ең жоғарғы маргиналды релеванттылық процедурасын субмодульдік оңтайландырудың мысалы ретінде қарастыруға болады. Бұл маңызды модельдердің барлығы қамтуды, әртүрлілікті және ақпаратты ынталандырады. Сонымен қатар, субмодульді функцияларды тиімді түрде біріктіруге болады, ал нәтижедегі функция да субмодульді болып қалады. Сондықтан, әртүрлілікті модельдейтін бір субмодульді функциямен, қамтуды модельдейтін басқа бір функциямен және проблема үшін субмодульді функцияның дұрыс моделін үйрену үшін адам қадағалауын пайдалануға болады. Субмодульді функциялар қорытындылау үшін қолайлы мәселелер болса да, олар оңтайландыру үшін өте тиімді алгоритмдерді де ұсынады. Мысалы, қарапайым ашкөз алгоритм тұрақты фактор бойынша кепілдік береді. Сонымен қатар, ашкөз алгоритмді іске асыру өте қарапайым және ол үлкен деректер жиынтығына дейін масштабталуы мүмкін, бұл қорытындылау мәселелері үшін өте маңызды. Субмодульді функциялар дерлік барлық қорытындылау мәселелеріндегі ең жақсы нәтижелерге жетті. Мысалы, Лин мен Билмес (2012) жүргізген зерттеулер құжат қорытындылаудағы DUC 04, DUC 05, DUC 06 және DUC 07 жүйелерінде субмодульді функциялар ең жақсы нәтижелерге қол жеткізгенін көрсетті. Сол сияқты, Лин мен Билмес (2011) жүргізген зерттеулер автоматты қорытындылаудың көптеген қолданыстағы жүйелері субмодульді функциялардың мысалдары екенін көрсетті. Бұл – қорытындылау мәселелері үшін субмодульді функцияларды дұрыс модельдер ретінде белгілеген маңызды жаңалық болды. Субмодульді функциялар басқа қорытындылау тапсырмаларында да қолданылған. Tschiatschek және басқалар (2014) кескіндер жинағын қорыту үшін субмодульді функциялардың қоспалары ең жақсы нәтижелерге жететінін көрсетті. Сондай-ақ, Bairi және басқалар (2015) көп құжаттық тақырыптық иерархияларды қорыту үшін субмодульді функциялардың пайдалылығын көрсетті. Субмодульді функциялар машиналық оқыту деректер жиынтықтарын қорыту үшін де сәтті қолданылды.

Бағалау

Автоматты түрде жасалған қорытындылардың ақпараттылығын бағалаудың ең көп таралған жолы – оларды адам жасаған үлгілік қорытындылармен салыстыру. Бағалау ішкі немесе сыртқы, мәтінаралық немесе мәтінішілік болуы мүмкін.

Ішкі және сыртқы

Ішкі бағалау түйіндемелерді тікелей бағалайды, ал сыртқы бағалау түйіндемелеу жүйесінің қандай да бір басқа міндетті орындауға қалай әсер ететінін бағалайды. Ішкі бағалаулар көбінесе түйіндемелердің ұғымдылығы мен мәліметтілігін бағалайды. Ал сыртқы бағалаулар түйіндемелеудің маңыздылықты бағалау, оқуды түсіну және т.б. сияқты міндеттерге тигізетін әсерін тексерді.

Мәтін аралық және мәтін ішіндегі

Мәтілік бағалау белгілі бір қорытындылау жүйесінің нәтижесін бағалайды, ал мәтіліаралық бағалау бірнеше қорытындылау жүйелерінің нәтижелерін салыстыруға бағытталған. Адамдардың пікірі «жақсы» қорытындының критерийлері бойынша жиі өзгеше болады, сондықтан автоматты бағалау процесін құру өте қиын. Қолмен бағалауға болады, бірақ ол уақытты да, еңбекті де қажет етеді, себебі адамдардан тек қорытындыларды ғана емес, сонымен қатар бастапқы құжаттарды оқу талап етіледі. Басқа да мәселелер бар – мәтіннің байланыстылығы мен мазмұнының толықтығы. Қорытындыларды бағалаудың ең көп қолданылатын тәсілі – ROUGE (Қорытындыларды бағалау үшін еске түсіруге бағытталған зерттеу). Бұл NIST-тің «Құжаттарды түсіну» конференциясында қорытындылау және аударма жүйелері үшін кеңінен қолданылады. ROUGE – бұл қорытындының адам жасаған қорытындылардың мазмұнын қаншалықты жақсы қамтитынын еске түсіруге негізделген өлшем. Ол автоматты түрде жасалған және бұрын жазылған адамдардың қорытындылары арасындағы n-граммалардың сәйкестігін есептейді. ROUGE маңызды тақырыптардың барлығын қорытындыға енгізуге ынталандыру үшін еске түсіру принципіне негізделген. Еске түсіру униграмма, биграмма, триграмма немесе 4-грамма сәйкестігі бойынша есептелуі мүмкін. Мысалы, ROUGE 1 – бұл анықтамалық қорытындыдағы барлық униграммалардың ішінде анықтамалық және автоматты қорытындыларда кездесетін униграммалардың үлесі. Егер бірнеше анықтамалық қорытынды болса, олардың ұпалдары орташаланады. Үлкен сәйкестік деңгейі екі қорытынды арасындағы ұқсас түсініктердің жоғары деңгейін көрсетеді. ROUGE нәтиже мәтіннің байланыстылығын, яғни сөйлемдердің логикалық ретпен келгенін анықтай алмайды. Жоғары ретті n-грамма ROUGE өлшемдері белгілі бір деңгейде көмектеседі. Тағы бір шешілмеген мәселе – анафоралық анықтама. Сол сияқты, кескіндерді қорытындылау үшін Tschiatschek және авторлар бейне қорытындылау алгоритмдерінің өнімділігін бағалайтын Visual ROUGE ұпайын жасады.

Домендік-нақты және домендік-тәуелсіз қорытындылау

Доменге тәуелсіз қорытындылау техникалары ақпаратқа толы мәтін бөлімдерін анықтау үшін жалпы ерекшеліктер жиынтығын қолданады. Соңғы зерттеулер мәтіннің доменіне тән білімді пайдаланатын, доменге қатысты қорытындылауға бағытталған, мысалы, медициналық білім және медициналық мәтіндерді қорытындылау үшін онтологиялар.

Сапалық

Бағалау жүйелерінің қазігі кездегі басты кемшілігі – автоматты түрде жасалған қорытындыларды модельдермен салыстыру үшін бізге эталондық қорытынды (кейбір әдістер үшін бірнешеу) қажеттігі. Бұл қиын және қымбат жұмыс. Мәтіндер мен оларға сәйкес қорытындылардан тұратын корпус жасауға көп еңбек жұмсалуы керек. Бұдан өзге, кейбір әдістер қорытындыларды қолмен белгілеуді талап етеді (мысалы, пирамида әдісіндегі SCU). Сонымен қатар, олардың бәрі әртүрлі ұқсастық көрсеткіштері бойынша сандық бағалау жүргізеді.

Тарих

Бұл саладағы алғашқы жарияланым 1957 жылға (Ханс Петер Лун) дейін барып тоқталады, ол статистикалық техникадан бастау алды. 2015 жылы зерттеулер күрт өсті. 2016 жылға дейін терминнің жиілігі – кері құжат жиілігі қолданылды. 2016 жылға қарай көп құжатты қорытындылау үшін ең тиімді әдіс үлгіге негізделген қорытындылау болып табылды. Келесі жылы ол жасырын семантикалық талдау (LSA) және оң емес матрицалық факторлау (NMF) комбинациясымен басып өтті. Олар басқа тәсілдерді толығымен алмастырмаса да, көбінесе олармен біріктіріледі, бірақ 2019 жылға қарай машиналық оқыту әдістері жеке құжаттарды экстрактивті түрде қорытындылауда басымдыққа ие болды, бұл сала жетілуге жақын деп есептелді. 2020 жылға қарай бұл сала әлі де өте сергекті болды және зерттеулер абстрактілі қорытындылау және нақты уақыт қорытындылауға қарай жылдамдады.

Соңғы тәсілдер

Жұ recently дәстүрлі RNN (LSTM) моделінің орнына трансформатор моделінің пайда болуы, мәтіндік тізбектерді басқа типтегі мәтіндік тізбектерге бейімдеуде жаңа мүмкіндіктер берді, бұл автоматты түрде мазмұндау үшін өте қолайлы. Бұл T5 және Pegasus сияқты модельдерді қамтиды.