Кіріспе

Машинамен аударылған мәтіннің сапасын бағалау алгоритмі – машиналық аударманың сапасын бағалау метрикасы. NOTOC BLEU (екі тілді бағалаудың көмекшісі) – бұл бір табиғи тілден екіншісіне машинамен аударылған мәтіннің сапасын бағалау алгоритмі. Сапа – машинаның нәтижесі мен адамның аудармасы арасындағы сәйкестік деңгейімен анықталады: «Машиналық аударма кәсіби адам аудармасына неғұрлым жақын болса, соғұрлым жақсы» – осы BLEU-дың негізгі идеясы. 2001 жылы IBM компаниясында ойлап табылған BLEU, сапаның адам бағасымен жоғары корреляцияны көрсеткен алғашқы метрикалардың бірі болды және қазірге дейін ең танымал, автоматтандырылған және қолжетімді метрика болып табылады. Бағалар әдетте сөйлемдер сияқты жеке аударма сегменттері үшін, оларды жоғары сапалы анықтамалық аудармалар жиынтығымен салыстыру арқылы есептеледі. Содан кейін бұл бағалардың орташасы алынып, аударманың жалпы сапасы бағаланады. Мәтіннің түсініктілігі немесе грамматикалық дұрыстығы ескерілмейді. BLEU нәтижесі әрқашан 0 мен 1 арасындағы сан болады. Бұл сан кандидат мәтіннің анықтамалық мәтіндерге қаншалықты ұқсас екенін көрсетеді, 1-ге жақын мәндер мәтіндердің үлкен ұқсастығын білдіреді. Адам аудармаларының өте сирек жағдайда ғана 1 балға жететінін атап өткен жөн, себебі бұл кандидат мәтіні анықтамалық аудармалардың бірімен толық сәйкес екенін көрсетеді. Сондықтан 1 балға жетудің қажеті жоқ. Анықтамалық аудармалардың саны артық болған сайын, BLEU баллы да артады, себебі сәйкес келу мүмкіндіктері көбейеді.

Негізгі баптау

BLEU бағасын анықтаудың бастапқы, қарапайым әрекеті екі аргумент қабылдайды: үміткер тізбек және сілтеме тізбектерінің тізімі. Егер үміткер тізбек сілтеме тізбектерге ұқсас болса, онда нәтиже 1-ге жақын, ал егер ұқсас болмаса, 0-ге жақын болуы керек. Мысал ретінде, BLEU бағасы – бұл тіл оқытушысы студенттің аудармасының сапасын бағалау үшін анықтамалық жауаптармен қаншалықты сәйкес екенін тексергенге ұқсас. Табиғи тілді өңдеуде үміткер тізбектерінің үлкен жиынтығын бағалау қажет болғандықтан, BLEU бағасын "корпус" деп аталатын M үміткер тізбектерінің тізіміне және әрбір үміткер тізбегі үшін сілтеме үміткер тізбектерінің тізіміне бейімдеу керек. Кез келген тізбек пен кез келген бүтін сан үшін, оның n-грамдарының жиынтығын анықтаймыз. Бұл қайталама элементтерге рұқсат бермейтін бірегей элементтердің жиынтығы, сондықтан, мысалы, кез келген екі тізбек үшін, ішкі тізбектердің санын анықтаңыз. Енді, үміткер корпусын және сілтеме үміткер корпусын бекітейік, мұнда әрбір .

Өзгертілген n-грамдық дәлдік

Өзгертілген n грамм дәлдік функциясын анықтаңыз. Күрделі болып көрінетін өзгертілген n грамм, шын мәнінде, прототиптік жағдайдың қарапайым жалпылауы: бір үміткер сөйлем және бір анықтама сөйлем. Бұл жағдайда, ол келесідей: Бұл өрнекке жету үшін біз ең қарапайым n граммдық есептеу жиынтығынан бастаймыз: Бұл шама референттік сөйлемдегі n граммның кандидат сөйлемде қанша рет қайталанғанын өлшейді. Назар аударыңыз, біз n грамм емес, n таңбалық тізбектерін санаймыз. Мысалы, егер n=2 болса, «ab» және «ba» екі таңбалық тізбегі «aababb» сөйлемде үш реттен келеді, сондықтан есеп 6, ал емес 2. Бірақ жоғарыдағы жағдайда кандидат тізбегі тым қысқа. «aababb» сөйлемде «ab» үш рет кездессе, кандидат тізбегінде тек бір рет кездеседі, сондықтан оны түзету үшін ең төменгі функцияны қосамыз: Бұл есептеу жиынтығын сөйлемдерді салыстыру үшін пайдалануға болмайды, себебі ол нормаланбаған. Егер анықтамалық және кандидат сөйлемдер ұзын болса, кандидаттың сапасы өте нашар болса да, есеп үлкен болуы мүмкін. Сондықтан біз оны нормалаймыз. Нормалау осылай жүзеге асырылады, нәтижесінде ол әрқашан [0, 1] аралығындағы сан болады, бұл деректер жинақтарын мағыналы түрде салыстыруға мүмкіндік береді. Егер кандидаттағы ешбір n таңбалық тізбек анықтамада болмаса, нәтиже нөлге тең болады. Егер кандидаттағы әрбір n грамм анықтамада кандидаттағыдай немесе одан да көп рет кездессе, нәтиже бірге тең болады. Атап айтқанда, егер кандидат анықтаманың ішкі тізбегі болса, нәтиже бірге тең болады.

БЛЭУ-ның түпкілікті анықтамасы

BLEU-ның бір ғана анықтамасы жоқ, оның орнына салмақ векторымен параметрленген анықтамалардың толық отбасы бар. Бұл - , яғни , және аралығындағы ықтималдық тарату. Салмақ векторын таңдау арқылы BLEU ұпайы алынады. Сөздермен айтқанда, бұл түрлендірілген n-граммалық дәлдіктердің салмақталған геометриялық орташасы, қысқалық айыбымен көбейтілген. Біз салмақталған арифметикалық орташаның орнына салмақталған геометриялық орташаны қолданамыз, өйткені бұл бірнеше n-граммалық дәлдіктер бойынша бір уақытта жақсы нәтижелерді көрсеткен үміткер корпустарды басымдыққа ие етеді. Ең көп қолданылатын және бастапқы мақалада ұсынылған таңдау - .

Өнер көрсету

BLEU жиі адам бағасымен жақсы сәйкес келетіні туралы хабарланды және кез келген жаңа бағалау метрикасын бағалау үшін стандарт болып табылады. Дегенмен, бірнеше сын айтылды. BLEU принципі бойынша кез келген тілдегі аудармаларды бағалай алғанымен, қазіргі түрінде сөздердің шекарасы жоқ тілдермен жұмыс істей алмайды. Бірнеше анықтамалық аудармамен қолдануға арналған, бірақ іс жүзінде көбінесе тек бір аудармамен қолданылады. BLEU сөздерге бөлу (токенизация) әдісіне өте сезімтал, және әртүрлі әдістермен алынған нәтижелерді салыстыру мүмкін емес (бұл көбінесе естен шығарылады); осы мәселені шешу үшін SacreBLEU нұсқасы жасалды. BLEU-ның маңызды артықшылықтары болғанымен, BLEU көрсеткішінің жоғарылауы аударма сапасының жақсарғанын білдіретініне кепілдік жоқ.