Кіріспе
Машинамен аударылған мәтіннің сапасын бағалау алгоритмі – машиналық аударманың сапасын бағалау метрикасы. NOTOC BLEU (екі тілді бағалаудың көмекшісі) – бұл бір табиғи тілден екіншісіне машинамен аударылған мәтіннің сапасын бағалау алгоритмі. Сапа – машинаның нәтижесі мен адамның аудармасы арасындағы сәйкестік деңгейімен анықталады: «Машиналық аударма кәсіби адам аудармасына неғұрлым жақын болса, соғұрлым жақсы» – осы BLEU-дың негізгі идеясы. 2001 жылы IBM компаниясында ойлап табылған BLEU, сапаның адам бағасымен жоғары корреляцияны көрсеткен алғашқы метрикалардың бірі болды және қазірге дейін ең танымал, автоматтандырылған және қолжетімді метрика болып табылады. Бағалар әдетте сөйлемдер сияқты жеке аударма сегменттері үшін, оларды жоғары сапалы анықтамалық аудармалар жиынтығымен салыстыру арқылы есептеледі. Содан кейін бұл бағалардың орташасы алынып, аударманың жалпы сапасы бағаланады. Мәтіннің түсініктілігі немесе грамматикалық дұрыстығы ескерілмейді. BLEU нәтижесі әрқашан 0 мен 1 арасындағы сан болады. Бұл сан кандидат мәтіннің анықтамалық мәтіндерге қаншалықты ұқсас екенін көрсетеді, 1-ге жақын мәндер мәтіндердің үлкен ұқсастығын білдіреді. Адам аудармаларының өте сирек жағдайда ғана 1 балға жететінін атап өткен жөн, себебі бұл кандидат мәтіні анықтамалық аудармалардың бірімен толық сәйкес екенін көрсетеді. Сондықтан 1 балға жетудің қажеті жоқ. Анықтамалық аудармалардың саны артық болған сайын, BLEU баллы да артады, себебі сәйкес келу мүмкіндіктері көбейеді.
the evaluation metric for machine translation
NOTOC
BLEU (bilingual evaluation understudy) is an algorithm for evaluating the quality of text which has been machine translated from one natural language to another. Quality is considered to be the correspondence between a machine's output and that of a human: "the closer a machine translation is to a professional human translation, the better it is" – this is the central idea behind BLEU. Invented at IBM in 2001, BLEU was one of the first metrics to claim a high correlation with human judgements of quality, and remains one of the most popular automated and inexpensive metrics. Scores are calculated for individual translated segments—generally sentences—by comparing them with a set of good quality reference translations. Those scores are then averaged over the whole corpus to reach an estimate of the translation's overall quality. Intelligibility or grammatical correctness are not taken into account. BLEU's output is always a number between 0 and 1. This value indicates how similar the candidate text is to the reference texts, with values closer to 1 representing more similar texts. Few human translations will attain a score of 1, since this would indicate that the candidate is identical to one of the reference translations. For this reason, it is not necessary to attain a score of 1. Because there are more opportunities to match, adding additional reference translations will increase the BLEU score.
Негізгі баптау
BLEU бағасын анықтаудың бастапқы, қарапайым әрекеті екі аргумент қабылдайды: үміткер тізбек және сілтеме тізбектерінің тізімі. Егер үміткер тізбек сілтеме тізбектерге ұқсас болса, онда нәтиже 1-ге жақын, ал егер ұқсас болмаса, 0-ге жақын болуы керек. Мысал ретінде, BLEU бағасы – бұл тіл оқытушысы студенттің аудармасының сапасын бағалау үшін анықтамалық жауаптармен қаншалықты сәйкес екенін тексергенге ұқсас. Табиғи тілді өңдеуде үміткер тізбектерінің үлкен жиынтығын бағалау қажет болғандықтан, BLEU бағасын "корпус" деп аталатын M үміткер тізбектерінің тізіміне және әрбір үміткер тізбегі үшін сілтеме үміткер тізбектерінің тізіміне бейімдеу керек. Кез келген тізбек пен кез келген бүтін сан үшін, оның n-грамдарының жиынтығын анықтаймыз. Бұл қайталама элементтерге рұқсат бермейтін бірегей элементтердің жиынтығы, сондықтан, мысалы, кез келген екі тізбек үшін, ішкі тізбектердің санын анықтаңыз. Енді, үміткер корпусын және сілтеме үміткер корпусын бекітейік, мұнда әрбір .
Since in natural language processing, one should evaluate a large set of candidate strings, one must generalize the BLEU score to the case where one has a list of M candidate strings (called a "corpus") , and for each candidate string , a list of reference candidate strings
Given any string , and any integer , we define the set of its n grams to be Note that it is a set of unique elements, not a multiset allowing redundant elements, so that, for example,
Given any two strings , define the substring count to be the number of appearances of as a substring of For example,
Now, fix a candidate corpus , and reference candidate corpus , where each .
Өзгертілген n-грамдық дәлдік
Өзгертілген n грамм дәлдік функциясын анықтаңыз. Күрделі болып көрінетін өзгертілген n грамм, шын мәнінде, прототиптік жағдайдың қарапайым жалпылауы: бір үміткер сөйлем және бір анықтама сөйлем. Бұл жағдайда, ол келесідей: Бұл өрнекке жету үшін біз ең қарапайым n граммдық есептеу жиынтығынан бастаймыз: Бұл шама референттік сөйлемдегі n граммның кандидат сөйлемде қанша рет қайталанғанын өлшейді. Назар аударыңыз, біз n грамм емес, n таңбалық тізбектерін санаймыз. Мысалы, егер n=2 болса, «ab» және «ba» екі таңбалық тізбегі «aababb» сөйлемде үш реттен келеді, сондықтан есеп 6, ал емес 2. Бірақ жоғарыдағы жағдайда кандидат тізбегі тым қысқа. «aababb» сөйлемде «ab» үш рет кездессе, кандидат тізбегінде тек бір рет кездеседі, сондықтан оны түзету үшін ең төменгі функцияны қосамыз: Бұл есептеу жиынтығын сөйлемдерді салыстыру үшін пайдалануға болмайды, себебі ол нормаланбаған. Егер анықтамалық және кандидат сөйлемдер ұзын болса, кандидаттың сапасы өте нашар болса да, есеп үлкен болуы мүмкін. Сондықтан біз оны нормалаймыз. Нормалау осылай жүзеге асырылады, нәтижесінде ол әрқашан [0, 1] аралығындағы сан болады, бұл деректер жинақтарын мағыналы түрде салыстыруға мүмкіндік береді. Егер кандидаттағы ешбір n таңбалық тізбек анықтамада болмаса, нәтиже нөлге тең болады. Егер кандидаттағы әрбір n грамм анықтамада кандидаттағыдай немесе одан да көп рет кездессе, нәтиже бірге тең болады. Атап айтқанда, егер кандидат анықтаманың ішкі тізбегі болса, нәтиже бірге тең болады.
This quantity measures how many n grams in the reference sentence are reproduced by the candidate sentence. Note that we count the n substrings, not n grams. For example, when , all the 2 substrings in (ab and ba) appear in 3 times each, so the count is 6, not 2. In the above situation, however, the candidate string is too short. Instead of 3 appearances of it contains only one, so we add a minimum function to correct for that: This count summation cannot be used to compare between sentences, since it is not normalized. If both the reference and the candidate sentences are long, the count could be big, even if the candidate is of very poor quality. So we normalize it The normalization is such that it is always a number in , allowing meaningful comparisons between corpuses. It is zero iff none of the n substrings in candidate is in reference. It is one iff every n gram in the candidate appears in reference, for at least as many times as in candidate. In particular, if the candidate is a substring of the reference, then it is one.
БЛЭУ-ның түпкілікті анықтамасы
BLEU-ның бір ғана анықтамасы жоқ, оның орнына салмақ векторымен параметрленген анықтамалардың толық отбасы бар. Бұл - , яғни , және аралығындағы ықтималдық тарату. Салмақ векторын таңдау арқылы BLEU ұпайы алынады. Сөздермен айтқанда, бұл түрлендірілген n-граммалық дәлдіктердің салмақталған геометриялық орташасы, қысқалық айыбымен көбейтілген. Біз салмақталған арифметикалық орташаның орнына салмақталған геометриялық орташаны қолданамыз, өйткені бұл бірнеше n-граммалық дәлдіктер бойынша бір уақытта жақсы нәтижелерді көрсеткен үміткер корпустарды басымдыққа ие етеді. Ең көп қолданылатын және бастапқы мақалада ұсынылған таңдау - .
With a choice of , the BLEU score isIn words, it is a weighted geometric mean of all the modified n gram precisions, multiplied by the brevity penalty. We use the weighted geometric mean, rather than the weighted arithmetic mean, to strongly favor candidate corpuses that are simultaneously good according to multiple n gram precisions. The most typical choice, the one recommended in the original paper, is .
Өнер көрсету
BLEU жиі адам бағасымен жақсы сәйкес келетіні туралы хабарланды және кез келген жаңа бағалау метрикасын бағалау үшін стандарт болып табылады. Дегенмен, бірнеше сын айтылды. BLEU принципі бойынша кез келген тілдегі аудармаларды бағалай алғанымен, қазіргі түрінде сөздердің шекарасы жоқ тілдермен жұмыс істей алмайды. Бірнеше анықтамалық аудармамен қолдануға арналған, бірақ іс жүзінде көбінесе тек бір аудармамен қолданылады. BLEU сөздерге бөлу (токенизация) әдісіне өте сезімтал, және әртүрлі әдістермен алынған нәтижелерді салыстыру мүмкін емес (бұл көбінесе естен шығарылады); осы мәселені шешу үшін SacreBLEU нұсқасы жасалды. BLEU-ның маңызды артықшылықтары болғанымен, BLEU көрсеткішінің жоғарылауы аударма сапасының жақсарғанын білдіретініне кепілдік жоқ.