Введение
Алгоритм оценки качества машинного перевода
метрика оценки машинного перевода
NOTOC
BLEU (bilingual evaluation understudy) – это алгоритм для оценки качества текста, машинного перевода с одного естественного языка на другой. Качество определяется как соответствие между результатом машинного перевода и переводом, выполненным человеком: «чем ближе машинный перевод к профессиональному переводу, сделанному человеком, тем он лучше» – такова основная идея BLEU. Разработанный в IBM в 2001 году, BLEU стал одной из первых метрик, заявивших о высокой корреляции с оценками качества, данными людьми, и остаётся одной из самых популярных, автоматизированных и недорогих метрик. Оценки рассчитываются для отдельных переведённых сегментов – как правило, предложений – путём сравнения их с набором качественных эталонных переводов. Затем эти оценки усредняются по всему корпусу для получения оценки общего качества перевода. Понятность или грамматическая правильность при этом не учитываются. Результат BLEU всегда представляет собой число от 0 до 1. Это значение указывает на степень сходства между кандидатским текстом и эталонными текстами, при этом значения, близкие к 1, указывают на большее сходство. Лишь немногие переводы, выполненные человеком, могут достичь оценки 1, поскольку это означало бы, что кандидатский текст идентичен одному из эталонных переводов. Поэтому достижение оценки 1 не является необходимостью. Поскольку возможностей для сопоставления больше, добавление дополнительных эталонных переводов повысит оценку BLEU.
the evaluation metric for machine translation
NOTOC
BLEU (bilingual evaluation understudy) is an algorithm for evaluating the quality of text which has been machine translated from one natural language to another. Quality is considered to be the correspondence between a machine's output and that of a human: "the closer a machine translation is to a professional human translation, the better it is" – this is the central idea behind BLEU. Invented at IBM in 2001, BLEU was one of the first metrics to claim a high correlation with human judgements of quality, and remains one of the most popular automated and inexpensive metrics. Scores are calculated for individual translated segments—generally sentences—by comparing them with a set of good quality reference translations. Those scores are then averaged over the whole corpus to reach an estimate of the translation's overall quality. Intelligibility or grammatical correctness are not taken into account. BLEU's output is always a number between 0 and 1. This value indicates how similar the candidate text is to the reference texts, with values closer to 1 representing more similar texts. Few human translations will attain a score of 1, since this would indicate that the candidate is identical to one of the reference translations. For this reason, it is not necessary to attain a score of 1. Because there are more opportunities to match, adding additional reference translations will increase the BLEU score.
Основная настройка
Основная, первая попытка определения оценки BLEU требует двух аргументов: строку-кандидат и список эталонных строк. Идея заключается в том, что оценка должна быть близка к 1, если строка-кандидат похожа на эталонные строки, и близка к 0, если нет. В качестве аналогии, оценка BLEU подобна преподавателю языка, оценивающему качество перевода студента, проверяя, насколько точно он соответствует эталонным ответам. Поскольку в обработке естественного языка необходимо оценивать большой набор строк-кандидатов, необходимо обобщить оценку BLEU для случая, когда имеется список из M строк-кандидатов (называемый "корпусом") и для каждой строки-кандидата – список эталонных строк. Для любой строки и любого целого числа n мы определяем множество ее n-грамм. Следует отметить, что это множество уникальных элементов, а не мультимножество, допускающее повторения, так что, например, для любых двух строк мы определяем счет подстрок как количество появлений одной строки в качестве подстроки другой. Теперь зафиксируем корпус строк-кандидатов и корпус эталонных строк, где для каждого .
Since in natural language processing, one should evaluate a large set of candidate strings, one must generalize the BLEU score to the case where one has a list of M candidate strings (called a "corpus") , and for each candidate string , a list of reference candidate strings
Given any string , and any integer , we define the set of its n grams to be Note that it is a set of unique elements, not a multiset allowing redundant elements, so that, for example,
Given any two strings , define the substring count to be the number of appearances of as a substring of For example,
Now, fix a candidate corpus , and reference candidate corpus , where each .
Модифицированная точность n-грамм
Определите модифицированную функцию точности n-грамм как. Модифицированная n-грамма, которая выглядит сложной, является лишь прямым обобщением прототипического случая: одного предложения-кандидата и одного референтного предложения. В этом случае она равна. Чтобы вывести это выражение, начнем с наиболее очевидной суммы подсчета n-грамм:
Эта величина измеряет, сколько n-грамм в референтном предложении воспроизводится в предложении-кандидате. Обратите внимание, что мы подсчитываем n подстрок, а не n-грамм. Например, когда , все 2 подстроки в (ab и ba) встречаются в 3 раза каждая, поэтому подсчет равен 6, а не 2. Однако в вышеуказанной ситуации строка-кандидат слишком короткая. Вместо 3 появлений она содержит только одно, поэтому мы добавляем функцию минимума для исправления: Эта сумма подсчета не может быть использована для сравнения предложений, поскольку она не нормализована. Если и референтное, и кандидатское предложения длинные, подсчет может быть большим, даже если кандидат очень низкого качества. Поэтому мы нормализуем ее:
Нормализация такова, что это всегда число в интервале [0, 1], что позволяет проводить осмысленные сравнения между корпусами. Она равна нулю, если ни одна из n подстрок в кандидате не встречается в референтном предложении. Она равна единице, если каждая n-грамма в кандидате встречается в референтном предложении по крайней мере столько же раз, сколько в кандидате. В частности, если кандидат является подстрокой референтного предложения, то она равна единице.
This quantity measures how many n grams in the reference sentence are reproduced by the candidate sentence. Note that we count the n substrings, not n grams. For example, when , all the 2 substrings in (ab and ba) appear in 3 times each, so the count is 6, not 2. In the above situation, however, the candidate string is too short. Instead of 3 appearances of it contains only one, so we add a minimum function to correct for that: This count summation cannot be used to compare between sentences, since it is not normalized. If both the reference and the candidate sentences are long, the count could be big, even if the candidate is of very poor quality. So we normalize it The normalization is such that it is always a number in , allowing meaningful comparisons between corpuses. It is zero iff none of the n substrings in candidate is in reference. It is one iff every n gram in the candidate appears in reference, for at least as many times as in candidate. In particular, if the candidate is a substring of the reference, then it is one.
Окончательное определение BLEU
Не существует единого определения BLEU, а целое семейство определений, параметризуемое вектором весов. Это распределение вероятностей на множестве , то есть, , и при выборе , оценка BLEU представляет собой, по сути, взвешенное геометрическое среднее всех модифицированных n-граммных точностей, умноженное на штраф за краткость. Мы используем взвешенное геометрическое среднее, а не взвешенное арифметическое среднее, чтобы отдавать предпочтение кандидатам, которые одновременно демонстрируют хорошие результаты по нескольким n-граммным точностям. Наиболее типичный выбор, рекомендованный в оригинальной статье, – .
With a choice of , the BLEU score isIn words, it is a weighted geometric mean of all the modified n gram precisions, multiplied by the brevity penalty. We use the weighted geometric mean, rather than the weighted arithmetic mean, to strongly favor candidate corpuses that are simultaneously good according to multiple n gram precisions. The most typical choice, the one recommended in the original paper, is .
Выступление
О BLEU часто сообщалось, что он хорошо коррелирует с оценкой человека, и он по-прежнему служит эталоном для оценки любых новых метрик. Однако существует ряд критических замечаний. Отмечалось, что, хотя BLEU в принципе способен оценивать переводы на любой язык, в текущей реализации он не может работать с языками, в которых отсутствуют границы слов. Разработанный для использования с несколькими эталонными переводами, на практике его часто применяют только с одним. BLEU печально известен своей зависимостью от метода токенизации, и результаты, полученные с использованием разных методов, несравнимы (что часто игнорируется); для повышения воспроизводимости и сопоставимости была разработана версия SacreBLEU. Утверждается, что, несмотря на значительные преимущества BLEU, повышение его оценки не обязательно свидетельствует об улучшении качества перевода.