Введение

Алгоритм оценки качества машинного перевода
метрика оценки машинного перевода
NOTOC
BLEU (bilingual evaluation understudy) – это алгоритм для оценки качества текста, машинного перевода с одного естественного языка на другой. Качество определяется как соответствие между результатом машинного перевода и переводом, выполненным человеком: «чем ближе машинный перевод к профессиональному переводу, сделанному человеком, тем он лучше» – такова основная идея BLEU. Разработанный в IBM в 2001 году, BLEU стал одной из первых метрик, заявивших о высокой корреляции с оценками качества, данными людьми, и остаётся одной из самых популярных, автоматизированных и недорогих метрик. Оценки рассчитываются для отдельных переведённых сегментов – как правило, предложений – путём сравнения их с набором качественных эталонных переводов. Затем эти оценки усредняются по всему корпусу для получения оценки общего качества перевода. Понятность или грамматическая правильность при этом не учитываются. Результат BLEU всегда представляет собой число от 0 до 1. Это значение указывает на степень сходства между кандидатским текстом и эталонными текстами, при этом значения, близкие к 1, указывают на большее сходство. Лишь немногие переводы, выполненные человеком, могут достичь оценки 1, поскольку это означало бы, что кандидатский текст идентичен одному из эталонных переводов. Поэтому достижение оценки 1 не является необходимостью. Поскольку возможностей для сопоставления больше, добавление дополнительных эталонных переводов повысит оценку BLEU.

Основная настройка

Основная, первая попытка определения оценки BLEU требует двух аргументов: строку-кандидат и список эталонных строк. Идея заключается в том, что оценка должна быть близка к 1, если строка-кандидат похожа на эталонные строки, и близка к 0, если нет. В качестве аналогии, оценка BLEU подобна преподавателю языка, оценивающему качество перевода студента, проверяя, насколько точно он соответствует эталонным ответам. Поскольку в обработке естественного языка необходимо оценивать большой набор строк-кандидатов, необходимо обобщить оценку BLEU для случая, когда имеется список из M строк-кандидатов (называемый "корпусом") и для каждой строки-кандидата – список эталонных строк. Для любой строки и любого целого числа n мы определяем множество ее n-грамм. Следует отметить, что это множество уникальных элементов, а не мультимножество, допускающее повторения, так что, например, для любых двух строк мы определяем счет подстрок как количество появлений одной строки в качестве подстроки другой. Теперь зафиксируем корпус строк-кандидатов и корпус эталонных строк, где для каждого .

Модифицированная точность n-грамм

Определите модифицированную функцию точности n-грамм как. Модифицированная n-грамма, которая выглядит сложной, является лишь прямым обобщением прототипического случая: одного предложения-кандидата и одного референтного предложения. В этом случае она равна. Чтобы вывести это выражение, начнем с наиболее очевидной суммы подсчета n-грамм:
Эта величина измеряет, сколько n-грамм в референтном предложении воспроизводится в предложении-кандидате. Обратите внимание, что мы подсчитываем n подстрок, а не n-грамм. Например, когда , все 2 подстроки в (ab и ba) встречаются в 3 раза каждая, поэтому подсчет равен 6, а не 2. Однако в вышеуказанной ситуации строка-кандидат слишком короткая. Вместо 3 появлений она содержит только одно, поэтому мы добавляем функцию минимума для исправления: Эта сумма подсчета не может быть использована для сравнения предложений, поскольку она не нормализована. Если и референтное, и кандидатское предложения длинные, подсчет может быть большим, даже если кандидат очень низкого качества. Поэтому мы нормализуем ее:
Нормализация такова, что это всегда число в интервале [0, 1], что позволяет проводить осмысленные сравнения между корпусами. Она равна нулю, если ни одна из n подстрок в кандидате не встречается в референтном предложении. Она равна единице, если каждая n-грамма в кандидате встречается в референтном предложении по крайней мере столько же раз, сколько в кандидате. В частности, если кандидат является подстрокой референтного предложения, то она равна единице.

Окончательное определение BLEU

Не существует единого определения BLEU, а целое семейство определений, параметризуемое вектором весов. Это распределение вероятностей на множестве , то есть, , и при выборе , оценка BLEU представляет собой, по сути, взвешенное геометрическое среднее всех модифицированных n-граммных точностей, умноженное на штраф за краткость. Мы используем взвешенное геометрическое среднее, а не взвешенное арифметическое среднее, чтобы отдавать предпочтение кандидатам, которые одновременно демонстрируют хорошие результаты по нескольким n-граммным точностям. Наиболее типичный выбор, рекомендованный в оригинальной статье, – .

Выступление

О BLEU часто сообщалось, что он хорошо коррелирует с оценкой человека, и он по-прежнему служит эталоном для оценки любых новых метрик. Однако существует ряд критических замечаний. Отмечалось, что, хотя BLEU в принципе способен оценивать переводы на любой язык, в текущей реализации он не может работать с языками, в которых отсутствуют границы слов. Разработанный для использования с несколькими эталонными переводами, на практике его часто применяют только с одним. BLEU печально известен своей зависимостью от метода токенизации, и результаты, полученные с использованием разных методов, несравнимы (что часто игнорируется); для повышения воспроизводимости и сопоставимости была разработана версия SacreBLEU. Утверждается, что, несмотря на значительные преимущества BLEU, повышение его оценки не обязательно свидетельствует об улучшении качества перевода.