Введение

Метрика компьютерной обработки языка Скорость ошибок слов (WER) является общей метрикой производительности системы распознавания речи или машинного перевода. Общая сложность измерения производительности заключается в том, что распознаваемая последовательность слов может иметь другую длину, чем эталонная последовательность слов (предположительно правильная). WER происходит от расстояния Левенштейна, работая на уровне слов вместо уровня фонемы. WER является ценным инструментом для сравнения различных систем, а также для оценки улучшений в рамках одной системы. Однако данный вид измерения не дает никаких подробностей о характере ошибок перевода, поэтому требуется дальнейшая работа по выявлению основных источников ошибок и сосредоточению любых исследовательских усилий. Эта проблема решается, сначала выравнивая распознаваемую последовательность слов с справочной (говорящей) последовательностью слов с использованием динамического выравнивания струн. Исследование этого вопроса рассматривается с помощью теории, называемой законом силы, который устанавливает корреляцию между запутанностью и частотой ошибок слов. Скорость ошибок слов может быть вычислена как: где S - количество замен, D - количество удалений, I - количество вставлений, C - количество правильных слов, N - количество слов в ссылке (N = S + D + C). Интуиция за "удаление" и "вставка" заключается в том, как добраться от ссылки к гипотезе. Если у нас есть ссылка "Это - Википедия" и гипотеза "Эта Википедия", мы называем это удалением. При сообщении о производительности системы распознавания речи иногда вместо этого используется точность слов (WAcc): Обратите внимание, что поскольку N - это количество слов в ссылке, коэффициент ошибки слов может быть больше 1,0, и, таким образом, точность слов может быть меньше 0,0.

Эксперименты

Обычно считается, что более низкий уровень ошибок слов показывает превосходную точность в распознавании речи по сравнению с более высоким уровнем ошибок слов. Однако, по крайней мере, одно исследование показало, что это может быть не так. В эксперименте Microsoft Research было показано, что если люди были обучены "в соответствии с целью оптимизации для понимания" (Wang, Acero and Chelba, 2003), они показали бы более высокую точность в понимании языка, чем другие люди, которые продемонстрировали более низкий уровень ошибок слов, показывая, что истинное понимание разговорного языка зависит от большего, чем просто высокая точность распознавания слов.

Другие показатели

Однако одна из проблем использования общей формулы, такой как приведенная выше, заключается в том, что не учитывается влияние, которое различные типы ошибок могут оказывать на вероятность успешного результата, например, некоторые ошибки могут быть более разрушительными, чем другие, а некоторые могут быть исправлены легче, чем другие. Эти факторы, вероятно, будут специфичны для тестируемого синтаксиса. Еще одна проблема заключается в том, что даже при наилучшем выравнивании формула не может отличить ошибку замещения от ошибки совместного удаления плюс вставки. Хант (1990) предложил использовать взвешенную меру точности производительности, где ошибки замещения взвешиваются в единице, но ошибки удаления и вставки взвешиваются только в 0,5, таким образом: Существует некоторая дискуссия, однако, о том, может ли формула Ханта правильно использоваться для оценки производительности одной системы, поскольку она была разработана как средство сравнения более справедливых конкурирующих систем-кандидатов. Еще одна сложность заключается в том, позволяет ли данный синтаксис исправлять ошибки и, если да, насколько этот процесс прост для пользователя. Таким образом, есть некоторая обоснованность в том, что показатели производительности должны быть разработаны в соответствии с конкретной системой, подлежащей измерению. Однако, какая бы из этих метрик ни использовалась, одна из основных теоретических проблем при оценке эффективности системы заключается в том, чтобы определить, было ли слово "неправильно произнесено", то есть, виноват ли пользователь или распознаватель. Это может быть особенно актуально в системе, которая предназначена для того, чтобы справиться с не носителями данного языка или с сильными региональными акцентами. Темп, с которым следует произносить слова во время процесса измерения, также является источником изменчивости между субъектами, как и необходимость для субъектов отдыхать или дышать. Возможно, все эти факторы должны быть под контролем. Для текстового диктовки, как правило, соглашается, что точность производительности ниже 95% не является приемлемой, но это снова может быть синтаксисом и/или спецификой области, например, есть ли временное давление на пользователей, чтобы выполнить задачу, есть ли альтернативные методы завершения и т. д. Термин "Ставка ошибок одного слова" иногда называют процентом неправильных распознаваний для каждого разного слова в словарном запасе системы.

Изменить расстояние

Коэффициент ошибки слов также может называться нормализованным расстоянием редактирования. Нормальное расстояние редактирования между X и Y, d(X, Y) определяется как минимум W(P) /L (P), где P - путь редактирования между X и Y, W (P) - сумма весов элементарных операций редактирования P, а L(P) - количество этих операций (длина P).

Другие источники

МакКоуэн и др. 2005: О применении мер по извлечению информации для оценки распознавания речи Хант, М. Дж., 1990: Цифры достоинства для оценки подключенных распознавателей слов (Связь речи, 9, 1990, с. 239 336) Zechner, K., Waibel, A. Минимизация частоты ошибок в текстовых резюме разговорного языка