Введение
Метрика компьютерной обработки языка Скорость ошибок слов (WER) является общей метрикой производительности системы распознавания речи или машинного перевода. Общая сложность измерения производительности заключается в том, что распознаваемая последовательность слов может иметь другую длину, чем эталонная последовательность слов (предположительно правильная). WER происходит от расстояния Левенштейна, работая на уровне слов вместо уровня фонемы. WER является ценным инструментом для сравнения различных систем, а также для оценки улучшений в рамках одной системы. Однако данный вид измерения не дает никаких подробностей о характере ошибок перевода, поэтому требуется дальнейшая работа по выявлению основных источников ошибок и сосредоточению любых исследовательских усилий. Эта проблема решается, сначала выравнивая распознаваемую последовательность слов с справочной (говорящей) последовательностью слов с использованием динамического выравнивания струн. Исследование этого вопроса рассматривается с помощью теории, называемой законом силы, который устанавливает корреляцию между запутанностью и частотой ошибок слов. Скорость ошибок слов может быть вычислена как: где S - количество замен, D - количество удалений, I - количество вставлений, C - количество правильных слов, N - количество слов в ссылке (N = S + D + C). Интуиция за "удаление" и "вставка" заключается в том, как добраться от ссылки к гипотезе. Если у нас есть ссылка "Это - Википедия" и гипотеза "Эта Википедия", мы называем это удалением. При сообщении о производительности системы распознавания речи иногда вместо этого используется точность слов (WAcc): Обратите внимание, что поскольку N - это количество слов в ссылке, коэффициент ошибки слов может быть больше 1,0, и, таким образом, точность слов может быть меньше 0,0.
Word error rate (WER) is a common metric of the performance of a speech recognition or machine translation system. The general difficulty of measuring performance lies in the fact that the recognized word sequence can have a different length from the reference word sequence (supposedly the correct one). The WER is derived from the Levenshtein distance, working at the word level instead of the phoneme level. The WER is a valuable tool for comparing different systems as well as for evaluating improvements within one system. This kind of measurement, however, provides no details on the nature of translation errors and further work is therefore required to identify the main source(s) of error and to focus any research effort. This problem is solved by first aligning the recognized word sequence with the reference (spoken) word sequence using dynamic string alignment. Examination of this issue is seen through a theory called the power law that states the correlation between perplexity and word error rate. Word error rate can then be computed as:
where
S is the number of substitutions,
D is the number of deletions,
I is the number of insertions,
C is the number of correct words,
N is the number of words in the reference (N=S+D+C)
The intuition behind 'deletion' and 'insertion' is how to get from the reference to the hypothesis. So if we have the reference "This is wikipedia" and hypothesis "This wikipedia", we call it a deletion. When reporting the performance of a speech recognition system, sometimes word accuracy (WAcc) is used instead:
Note that since N is the number of words in the reference, the word error rate can be larger than 1.0, and thus, the word accuracy can be smaller than 0.0.
Эксперименты
Обычно считается, что более низкий уровень ошибок слов показывает превосходную точность в распознавании речи по сравнению с более высоким уровнем ошибок слов. Однако, по крайней мере, одно исследование показало, что это может быть не так. В эксперименте Microsoft Research было показано, что если люди были обучены "в соответствии с целью оптимизации для понимания" (Wang, Acero and Chelba, 2003), они показали бы более высокую точность в понимании языка, чем другие люди, которые продемонстрировали более низкий уровень ошибок слов, показывая, что истинное понимание разговорного языка зависит от большего, чем просто высокая точность распознавания слов.
Другие показатели
Однако одна из проблем использования общей формулы, такой как приведенная выше, заключается в том, что не учитывается влияние, которое различные типы ошибок могут оказывать на вероятность успешного результата, например, некоторые ошибки могут быть более разрушительными, чем другие, а некоторые могут быть исправлены легче, чем другие. Эти факторы, вероятно, будут специфичны для тестируемого синтаксиса. Еще одна проблема заключается в том, что даже при наилучшем выравнивании формула не может отличить ошибку замещения от ошибки совместного удаления плюс вставки. Хант (1990) предложил использовать взвешенную меру точности производительности, где ошибки замещения взвешиваются в единице, но ошибки удаления и вставки взвешиваются только в 0,5, таким образом: Существует некоторая дискуссия, однако, о том, может ли формула Ханта правильно использоваться для оценки производительности одной системы, поскольку она была разработана как средство сравнения более справедливых конкурирующих систем-кандидатов. Еще одна сложность заключается в том, позволяет ли данный синтаксис исправлять ошибки и, если да, насколько этот процесс прост для пользователя. Таким образом, есть некоторая обоснованность в том, что показатели производительности должны быть разработаны в соответствии с конкретной системой, подлежащей измерению. Однако, какая бы из этих метрик ни использовалась, одна из основных теоретических проблем при оценке эффективности системы заключается в том, чтобы определить, было ли слово "неправильно произнесено", то есть, виноват ли пользователь или распознаватель. Это может быть особенно актуально в системе, которая предназначена для того, чтобы справиться с не носителями данного языка или с сильными региональными акцентами. Темп, с которым следует произносить слова во время процесса измерения, также является источником изменчивости между субъектами, как и необходимость для субъектов отдыхать или дышать. Возможно, все эти факторы должны быть под контролем. Для текстового диктовки, как правило, соглашается, что точность производительности ниже 95% не является приемлемой, но это снова может быть синтаксисом и/или спецификой области, например, есть ли временное давление на пользователей, чтобы выполнить задачу, есть ли альтернативные методы завершения и т. д. Термин "Ставка ошибок одного слова" иногда называют процентом неправильных распознаваний для каждого разного слова в словарном запасе системы.
There is some debate, however, as to whether Hunt's formula may properly be used to assess the performance of a single system, as it was developed as a means of comparing more fairly competing candidate systems. A further complication is added by whether a given syntax allows for error correction and, if it does, how easy that process is for the user. There is thus some merit to the argument that performance metrics should be developed to suit the particular system being measured. Whichever metric is used, however, one major theoretical problem in assessing the performance of a system is deciding whether a word has been “mis pronounced,” i. e. does the fault lie with the user or with the recogniser. This may be particularly relevant in a system which is designed to cope with non native speakers of a given language or with strong regional accents. The pace at which words should be spoken during the measurement process is also a source of variability between subjects, as is the need for subjects to rest or take a breath. All such factors may need to be controlled in some way. For text dictation it is generally agreed that performance accuracy at a rate below 95% is not acceptable, but this again may be syntax and/or domain specific, e. g. whether there is time pressure on users to complete the task, whether there are alternative methods of completion, and so on. The term "Single Word Error Rate" is sometimes referred to as the percentage of incorrect recognitions for each different word in the system vocabulary.
Изменить расстояние
Коэффициент ошибки слов также может называться нормализованным расстоянием редактирования. Нормальное расстояние редактирования между X и Y, d(X, Y) определяется как минимум W(P) /L (P), где P - путь редактирования между X и Y, W (P) - сумма весов элементарных операций редактирования P, а L(P) - количество этих операций (длина P).
Другие источники
МакКоуэн и др. 2005: О применении мер по извлечению информации для оценки распознавания речи Хант, М. Дж., 1990: Цифры достоинства для оценки подключенных распознавателей слов (Связь речи, 9, 1990, с. 239 336) Zechner, K., Waibel, A. Минимизация частоты ошибок в текстовых резюме разговорного языка
Hunt, M. J., 1990: Figures of Merit for Assessing Connected Word Recognisers (Speech Communication, 9, 1990, pp 239 336)
Zechner, K., Waibel, A. Minimizing Word Error Rate in Textual Summaries of Spoken Language