Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Анализ речи — это процесс анализа записанных звонков для сбора информации о клиентах с целью улучшения коммуникации и последующего взаимодействия. В основном этот процесс используется в контакт-центрах для извлечения информации, содержащейся во взаимодействиях клиентов с компанией. Хотя анализ речи включает в себя элементы автоматического распознавания речи, он известен тем, что анализирует тему обсуждения, сопоставляя её с эмоциональной окраской речи, а также с соотношением времени речи и пауз во время взаимодействия. Анализ речи в контакт-центрах позволяет извлекать из записей взаимодействий с клиентами ценные сведения, необходимые для разработки эффективных стратегий снижения затрат и повышения качества обслуживания. Эта технология позволяет выявлять факторы, влияющие на издержки, проводить анализ тенденций, определять сильные и слабые стороны процессов и продуктов, а также понимать восприятие предложений компании на рынке.
Speech analytics is the process of analyzing recorded calls to gather customer information to improve communication and future interaction. The process is primarily used by customer contact centers to extract information buried in client interactions with an enterprise. Although speech analytics includes elements of automatic speech recognition, it is known for analyzing the topic being discussed, which is weighed against the emotional character of the speech and the amount and locations of speech versus non speech during the interaction. Speech analytics in contact centers can be used to mine recorded customer interactions to surface the intelligence essential for building effective cost containment and customer service strategies. The technology can pinpoint cost drivers, trend analysis, identify strengths and weaknesses with processes and products, and help understand how the marketplace perceives offerings.
Определение
Анализ речи обеспечивает всесторонний анализ записанных телефонных разговоров между компанией и ее клиентами. Он предоставляет расширенные возможности и ценные сведения, полученные из клиентских звонков. Эта информация может быть использована для выявления данных, касающихся стратегии, продукта, процессов, операционных проблем и эффективности работы сотрудников контакт-центра. Кроме того, анализ речи позволяет автоматически определять области, в которых сотрудникам контакт-центра может потребоваться дополнительное обучение или коучинг, а также автоматически контролировать качество обслуживания клиентов во время звонков. Этот процесс позволяет выделить наиболее часто используемые слова и фразы за определенный период времени, а также отслеживать динамику их использования – рост или снижение. Эта информация полезна руководителям, аналитикам и другим специалистам организации для выявления изменений в поведении потребителей и принятия мер по снижению нагрузки на контакт-центр и повышению удовлетворенности клиентов. Это дает возможность понять ход мыслей клиента, что, в свою очередь, открывает компаниям возможности для внесения корректировок.
Speech analytics provides a Complete analysis of recorded phone conversations between a company and its customers. It provides advanced functionality and valuable intelligence from customer calls. This information can be used to discover information relating to strategy, product, process, operational issues and contact center agent performance. In addition, speech analytics can automatically identify areas in which contact center agents may need additional training or coaching, and can automatically monitor the customer service provided on calls. The process can isolate the words and phrases used most frequently within a given time period, as well as indicate whether usage is trending up or down. This information is useful for supervisors, analysts, and others in an organization to spot changes in consumer behavior and take action to reduce call volumes—and increase customer satisfaction. It allows insight into a customer's thought process, which in turn creates an opportunity for companies to make adjustments.
Удобство использования
Приложения для анализа речи способны выявлять ключевые слова или фразы, как в режиме реального времени при анализе живого аудио, так и на этапе последующей обработки записанной речи. Эта техника также известна как аудио-майнинг. Другие области применения включают категоризацию речи в среде контакт-центра для идентификации звонков от недовольных клиентов. Такие показатели, как точность и полнота, широко используемые в области информационного поиска, являются типичными способами количественной оценки работы поисковой системы речевой аналитики. Точность определяет долю релевантных результатов поиска по отношению к общему числу результатов. Полнота определяет долю релевантных элементов, найденных системой, по отношению к общему числу релевантных элементов. Если используется стандартизированный тестовый набор, показатели точности и полноты могут быть использованы для непосредственного сравнения эффективности поиска различных систем речевой аналитики. Сделать содержательное сравнение точности различных систем речевой аналитики может быть сложно. Результаты работы систем LVCSR можно оценить по эталонным транскрипциям на уровне слов для получения значения коэффициента ошибок распознавания (WER), однако, поскольку фонетические системы используют фонемы как базовую единицу распознавания, а не слова, сравнения с использованием этой метрики невозможны. При использовании систем речевой аналитики для поиска произнесенных слов или фраз для пользователя важна точность возвращаемых результатов поиска. Поскольку влияние отдельных ошибок распознавания на эти результаты может существенно различаться, такие показатели, как коэффициент ошибок распознавания, не всегда позволяют оценить общую точность поиска с точки зрения пользователя. Согласно Управлению подотчетности правительства США, "надежность данных" относится к точности и полноте компьютерно обработанных данных с учетом их предполагаемого использования. В области распознавания и анализа речи "полнота" измеряется "вероятностью обнаружения", и, как правило, с повышением точности вероятность обнаружения снижается.
Speech analytics applications can spot spoken keywords or phrases, either as real time alerts on live audio or as a post processing step on recorded speech. This technique is also known as audio mining. Other uses include categorization of speech in the contact center environment to identify calls from unsatisfied customers. Measures such as Precision and recall, commonly used in the field of Information retrieval, are typical ways of quantifying the response of a speech analytics search system. Precision measures the proportion of search results that are relevant to the query. Recall measures the proportion of the total number of relevant items that were returned by the search results. Where a standardised test set has been used, measures such as precision and recall can be used to directly compare the search performance of different speech analytics systems. Making a meaningful comparison of the accuracy of different speech analytics systems can be difficult. The output of LVCSR systems can be scored against reference word level transcriptions to produce a value for the word error rate (WER), but because phonetic systems use phones as the basic recognition unit, rather than words, comparisons using this measure cannot be made. When speech analytics systems are used to search for spoken words or phrases, what matters to the user is the accuracy of the search results that are returned. Because the impact of individual recognition errors on these search results can vary greatly, measures such as word error rate are not always helpful in determining overall search accuracy from the user perspective. According to the US Government Accountability Office, “data reliability refers to the accuracy and completeness of computer processed data, given the uses they are intended for.” In the realm of Speech Recognition and Analytics, “completeness” is measured by the “detection rate”, and usually as accuracy goes up, the detection rate goes down.
Технология
Продавцы решений для речевой аналитики используют "движок" сторонних разработчиков, а другие разрабатывают собственные. В технологии применяются главным образом три подхода. Фонетический подход – самый быстрый для обработки, в основном из-за небольшого размера грамматики, где фонема является базовой единицей распознавания. В большинстве языков существует всего несколько десятков уникальных фонем, а результатом распознавания является поток (текст) фонем, по которому затем можно осуществлять поиск. Непрерывное распознавание речи с большим словарём (LVCSR, чаще известное как преобразование речи в текст, полная транскрипция или автоматическое распознавание речи – ASR) использует набор слов (биграммы, триграммы и т.д.) в качестве базовой единицы. Для этого подхода требуется сопоставление аудио с сотнями тысяч слов. Он позволяет выявлять новые бизнес-задачи, запросы выполняются быстрее, а точность выше, чем при использовании фонетического подхода. Расширенное распознавание и прогнозирование эмоций в речи основано на трех основных классификаторах: kNN, C4.5 и SVM с ядром RBF. Этот набор демонстрирует более высокую эффективность, чем каждый из базовых классификаторов по отдельности. Его сравнивают с двумя другими наборами классификаторов: многоклассовым SVM с гибридными ядрами, использующим стратегию "один против всех" (OAA), и набором, состоящим из двух базовых классификаторов: C5.0 и нейронной сети. Предложенный вариант показывает лучшие результаты, чем два других набора классификаторов.
Speech analytics vendors use the "engine" of a 3rd party and others develop proprietary engines. The technology mainly uses three approaches. The phonetic approach is the fastest for processing, mostly because the size of the grammar is very small, with a phoneme as the basic recognition unit. There are only few tens of unique phonemes in most languages, and the output of this recognition is a stream (text) of phonemes, which can then be searched. Large vocabulary continuous speech recognition (LVCSR, more commonly known as speech to text, full transcription or ASR automatic speech recognition) uses a set of words (bi grams, tri grams etc.) as the basic unit. This approach requires hundreds of thousands of words to match the audio against. It can surface new business issues, the queries are much faster, and the accuracy is higher than the phonetic approach. Extended speech emotion recognition and prediction is based on three main classifiers: kNN, C4.5 and SVM RBF Kernel. This set achieves better performance than each basic classifier taken separately. It is compared with two other sets of classifiers: one against all (OAA) multiclass SVM with Hybrid kernels and the set of classifiers which consists of the following two basic classifiers: C5.0 and Neural Network. The proposed variant achieves better performance than the other two sets of classifiers.
Рост
Исследования рынка показывают, что к 2020 году индустрия речевой аналитики достигнет объема в миллиард долларов, при этом наибольшая доля рынка придется на Северную Америку. Рост обусловлен повышением требований к соответствию нормативным требованиям и управлению рисками, а также усилением конкуренции в отрасли благодаря использованию аналитических данных. Наибольшую долю рынка занимают сегменты телекоммуникаций, информационных технологий и аутсорсинга, при этом ожидается рост в сегментах туристического и гостиничного бизнеса.
Market research indicates that speech analytics is projected to become a billion dollar industry by 2020 with North America having the largest market share. The growth rate is attributed to rising requirements for compliance and risk management as well as an increase in industry competition through market intelligence. The telecommunications, IT and outsourcing segments of the industry are considered to hold the largest market share with expected growth from the travel and hospitality segments.