Дауыс талдауы: клиенттермен байланысты жақсарту және ақпаратты табу жолы
Speech analytics
Дауыс талдауы – қосылыс орталықтарында клиенттермен әңгімелерді талдап, қызмет сапасын арттыруға көмектесетін технология. Ақпаратты жинап, тенденцияларды анықтайды.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Сөйлеуді талдау – бұл жазылған қоңырауларды талдау арқылы клиент туралы ақпаратты жинап, коммуникацияны жақсарту және болашақ өзара әрекеттесуді жетілдіру процесі. Бұл процесті көбінесе клиенттермен байланыс орталықтары кәсіпорынмен клиенттердің өзара әрекеттесуінде жасырылған ақпаратты алу үшін пайдаланады. Сөйлеуді талдау автоматты сөйлеуді тану элементтерін қамтиды, бірақ ол талқыланатын тақырыпты, сөйлеудің эмоционалдық сипатын және өзара әрекеттесу барысындағы сөйлеу мен үнсіздік арақатынасын талдаумен ерекшеленеді. Байланыс орталықтарында сөйлеуді талдау клиенттермен тікелей байланыстың жазбаларын пайдаланып, тиімді шығындарды басқару және клиенттерге қызмет көрсету стратегияларын құруға қажетті мәліметтерді табуға мүмкіндік береді. Бұл технология шығындардың себептерін анықтап, трендтерді талдайды, процестер мен өнімдердің артықшылықтары мен кемшіліктерін анықтайды және нарықтың ұсыныстарды қалай қабылдайтынын түсінуге көмектеседі.
Speech analytics is the process of analyzing recorded calls to gather customer information to improve communication and future interaction. The process is primarily used by customer contact centers to extract information buried in client interactions with an enterprise. Although speech analytics includes elements of automatic speech recognition, it is known for analyzing the topic being discussed, which is weighed against the emotional character of the speech and the amount and locations of speech versus non speech during the interaction. Speech analytics in contact centers can be used to mine recorded customer interactions to surface the intelligence essential for building effective cost containment and customer service strategies. The technology can pinpoint cost drivers, trend analysis, identify strengths and weaknesses with processes and products, and help understand how the marketplace perceives offerings.
Анықтама
Сөйлеуді талдау – компания мен оның клиенттері арасындағы жазылған телефон әңгімелерінің толыққанды талдауын жүзеге асырады. Ол клиенттердің қоңырауларынан кеңейтілген мүмкіндіктер мен құнды мәліметтерді ұсынады. Бұл ақпарат стратегия, өнім, процестер, операциялық мәселелер және байланыс орталығы агенттерінің жұмысын анықтау үшін қолданылуы мүмкін. Сонымен қатар, сөйлеуді талдау байланыс орталығы агенттеріне қосымша оқыту немесе жаттығу қажеттіліктерін автоматты түрде анықтай алады, сондай-ақ қоңыраулар арқылы көрсетілетін қызмет сапасын қадағалайды. Бұл процесте белгілі бір кезеңде ең көп қолданылатын сөздер мен тіркестерді бөліп көрсетуге болады, сонымен қатар олардың қолданылу жиілігінің артуын немесе азаюын анықтауға мүмкіндік бар. Бұл ақпарат басшыларға, сарапшыларға және ұйымның басқа да қызметкерлеріне тұтынушылардың мінез-құлқындағы өзгерістерді байқап, қоңырау көлемін азайту және клиенттердің қанағаттануын арттыру үшін шаралар қабылдауға көмектеседі. Бұл клиенттің ой-өрісін түсінуге мүмкіндік береді, нәтижесінде компаниялар өздерінің әрекеттерін түзетуге жағдай туады.
Speech analytics provides a Complete analysis of recorded phone conversations between a company and its customers. It provides advanced functionality and valuable intelligence from customer calls. This information can be used to discover information relating to strategy, product, process, operational issues and contact center agent performance. In addition, speech analytics can automatically identify areas in which contact center agents may need additional training or coaching, and can automatically monitor the customer service provided on calls. The process can isolate the words and phrases used most frequently within a given time period, as well as indicate whether usage is trending up or down. This information is useful for supervisors, analysts, and others in an organization to spot changes in consumer behavior and take action to reduce call volumes—and increase customer satisfaction. It allows insight into a customer's thought process, which in turn creates an opportunity for companies to make adjustments.
Пайдалану мүмкіндігі
Сөйлеуді талдау қолданбалары тікелей эфирдегі аудиода немесе жазылған сөйлеуді өңдеу кезінде сөйленген кілт сөздерді немесе сөз тіркестерін анықтай алады. Бұл техника аудио-іздеу деп те аталады. Басқа қолданыстарға байланыс орталығында наразы клиенттерден түскен қоңырауларды анықтау үшін сөйлеуді жіктеу кіреді. Ақпаратты іздеу саласында кеңінен қолданылатын дәлдік (Precision) және толықтық (Recall) сияқты өлшемдер, сөйлеуді талдау іздеу жүйесінің жауабын бағалаудың әдеттегі тәсілдері болып табылады. Дәлдік – іздеу сұранымына қатысты іздеу нәтижелерінің үлесін көрсетеді. Ал толықтық – іздеу нәтижелерімен табылган барлық қажетті элементтердің жалпы санына қатынасын білдіреді. Егер стандартталған сынақ жиынтығы қолданылса, әртүрлі сөйлеуді талдау жүйелерінің іздеу өнімділігін тікелей салыстыру үшін дәлдік және толықтық сияқты өлшемдерді пайдалануға болады. Әртүрлі сөйлеуді талдау жүйелерінің дәлдігін салыстыру қиын болуы мүмкін. LVCSR жүйелерінің нәтижелерін сөз қателік деңгейін (WER) есептеу үшін эталондық сөз транскрипцияларымен салыстыруға болады, бірақ фонетикалық жүйелер сөздердің орнына дыбыстарды (фонемаларды) негізгі тану бірлігі ретінде қолданғандықтан, осы өлшемді пайдаланып салыстыру жасау мүмкін емес. Сөйлеуді талдау жүйелері сөйленген сөздерді немесе сөз тіркестерін іздеу үшін қолданылғанда, пайдаланушы үшін іздеу нәтижелерінің дұрыстығы маңызды. Жеке тану қателерінің іздеу нәтижелеріне тигізетін әсері әртүрлі болғандықтан, сөз қателік деңгейі сияқты өлшемдер әрдайым пайдаланушының көзқарасынан жалпы іздеудің дәлдігін анықтауға көмектеспейді. АҚШ Үкіметтік Есеп беру кеңсесінің мәліметінше, "деректердің сенімділігі – компьютерлік өңдеуден өткен деректердің дәлдігі мен толықтығы, олардың қолданылу мақсатына байланысты". Сөзді тану және талдау саласында "толықтық" "анықтау жылдамдығымен" өлшенді, және әдетте дәлдік артқан сайын, анықтау жылдамдығы төмендейді.
Speech analytics applications can spot spoken keywords or phrases, either as real time alerts on live audio or as a post processing step on recorded speech. This technique is also known as audio mining. Other uses include categorization of speech in the contact center environment to identify calls from unsatisfied customers. Measures such as Precision and recall, commonly used in the field of Information retrieval, are typical ways of quantifying the response of a speech analytics search system. Precision measures the proportion of search results that are relevant to the query. Recall measures the proportion of the total number of relevant items that were returned by the search results. Where a standardised test set has been used, measures such as precision and recall can be used to directly compare the search performance of different speech analytics systems. Making a meaningful comparison of the accuracy of different speech analytics systems can be difficult. The output of LVCSR systems can be scored against reference word level transcriptions to produce a value for the word error rate (WER), but because phonetic systems use phones as the basic recognition unit, rather than words, comparisons using this measure cannot be made. When speech analytics systems are used to search for spoken words or phrases, what matters to the user is the accuracy of the search results that are returned. Because the impact of individual recognition errors on these search results can vary greatly, measures such as word error rate are not always helpful in determining overall search accuracy from the user perspective. According to the US Government Accountability Office, “data reliability refers to the accuracy and completeness of computer processed data, given the uses they are intended for.” In the realm of Speech Recognition and Analytics, “completeness” is measured by the “detection rate”, and usually as accuracy goes up, the detection rate goes down.
Технология
Сөйлеуді талдау өнімдерін өндірушілер үшінші тараптың "қозғалтқышын" пайдаланады, ал басқалары жеке қозғалтқыштарды әзірлейді. Технология негізінен үш тәсілді қолданады. Фонетикалық тәсіл өңдеуде ең жылдам, себебі грамматиканың көлемі өте шағын, ал фонема негізгі тану бірлігі болып табылады. Көптеген тілдерде ондаған ғана бірегей фонемалар бар, ал осы танудың нәтижесі фонемалар ағыны (мәтін) болып табылады, одан кейін оны іздеуге болады. Үлкен сөздікпен үздіксіз сөйлеуді тану (LVCSR, көбінесе сөйлеуді мәтінге түрлендіру, толық транскрипция немесе ASR – автоматты сөйлеуді тану деп аталады) негізгі бірлік ретінде сөздерді (биграмма, триграмма және т.б.) қолданады. Бұл тәсіл аудионы салыстыру үшін жүздеген мың сөзді қажет етеді. Ол жаңа бизнес мәселелерін анықтауға көмектеседі, сұраныстар әлдеқайда жылдам, ал дәлдігі фонетикалық тәсілге қарағанда жоғары. Күрделендірілген сөйлеу эмоцияларын тану және болжау үш негізгі жіктегішке негізделген: kNN, C4.5 және SVM RBF Kernel. Бұл жиын әрбір жеке жіктегіштен жақсы нәтижелер береді. Ол тағы екі жіктегіш жиынтығымен салыстырылады: бірі – гибридті ядролары бар барлыққа қарсы (OAA) көп класты SVM, екіншісі – келесі екі негізгі жіктегіштен тұратын жиынтық: C5.0 және нейрондық желі. Ұсынылған нұсқа басқа екі жиынтықтан жақсы өнімділік көрсетеді.
Speech analytics vendors use the "engine" of a 3rd party and others develop proprietary engines. The technology mainly uses three approaches. The phonetic approach is the fastest for processing, mostly because the size of the grammar is very small, with a phoneme as the basic recognition unit. There are only few tens of unique phonemes in most languages, and the output of this recognition is a stream (text) of phonemes, which can then be searched. Large vocabulary continuous speech recognition (LVCSR, more commonly known as speech to text, full transcription or ASR automatic speech recognition) uses a set of words (bi grams, tri grams etc.) as the basic unit. This approach requires hundreds of thousands of words to match the audio against. It can surface new business issues, the queries are much faster, and the accuracy is higher than the phonetic approach. Extended speech emotion recognition and prediction is based on three main classifiers: kNN, C4.5 and SVM RBF Kernel. This set achieves better performance than each basic classifier taken separately. It is compared with two other sets of classifiers: one against all (OAA) multiclass SVM with Hybrid kernels and the set of classifiers which consists of the following two basic classifiers: C5.0 and Neural Network. The proposed variant achieves better performance than the other two sets of classifiers.
Өсу
Нарық зерттеулері көрсетіп тұрғандай, 2020 жылға қарай дауыс талдауы миллиард долларлық өнеркәсіпке айналады, ал Солтүстік Америка ең үлкен нарық үлесіне ие болады. Бұл өсімнің себебі – нормативтік талаптардың және тәуекелдерді басқарудың күшеюі, сондай-ақ нарық ақпараты арқылы өнеркәсіптегі бәсекелестіктің ұлғаюы. Телекоммуникация, АТ және аутсорсинг салалары ең үлкен нарық үлесін ұстап тұр, ал туризм және қонақжайлылық салаларында да өсу күтілуде.
Market research indicates that speech analytics is projected to become a billion dollar industry by 2020 with North America having the largest market share. The growth rate is attributed to rising requirements for compliance and risk management as well as an increase in industry competition through market intelligence. The telecommunications, IT and outsourcing segments of the industry are considered to hold the largest market share with expected growth from the travel and hospitality segments.