Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Сөйлеуді танудың құрамдас бөлігі
Component of speech recognition
Дауысты талдау – сөйлеуді тану сияқты, тілдік мазмұннан өзге мақсаттарда сөйлеу дыбыстарын зерттеу. Мұндай зерттеулерге көбінесе дауыстың медициналық талдауы (фониятрика) және сөйлеушіні анықтау кіреді. Көбірек дау тудыратыны, кейбіреулер дауыс стресін талдау немесе қабатты дауыс талдау арқылы сөйлеушінің шыншылдығын немесе эмоционалдық жағдайын анықтауға болады деп санайды.
Voice analysis is the study of speech sounds for purposes other than linguistic content, such as in speech recognition. Such studies include mostly medical analysis of the voice (phoniatrics), but also speaker identification. More controversially, some believe that the truthfulness or emotional state of speakers can be determined using voice stress analysis or layered voice analysis.
Талдау әдістері
Дауысты талдау қажет болатын дауыс проблемалары көбінесе дауыс байланыстарынан немесе оларды басқаратын көмекей бұлшықеттерінен туындайды, себебі байланыстар әрбір діріл айналымында соқтығысу күштеріне және олардың арасындағы тарлық арқылы өтетін ауаның құрғауына ұшырайды, ал көмекей бұлшықеттері сөйлеу немесе ән айту кезінде өте белсенді болып, шаршауға бейім. Дегенмен, дауыс байланыстарының динамикалық талдауы мен олардың қозғалысын зерттеу физикалық тұрғыдан қиын. Дауыс байланыстарының орналасуы олардың қозғалысын тікелей өлшеуге кедері келтіреді. Рентген немесе ультрадыбыс сияқты инвазивті емес бейнелеу әдістері де тиімді емес, себебі дауыс баулары шеміршекпен қоршалған, бұл бейне сапасын нашарлатады. Дауыс бауларының қозғалысы өте жылдам, негізгі жиіліктер әдетте 80-ден 300 Гц-ке дейін ауытқиды, сондықтан қарапайым бейнелерді қолдану мүмкін емес. Стробоскоптық және жоғары жылдамдықты бейнелерге мүмкіндік бар, бірақ дауыс байланыстарын көру үшін камераға жетектеуші талшықты зондты жұтқыншаққа енгізу қажет, бұл сөйлеуді қиындатады. Сонымен қатар, жұтқыншаққа заттарды салу көбінесе құсу рефлексін тудырады, ол дауысты тоқтатып, көмекейді жабады. Стробоскоптық бейнелеу тек дауыс байланысының діріл үлгісі өте тұрақты болған жағдайда ғана пайдалы. Қазіргі уақытта ең маңызды жанама әдістер – микрофон немесе ауыз арқылы өтетін ауа ағынын кері сүзгілеу және электроглотография (ЭГГ). Кері сүзгілеу кезінде сөйлеу дыбысы (микрофоннан алынған сәулеленетін акустикалық қысым толқыны) немесе ауыз арқылы өтетін ауа ағыны толқыны айналасы желдетілетін (АЖ) маскадан ауыз сыртынан жазылады, содан кейін математикалық әдіспен сүзгіленіп, дауыс жолының әсерін жояды. Бұл әдіс дауыс шығарудың көмекейлік кірісін шығысты жазып, дауыс жолының әсерін теріске шығару үшін есептеу моделін қолдану арқылы бағалайды. Дауыс байланыстарының қозғалысын жанама түрде көрсететін тағы бір әдіс – электроглотография. Бұл әдісте адамның жұтқыншағының екі жағына орналастырылған электродтар дауыс байланыстары деңгейінде дауыс байланыстарының бір-біріне қаншалықты жанасқанын тіркейді, соның нәтижесінде жұтқыншақтың өткізгіштігінің өзгеруін анықтайды. Осылайша, ол байланыс аймағы туралы бір өлшемді ақпарат береді. Кері сүзгілеу де, ЭГГ де дауыс байланыстарының қозғалысының күрделі үш өлшемді үлгісін толық сипаттауға жеткіліксіз, бірақ бұл қозғалыстың пайдалы жанама дәлелін ұсынуы мүмкін. Дауысты талдаудың тағы бір жолы – дауыс сипаттамаларын қарастыру. Дауыстың кейбір сипаттамалары – дыбыс, биіктік, күштілік және жылдамдық. Бұл сипаттамаларды адамның дауысын бағалау үшін қолдануға болады және дауыс талдау процесіне көмектесе алады. Фонация әдетте адамнан жиналған әртүрлі деректерді қарау арқылы тексеріледі, мысалы, ұзын дауыстылар бар сөздер, көптеген фонемалар бар сөздер немесе жай ғана әдеттегі сөйлеу. Адамның дыбыс биіктігін оның ең жоғары және ең төменгі дыбыстарды шығара алуы арқылы, сондай-ақ олардың арасындағы дыбыстарды шығара алуы арқылы бағалауға болады. Бұл процеске қол жеткізу үшін пернетақта қолданылуы мүмкін. Күштілікті бақылау маңызды, себебі кейбір адамдар үшін күштілік белгілі бір дыбыстарды шығаруға әсер етеді. Кейбір адамдар басқаларына қарағанда белгілі бір дыбыстарды шығару үшін күштірек сөйлеуі керек. Бұл адамды бірдей күштілікпен ән салуды сұрату арқылы сынауға болады. Жылдамдық та маңызды, себебі ол адамның қаншалықты жылдам немесе баяу сөйлейтінін көрсетеді.
Voice problems that require voice analysis most commonly originate from the vocal folds or the laryngeal musculature that controls them, since the folds are subject to collision forces with each vibratory cycle and to drying from the air being forced through the small gap between them, and the laryngeal musculature is intensely active during speech or singing and is subject to tiring. However, dynamic analysis of the vocal folds and their movement is physically difficult. The location of the vocal folds effectively prohibits direct, invasive measurement of movement. Less invasive imaging methods such as x rays or ultrasounds do not work because the vocal cords are surrounded by cartilage, which distorts image quality. Movements in the vocal cords are rapid, fundamental frequencies are usually between 80 and 300 Hz, thus preventing usage of ordinary video. Stroboscopic, and high speed videos provide an option, but to see the vocal folds a fiberoptic probe leading to the camera must be positioned in the throat, which makes speaking difficult. In addition, placing objects in the pharynx usually triggers a gag reflex that stops voicing and closes the larynx. In addition, stroboscopic imaging is only useful when the vocal fold vibratory pattern is closely periodic. The most important indirect methods are currently inverse filtering of either microphone or oral airflow recordings and electroglottography (EGG). In inverse filtering, the speech sound (the radiated acoustic pressure waveform, as obtained from a microphone) or the oral airflow waveform from a circumferentially vented (CV) mask is recorded outside the mouth and then filtered by a mathematical method to remove the effects of the vocal tract. This method estimates the glottal input of voice production by recording output and using a computational model to invert the effects of the vocal tract. The other kind of noninvasive indirect indication of vocal fold motion is the electroglottography, in which electrodes placed on either side of the subject's throat at the level of the vocal folds record the changes in the conductivity of the throat according to how large a portion of the vocal folds are touching each other. It thus yields one dimensional information of the contact area. Neither inverse filtering nor EGG are sufficient to completely describe the complex 3 dimensional pattern of vocal fold movement, but can provide useful indirect evidence of that movement. Another way to conduct voice analysis is to look at voice characteristics. Some characteristics of voice are phonation, pitch, loudness, and rate. These characteristics can be used to evaluate a person's voice and can aid in the voice analysis process. Phonation is typically tested by looking at different types of data collected from a person such as words with long vowels, words with many phonemes, or just typical speech. A person's pitch can be evaluated by making the person produce the highest and lowest sounds they can, as well as sounds in between. A keyboard can be used to aid in this process. Loudness is valuable to look at because for certain people, loudness affects the way they produce certain sounds. Some people need to speak louder for certain phonemes in comparison to others just so they can produce them. This can be tested by asking the person to use the same amount of loudness while singing a scale. Rate is also important because it looks at how fast or slow a person speaks.
Медициналық қолдану
Дауыстың медициналық зерттеуі, мысалы, операция арқылы дауыс байланыстарынан полип алынып тасталған науқастардың дауысын талдау болуы мүмкін. Мұндай мәселелерді объективті түрде бағалау үшін компьютерлік әдістерді қолдануға болады. Тәжірибелі дауыс терапевті дауысты сенімді бағалай алады, бірақ бұл үшін кеңейтілген оқыту қажет, және бұл әлі де субъективті болып табылады. Медициналық дауыс талдауындағы тағы бір белсенді зерттеу тақырыбы – дауыс жүктемесін бағалау. Ұзақ уақыт сөйлейтін адамның дауыс байланыстары шаршайды, яғни сөйлеу процесі дауыс байланыстарына жүктеме түсіріп, тінді шаршатады. Кәсіби дауыс қолданушылары (мысалы, мұғалімдер, сатушылар) арасында бұл шаршау дауыс жетіспеушілігіне және ауру демалысына әкелуі мүмкін. Дауысты талдау мұндай проблемаларды бағалаудың объективті құралы ретінде зерттелді. Дауысты талдау дауыс байланысының салдарынан туындаған параличті зерттеуде маңызды фактор болды. Ол сөйлеуден тыныс алуға дейін дауыс байланыстарының әртүрлі функцияларына әсер етеді, және дауыс талдауы операциядан кейін дауыс байланыстарындағы тиропластиканың (медиализациялық тиропластика) тиімділігін зерттеу үшін қолданылады. Операцияға дейін дәстүрлі дауыс жазу науқастардың дауыстарын операциядан кейінгі жағдаймен салыстыру үшін қолданылады, сондай-ақ электроглотография, фотоглотография және видеокиммографияны қолданатын күрделі жазбалармен бірге қолданылады. Медициналық мамандар күрделі жазбалардан алынған нәтижелерді оқи және түсіне алады, бірақ дәл нәтижелер алу үшін осы тәжірибелерде дауыс маманының білімі қажет. Дауыс мамандары дауыс байланыстарының физикалық тексеруін неврологиялық тексерумен байланыстыруда маңызды рөл атқарды, осылайша операцияның сәттілігін қамтамасыз етті, себебі олардың жақсы дамыған есту қабілеттері бар. Дауыстың қабылдануы үн сапасына көп тәуелді, бұл факторды әдетте дауыс мамандары (сөз терапевтері) бағалайды. Кәсіби дауыс талдаушысы жақсы дамыған есту қабілетіне ие және нәтижелерді бұрмалауға әкелуі мүмкін артық факторларды жоюға қабілетті.
A medical study of the voice can be, for instance, analysis of the voice of patients who have had a polyp removed from their vocal cords through an operation. Computerized methods can be used to assess such issues in an objective manner. An experienced voice therapist can quite reliably evaluate the voice, but this requires extensive training and is still subjective. Another active research topic in medical voice analysis is vocal loading evaluation. The vocal cords of a person who speaks for an extended time suffer from tiring—that is, the process of speaking exerts a load on the vocal cords and tires the tissue. Among professional voice users (e. g., teachers, sales people) this tiring can cause voice failures and sick leaves. Voice analysis has been studied as an objective means to evaluate such problems. Voice analysis was an important factor in the study of vocal cord paralysis. It effects different functions of the vocal cords, from speech to breathing and voice analysis is used to study the effectiveness of Thyroplasty (medialization thyroplasty) improvements on the vocal cords after the surgery. Traditional voice recording is used in pre operation to record the voices of chosen patients to be compared with the post operation usage, along with more complex recordings using an electroglottograpy, photoglottography, and videokymography. Medical professionals have the ability to read and understand the results from the complex recordings, but knowledge from a voice professional is needed within these experiments for accurate results. Voice experts were an important to tie the physical examination of the vocal cords to the neurological examination to ensure the success of the surgery because of their trained ear. Perceptual evaluation of voice is heavily reliant on voice quality, a factor assessed preferably by voice specialists (speech therapists). A professional voice analyzer has a trained ear and can block out excess variants that can be deceptive from the results.
Сот медицинасында қолдану
Дауысты талдау аудиокриминалистика деп аталатын сот-медицина ғылымының бір саласында қолданылады. Мұндай талдаулар көбінесе аудиожазбаның түпнұсқалығын бағалау, ыңғайсыз фондық шудың астында жасырылған аудио ерекшеліктерін анықтау және күшейту, аудионы сот-медициналық сарапшының тұрғысынан түсіндіру, ал кейбір жағдайларда сөйлеушіні анықтау мақсатында айғақтарға қатысты жүргізіледі. Сарапшы талдау барысында түрлі техникаларды қолданады. Міндетті процедуралардың қатарында "критикалық тыңдау, толқындық талдау және спектрлік талдау" бар. Критикалық тыңдау – алдыңғы және артқы жолдағы дыбыстарды қайталап тыңдау арқылы оларды мұқият талдау. Толқындық талдау сарапшыға кез келген ерекшеліктерді көруге мүмкіндік беретін аудионың визуализациясын қамтамасыз етеді. Спектрлік талдау аудио жиілігін визуализациялайды, бұл сарапшыға қызығушылық тудыратын ерекшеліктерді анықтауға көмектеседі. Аудио үлкен рөл атқарған бір жағдай – Трейвон Мартин ісі, онда полицияға жасалған қоңыраудың жазбасы фондық айғайлар Джордж Циммерманнан немесе Мартиннен шыққандығын анықтау үшін сараланды.
Voice analysis is used in a branch of forensic science called audio forensics. These analyses are generally performed on evidence for the purposes of evaluating the authenticity of the audio in question, enhancing features of the audio that may be hidden beneath distracting background noise, interpreting the audio from the perspective of a forensic expert, or in some cases for the purposes of speaker identification. An expert will employ a variety of techniques in their analysis. The minimum of procedures are "critical listening, waveform analysis, and spectral analysis". Critical listening involves a thorough breakdown of both foreground and background sounds through repetitive listening. Waveform analysis visualizes the audio for the examiner to see any irregularities that may occur. Spectral analysis visualizes the frequency of the audio for an examiner to pick out features of interest. One case in which audio played a larger role is the Trayvon Martin case, where a recording of a call made to the police was analyzed to determine if background screams came from George Zimmerman or from Martin.
Соттанушы дауысы
Сотталған дауысты сарапшылар жазылған сөзді талдайды, оның берілу және сақталу жолдарын зерттейді, жақсартады және қылмыстық тергеп-тексерулер, сот отырыстары және федералдық агенттіктер үшін түсіндіреді. Аудиожазбаларды сотта пайдалану үшін сот-фонетикасы маманы жазбаның түпнұсқалығын растауы, өзгертулерді анықтауы, дыбысты жақсартуы және сөйлеуді интерпретациялауы қажет. Олардың бірінші міндеті – жазбадағы сөздің түсінікті болуын қамтамасыз ету. Көбінесе, үлгілердің дыбыс сапасы жел, қозғалыс сияқты сыртқы факторларға байланысты нашарлайды. Кейде дыбыс нашарлауына жазба құрылғысының техникалық ақаулары себеп болады. Жазбаның сапасы жақсарғанша, сөйлеушіні анықтау жұмысын жүргізуге болмайды. Дыбысты түсінудегі қиындықтарды жою үшін компьютерлік бағдарламалар қолданылады, олар шуды сүзуге және жоюға мүмкіндік береді. Компьютерлік бағдарламалық құралдар сөйлеуді спектрлер мен толқынға айналдыра алады, бұл сот-медициналық фонетика үшін пайдалы. Дегенмен, жазбамен жұмыс жасау алдымен түпнұсқа жазбаның көшірмесін жасағаннан кейін ғана жүргізілуі керек. Сот-медициналық фонетиканың маңызды бөлігі – сөйлеушіні анықтау. Интерпретация процесіне уақыт шкаласын құру, диалогты жазу және аудиожазбадағы белгісіз немесе түсініксіз дыбыстарды анықтау кіруі мүмкін. Сотта сарапшы аудиодәлелдерге қатысты фактілерді түсіндіреді, жазбадағы мәліметтерді түсіндіру үшін тиісті акустикалық және физикалық принциптерді баяндайды. Есептерде толыққанды ақпарат келтіріледі, егер жазбаның бөлігі түсініксіз немесе естілмейтін болса, жазбада не болғаны және жазбадан не жетіспейтіні туралы сипаттама беріледі.
Experts in forensic voice analyze recordings by examining transmitted and stored speech, enhancing it and decoding it for criminal investigations, court trials, and federal agencies. To utilize audio recordings in court, a forensic phonetician must authenticate the recording to detect tampering, enhance the audio, and interpret the speech. Their first job is to ensure that the speech in the recording being used is comprehensible. Oftentimes, samples have poor sound quality due to environmental factors such as wind or movement. Other times the sound degradation is due to technological issues within the recording device. Any investigative work on speaker identification cannot be done until the recording is of proper quality. Different solutions for poor comprehensibility are done using computer programs that allow the user to filter and eliminate noise. Computer software is also able to convert the speech to spectra and waveforms, which is useful for the forensic phonetician. However, any work done on the recording should be done after a copy of the original recording is made. A main part of the forensic phonetician's job is speaker identification. The interpretation process might include piecing together a timeline, transcribing the dialog, and identifying unknown or unintelligible sounds in the audio recording. In court, the expert ultimately serves to explain the facts surrounding the audio evidence, providing an explanation of relevant acoustical and physical principles to explain what is evidenced by the recording. Reports are made to include detailed information, if there is a section of the recording that is not comprehensible or is inaudible, an explanation of what was happening (in the recording), and a description of what is missing from the recording.
Дауысты анықтау
Дауысты талдау сөйлеушіні анықтауда маңызды рөл атқарады. Бұл сөйлеушінің кім екені белгісіз болғанда, қылмыстық тергеп-тексеру немесе сот отырысында басқа дауыстардың немесе күдіктілердің арасынан оны анықтау қажеттігі туындайды. Сөйлеуші мен дауыстарды дұрыс анықтау, әсіресе қылмыстық істерде, таныс болу, дауысқа ұшырау, кешігу, дауыс ырғағы, дауыстың өзгеруі және акцент сияқты факторларға байланысты. Сөйлеушімен таныс болу дауысты дұрыс анықтау және оны басқалардан ажырату мүмкіндігін арттырады. Дауысқа қаншалықты көп ұшырасаңыз, тіпті ол дауыс сізге жат болса да, оны дұрыс анықтауға мүмкіндік аласыз. Ұзақ сөйлемді тыңдаған немесе дауысқа жиі құлақтанған адам, бір ғана сөзді естіген адамға қарағанда, дауысты жақсырақ таниды. Дауысты естігеннен кейін оны анықтауға кешігу, дұрыс сөйлеушіні анықтау ықтималдығын азайтады. Дауыс ырғағы дұрыс сөйлеушіні анықтау қабілетіне әсер етеді. Егер дауыс ырғағы салыстыру кезінде сөйлеушінің дауыс ырғағымен сәйкес келмесе, талдау қиындап кетеді. Дауыстың өзгеруі, мысалы, сөйлеушінің сыбырлап сөйлеуі, сөйлеушіні дәл анықтауға және сәйкестендіруге кедергі келтіреді. Кейбір жағдайларда, дауысы талданатын сөйлеушімен бір тілде сөйлейтін адамдар акцент пен дауыс екпінінің арқасында оны оңайырақ анықтай алады. Сөйлеушіні анықтауды жазудың техникалық тәсілдерінен туындайтын бұрмалаулар және сөйлеушінің эмоционалдық жағдайы немесе басқа да ниеттері, олардың дауысы мен жазба арасындағы айырмашылықтар да қиындатады. Сот-криминалистикалық сараптамада сөйлеушіні анықтау әдістеріне өздері естіген дауыстарды анықтау үшін қолданылатын куәгерлер, маман жүргізетін дауыстық-перцептивтік тәсіл (жеке адамның сөйлеуінің суперсегменттік ерекшеліктерін зерттеу) және компьютерлік әдістер кіреді.
Voice analysis has a role in speaker identification. This is when the identity of a speaker is unknown, and has to be identify from an array of other voices or suspects when pertaining to a crime investigation or court trial. Proper identification of speaker and voices particularly for criminal cases depend on a list of factors, like familiarity, exposure, delay, tone of voice, voice disguising, and accents. Familiarity with a speaker increases the chances of properly identifying a voice, and distinguishing it. The amount of exposure to a voice also aids in correctly identifying a voice, even if it is an unfamiliar one. A hearer that listen to a longer utterance or was exposed to a voice more often is better at recognizing a voice, than someone who perhaps was only able to hear one word. A delay between the time of hearing a voice and the time of identifying the speaker also decreases the prospect of identifying the correct speaker. The tone of voice affects the ability to identify the right speaker. If the tone does not match that of the speaker at the time of comparison, it will prove to be more difficult to analyse. Disguise of the voice, for example when a speaker is whispering, will also hinder the ability to accurately match and identify the speaker. In some cases, individuals who speak the same language as the speaker whose voice is being analysed will have an easier time identifying them because of the accent and stress of the voice. Speaker identification is additionally complicated by distortions from the technical method of recording and speaker based issues, such as emotional states or alternative motives causing a discrepancy between their voice and that of a recording. The methods of speaker identification in forensics include the use of earwitnesses who are used to identify voices they have heard, the aural perceptual approach conducted by a specialist regarding the suprasegmentals of an individual's speech, and computer based approaches.