Кіріспе

Сөйлеушіні дауысынан тану

Сөйлеушіні тану – дауыстың ерекшеліктері арқылы адамды анықтау. Бұл «Кім сөйлеп тұр?» деген сұраққа жауап беру үшін қолданылады. «Дауысты тану» термині сөйлеушіні тану немесе тілді тануға қатысты болуы мүмкін. Сөйлеушіні тексеру (немесе сөйлеушіні растау) сәйкестендіруден өзгеше, ал сөйлеушіні тану сөйлеушінің сөйлеген уақытын анықтаудан (бір сөйлеушінің қайталап сөйлегенін танудан) ерекшеленеді. Сөйлеушіні тану, белгілі бір дауыстарға үйретілген жүйелерде тілді аударуды жеңілдете алады немесе қауіпсіздік процесінің бір бөлігі ретінде сөйлеушінің кім екенін растауға немесе тексеруге қолданылуы мүмкін. Сөйлеушіні тану 2019 жылға дейін шамамен төрт онжылдықтан бері дамып келеді және адамдар арасында әртүрлі болатын сөйлеудің акустикалық ерекшеліктерін пайдаланады. Бұл акустикалық үлгілер анатомиялық ерекшеліктерді де, үйренген мінез-құлықты да көрсетеді.

Тексеру мен сәйкестендіру

Сөйлеушіні тану технологиялары мен әдістемелерінің екі негізгі қолданысы бар. Егер сөйлеуші белгілі бір тұлға екенін айтса және дауысы осы мәлімдемені растау үшін қолданылса, бұл тексеру немесе аутентификация деп аталады. Ал екінші жағынан, сәйкестендіру – белгісіз сөйлеушінің кім екенін анықтау міндеті. Шартты түрде айтқанда, сөйлеушіні тексеру – 1:1 сәйкестік, онда бір сөйлеушінің дауысы нақты бір үлгімен салыстырылады, ал сәйкестендіру – 1:N сәйкестік, онда дауыс бірнеше үлгімен салыстырылады. Қауіпсіздік тұрғысынан алғанда, сәйкестендіру тексеруден ерекшеленеді. Сөйлеушіні тексеру әдетте қауіпсіз жүйеге кіруді қамтамасыз ету үшін «қақпашы» ретінде қолданылады. Мұндай жүйелер пайдаланушылардың білімімен жұмыс істейді және көбінесе олардың қатысуын қажет етеді. Сөйлеушіні анықтау жүйелерін пайдаланушының білмеуіне байланысты жасырын түрде де іске қосуға болады, мысалы, пікірсайыста сөйлеушілерді анықтау, спикерлердің ауысуы туралы автоматтандырылған жүйелерді ескерту, пайдаланушының жүйеде тіркелгенін тексеру және т.б. Сот-криминалистикалық салада, әдетте, ең жақсы сәйкестіктердің тізімін жасау үшін алдымен сөйлеушіні сәйкестендіру процесі жүргізіледі, содан кейін нақты сәйкестікті анықтау үшін бірнеше тексеру процестері орындалады. Сөйлеушіден алынған үлгілерді ең жақсы сәйкестіктер тізімімен салыстыру ұқсастықтар мен айырмашылықтар деңгейіне қарай олардың бір адам екенін анықтауға көмектеседі. Прокуратура және қорғаушы бұл деректі күдіктінің қылмыскер екенін анықтау үшін дәлел ретінде пайдаланады.

Оқыту

Коммерциялық мақсатқа қол жеткізуге арналған ең алғашқы оқыту технологияларының бірі Worlds of Wonder компаниясының 1987 жылғы Джули қуыршағында іске асырылды. Ол кезде дауысқа тәуелсіздік – күтілетін жаңалық болды, ал жүйелерді оқыту қажеттілігі болды. 1987 жылғы қуыршақ жарнамасы "Соңғы рет, сені түсінетін қуыршақ!" деген ұранмен шықты, бірақ өнім "балаларға өз дауыстарын тануға үйретуге болатын" деп сипатталды. «Дауысты тану» термині тіпті он жыл өткен соң да дауысқа тәуелсіздікпен байланысты болды.

Дауысты танудың нұсқалары

Ауызекі тану жүйесінің екі кезеңі бар: тіркеу және тексеру. Тіркеу кезінде сөйлеушінің дауысы жазылады және әдетте дауыстық із, үлгі немесе модель құру үшін бірқатар ерекшеліктер анықталады. Тексеру кезеңінде сөйлеу үлгісі немесе "сөз" бұрын жасалған дауыстық ізбен салыстырылады. Анықтау жүйелерінде сөйлеуді ең жақсы сәйкестікті анықтау үшін бірнеше дауыстық іздермен салыстыру жүргізіледі, ал тексеру жүйелері сөйлеуді бір дауыстық ізбен салыстырады. Осы процеске байланысты, тексеру идентификациядан жылдам. Ауызекі тану жүйелері екі санатқа бөлінеді: мәтінге тәуелді және мәтінге тәуелсіз. Мәтінге тәуелді тану тіркеу және тексеру кезінде мәтіннің бірдей болуын қажет етеді. Мәтінге тәуелді жүйеде сұраулар барлық сөйлеушілер үшін ортақ (мысалы, жалпы құпия сөз) немесе бірегей болуы мүмкін. Сонымен қатар, ортақ құпияларды (мысалы, парольдер және PIN-кодтар) немесе білімге негізделген ақпаратты көп факторлы аутентификация сценарийін құру үшін пайдалануға болады. Керісінше, мәтінге тәуелсіз жүйелер нақты мәтінді пайдалануды қажет етпейді. Олар көбінесе сөйлеушіні анықтау үшін қолданылады, себебі олар сөйлеушінің минималды қатысуын немесе қатысуын қажет етпейді. Бұл жағдайда тіркеу және тест кезінде мәтін әртүрлі болады. Шындығында, көптеген сот-медициналық қолданыстарда тіркеу пайдаланушының білмеуімен жүзеге асуы мүмкін. Мәтінге тәуелсіз технологиялар тіркеу және тексеру кезінде айтылғандарды салыстырмайтындықтан, тексеру қолданыстары аутентификация кезінде пайдаланушының не айтып тұрғанын анықтау үшін сөйлеуді тануды қолдануы мүмкін. Мәтінге тәуелсіз жүйелерде акустикалық және сөйлеуді талдау әдістері қолданылады.

Технология

Сөйлеушіні тану – үлгіні тану мәселесі. Дауыс іздерін өңдеу және сақтау үшін қолданылатын әртүрлі технологияларға жиілік бағалау, жасырын Марков модельдері, Гаусс қоспасы модельдері, үлгіні сәйкестендіру алгоритмдері, нейрондық желілер, матрицалық бейнелеу, векторлық кванттау және шешім ағаштары жатады. Дауыстық сөздерді дауыс іздерімен салыстыру үшін косинус ұқсастығы сияқты қарапайым әдістер дәстүрлі түрде олардың қарапайымдығы мен тиімділігі үшін қолданылады. Кейбір жүйелер сондай-ақ когорттық модельдер және әлемдік модельдер сияқты "анти-спикер" техникаларын қолданады. Сөйлеушінің ерекшеліктерін бейнелеуде спектрлік белгілер басымдықпен қолданылады. Сызықтық болжамды кодтау (LPC) – сөйлеушіні тану және сөйлеуді растау үшін қолданылатын сөйлеуді кодтау әдісі. Қоршаған ортаның шу деңгейі бастапқы және келесі дауыстық үлгілерді жинауға кедеріл келтіруі мүмкін. Шуды азайту алгоритмдерін дәлдікті арттыру үшін қолдануға болады, бірақ дұрыс емес қолдану кері нәтиже беруі мүмкін. Өнімділіктің төмендеуі дауыстың мінез-құлқының өзгеруінен және бір телефонда тіркеуден, ал екінші телефонда растаудан туындауы мүмкін. Екі факторлы аутентификация өнімдерімен интеграцияның артуы күтілуде. Қартаюға байланысты дауыс өзгерістері жүйелік өнімділікке уақыт өте келе әсер етуі мүмкін. Кейбір жүйелер дауыстың осындай ұзақ мерзімді өзгерістерін анықтау үшін әрбір сәтті растаудан кейін сөйлеушінің модельдерін бейімдейді, бірақ автоматтандырылған бейімделудің жалпы қауіпсіздікке тигізетін әсері туралы пікірталас бар.

Құқықтық салдарлар

Еуропалық Одақтағы «Жалпы деректерді қорғау ережесі» және АҚШ-тағы «Калифорния тұтынушылардың құпиялылығы туралы заң» сияқты заңнамалардың қабылдануына байланысты жұмыс орнында дауыс тануды қолдану мәселесі кеңінен талқыланды. 2019 жылдың қыркүйек айында ирландтық дауыс тануды әзірлейтін Soapbox Labs компаниясы осыған байланысты туындауы мүмкін құқықтық жағдайлар туралы ескертті.

Қолданбалар

Алғашқы халықаралық патент 1983 жылы тіркелді, ол Микеле Кавацца мен Альберто Чиарамелланың CSELT (Италия) телекоммуникациялық зерттеулерінің нәтижесінде пайда болды. Бұл болашақ телекоммуникациялық қызметтерді соңғы тұтынушыларға ұсыну және желідегі шуды азайту техникаларын жақсарту үшін негіз болды. 1996-1998 жылдар аралығында Scobey–Coronach шекаралық өтпелі пункте дауыс тану технологиясы қолданылды, бұл тіркелген жергілікті тұрғындарға ешнәрсе жарияламайтын жағдайда, тексеру бекеттері түнде жабылып тұрғанда Канада–АҚШ шекарасын кесіп өтуге мүмкіндік берді. Жүйе АҚШ-тың Иммиграция және натурализация қызметі үшін Мичиган штатының Уоррен қаласындағы Voice Strategies компаниясымен әзірленді. 2013 жылы Barclays Wealth, Barclays жеке банк бөлімшесі, клиенттерді байланыс орталықтарында сәйкестендірудің негізгі құралы ретінде дауыстық биометрияны қолданған алғашқы қаржы мекемесі болды. Жүйе пассивті дауыс тану арқылы телефон арқылы сөйлескен клиенттердің сәйкестігін қалыпты әңгіме барысында 30 секунд ішінде тексерді. Оны дауыс тану компаниясы Nuance (2011 жылы CSELT-тің өзінен бөлініп шыққан сөйлеу технологиясы компаниясы Loquendo-ны сатып алған), Apple-дің Siri технологиясын жасаған компания әзірледі. Клиенттердің 93% жүйенің жылдамдығы, қолдану жеңілдігі және қауіпсіздігі үшін "10 балдық шкала бойынша 9" бағасын берді. Дауыс тану технологиясы қылмыстық тергеп-тексерулерде де қолданылуы мүмкін, мысалы, 2014 жылы Джеймс Фоули мен Стивен Сотлоффты өлтіру ісінде. 2016 жылдың ақпан айында Ұлыбританияның HSBC банкі және оның интернет-банктік First Direct 15 миллион клиентіне саусақ іздері немесе дауысы арқылы онлайн және телефондық шоттарына кіруге мүмкіндік беретін биометриялық банк бағдарламалық құралын ұсынатынын хабарлады. 2023 жылы Vice News және The Guardian жеңілдікпен стандартты қаржылық дауыспен сәйкестендіру жүйелерін жасанды интеллект арқылы жасалған, нысананың дауысының шамамен бес минуттық үлгілерінен алынған дауыстарды пайдаланып бұзуға болатынын көрсетті.