Кіріспе
Адам сөйлеуіне қолданылатын жоғалтулы аудио қысу. Сөйлеуді кодтау – сөйлеуді қамтитын цифрлық аудио сигналдарға деректерді қысу технологиясы. Сөйлеуді кодтау, аудио сигналды өңдеу әдістерін қолдана отырып, сөйлеуге тән параметрлерді бағалау арқылы сөйлеу сигналын модельдейді, ал нәтижедегі модельделген параметрлерді ықшам бит ағынында көрсету үшін жалпы деректерді қысу алгоритмдерімен біріктіреді. Сөйлеуді кодтаутың кең таралған қолданыс түрлері – ұялы телефон және IP желісі арқылы дауыс беру (VoIP). Ұялы телефонияда ең көп қолданылатын сөйлеуді кодтау әдісі – сызықтық болжамды кодтау (LPC), ал VoIP қолданбаларында ең көп қолданылатыны – LPC және модификацияланған дискретті косинус түрлендіру (MDCT) әдістері. Сөйлеуді кодтауда қолданылатын әдістер аудио деректерді қысу және аудио кодтауда қолданылатын әдістерге ұқсас, онда психоакустиканы ескере отырып, тек адамның есту қабілетіне қатысты деректер беріледі. Мысалы, дауыстық жолақты сөйлеуді кодтауда тек 400-3500 Гц жиілік диапазонындағы ақпарат беріледі, бірақ қалпына келтірілген сигнал жеткілікті деңгейде түсінікті болып қалады. Сөйлеуді кодтау, басқа аудио кодтау түрлерінен өзгеше, сөйлеу басқа аудио сигналдарға қарағанда қарапайым сигнал болып табылады және сөйлеу қасиеттері туралы статистикалық мәліметтер бар. Осының салдарынан, жалпы аудио кодтауда маңызды болатын кейбір аудиторлық ақпарат сөйлеуді кодтау контекстінде қажетсіз болуы мүмкін. Сөйлеуді кодтау, шектеулі көлемде берілетін деректерді пайдаланып, сөйлеудің түсініктілігі мен жағымдылығын сақтауға баса назар аударады. Сонымен қатар, көптеген сөйлеу қолданбалары төмен кодтау кешігуін қажет етеді, себебі кешігу сөйлеумен өзара әрекеттесуге кедергі келтіреді.
Speech coding is an application of data compression to digital audio signals containing speech. Speech coding uses speech specific parameter estimation using audio signal processing techniques to model the speech signal, combined with generic data compression algorithms to represent the resulting modeled parameters in a compact bitstream. Common applications of speech coding are mobile telephony and voice over IP (VoIP). The most widely used speech coding technique in mobile telephony is linear predictive coding (LPC), while the most widely used in VoIP applications are the LPC and modified discrete cosine transform (MDCT) techniques. The techniques employed in speech coding are similar to those used in audio data compression and audio coding where appreciation of psychoacoustics is used to transmit only data that is relevant to the human auditory system. For example, in voiceband speech coding, only information in the frequency band 400 to 3500 Hz is transmitted but the reconstructed signal retains adequate intelligibility. Speech coding differs from other forms of audio coding in that speech is a simpler signal than other audio signals, and statistical information is available about the properties of speech. As a result, some auditory information that is relevant in general audio coding can be unnecessary in the speech coding context. Speech coding stresses the preservation of intelligibility and pleasantness of speech while using a constrained amount of transmitted data. In addition, most speech applications require low coding delay, as latency interferes with speech interaction.
Сөйлеу кодтаудың бір түрі ретінде қарастырылған үлгілік компинг
G.711 PCM цифрлік телефониясында қолданылатын A және μ заңдылық алгоритмдерін сөйлеуді кодтаудың алғашқы нұсқасы ретінде қарастыруға болады, олар бір үлгіге тек 8 бит қажет етеді, бірақ іс жүзінде 12 биттік ажыратымдылықты қамтамасыз етеді. Логарифмдік компондау адамның есту қабілетімен үйлеседі, себебі төмен амплитудалы шу, төмен амплитудалы сөйлеу сигналымен бірге естіледі, бірақ жоғары амплитудалы сигналмен жасырылады. Бұл музыка сигналында қабылдауға болмайтын бұрмалау тудырса да, сөйлеу толқындарының өршіл сипаты, сөйлеудің қарапайым жиілік құрылымы – бір негізгі жиілігі бар периодтық толқын және кейде қосылатын шудың шашырауы, осы өте қарапайым, дереу сығымдау алгоритмдерін сөйлеу үшін қолдануға мүмкіндік береді. Сол кезде көптеген басқа алгоритмдер де сыналып көрілді, көбінесе дельта модуляциясының түрлері, бірақ мұқият қарастырылғаннан кейін, алғашқы цифрлық телефон жүйелерінің жасаушылары A/μ заңдылық алгоритмдерін таңдады. Оларды жобалау кезінде, өте төмен күрделілікпен жолақты 33%-ға қысқарту, тамаша инженерлік шешім болды. Олардың дыбыстық өнімділігі қанағаттанарлық деңгейде сақталып келеді және стационарлық телефон желісінде оларды ауыстыру қажеттігі тумады. 2008 жылы ITU T ұйымы масштабталатын құрылымы бар G.711.1 кодегін стандарттады. Кіріс үлгілеу жылдамдығы 16 кГц құрайды.
Қазіргі заманғы сөйлеуді қысу
Сөйлеуді қысудағы кейінгі жұмыстардың көп бөлігі әскери радионың қауіпсіздігі үшін цифрлық байланыс саласындағы әскери зерттеулермен шақырылды, онда жау радио ортасында тиімді жұмыс істеу үшін өте төмен деректер жылдамдығы қолданылған. Сонымен қатар, VLSI схемалары түрінде бұрынғы қысу техникаларына қарағанда әлдеқайда көп өңдеу қуаты қол жетімді болды. Нәтижесінде, қазіргі заманғы сөйлеуді қысу алгоритмдері 1960 жылдары қол жетімді болғаннан әлдеқайда күрделі техникаларды пайдалана алды, осылайша қысу коэффициенттерін арттыра алды. Ең көп қолданылатын сөйлеу кодтау алгоритмдері сызықтық болжау кодтауына (LPC) негізделген. Атап айтқанда, ең көп таралған сөйлеуді кодтау схемасы – LPC негізіндегі кодты қозғайтын сызықтық болжау (CELP) кодтауы, ол мысалы GSM стандартында қолданылады. CELP-де модельдеу екі кезеңге бөлінеді: спектральді орамды модельдейтін сызықтық болжау кезеңі және сызықтық болжау моделінің қалдықтарының код кітапшасына негізделген моделі. CELP-де сызықтық болжау коэффициенттері (LPC) есептеледі және квантталады, әдетте сызықтық спектральді жұптар (LSP) түрінде. Сигналдың өзіндік сөйлеу кодтауынан басқа, тарату қателерінен туындайтын жоғалтуларды болдырмау үшін арна кодтауын қолдану жиі қажет болады. Ең жақсы жалпы кодтау нәтижелерін алу үшін сөйлеуді кодтау және арнаны кодтау әдістері жұптармен таңдалады, сөйлеу деректері ағынындағы маңызды биттер арнаны қысудың сенімді әдістерімен қорғалады. Өзгертілген дискретті косинус түрлендіруі (MDCT) 1999 жылы ұсынылған AAC LD форматында қолданылатын LD MDCT техникасында қолданылады. MDCT содан бері IP желісі арқылы дауыс беру (VoIP) қолданбаларында кеңінен қабылданып, мысалы 2006 жылы ұсынылған G.729.1 кең жолақты аудио кодегі, 2010 жылы ұсынылған Apple FaceTime (AAC LD пайдалану) және 2011 жылы ұсынылған CELT кодегі сияқты қолданыстарда қолданылады. Opus – ашық лицензиялы аудио кодек. Ол сөйлеуге бағытталған LPC негізіндегі SILK алгоритмін және төменгі задерлі MDCT негізіндегі CELT алгоритмін біріктіреді, ең жоғары тиімділікке қол жеткізу үшін оларды ауыстырады немесе біріктіреді. WhatsApp-та VoIP қоңыраулары үшін кеңінен қолданылады. PlayStation 4 ойын консолі де PlayStation Network жүйесіндегі дауыстық чат үшін Opus-ты пайдаланады. Өте төмен біт жылдамдығымен жұмыс істейтін бірнеше кодектер көрсетілді. 450 бит/с жылдамдықпен жұмыс істейтін Codec2 кодегі әуесқойлар радиосында қолданылады. НАТО қазіргі уақытта MELPe кодегін қолданады, ол 600 бит/с және одан төмен жылдамдықпен түсінікті сөйлеуді қамтамасыз етеді. Нейрондық вокодерлер де пайда болды: Google-дің Lyra кодегі 3 кбит/с жылдамдықпен «көңілді қорқынышты» сапа береді. Microsoft-тың Satin кодегі де машиналық оқытуды қолданады, бірақ жоғары реттелетін біт жылдамдығын қолданады және кең жолақты.