Кіріспе

Аудиосигналдың жылдамдығын немесе ұзақтығын оның тонына әсер етпей өзгерту

Уақытты созу – бұл аудиосигналдың жылдамдығын немесе ұзақтығын оның тонына әсер етпей өзгерту процесі. Тонды өзгерту – керісінше процесс, жылдамдыққа әсер етпей тонды өзгерту. Тондық ауыстыру – эффекттер құрылғысында іске асырылған және тікелей орындауға арналған тонды өзгерту. Тонды басқару – бұл ойнау жылдамдығын баяулату немесе жылдамдату арқылы тон мен жылдамдыққа бірдей әсер ететін қарапайым процесс. Бұл процестер көбінесе екі алдын ала жазылған аудиофрагменттің тонын және темпін араластыру үшін сәйкес келтіруге қолданылады, егер аудиофрагменттерді қайта орындау немесе қайта үлгілеу мүмкін болмаса. Уақытты созу радио жарнамаларын және телеарнадағы жарнамалардың дыбынын 30 немесе 60 секундтық уақытқа сәйкес келтіру үшін жиі қолданылады. Ол сондай-ақ ұзын материалды белгіленген уақытқа, мысалы, 1 сағаттық хабар таратуға бейімдеу үшін де пайдаланылуы мүмкін.

Үлгілерді қайта алу

Аудио жазбаның ұзақтығын немесе тональностьн өзгертудің ең оңай жолы – ойнату жылдамдығын өзгерту. Цифрлық аудио жазба үшін бұл үлгі алу жылдамдығын түрлендіру арқылы іске асырылуы мүмкін. Бұл әдіс қолданылғанда, жазбадағы жиіліктер әрқашан жылдамдықпен бірдей пропорцияда өзгертіледі, соның салдарынан оның сезілетін тональность жоғарылатылады немесе төмендетіледі. Жазбаны ұзақтығын арттыру үшін баяулату тональностьты төмендетеді, ал оны қысқарту үшін жылдамдату тиісінше тональностьты көтереді, бұл «Chipmunk» эффектісі деп аталады. Аудионы едәуір төменгі тональностьқа қайта үлгілегенде, бастапқы аудионың жоғары үлгі алу жылдамдығы болғаны жөн, себебі ойнату жылдамдығын баяулату төмен сападағы аудио сигналын шығарады, демек дыбыстың айқындығын азайтады. Керісінше, аудионы едәуір жоғары тональностьқа қайта үлгілегенде, интерполяциялық сүзгіні қосу ұсынылады, өйткені Найквист жиілігінен (аудио өңдеу бағдарламалық қамтамасының немесе құрылғысының үлгі алу жылдамдығымен анықталады) асып түсетін жиіліктер көбінесе жағымсыз дыбыс бұрмалауларын тудырады, бұл құбылыс алиасинг деп те аталады.

Синусоидты спектрлік модельдеу

Уақытты созудың тағы бір әдісі сигналдың спектрлік моделіне негізделген. Бұл әдісте сигналдың STFT-і қолданылып, кадрлардағы ең жоғары нүктелер анықталады, содан кейін жақын кадрлардағы ең жоғары нүктелерді қосып, синусоидтық "жолдар" құрылады. Бұл жолдар жаңа уақыт өлшемінде қайта синтезделеді. Бұл әдіс полифониялық және соқпалы материалдарда жақсы нәтижелер береді, әсіресе сигнал суб-диапазондарға бөлінген кезде. Дегенмен, бұл әдіс басқа әдістерге қарағанда көбірек есептеу қуатын қажет етеді.

SOLA

Рабинер мен Шафер 1978 жылы уақыт доменінде жұмыс істейтін балама шешім ұсынды: белгілі бір биіктік анықтау алгоритмін (әдетте сигналдың автокорреляциясының ең жоғарғы нүктесі немесе кейде цепстральдық өңдеу) қолдана отырып, толқынның берілген бөлігінің периодын (немесе эквивалентті түрде негізгі жиілігін) табуға тырысу және бір периодты екіншісімен біріктіру. Бұл уақыт доменіндегі гармоникалық масштабтау немесе синхронды жапсарлас қосу әдісі (SOLA) деп аталады және баяу машиналарда фазалық вокодерге қарағанда шамалы жылдам жұмыс істейді, бірақ автокорреляция күрделі гармоникаларға ие сигналдың периодын дұрыс бағаламайтын жағдайларда (мысалы, оркестрлік туындылар) сәтсіздікке ұшырайды. Adobe Audition (бұрын Cool Edit Pro) пайдаланушы белгілейтін орталық периодқа ең жақын периодты іздеу арқылы бұл мәселені шешеді, ол темптің толық еселігі болуы керек және 30 Гц пен ең төменгі бас жиілігі аралығында болуы тиіс. Бұл фазалық вокодерге негізделген өңдеуге қарағанда әлдеқайда шектеулі, бірақ нақты уақыт қолданбалары үшін процессорды аз пайдаланады. Ол дауыс немесе музыкалық монофониялық аспаптар сияқты бір ырғақты дыбыстар үшін ең үйлесімді нәтижелерді қамтамасыз етеді. Жоғары деңгейдегі коммерциялық аудио өңдеу пакеттері екі техниканы біріктіреді (мысалы, сигналды синусоидты және өткінші толқындарға бөліп), немесе толқындық түрлендіруге немесе жасанды нейрондық желілерді өңдеуге негізделген басқа әдістерді қолданады, бұл ең жоғары сапалы уақыт созуға мүмкіндік береді.

Тыңдау жылдамдығы және сөйлеу жылдамдығы

Сөйлеуге қатысты нақты жағдайда, уақытты созу PSOLA көмегімен жүзеге асырылуы мүмкін. Уақыты қысқартылған сөйлеу – бұл сөздік мәтіннің қысқартылған уақыттағы бейнеленуі. Жылдамдату түсініктілікті азайтуы мүмкін деген болжам бар, бірақ Герб Фридманның айтуынша, "Тәжірибелер көрсеткендей, ақпараттың құлақ арқылы – сөйлеу арқылы – берілу жылдамдығы 'орташа' оқу жылдамдығымен (минут сайын шамамен 200–300 сөз) бірдей болғанда ми ең тиімді жұмыс істейді, ал сөйлеудің орташа жылдамдығы шамамен 100–150 сөзді құрайды". Уақыты қысқартылған сөйлеуді тыңдау жылдам оқумен пара-пар деп есептеледі.

Биіктік масштабы

Бұл әдістерді жылдамдықты немесе ұзақтығын тұрақты ұстай отырып, дыбыс үлгісін көшіру үшін де қолдануға болады. Бұл уақытты созу арқылы және бастапқы ұзындығына қайта өлшеу арқылы жүзеге асырылуы мүмкін. Синусоидты модельдегі синусоидтардың жиілігін тікелей өзгертуге және сигналды тиісті уақыт шкаласында қайта құруға болады. Транспозициялауды перспективаға байланысты жиілік масштабтауы немесе ырғақты өзгерту деп атауға болады. Мысалы, әрбір нотаның ырғағын бір квинтаға көтеріп, темпін өзгеріссіз ұстауға болады. Бұл транспозицияны "ырғақты өзгерту" деп қарастыруға болады, әрбір нотаны фортепиано пернелерінде 7 пернеге "қозғау", немесе Мель шкаласында белгілі бір шаманы қосу, немесе сызықтық ырғақ кеңістігінде белгілі бір шаманы қосу. Сол транспозицияны "жиілік масштабтауы" деп қарастыруға болады, яғни әрбір нотаның жиілігін 3/2-ге көбейту. Музыкалық транспозиция дыбыстың тембрін анықтайтын гармоникалық жиіліктердің арақатынастарын сақтайды, амплитудалық модуляциямен жасалатын жиілік өзгертуінен өзгеше, ол әрбір нотаның жиілігіне тұрақты жиілік сменасын қосады. (Теориялық тұрғыда, музыкалық ырғақ кеңістігіндегі орналасуы масштабталған (жоғары нота төменгі нотаға қарағанда сызықтық ырғақ кеңістігінде үлкен интервалмен қозғалады) сөзбе-сөз ырғақ масштабтауын орындауға болады, бірақ мұндай жағдай сирек кездеседі және музыкалық емес.) Уақыт доменіндегі өңдеу мұнда жақсырақ жұмыс істейді, себебі бұрмалану аз байқалады, бірақ дауыстық үлгілерді масштабтау форматтарды "Альвин және Чипмункс" сияқты эффектіге бұзады, бұл қажетті немесе қажетсіз болуы мүмкін. Дауыстың форматтары мен ерекшеліктерін сақтайтын процесс сигналды арналық вокодермен немесе LPC вокодермен және бірнеше ырғақ анықтау алгоритмдерінің кез келгенімен талдауды және оны басқа негізгі жиілікте қайта синтездеуді қамтиды. Ырғақты өзгертудің ескі аналогтық жазу әдістерінің толық сипаттамасын мына жерде табуға болады.

Тұтынушы бағдарламалық жасақтамасында

Питч түзетілген аудионың уақытын созу мүмкіндігі кез келген заманауи веб-браузерде медианы ойнату бойынша HTML стандартының бір бөлігі ретінде табылады. Ұқсас басқару элементтері GStreamer және Unity сияқты медиа қолданбалары мен платформаларда кеңінен қолданылады.