Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Аудиосигналдың жылдамдығын немесе ұзақтығын оның тонына әсер етпей өзгерту
Changing the speed or duration of an audio signal without affecting its pitch
Уақытты созу – бұл аудиосигналдың жылдамдығын немесе ұзақтығын оның тонына әсер етпей өзгерту процесі. Тонды өзгерту – керісінше процесс, жылдамдыққа әсер етпей тонды өзгерту. Тондық ауыстыру – эффекттер құрылғысында іске асырылған және тікелей орындауға арналған тонды өзгерту. Тонды басқару – бұл ойнау жылдамдығын баяулату немесе жылдамдату арқылы тон мен жылдамдыққа бірдей әсер ететін қарапайым процесс. Бұл процестер көбінесе екі алдын ала жазылған аудиофрагменттің тонын және темпін араластыру үшін сәйкес келтіруге қолданылады, егер аудиофрагменттерді қайта орындау немесе қайта үлгілеу мүмкін болмаса. Уақытты созу радио жарнамаларын және телеарнадағы жарнамалардың дыбынын 30 немесе 60 секундтық уақытқа сәйкес келтіру үшін жиі қолданылады. Ол сондай-ақ ұзын материалды белгіленген уақытқа, мысалы, 1 сағаттық хабар таратуға бейімдеу үшін де пайдаланылуы мүмкін.
Time stretching is the process of changing the speed or duration of an audio signal without affecting its pitch. Pitch scaling is the opposite: the process of changing the pitch without affecting the speed. Pitch shift is pitch scaling implemented in an effects unit and intended for live performance. Pitch control is a simpler process which affects pitch and speed simultaneously by slowing down or speeding up a recording. These processes are often used to match the pitches and tempos of two pre recorded clips for mixing when the clips cannot be reperformed or resampled. Time stretching is often used to adjust radio commercials and the audio of television advertisements to fit exactly into the 30 or 60 seconds available. It can be used to conform longer material to a designated time slot, such as a 1 hour broadcast.
Үлгілерді қайта алу
Аудио жазбаның ұзақтығын немесе тональностьн өзгертудің ең оңай жолы – ойнату жылдамдығын өзгерту. Цифрлық аудио жазба үшін бұл үлгі алу жылдамдығын түрлендіру арқылы іске асырылуы мүмкін. Бұл әдіс қолданылғанда, жазбадағы жиіліктер әрқашан жылдамдықпен бірдей пропорцияда өзгертіледі, соның салдарынан оның сезілетін тональность жоғарылатылады немесе төмендетіледі. Жазбаны ұзақтығын арттыру үшін баяулату тональностьты төмендетеді, ал оны қысқарту үшін жылдамдату тиісінше тональностьты көтереді, бұл «Chipmunk» эффектісі деп аталады. Аудионы едәуір төменгі тональностьқа қайта үлгілегенде, бастапқы аудионың жоғары үлгі алу жылдамдығы болғаны жөн, себебі ойнату жылдамдығын баяулату төмен сападағы аудио сигналын шығарады, демек дыбыстың айқындығын азайтады. Керісінше, аудионы едәуір жоғары тональностьқа қайта үлгілегенде, интерполяциялық сүзгіні қосу ұсынылады, өйткені Найквист жиілігінен (аудио өңдеу бағдарламалық қамтамасының немесе құрылғысының үлгі алу жылдамдығымен анықталады) асып түсетін жиіліктер көбінесе жағымсыз дыбыс бұрмалауларын тудырады, бұл құбылыс алиасинг деп те аталады.
The simplest way to change the duration or pitch of an audio recording is to change the playback speed. For a digital audio recording, this can be accomplished through sample rate conversion. When using this method, the frequencies in the recording are always scaled at the same ratio as the speed, transposing its perceived pitch up or down in the process. Slowing down the recording to increase duration also lowers the pitch, while speeding it up for a shorter duration respectively raises the pitch, creating the so called Chipmunk effect. When resampling audio to a notably lower pitch, it may be preferred that the source audio is of a higher sample rate, as slowing down the playback rate will reproduce an audio signal of a lower resolution, and therefore reduce the perceived clarity of the sound. On the contrary, when resampling audio to a notably higher pitch, it may be preferred to incorporate an interpolation filter, as frequencies that surpass the Nyquist frequency (determined by the sampling rate of the audio reproduction software or device) will create usually undesired sound distortions, a phenomenon that is also known as aliasing.
Синусоидты спектрлік модельдеу
Уақытты созудың тағы бір әдісі сигналдың спектрлік моделіне негізделген. Бұл әдісте сигналдың STFT-і қолданылып, кадрлардағы ең жоғары нүктелер анықталады, содан кейін жақын кадрлардағы ең жоғары нүктелерді қосып, синусоидтық "жолдар" құрылады. Бұл жолдар жаңа уақыт өлшемінде қайта синтезделеді. Бұл әдіс полифониялық және соқпалы материалдарда жақсы нәтижелер береді, әсіресе сигнал суб-диапазондарға бөлінген кезде. Дегенмен, бұл әдіс басқа әдістерге қарағанда көбірек есептеу қуатын қажет етеді.
Another method for time stretching relies on a spectral model of the signal. In this method, peaks are identified in frames using the STFT of the signal, and sinusoidal "tracks" are created by connecting peaks in adjacent frames. The tracks are then re synthesized at a new time scale. This method can yield good results on both polyphonic and percussive material, especially when the signal is separated into sub bands. However, this method is more computationally demanding than other methods.
SOLA
Рабинер мен Шафер 1978 жылы уақыт доменінде жұмыс істейтін балама шешім ұсынды: белгілі бір биіктік анықтау алгоритмін (әдетте сигналдың автокорреляциясының ең жоғарғы нүктесі немесе кейде цепстральдық өңдеу) қолдана отырып, толқынның берілген бөлігінің периодын (немесе эквивалентті түрде негізгі жиілігін) табуға тырысу және бір периодты екіншісімен біріктіру. Бұл уақыт доменіндегі гармоникалық масштабтау немесе синхронды жапсарлас қосу әдісі (SOLA) деп аталады және баяу машиналарда фазалық вокодерге қарағанда шамалы жылдам жұмыс істейді, бірақ автокорреляция күрделі гармоникаларға ие сигналдың периодын дұрыс бағаламайтын жағдайларда (мысалы, оркестрлік туындылар) сәтсіздікке ұшырайды. Adobe Audition (бұрын Cool Edit Pro) пайдаланушы белгілейтін орталық периодқа ең жақын периодты іздеу арқылы бұл мәселені шешеді, ол темптің толық еселігі болуы керек және 30 Гц пен ең төменгі бас жиілігі аралығында болуы тиіс. Бұл фазалық вокодерге негізделген өңдеуге қарағанда әлдеқайда шектеулі, бірақ нақты уақыт қолданбалары үшін процессорды аз пайдаланады. Ол дауыс немесе музыкалық монофониялық аспаптар сияқты бір ырғақты дыбыстар үшін ең үйлесімді нәтижелерді қамтамасыз етеді. Жоғары деңгейдегі коммерциялық аудио өңдеу пакеттері екі техниканы біріктіреді (мысалы, сигналды синусоидты және өткінші толқындарға бөліп), немесе толқындық түрлендіруге немесе жасанды нейрондық желілерді өңдеуге негізделген басқа әдістерді қолданады, бұл ең жоғары сапалы уақыт созуға мүмкіндік береді.
Rabiner and Schafer in 1978 put forth an alternate solution that works in the time domain: attempt to find the period (or equivalently the fundamental frequency) of a given section of the wave using some pitch detection algorithm (commonly the peak of the signal's autocorrelation, or sometimes cepstral processing), and crossfade one period into another. This is called time domain harmonic scaling or the synchronized overlap add method (SOLA) and performs somewhat faster than the phase vocoder on slower machines but fails when the autocorrelation mis estimates the period of a signal with complicated harmonics (such as orchestral pieces). Adobe Audition (formerly Cool Edit Pro) seems to solve this by looking for the period closest to a center period that the user specifies, which should be an integer multiple of the tempo, and between 30 Hz and the lowest bass frequency. This is much more limited in scope than the phase vocoder based processing, but can be made much less processor intensive, for real time applications. It provides the most coherent results for single pitched sounds like voice or musically monophonic instrument recordings. High end commercial audio processing packages either combine the two techniques (for example by separating the signal into sinusoid and transient waveforms), or use other techniques based on the wavelet transform, or artificial neural network processing, producing the highest quality time stretching.
Тыңдау жылдамдығы және сөйлеу жылдамдығы
Сөйлеуге қатысты нақты жағдайда, уақытты созу PSOLA көмегімен жүзеге асырылуы мүмкін. Уақыты қысқартылған сөйлеу – бұл сөздік мәтіннің қысқартылған уақыттағы бейнеленуі. Жылдамдату түсініктілікті азайтуы мүмкін деген болжам бар, бірақ Герб Фридманның айтуынша, "Тәжірибелер көрсеткендей, ақпараттың құлақ арқылы – сөйлеу арқылы – берілу жылдамдығы 'орташа' оқу жылдамдығымен (минут сайын шамамен 200–300 сөз) бірдей болғанда ми ең тиімді жұмыс істейді, ал сөйлеудің орташа жылдамдығы шамамен 100–150 сөзді құрайды". Уақыты қысқартылған сөйлеуді тыңдау жылдам оқумен пара-пар деп есептеледі.
For the specific case of speech, time stretching can be performed using PSOLA. Time compressed speech is the representation of verbal text in compressed time. While one might expect speeding up to reduce comprehension, Herb Friedman says that "Experiments have shown that the brain works most efficiently if the information rate through the ears—via speech—is the 'average' reading rate, which is about 200–300 wpm (words per minute), yet the average rate of speech is in the neighborhood of 100–150 wpm." Listening to time compressed speech is seen as the equivalent of speed reading.
Биіктік масштабы
Бұл әдістерді жылдамдықты немесе ұзақтығын тұрақты ұстай отырып, дыбыс үлгісін көшіру үшін де қолдануға болады. Бұл уақытты созу арқылы және бастапқы ұзындығына қайта өлшеу арқылы жүзеге асырылуы мүмкін. Синусоидты модельдегі синусоидтардың жиілігін тікелей өзгертуге және сигналды тиісті уақыт шкаласында қайта құруға болады. Транспозициялауды перспективаға байланысты жиілік масштабтауы немесе ырғақты өзгерту деп атауға болады. Мысалы, әрбір нотаның ырғағын бір квинтаға көтеріп, темпін өзгеріссіз ұстауға болады. Бұл транспозицияны "ырғақты өзгерту" деп қарастыруға болады, әрбір нотаны фортепиано пернелерінде 7 пернеге "қозғау", немесе Мель шкаласында белгілі бір шаманы қосу, немесе сызықтық ырғақ кеңістігінде белгілі бір шаманы қосу. Сол транспозицияны "жиілік масштабтауы" деп қарастыруға болады, яғни әрбір нотаның жиілігін 3/2-ге көбейту. Музыкалық транспозиция дыбыстың тембрін анықтайтын гармоникалық жиіліктердің арақатынастарын сақтайды, амплитудалық модуляциямен жасалатын жиілік өзгертуінен өзгеше, ол әрбір нотаның жиілігіне тұрақты жиілік сменасын қосады. (Теориялық тұрғыда, музыкалық ырғақ кеңістігіндегі орналасуы масштабталған (жоғары нота төменгі нотаға қарағанда сызықтық ырғақ кеңістігінде үлкен интервалмен қозғалады) сөзбе-сөз ырғақ масштабтауын орындауға болады, бірақ мұндай жағдай сирек кездеседі және музыкалық емес.) Уақыт доменіндегі өңдеу мұнда жақсырақ жұмыс істейді, себебі бұрмалану аз байқалады, бірақ дауыстық үлгілерді масштабтау форматтарды "Альвин және Чипмункс" сияқты эффектіге бұзады, бұл қажетті немесе қажетсіз болуы мүмкін. Дауыстың форматтары мен ерекшеліктерін сақтайтын процесс сигналды арналық вокодермен немесе LPC вокодермен және бірнеше ырғақ анықтау алгоритмдерінің кез келгенімен талдауды және оны басқа негізгі жиілікте қайта синтездеуді қамтиды. Ырғақты өзгертудің ескі аналогтық жазу әдістерінің толық сипаттамасын мына жерде табуға болады.
These techniques can also be used to transpose an audio sample while holding speed or duration constant. This may be accomplished by time stretching and then resampling back to the original length. Alternatively, the frequency of the sinusoids in a sinusoidal model may be altered directly, and the signal reconstructed at the appropriate time scale. Transposing can be called frequency scaling or pitch shifting, depending on perspective. For example, one could move the pitch of every note up by a perfect fifth, keeping the tempo the same. One can view this transposition as "pitch shifting", "shifting" each note up 7 keys on a piano keyboard, or adding a fixed amount on the Mel scale, or adding a fixed amount in linear pitch space. One can view the same transposition as "frequency scaling", "scaling" (multiplying) the frequency of every note by 3/2. Musical transposition preserves the ratios of the harmonic frequencies that determine the sound's timbre, unlike the frequency shift performed by amplitude modulation, which adds a fixed frequency offset to the frequency of every note. (In theory one could perform a literal pitch scaling in which the musical pitch space location is scaled [a higher note would be shifted at a greater interval in linear pitch space than a lower note], but that is highly unusual, and not musical.) Time domain processing works much better here, as smearing is less noticeable, but scaling vocal samples distorts the formants into a sort of Alvin and the Chipmunks like effect, which may be desirable or undesirable. A process that preserves the formants and character of a voice involves analyzing the signal with a channel vocoder or LPC vocoder plus any of several pitch detection algorithms and then resynthesizing it at a different fundamental frequency. A detailed description of older analog recording techniques for pitch shifting can be found at .
Тұтынушы бағдарламалық жасақтамасында
Питч түзетілген аудионың уақытын созу мүмкіндігі кез келген заманауи веб-браузерде медианы ойнату бойынша HTML стандартының бір бөлігі ретінде табылады. Ұқсас басқару элементтері GStreamer және Unity сияқты медиа қолданбалары мен платформаларда кеңінен қолданылады.
Pitch corrected audio timestretch is found in every modern web browser as part of the HTML standard for media playback. Similar controls are ubiquitous in media applications and frameworks such as GStreamer and Unity.