Кіріспе
Америка ағылшын тілінің транскрипцияланған корпусы (англ. Transcribed corpus of American English TIMIT) - әртүрлі жынысты және диалекттегі американдық ағылшын тілінде сөйлейтіндердің фонемиялық және лексикалық транскрипцияланған сөйлеу корпусы. Әрбір транскрипцияланған элемент уақыт бойынша белгіленді. TIMIT акустикалық фонетика білімін және автоматты сөйлеуді тану жүйелерін жетілдіруге арналған. Бұл жобаны DARPA тапсырды, ал корпус дизайны Массачусетс технология институтының, SRI International және Texas Instruments (TI) бірлескен жұмысы болды. Бұл баяндама TI-де жазылған, MIT-де көшірілген, Ұлттық стандарттар және технология институты (NIST) растаған және жариялауға дайындаған. NTIMIT (Network TIMIT) деп аталатын телефондық жолақтылық нұсқасы да бар. TIMIT және NTIMIT деректер жиынтығына қол жеткізу үшін Лингвистикалық деректер консорциумына мүше болу немесе ақшалай төлем талап етіледі.
TIMIT is a corpus of phonemically and lexically transcribed speech of American English speakers of different sexes and dialects. Each transcribed element has been delineated in time. TIMIT was designed to further acoustic phonetic knowledge and automatic speech recognition systems. It was commissioned by DARPA and corpus design was a joint effort between the Massachusetts Institute of Technology, SRI International, and Texas Instruments (TI). The speech was recorded at TI, transcribed at MIT, and verified and prepared for publishing by the National Institute of Standards and Technology (NIST). There is also a telephone bandwidth version called NTIMIT (Network TIMIT). TIMIT and NTIMIT are not freely available — either membership of the Linguistic Data Consortium, or a monetary payment, is required for access to the dataset.
Тарих
TIMIT телефон корпусы сөйлеу үлгілері бар деректер базасын құрудың алғашқы әрекеті болды. Ол 1988 жылы CD-ROM-да жарық көрді және әр сөйлеушіге 10 сөйлемден тұрады. Әр сөйлеуші екі "диалекттік" сөйлем оқыды, сонымен қатар үлкен жиынтықтан таңдалған тағы 8 сөйлем. Әр сөйлемнің ұзақтығы орташа есеппен 3 секунд және оны 630 түрлі сөйлеуші айтады. Бұл сөйлеу корпусын жасау мен таратудың алғашқы елеулі әрекеті болды және жалпы жоба 1,5 миллион АҚШ долларын құрады. Жобаның толық атауы - DARPA TIMIT Acoustic Phonetic Continuous Speech Corpus және TIMIT деген аббревиатура Texas Instruments/Massachusetts Institute of Technology дегенді білдіреді. Телефон арқылы сөйлеудің негізгі себебі сөйлеуді тану бағдарламасын оқыту болды. Blizzard сынағында әртүрлі бағдарламалық жасақтама аудио жазбаларды мәтіндік деректерге айналдыруға міндетті, ал TIMIT корпусы стандартталған негіз ретінде пайдаланылды.