Кіріспе

Америка ағылшын тілінің транскрипцияланған корпусы (англ. Transcribed corpus of American English TIMIT) - әртүрлі жынысты және диалекттегі американдық ағылшын тілінде сөйлейтіндердің фонемиялық және лексикалық транскрипцияланған сөйлеу корпусы. Әрбір транскрипцияланған элемент уақыт бойынша белгіленді. TIMIT акустикалық фонетика білімін және автоматты сөйлеуді тану жүйелерін жетілдіруге арналған. Бұл жобаны DARPA тапсырды, ал корпус дизайны Массачусетс технология институтының, SRI International және Texas Instruments (TI) бірлескен жұмысы болды. Бұл баяндама TI-де жазылған, MIT-де көшірілген, Ұлттық стандарттар және технология институты (NIST) растаған және жариялауға дайындаған. NTIMIT (Network TIMIT) деп аталатын телефондық жолақтылық нұсқасы да бар. TIMIT және NTIMIT деректер жиынтығына қол жеткізу үшін Лингвистикалық деректер консорциумына мүше болу немесе ақшалай төлем талап етіледі.

Тарих

TIMIT телефон корпусы сөйлеу үлгілері бар деректер базасын құрудың алғашқы әрекеті болды. Ол 1988 жылы CD-ROM-да жарық көрді және әр сөйлеушіге 10 сөйлемден тұрады. Әр сөйлеуші екі "диалекттік" сөйлем оқыды, сонымен қатар үлкен жиынтықтан таңдалған тағы 8 сөйлем. Әр сөйлемнің ұзақтығы орташа есеппен 3 секунд және оны 630 түрлі сөйлеуші айтады. Бұл сөйлеу корпусын жасау мен таратудың алғашқы елеулі әрекеті болды және жалпы жоба 1,5 миллион АҚШ долларын құрады. Жобаның толық атауы - DARPA TIMIT Acoustic Phonetic Continuous Speech Corpus және TIMIT деген аббревиатура Texas Instruments/Massachusetts Institute of Technology дегенді білдіреді. Телефон арқылы сөйлеудің негізгі себебі сөйлеуді тану бағдарламасын оқыту болды. Blizzard сынағында әртүрлі бағдарламалық жасақтама аудио жазбаларды мәтіндік деректерге айналдыруға міндетті, ал TIMIT корпусы стандартталған негіз ретінде пайдаланылды.