Введение

Транскрибированный корпус американского английского языка (англ. Transcribed corpus of American English TIMIT) - это корпус фонетически и лексически транскрибированной речи американских носителей английского языка разных полов и диалектов. Каждый из переписанных элементов был очерчен во времени. TIMIT был разработан для дальнейшего развития знаний в области акустической фонетики и автоматических систем распознавания речи. Он был заказан DARPA, а дизайн корпуса был совместной работой Массачусетского технологического института, SRI International и Texas Instruments (TI). Речь была записана в TI, переписана в MIT, а также проверена и подготовлена для публикации Национальным институтом стандартов и технологий (NIST). Существует также версия телефонной полосы пропускания под названием NTIMIT (Network TIMIT). TIMIT и NTIMIT не являются свободно доступными для доступа к набору данных требуется либо членство в Консорциуме лингвистических данных, либо денежная оплата.

История

Телефонный корпус TIMIT был первой попыткой создать базу данных с образцами речи. Она была опубликована в 1988 году на CD-ROM и состоит всего из 10 предложений на одного оратора. Каждый докладчик зачитал два "диалектовых" предложения, а также 8 предложений, выбранных из более крупного набора. Каждое предложение длится в среднем 3 секунды и произносится 630 разными докладчиками. Это была первая заметная попытка создать и распространить корпус речи, и общий проект обошёлсь в 1,5 миллиона долларов США. Полное название проекта - DARPA TIMIT Acoustic Phonetic Continuous Speech Corpus, а аббревиатура TIMIT - это Texas Instruments/Massachusetts Institute of Technology. Основная причина, по которой был создан корпус телефонной речи, заключалась в обучении программного обеспечения распознавания речи. В Blizzard Challenge различные программы обязаны преобразовывать аудиозаписи в текстовые данные, а корпус TIMIT использовался в качестве стандартизированной базовой линии.