Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
NETtalk – бұл жасанды нейрондық желі. Ол Терренс Сейновски мен Чарльз Розенбергтің 1980 жылдардың ортасында жүргізген зерттеулерінің нәтижесі. NETtalk-тің мақсаты – адам деңгейіндегі танымдық міндеттерді оқып үйренудің күрделілігін түсіндіретін және оларды салыстырмалы міндетті орындауға үйрене алатын байланыстық модель ретінде жүзеге асыруға болатын қарапайым модельдерді құру болды. Авторлар оны екі тәсілмен оқытты: біріншіден, Болцман машинасы арқылы, екіншіден, кері тарату арқылы. NETtalk – ағылшын тіліндегі жазылған мәтінді оқылуын үйренетін бағдарлама. Желі көптеген ағылшын сөздері мен олардың сәйкес айтылуы бойынша оқытылды және жоғары дәлдікпен бұрын көрмеген сөздердің айтылуын дамыта алады. NETtalk желісінің жетістігі айтылуды жасау және сөйлеу синтезі саласындағы қосымша зерттеулерге түрткіс берді және күрделі NLP мәселелерін шешу үшін нейрондық желілердің мүмкіндіктерін көрсетті. Желінің нәтижесінде фонемалар ағыны пайда болды, ол DECtalk жүйесіне естілетін сөйлеуді шығаруға мүмкіндік берді. Ол «Today» телешоуында пайда болып, көпшілікке танымал болды. Даму процесі 1993 жылғы сұхбатта сипатталды. Оқу деректерін жасауға үш ай уақыт кетті, ал желіні оқытуға бірнеше күн ғана уақыт қажет болды.
NETtalk is an artificial neural network. It is the result of research carried out in the mid 1980s by Terrence Sejnowski and Charles Rosenberg. The intent behind NETtalk was to construct simplified models that might shed light on the complexity of learning human level cognitive tasks, and their implementation as a connectionist model that could also learn to perform a comparable task. The authors trained it in two ways, once by Boltzmann machine and once by backpropagation. NETtalk is a program that learns to pronounce written English text by being shown text as input and matching phonetic transcriptions for comparison. The network was trained on a large amount of English words and their corresponding pronunciations, and is able to generate pronunciations for unseen words with a high level of accuracy. The success of the NETtalk network inspired further research in the field of pronunciation generation and speech synthesis and demonstrated the potential of neural networks for solving complex NLP problems. The output of the network was a stream of phonemes, which fed into DECtalk to produce audible speech, It achieved popular success, appearing on the Today show. The development process was described in a 1993 interview. It took three months to create the training dataset, but only a few days to train the network.
Сәулет
Желі үш қабаттан тұрды және 18 629 реттелетін салмаққа ие болды, бұл 1986 жылғы стандарттар бойынша үлкен көрсеткіш. Деректер жиынтығына артық үйлесім (overfitting) тудыруы мүмкін деген алаңдаушылық болды, бірақ оқу сәтті аяқталды. Деректер жиынтығы Браун корпусының 20 000 сөздік бөлігінен құралды, онда әр әріп үшін қолмен белгіленген фонема мен әсер ету орны көрсетілген. Желіге 203 элементтен тұратын кіріс берілді, олар 29 элементтен тұратын 7 топқа бөлінді. Әр топ – бір таңбаның біртүрлі кодтамасы. 29 мүмкін таңба бар: 26 әріп, үтір, нүкте және сөз шекарасы (бос орын). Жасырын қабатта 80 элемент бар. Шығыста 26 элемент бар. 21 элемент фонемалардың артикуляциялық ерекшеліктерін (артикуляциялау орны, дауыстық, дауыстылардың биіктігі және т.б.) кодтайды, ал 5 элемент әсер ету орнын және буын шекараларын кодтайды.
The network had three layers and 18,629 adjustable weights, large by the standards of 1986. There were worries that it would overfit the dataset, but it was trained successfully. The dataset was a 20,000 word subset of the Brown Corpus, with manually annotated phoneme and stress for each letter. The input of the network has 203 units, divided into 7 groups of 29 units each. Each group is a one hot encoding of one character. There are 29 possible characters: 26 letters, comma, period, and word boundary (whitespace). The hidden layer has 80 units. The output has 26 units. 21 units encode for articulatory features (point of articulation, voicing, vowel height, etc.) of phonemes, and 5 units encode for stress and syllable boundaries.
Жетістіктер мен шектеулер
NETtalk ағылшын мәтінін дұрыс айтуды үйрену механизмдерін зерттеу үшін жасалған. Авторлар оқуды үйренудің адам миының көптеген бөліктерін қамтитын күрделі механизм екенін атап көрсетеді. NETtalk көру қабығының бейне өңдеу кезеңдерін және әріптерді тануын нақты түрде модельдемейді. Оның орнына, ол әріптердің алдын ала жіктелгені және танылғаны, ал осы әріптер тізбектері сөздерді құрайтыны және оқыту кезінде де, сынақ кезінде де нейрондық желіге көрсетілетінін қабылдайды. NETtalk-тың міндеті – әріптердің берілген тізбегіне сәйкес дұрыс айтылуын, әріптердің қолданылған контекстіне байланысты үйрену. Яғни, NETtalk ағылшын тіліндегі фонеманың дұрыс айтылуын анықтау үшін, оның мақсатталған фонемалық бейнесіне сілтеме беретін, айналасындағы әріптерді пайдалануды үйренеді.
NETtalk was created to explore the mechanisms of learning to correctly pronounce English text. The authors note that learning to read involves a complex mechanism involving many parts of the human brain. NETtalk does not specifically model the image processing stages and letter recognition of the visual cortex. Rather, it assumes that the letters have been pre classified and recognized, and these letter sequences comprising words are then shown to the neural network during training and during performance testing. It is NETtalk's task to learn proper associations between the correct pronunciation with a given sequence of letters based on the context in which the letters appear. In other words, NETtalk learns to use the letters around the currently pronounced phoneme that provide cues as to its intended phonemic mapping.