Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Сөйлеу сегментациясы – табиғи тілдерде сөздердің, буындардың немесе фонемалардың шекараларын анықтау процесі. Бұл термин адамдардың ойлау қабілеттеріне де, жасанды тіл өңдеу процестеріне де қатысты қолданылады. Сөйлеу сегментациясы – жалпы сөйлеуді қабылдау саласының бір бөлігі және сөйлеуді тану технологиялық саласының маңызды кіші мәселесі болып табылады, оны жеке қарастырып толық шешу мүмкін емес. Басқа тілдерді өңдеу мәселелеріндегідей, контекст, грамматика және семантика ескерілуі керек, тіпті солай болған жағдайда нәтиже көбінесе санаттық емес, ықтималдыққа негізделген (статистикалық мүмкіндіктер бойынша) бөлініс болады. Тілдерде сөйлеу сегментациясының басты қиындығы коартикуляция – көршілес сөздердің арасында да, бір сөз ішінде де кездесетін құбылыс болып көрінсе де, келесі бөлімдерде осы мәселелерді шешу үшін қолданылатын басқа да мәселелер мен стратегияларды көруге болады. Бұл мәселе белгілі бір деңгейде қытай және жапон тілдері сияқты дәстүрлі түрде сөздер арасында бос орынсыз жазылатын тілдерде кездесетін мәтін сегментациясы мәселесімен байланысты, ал басқа жазу жүйелері сөздер арасындағы шекараларды, мысалы, бос орын арқылы көрсетеді. Дегенмен, тіпті осы тілдер үшін де мәтін сегментациясы сөйлеу сегментациясынан әлдеқайда оңай, себебі жазба тілінде көршілес сөздер арасында аз ғана араласу болады және сөйлеуде жоқ қосымша белгілер болады (мысалы, жапон тіліндегі сөз түбірлері үшін қытай иероглифтерін пайдалану).
Speech segmentation is the process of identifying the boundaries between words, syllables, or phonemes in spoken natural languages. The term applies both to the mental processes used by humans, and to artificial processes of natural language processing. Speech segmentation is a subfield of general speech perception and an important subproblem of the technologically focused field of speech recognition, and cannot be adequately solved in isolation. As in most natural language processing problems, one must take into account context, grammar, and semantics, and even so the result is often a probabilistic division (statistically based on likelihood) rather than a categorical one. Though it seems that coarticulation—a phenomenon which may happen between adjacent words just as easily as within a single word—presents the main challenge in speech segmentation across languages, some other problems and strategies employed in solving those problems can be seen in the following sections. This problem overlaps to some extent with the problem of text segmentation that occurs in some languages which are traditionally written without inter word spaces, like Chinese and Japanese, compared to writing systems which indicate speech segmentation between words by a word divider, such as the space. However, even for those languages, text segmentation is often much easier than speech segmentation, because the written language usually has little interference between adjacent words, and often contains additional clues not present in speech (such as the use of Chinese characters for word stems in Japanese).
Лексикалық тану
Табиғи тілдерде күрделі сөйлеу сөйлемінің мағынасын оны кіші лексикалық сегменттерге (шамамен, тілдің сөздеріне) бөлу арқылы, әр сегментке мағынаны байланыстырып, сол мағыналарды тілдің грамматикалық ережелеріне сәйкес біріктіру арқылы түсінуге болады. Лексикалық тануды балалар бірінші жылында қолданбайды деп есептелетін болса да, олардың сөздік қоры өте шектеулі болғандықтан, бұл ересектер үшін сөйлеуді сегменттеуге қатысы бар негізгі процестердің бірі. Қазіргі зерттеулерде лексикалық танудың үш негізгі моделі бар: біріншісі, сөздердің лексикада толық сөз түрінде бейнеленгендігін айтатын толық сөздікке қол жеткізу; екіншісі, морфологиялық күрделі сөздердің морфемаларына (тамырлары, түбірлері, жұрнақтары және т.б.) бөлінетінін, содан кейін түсіндірілетінін айтатын ыдырау; үшіншісі, толық сөздік және ыдырау модельдерінің екеуі де қолданылады, бірақ толық сөздік модель кейбір есептеу артықшылықтарын ұсынады және сондықтан лексикалық тануда басым. Мысалы, толық сөздік модельде "cats" сөзі әрпі бойынша сақталып, ізделуі мүмкін, алдымен "c", содан кейін "ca", "cat", және соңында "cats". Ал ыдырау модельінде сол сөз "cat" түбір сөзінің астында сақталады және "s" жұрнағын алып тастағаннан кейін іздеуге болады. "Falling" сөзі де осыған ұқсас, "fall" деп сақталады және "ing" жұрнағымен жалғастырылады. Декомпозициялық модельді қолдайтындар морфемалық талдаудың көп есептеуді қажет ететінін мойындайды, бірақ морфологиялық ақпаратты бөлу басқа процестер үшін қажет деп санайды (мысалы, синтаксистік құрылым), олар лексикалық іздеулермен қатар жүруі мүмкін. Жалпы алғанда, адам лексикалық тану жүйелерін зерттеу үш негізгі модельді толыққанды ажырататын тәжірибелік деректердің жетіспеуіне байланысты шектеулі. Сонымен қатар, сөздің қалай бөлінгеніне байланысты бір сөздің мағынасы өзгеруі мүмкін. Көпте айтылатын мысал: "Жақсы жағажайды қалай бұзуға болады?" фразасы "Сөзді қалай тануға болады?" фразасына өте ұқсас. Осы мысалдан көрініп тұрғандай, дұрыс лексикалық сегментация контекст пен семантикаға байланысты, ол адам білімінің және тәжірибесінің толық жиынтығына негізделеді, сондықтан компьютерде оны іске асыру үшін жетілдірілген үлгіні тану және жасанды интеллект технологиялары қажет. Лексикалық тану компьютерлік сөйлеуді тану саласында ерекше құнды, себебі семантикалық байланыстағы идеялар желісін құру және іздеу мүмкіндігі сөйлеуді тану бағдарламалық құралдарының тиімділігін арттырады. Статистикалық модельдерді қолданып, жазылған сөйлеуді сөздерге немесе дыбыстарға сәйкестендіруге болады. Оның қолданылу аймақтарына мультфильмдердегі тілдің синхрондалу уақытын автоматты түрде түзету, видео субтитрлеу және тіл білімі саласындағы зерттеулер кіреді. Автоматты сегментациялау және сәйкестендіру бағдарламалық құралдары коммерциялық түрде қол жетімді.
In natural languages, the meaning of a complex spoken sentence can be understood by decomposing it into smaller lexical segments (roughly, the words of the language), associating a meaning to each segment, and combining those meanings according to the grammar rules of the language. Though lexical recognition is not thought to be used by infants in their first year, due to their highly limited vocabularies, it is one of the major processes involved in speech segmentation for adults. Three main models of lexical recognition exist in current research: first, whole word access, which argues that words have a whole word representation in the lexicon; second, decomposition, which argues that morphologically complex words are broken down into their morphemes (roots, stems, inflections, etc.) and then interpreted and; third, the view that whole word and decomposition models are both used, but that the whole word model provides some computational advantages and is therefore dominant in lexical recognition. To give an example, in a whole word model, the word "cats" might be stored and searched for by letter, first "c", then "ca", "cat", and finally "cats". The same word, in a decompositional model, would likely be stored under the root word "cat" and could be searched for after removing the "s" suffix. "Falling", similarly, would be stored as "fall" and suffixed with the "ing" inflection. Though proponents of the decompositional model recognize that a morpheme by morpheme analysis may require significantly more computation, they argue that the unpacking of morphological information is necessary for other processes (such as syntactic structure) which may occur parallel to lexical searches. As a whole, research into systems of human lexical recognition is limited due to little experimental evidence that fully discriminates between the three main models. Moreover, an utterance can have different meanings depending on how it is split into words. A popular example, often quoted in the field, is the phrase "How to wreck a nice beach", which sounds very similar to "How to recognize speech". As this example shows, proper lexical segmentation depends on context and semantics which draws on the whole of human knowledge and experience, and would thus require advanced pattern recognition and artificial intelligence technologies to be implemented on a computer. Lexical recognition is of particular value in the field of computer speech recognition, since the ability to build and search a network of semantically connected ideas would greatly increase the effectiveness of speech recognition software. Statistical models can be used to segment and align recorded speech to words or phones. Applications include automatic lip synch timing for cartoon animation, follow the bouncing ball video sub titling, and linguistic research. Automatic segmentation and alignment software is commercially available.
Фонатактикалық белгілер
Көптеген сөйлеу тілдерінде лексикалық бірліктер арасындағы шекараны анықтау қиын; фонотактика осы мәселеге бір жауап. Көптеген жазу тілдерінде, мысалы, ағылшын немесе испан тілдеріндегі сөздер аралық бос орындар, олардың сөйлеу нұсқасындағы үзілістерге сәйкес келеді деп күтуге болады, бірақ бұл тек өте баяу сөйлеуде ғана дұрыс, егер сөйлеуші осы үзілістерді қасады түрде енгізсе. Көбінесе, қалыпты сөйлеуде сөздердің арасында үзіліс болмайды, көптеген сөздер бірінен соң бірі тіркесіп айтылады. Сөйлеудің жазу сияқты, анық дауысты және қосымша дыбыстардың тізбегі ретінде қабылдануы, кейбір тілдік қауымдастықтар үшін әліпбилік мұраның із қалдығы болуы мүмкін. Шындығында, дауысты дыбыстардың өндірілуі оларды қоршап тұрған қосымша дыбыстарға байланысты, ал қосымша дыбыстар дауысты дыбыстардың әсеріне ұшырайды; бұл коартикуляция деп аталады. Мысалы, "kit" сөзіндегі [k] дыбысы, "caught" сөзіндегіге қарағанда алға қарай шығарылады. Сонымен қатар, "kick" сөзіндегі дауысты дыбыс, "kit" сөзіндегі дауысты дыбыстан фонетикалық тұрғыдан өзгеше, бірақ біз оны көбінесе естімейміз. Одан бөлек, кездейсоқ сөйлеуде тілге тән өзгерістер болады, олар оны орфографиядан мүлдем өзгеше етеді. Мысалы, ағылшын тілінде "hit you" тіркесін көбінесе "hitcha" деп жазуға болады. Құралымдық тұрғыдан қарағанда, фонотактика көп жағдайда сөйлеушілерге сөз шекарасын қайдан жүргізу керектігін білуге көмектеседі. Ағылшын тілінде "strawberry" сөзі сөйлеушілер тарапынан (фонетикалық тұрғыдан) екі бөліктен тұрады деп қабылданады: "straw" және "berry". "Stra" және "wberry" сияқты басқа интерпретациялар ағылшын тілінің фонотактикасымен шектеледі, ол сөз басында "wb" кластеріне жол бермейді. Басқа мысалдар – "day/dream" және "mile/stone", олардың "da/ydream" немесе "mil/estone" деп интерпретациялануы дауыстық кластерлердің фонотактикалық ықтималдығына немесе ықтималсыздығына байланысты мүмкін емес. "Five women left" сөйлемі, [faɪvwɪmɘnlɛft] деп транскрипцияланғанда, ерекшеленеді, өйткені ағылшын тілінің фонотактикасында /faɪvwɪmɘn/ сөзіндегі /vw/ немесе /wɪmɘnlɛft/ сөзіндегі /nl/ буын басында немесе соңында қолданылмайды. Осы фонотактикалық белгілер сөйлеушілерге сөздердегі шекараларды оңай ажыратуға көмектеседі. Фин тілі сияқты тілдердегі дауыстылар үйлесімділігі де фонотактикалық белгілерді беруге мүмкіндік береді. Жүйе бір морфема ішінде алдыңғы және артқы дауыстылардың бірге болуына жол бермесе де, күрделі сөздер екі морфеманың сөз ішінде бірге болу кезінде өздерінің дауыстылар үйлесімділігін сақтауына мүмкіндік береді. Сондықтан, "selkä/ongelma" ("арқа проблемасы") сияқты күрделі сөздерде, егер күрделі сөздің екі құрауышы арасында дауыстылар үйлесімділігі ерекшеленсе, шекара осы жағдайда "ä" мен "ö" арасындағы үйлесімділік ауысқан жерде болады. Дегенмен, фонотактика сегментацияға көмектеспейтін жағдайлар да бар. "Opinto/uudistus" ("білім беру реформасы") сияқты анық емес кластерлері немесе қарама-қарсы емес дауыстылар үйлесімділігі бар сөздер олардың қалай сегменттелетіні туралы фонотактикалық ақпарат бермейді. Алайда, бүкіл сөз моделі тұрғысынан алғанда, осы сөздер толық сөздер ретінде сақталады деп есептеледі, сондықтан құрамдас бөліктері лексикалық тану үшін міндетті түрде маңызды емес.
For most spoken languages, the boundaries between lexical units are difficult to identify; phonotactics are one answer to this issue. One might expect that the inter word spaces used by many written languages like English or Spanish would correspond to pauses in their spoken version, but that is true only in very slow speech, when the speaker deliberately inserts those pauses. In normal speech, one typically finds many consecutive words being said with no pauses between them, and often the final sounds of one word blend smoothly or fuse with the initial sounds of the next word. The notion that speech is produced like writing, as a sequence of distinct vowels and consonants, may be a relic of alphabetic heritage for some language communities. In fact, the way vowels are produced depends on the surrounding consonants just as consonants are affected by surrounding vowels; this is called coarticulation. For example, in the word "kit", the [k] is farther forward than when we say 'caught'. But also, the vowel in "kick" is phonetically different from the vowel in "kit", though we normally do not hear this. In addition, there are language specific changes which occur in casual speech which makes it quite different from spelling. For example, in English, the phrase "hit you" could often be more appropriately spelled "hitcha". From a decompositional perspective, in many cases, phonotactics play a part in letting speakers know where to draw word boundaries. In English, the word "strawberry" is perceived by speakers as consisting (phonetically) of two parts: "straw" and "berry". Other interpretations such as "stra" and "wberry" are inhibited by English phonotactics, which does not allow the cluster "wb" word initially. Other such examples are "day/dream" and "mile/stone" which are unlikely to be interpreted as "da/ydream" or "mil/estone" due to the phonotactic probability or improbability of certain clusters. The sentence "Five women left", which could be phonetically transcribed as [faɪvwɪmɘnlɛft], is marked since neither /vw/ in /faɪvwɪmɘn/ nor /nl/ in /wɪmɘnlɛft/ are allowed as syllable onsets or codas in English phonotactics. These phonotactic cues often allow speakers to easily distinguish the boundaries in words. Vowel harmony in languages like Finnish can also serve to provide phonotactic cues. While the system does not allow front vowels and back vowels to exist together within one morpheme, compounds allow two morphemes to maintain their own vowel harmony while coexisting in a word. Therefore, in compounds such as "selkä/ongelma" ('back problem') where vowel harmony is distinct between two constituents in a compound, the boundary will be wherever the switch in harmony takes place—between the "ä" and the "ö" in this case. Still, there are instances where phonotactics may not aid in segmentation. Words with unclear clusters or uncontrasted vowel harmony as in "opinto/uudistus" ('student reform') do not offer phonotactic clues as to how they are segmented. From the perspective of the whole word model, however, these words are thought be stored as full words, so the constituent parts would not necessarily be relevant to lexical recognition.
Сәбилер мен аналық емес
Сөйлеуді сегменттеуді зерттеуде нәрестелер маңызды назарда. Жоғарыда айтылғандай, сәбилер әлі кең контексттік түйсіндірулерді немесе алғашқы жылындағы ықтималдыққа негізделген сөздерді іздеуге қабілетті лексиканы меңгермегендіктен, олар көбінесе фонотактикалық және ырғақты белгілерге (прозодия басым белгі болып табылады) сүйенуі керек, олардың барлығы тілге тән. 6 мен 9 ай аралығында сәбилер ана тілінде кездеспейтін дыбыстарды ажырату қабілетін жоғалта бастайды және ана тілінің дыбыстық құрылымына сезімтал бола бастайды, ал сөзді сегменттеу қабілеті шамамен 7,5 айда пайда болады. Қазіргі және өткен зерттеулер ағылшын тілінде сөйлейтін сәбилердің сөздердің басындағы баса айтылған буындарға ден қоятынын көрсетеді. 7,5 айлық сәбилер күшті-әлсіз буын үлгілері бар екі буынды сөздерді сегменттеуге қабілетті, бірақ әлсіз-күшті буын үлгілері көбінесе қате түсіндіріледі, мысалы, "guiTAR is" фразасы "GUI TARis" деп қабылдануы мүмкін. Сәбилер сөздердің жиілігі мен ықтималдығын қадағалауда да күрделілік көрсетеді, мысалы, "the" және "dog" сөздері жиі қолданылса да, "the" басқа буындармен де жиі кездесетінін түсінеді, бұл "dog" сөзін "thedog" деп түсіндірудің орнына жеке сөз немесе ұғым ретінде тануға әкелуі мүмкін. Сөйлеуді сегменттеуді зертетудегі тағы бір топ – тіл үйренушілер. Кей жағдайларда, екінші тілді үйренуші үшін сөйлеуді сегменттеуді үйрену нәрестеге қарағанда қиын болуы мүмкін, себебі олар дыбыс ықтималдығы мен шектеулерімен таныс емес, сондай-ақ ана тілінің үлгілерін шамадан тыс қолдануға бейім. Кейбір үлгілер тілдер арасында ортақ болуы мүмкін, мысалы, француз және ағылшын тілдеріндегі буындық сегментация, бірақ олар жапон тілі сияқты мораға негізделген сегментация жүйесі бар тілдерде тиімді болмауы мүмкін. Сонымен қатар, ағылшын тілінде /ld/ шекаралық белгісіз кластері сияқты фонотактикалық шектеулерге рұқсат беріледі (шекараларды міндетті түрде белгілемей). Тіпті ағылшын тілінде сөйлейтіндерге интуитивті көрінетін дыбыс пен дауысты ұзындығы арасындағы байланыс басқа тілдерде болмауы мүмкін, сондықтан екінші тілді үйренушілер тілді және оның сегментация белгілерін үйренуде айқын қиындықтарға тап болады.
Infants are one major focus of research in speech segmentation. Since infants have not yet acquired a lexicon capable of providing extensive contextual clues or probability based word searches within their first year, as mentioned above, they must often rely primarily upon phonotactic and rhythmic cues (with prosody being the dominant cue), all of which are language specific. Between 6 and 9 months, infants begin to lose the ability to discriminate between sounds not present in their native language and grow sensitive to the sound structure of their native language, with the word segmentation abilities appearing around 7.5 months. Though much more research needs to be done on the exact processes that infants use to begin speech segmentation, current and past studies suggest that English native infants approach stressed syllables as the beginning of words. At 7.5 months, infants appear to be able to segment bisyllabic words with strong weak stress patterns, though weak strong stress patterns are often misinterpreted, e. g. interpreting "guiTAR is" as "GUI TARis". It seems that infants also show some complexity in tracking frequency and probability of words, for instance, recognizing that although the syllables "the" and "dog" occur together frequently, "the" also commonly occurs with other syllables, which may lead to the analysis that "dog" is an individual word or concept instead of the interpretation "thedog". Language learners are another set of individuals being researched within speech segmentation. In some ways, learning to segment speech may be more difficult for a second language learner than for an infant, not only in the lack of familiarity with sound probabilities and restrictions but particularly in the overapplication of the native language's patterns. While some patterns may occur between languages, as in the syllabic segmentation of French and English, they may not work well with languages such as Japanese, which has a mora based segmentation system. Further, phonotactic restrictions like the boundary marking cluster /ld/ in German or Dutch are permitted (without necessarily marking boundaries) in English. Even the relationship between stress and vowel length, which may seem intuitive to speakers of English, may not exist in other languages, so second language learners face an especially great challenge when learning a language and its segmentation cues.