Кіріспе

Сөйлеу сегментациясы – табиғи тілдерде сөздердің, буындардың немесе фонемалардың шекараларын анықтау процесі. Бұл термин адамдардың ойлау қабілеттеріне де, жасанды тіл өңдеу процестеріне де қатысты қолданылады. Сөйлеу сегментациясы – жалпы сөйлеуді қабылдау саласының бір бөлігі және сөйлеуді тану технологиялық саласының маңызды кіші мәселесі болып табылады, оны жеке қарастырып толық шешу мүмкін емес. Басқа тілдерді өңдеу мәселелеріндегідей, контекст, грамматика және семантика ескерілуі керек, тіпті солай болған жағдайда нәтиже көбінесе санаттық емес, ықтималдыққа негізделген (статистикалық мүмкіндіктер бойынша) бөлініс болады. Тілдерде сөйлеу сегментациясының басты қиындығы коартикуляция – көршілес сөздердің арасында да, бір сөз ішінде де кездесетін құбылыс болып көрінсе де, келесі бөлімдерде осы мәселелерді шешу үшін қолданылатын басқа да мәселелер мен стратегияларды көруге болады. Бұл мәселе белгілі бір деңгейде қытай және жапон тілдері сияқты дәстүрлі түрде сөздер арасында бос орынсыз жазылатын тілдерде кездесетін мәтін сегментациясы мәселесімен байланысты, ал басқа жазу жүйелері сөздер арасындағы шекараларды, мысалы, бос орын арқылы көрсетеді. Дегенмен, тіпті осы тілдер үшін де мәтін сегментациясы сөйлеу сегментациясынан әлдеқайда оңай, себебі жазба тілінде көршілес сөздер арасында аз ғана араласу болады және сөйлеуде жоқ қосымша белгілер болады (мысалы, жапон тіліндегі сөз түбірлері үшін қытай иероглифтерін пайдалану).

Лексикалық тану

Табиғи тілдерде күрделі сөйлеу сөйлемінің мағынасын оны кіші лексикалық сегменттерге (шамамен, тілдің сөздеріне) бөлу арқылы, әр сегментке мағынаны байланыстырып, сол мағыналарды тілдің грамматикалық ережелеріне сәйкес біріктіру арқылы түсінуге болады. Лексикалық тануды балалар бірінші жылында қолданбайды деп есептелетін болса да, олардың сөздік қоры өте шектеулі болғандықтан, бұл ересектер үшін сөйлеуді сегменттеуге қатысы бар негізгі процестердің бірі. Қазіргі зерттеулерде лексикалық танудың үш негізгі моделі бар: біріншісі, сөздердің лексикада толық сөз түрінде бейнеленгендігін айтатын толық сөздікке қол жеткізу; екіншісі, морфологиялық күрделі сөздердің морфемаларына (тамырлары, түбірлері, жұрнақтары және т.б.) бөлінетінін, содан кейін түсіндірілетінін айтатын ыдырау; үшіншісі, толық сөздік және ыдырау модельдерінің екеуі де қолданылады, бірақ толық сөздік модель кейбір есептеу артықшылықтарын ұсынады және сондықтан лексикалық тануда басым. Мысалы, толық сөздік модельде "cats" сөзі әрпі бойынша сақталып, ізделуі мүмкін, алдымен "c", содан кейін "ca", "cat", және соңында "cats". Ал ыдырау модельінде сол сөз "cat" түбір сөзінің астында сақталады және "s" жұрнағын алып тастағаннан кейін іздеуге болады. "Falling" сөзі де осыған ұқсас, "fall" деп сақталады және "ing" жұрнағымен жалғастырылады. Декомпозициялық модельді қолдайтындар морфемалық талдаудың көп есептеуді қажет ететінін мойындайды, бірақ морфологиялық ақпаратты бөлу басқа процестер үшін қажет деп санайды (мысалы, синтаксистік құрылым), олар лексикалық іздеулермен қатар жүруі мүмкін. Жалпы алғанда, адам лексикалық тану жүйелерін зерттеу үш негізгі модельді толыққанды ажырататын тәжірибелік деректердің жетіспеуіне байланысты шектеулі. Сонымен қатар, сөздің қалай бөлінгеніне байланысты бір сөздің мағынасы өзгеруі мүмкін. Көпте айтылатын мысал: "Жақсы жағажайды қалай бұзуға болады?" фразасы "Сөзді қалай тануға болады?" фразасына өте ұқсас. Осы мысалдан көрініп тұрғандай, дұрыс лексикалық сегментация контекст пен семантикаға байланысты, ол адам білімінің және тәжірибесінің толық жиынтығына негізделеді, сондықтан компьютерде оны іске асыру үшін жетілдірілген үлгіні тану және жасанды интеллект технологиялары қажет. Лексикалық тану компьютерлік сөйлеуді тану саласында ерекше құнды, себебі семантикалық байланыстағы идеялар желісін құру және іздеу мүмкіндігі сөйлеуді тану бағдарламалық құралдарының тиімділігін арттырады. Статистикалық модельдерді қолданып, жазылған сөйлеуді сөздерге немесе дыбыстарға сәйкестендіруге болады. Оның қолданылу аймақтарына мультфильмдердегі тілдің синхрондалу уақытын автоматты түрде түзету, видео субтитрлеу және тіл білімі саласындағы зерттеулер кіреді. Автоматты сегментациялау және сәйкестендіру бағдарламалық құралдары коммерциялық түрде қол жетімді.

Фонатактикалық белгілер

Көптеген сөйлеу тілдерінде лексикалық бірліктер арасындағы шекараны анықтау қиын; фонотактика осы мәселеге бір жауап. Көптеген жазу тілдерінде, мысалы, ағылшын немесе испан тілдеріндегі сөздер аралық бос орындар, олардың сөйлеу нұсқасындағы үзілістерге сәйкес келеді деп күтуге болады, бірақ бұл тек өте баяу сөйлеуде ғана дұрыс, егер сөйлеуші осы үзілістерді қасады түрде енгізсе. Көбінесе, қалыпты сөйлеуде сөздердің арасында үзіліс болмайды, көптеген сөздер бірінен соң бірі тіркесіп айтылады. Сөйлеудің жазу сияқты, анық дауысты және қосымша дыбыстардың тізбегі ретінде қабылдануы, кейбір тілдік қауымдастықтар үшін әліпбилік мұраның із қалдығы болуы мүмкін. Шындығында, дауысты дыбыстардың өндірілуі оларды қоршап тұрған қосымша дыбыстарға байланысты, ал қосымша дыбыстар дауысты дыбыстардың әсеріне ұшырайды; бұл коартикуляция деп аталады. Мысалы, "kit" сөзіндегі [k] дыбысы, "caught" сөзіндегіге қарағанда алға қарай шығарылады. Сонымен қатар, "kick" сөзіндегі дауысты дыбыс, "kit" сөзіндегі дауысты дыбыстан фонетикалық тұрғыдан өзгеше, бірақ біз оны көбінесе естімейміз. Одан бөлек, кездейсоқ сөйлеуде тілге тән өзгерістер болады, олар оны орфографиядан мүлдем өзгеше етеді. Мысалы, ағылшын тілінде "hit you" тіркесін көбінесе "hitcha" деп жазуға болады. Құралымдық тұрғыдан қарағанда, фонотактика көп жағдайда сөйлеушілерге сөз шекарасын қайдан жүргізу керектігін білуге көмектеседі. Ағылшын тілінде "strawberry" сөзі сөйлеушілер тарапынан (фонетикалық тұрғыдан) екі бөліктен тұрады деп қабылданады: "straw" және "berry". "Stra" және "wberry" сияқты басқа интерпретациялар ағылшын тілінің фонотактикасымен шектеледі, ол сөз басында "wb" кластеріне жол бермейді. Басқа мысалдар – "day/dream" және "mile/stone", олардың "da/ydream" немесе "mil/estone" деп интерпретациялануы дауыстық кластерлердің фонотактикалық ықтималдығына немесе ықтималсыздығына байланысты мүмкін емес. "Five women left" сөйлемі, [faɪvwɪmɘnlɛft] деп транскрипцияланғанда, ерекшеленеді, өйткені ағылшын тілінің фонотактикасында /faɪvwɪmɘn/ сөзіндегі /vw/ немесе /wɪmɘnlɛft/ сөзіндегі /nl/ буын басында немесе соңында қолданылмайды. Осы фонотактикалық белгілер сөйлеушілерге сөздердегі шекараларды оңай ажыратуға көмектеседі. Фин тілі сияқты тілдердегі дауыстылар үйлесімділігі де фонотактикалық белгілерді беруге мүмкіндік береді. Жүйе бір морфема ішінде алдыңғы және артқы дауыстылардың бірге болуына жол бермесе де, күрделі сөздер екі морфеманың сөз ішінде бірге болу кезінде өздерінің дауыстылар үйлесімділігін сақтауына мүмкіндік береді. Сондықтан, "selkä/ongelma" ("арқа проблемасы") сияқты күрделі сөздерде, егер күрделі сөздің екі құрауышы арасында дауыстылар үйлесімділігі ерекшеленсе, шекара осы жағдайда "ä" мен "ö" арасындағы үйлесімділік ауысқан жерде болады. Дегенмен, фонотактика сегментацияға көмектеспейтін жағдайлар да бар. "Opinto/uudistus" ("білім беру реформасы") сияқты анық емес кластерлері немесе қарама-қарсы емес дауыстылар үйлесімділігі бар сөздер олардың қалай сегменттелетіні туралы фонотактикалық ақпарат бермейді. Алайда, бүкіл сөз моделі тұрғысынан алғанда, осы сөздер толық сөздер ретінде сақталады деп есептеледі, сондықтан құрамдас бөліктері лексикалық тану үшін міндетті түрде маңызды емес.

Сәбилер мен аналық емес

Сөйлеуді сегменттеуді зерттеуде нәрестелер маңызды назарда. Жоғарыда айтылғандай, сәбилер әлі кең контексттік түйсіндірулерді немесе алғашқы жылындағы ықтималдыққа негізделген сөздерді іздеуге қабілетті лексиканы меңгермегендіктен, олар көбінесе фонотактикалық және ырғақты белгілерге (прозодия басым белгі болып табылады) сүйенуі керек, олардың барлығы тілге тән. 6 мен 9 ай аралығында сәбилер ана тілінде кездеспейтін дыбыстарды ажырату қабілетін жоғалта бастайды және ана тілінің дыбыстық құрылымына сезімтал бола бастайды, ал сөзді сегменттеу қабілеті шамамен 7,5 айда пайда болады. Қазіргі және өткен зерттеулер ағылшын тілінде сөйлейтін сәбилердің сөздердің басындағы баса айтылған буындарға ден қоятынын көрсетеді. 7,5 айлық сәбилер күшті-әлсіз буын үлгілері бар екі буынды сөздерді сегменттеуге қабілетті, бірақ әлсіз-күшті буын үлгілері көбінесе қате түсіндіріледі, мысалы, "guiTAR is" фразасы "GUI TARis" деп қабылдануы мүмкін. Сәбилер сөздердің жиілігі мен ықтималдығын қадағалауда да күрделілік көрсетеді, мысалы, "the" және "dog" сөздері жиі қолданылса да, "the" басқа буындармен де жиі кездесетінін түсінеді, бұл "dog" сөзін "thedog" деп түсіндірудің орнына жеке сөз немесе ұғым ретінде тануға әкелуі мүмкін. Сөйлеуді сегменттеуді зертетудегі тағы бір топ – тіл үйренушілер. Кей жағдайларда, екінші тілді үйренуші үшін сөйлеуді сегменттеуді үйрену нәрестеге қарағанда қиын болуы мүмкін, себебі олар дыбыс ықтималдығы мен шектеулерімен таныс емес, сондай-ақ ана тілінің үлгілерін шамадан тыс қолдануға бейім. Кейбір үлгілер тілдер арасында ортақ болуы мүмкін, мысалы, француз және ағылшын тілдеріндегі буындық сегментация, бірақ олар жапон тілі сияқты мораға негізделген сегментация жүйесі бар тілдерде тиімді болмауы мүмкін. Сонымен қатар, ағылшын тілінде /ld/ шекаралық белгісіз кластері сияқты фонотактикалық шектеулерге рұқсат беріледі (шекараларды міндетті түрде белгілемей). Тіпті ағылшын тілінде сөйлейтіндерге интуитивті көрінетін дыбыс пен дауысты ұзындығы арасындағы байланыс басқа тілдерде болмауы мүмкін, сондықтан екінші тілді үйренушілер тілді және оның сегментация белгілерін үйренуде айқын қиындықтарға тап болады.