Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Адамның жазу практикасы
Human writing practice
Мәтінді сегменттеу – жазбаша мәтінді мағыналы бірліктерге, мысалы, сөздерге, сөйлемдерге немесе тақырыптарға бөлу процесі. Бұл термин адамдар мәтінді оқығанда қолданатын ойлау процестеріне де, сондай-ақ табиғи тілді өңдеу саласында зерттелетін компьютерлерде іске асырылатын жасанды процестерге де қатысты. Бұл мәселе оңай емес, себебі кейбір жазба тілдерде сөздердің шекараларын көрсететін белгілер бар болса да (мысалы, ағылшын тіліндегі сөздер арасындағы бос орын немесе араб тіліндегі әріптердің бастапқы, ортаңғы және соңғы пішіндерінің ерекшелігі), мұндай белгілер кейде түсініксіз болуы мүмкін және барлық жазба тілдерде кездеспейді. Бұл процесті сөйлеуді сегменттеумен салыстыруға болады, яғни сөйлеуді тілдік мағынасы бар бөліктерге бөлумен.
Text segmentation is the process of dividing written text into meaningful units, such as words, sentences, or topics. The term applies both to mental processes used by humans when reading text, and to artificial processes implemented in computers, which are the subject of natural language processing. The problem is non trivial, because while some written languages have explicit word boundary markers, such as the word spaces of written English and the distinctive initial, medial and final letter shapes of Arabic, such signals are sometimes ambiguous and not present in all written languages. Compare speech segmentation, the process of dividing speech into linguistically meaningful portions.
Қалауды сегменттеу
Нысаналы сегменттеу – жазбаша мәтінді маңызды тіркестерге (екі немесе одан көп сөзден тұратын топтарға) бөлу мәселесі. Ағылшын және басқа барлық тілдердегі мақсат немесе қалау анықталып, маңызды тіркестің негізіне айналады. Негізгі өнім/қызмет, идея, әрекет және/немесе ой маңызды тіркесті бекітеді. "[Барлық нәрсе атомдардан тұрады]. [Тұрақты қозғалыстағы] [кішкентай бөлшектер], [бір-бірінен аз ғана қашықтықта] [бір-бірін тартады], [ал тығырыла қысылғанда] [бір-бірінен тебіледі]."
Intent segmentation is the problem of dividing written words into keyphrases (2 or more group of words). In English and all other languages the core intent or desire is identified and become the corner stone of the keyphrase Intent segmentation. Core product/service, idea, action & or thought anchor the keyphrase. "[All things are made of atoms]. [Little particles that move] [around in perpetual motion], [attracting each other] [when they are a little distance apart], [but repelling] [upon being squeezed] [into one another]."
Сөйлемдерді бөлу
Сөйлемдік бөлу – жазба тілінің жолын құрамына кіретін сөйлемдерге бөлу мәселесі. Ағылшын және кейбір басқа тілдерде тыныш белгілерді, әсіресе нүктені қолдану – шамамен дұрыс шешім. Дегенмен, тіпті ағылшын тілінде де бұл мәселе тривиальды емес, себебі нүкте таңбасы аббревиатуралар үшін де қолданылады, олар сөйлемді аяқтауы да, аяқтамауы да мүмкін. Мысалы, "Мистер Смит Джонс көшесіндегі дүкендерге барды" деген сөйлемде "Мистер" жеке сөйлем емес. Жазық мәтінді өңдеу кезінде нүктелі аббревиатуралардың тізімдері сөйлем шекараларын қате анықтаудың алдын алуға көмектеседі. Сөздік бөлудегідей, барлық жазба тілдерде сөйлем шекараларын шамамен анықтауға пайдалы тыныш белгілер болмайды.
Sentence segmentation is the problem of dividing a string of written language into its component sentences. In English and some other languages, using punctuation, particularly the full stop/period character is a reasonable approximation. However even in English this problem is not trivial due to the use of the full stop character for abbreviations, which may or may not also terminate a sentence. For example, Mr. is not its own sentence in "Mr. Smith went to the shops in Jones Street." When processing plain text, tables of abbreviations that contain periods can help prevent incorrect assignment of sentence boundaries. As with word segmentation, not all written languages contain punctuation characters that are useful for approximating sentence boundaries.
Тақырыптар сегменті
Тақырыпты талдау екі негізгі міндеттен тұрады: тақырыпты анықтау және мәтінді сегменттеу. Біріншісі – нақты мәтіннің қарапайым жіктелуі болса, екіншісі – құжат бірнеше тақырыпты қамтуы мүмкін екенін көрсетеді, ал компьютерлік мәтінді сегменттеу міндеті осы тақырыптарды автоматты түрде анықтап, мәтінді сәйкес бөлуден тұруы мүмкін. Тақырып шекаралары бөлім атаулары мен абзацтардан анық көрінуі мүмкін. Басқа жағдайларда құжаттарды жіктеуде қолданылатын тәсілдерге ұқсас әдістерді қолдану қажет. Мәтінді тақырыптарға немесе тілдік кезеңдерге бөлу кейбір табиғи тілді өңдеу міндеттерінде пайдалы болуы мүмкін: ол ақпаратты іздеуді немесе сөйлеуді тануды едәуір жақсарта алады (құжаттарды дәлірек индекстеу/танып алу арқылы немесе сұранысқа сәйкес құжаттың нақты бөлігін нәтиже ретінде ұсыну арқылы). Бұл тақырыпты анықтау және оны қадағалау жүйелерінде, сондай-ақ мәтінді қорытындылау мәселелерінде де қажет. Әртүрлі тәсілдер қолданылған: мысалы, HMM, лексикалық тізбектер, сөздердің бірлескен пайда болуын қолдана отырып, мәтін бөліктерінің ұқсастығын анықтау, кластерлеу, тақырыпты модельдеу және т.б. Бұл өте күрделі міндет – мәтінді сегменттеу жүйелерін бағалаушылар тақырып шекаралары бойынша жиі келіспейді. Сондықтан мәтін сегментін бағалау да қиын мәселе болып табылады.
Topic analysis consists of two main tasks: topic identification and text segmentation. While the first is a simple classification of a specific text, the latter case implies that a document may contain multiple topics, and the task of computerized text segmentation may be to discover these topics automatically and segment the text accordingly. The topic boundaries may be apparent from section titles and paragraphs. In other cases, one needs to use techniques similar to those used in document classification. Segmenting the text into topics or discourse turns might be useful in some natural processing tasks: it can improve information retrieval or speech recognition significantly (by indexing/recognizing documents more precisely or by giving the specific part of a document corresponding to the query as a result). It is also needed in topic detection and tracking systems and text summarizing problems. Many different approaches have been tried: e. g. HMM, lexical chains, passage similarity using word co occurrence, clustering, topic modeling, etc. It is quite an ambiguous task – people evaluating the text segmentation systems often differ in topic boundaries. Hence, text segment evaluation is also a challenging problem.
Басқа сегменттеу проблемалары
Процестер мәтінді аталғандардан өзге де сегменттерге бөлуді қажет етуі мүмкін, соның ішінде морфемаларға (әдетте морфологиялық талдау деп аталатын міндет) немесе абзастарға.
Processes may be required to segment text into segments besides mentioned, including morphemes (a task usually called morphological analysis) or paragraphs.