Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Разделение слова на слоги, деление слов для переноса.
Separation of a word into syllables
the division of words to break lines
Силлабификация (/s//ɪ/,/l//æ//b//ɪ//f//ɪ/'/k//eɪ//ʃ//ən/) или слагабизация (/s//ɪ/,/l//æ//b//ɪ/'/k//eɪ//ʃ//ən/), также известная как перено́с, — это разделение слова на слоги, будь то произносимые, письменные или знаковые.
Syllabification (/s//ɪ/,/l//æ//b//ɪ//f//ɪ/'/k//eɪ//ʃ//ən/) or syllabication (/s//ɪ/,/l//æ//b//ɪ/'/k//eɪ//ʃ//ən/), also known as hyphenation, is the separation of a word into syllables, whether spoken, written or signed.
Обзор
Письменное разделение на слоги обычно обозначается дефисом при использовании английской орфографии (например, syl la ble) и точкой при транскрибировании фактически произносимых слогов в Международном фонетическом алфавите (например, ). Для целей оформления типографы могут использовать интерпункт (символ Unicode U+00B7, например, syl·la·ble), специальный знак переноса (U+2027, например, syl‧la‧ble) или пробел (например, syl la ble). В конце строки слово разделяется на части, обычно называемые "слогами", если оно не помещается в строку и если перенос его на следующую строку сделает первую строку значительно короче остальных. Это может быть особенно проблематично для очень длинных слов и узких колонок в газетах. Текстовые процессоры автоматизировали процесс выравнивания текста, что часто делает слогоразделение коротких слов ненужным. В некоторых языках произносимые слоги также служат основой для слогоразделения на письме. Однако, возможно, из-за слабого соответствия между звуками и буквами в современной английской орфографии, письменное слогоразделение в английском языке основывается преимущественно на этимологических или морфологических, а не на фонетических принципах. Например, невозможно разделить слово "learning" как lear ning в соответствии с правильным слогоразделением живого языка. Увидев только "lear" в конце строки, читатель может неправильно произнести слово, так как диграф "ea" может иметь различные значения. История английской орфографии объясняет подобные явления. Таким образом, английское письменное слогоразделение оперирует понятием "слога", которое не соответствует лингвистическому понятию фонологической (в отличие от морфологической) единицы. В результате даже большинство носителей английского языка не могут разделить слова на слоги в соответствии с установленными правилами без обращения к словарю или использования текстового процессора. В школах обычно не дают больше рекомендаций по этой теме, чем совет обратиться к словарю. Кроме того, существуют различия между британским и американским слогоразделением и даже между словарями одного и того же варианта английского языка. В финском, итальянском, португальском, японском (ромадзи), корейском (романизированном) и других языках с почти фонематическим написанием писатели в принципе могут правильно разделить на слоги любое существующее или вновь созданное слово, используя только общие правила. В Финляндии детей сначала учат ставить дефисы в каждом слове, пока они не начнут правильно разделять слова на слоги, после чего дефисы можно опускать.
The written separation into syllables is usually marked by a hyphen when using English orthography (e. g., syl la ble) and with a period when transcribing the actually spoken syllables in the International Phonetic Alphabet (e. g., ). For presentation purposes, typographers may use an interpunct (Unicode character U+00B7, e. g., syl·la·ble), a special purpose "hyphenation point" (U+2027, e. g., syl‧la‧ble), or a space (e. g., syl la ble). At the end of a line, a word is separated in writing into parts, conventionally called "syllables", if it does not fit the line and if moving it to the next line would make the first line much shorter than the others. This can be a particular problem with very long words, and with narrow columns in newspapers. Word processing has automated the process of justification, making syllabification of shorter words often unnecessary. In some languages, the spoken syllables are also the basis of syllabification in writing. However, possibly due to the weak correspondence between sounds and letters in the spelling of modern English, written syllabification in English is based mostly on etymological or morphological, instead of phonetic, principles. For example, it is not possible to syllabify "learning" as lear ning according to the correct syllabification of the living language. Seeing only lear at the end of a line might mislead the reader into pronouncing the word incorrectly, as the digraph ea can hold many different values. The history of English orthography accounts for such phenomena. English written syllabification therefore deals with a concept of "syllable" that does not correspond to the linguistic concept of a phonological (as opposed to morphological) unit. As a result, even most native English speakers are unable to syllabify words according to established rules without consulting a dictionary or using a word processor. Schools usually do not provide much more advice on the topic than to consult a dictionary. In addition, there are differences between British and US syllabification and even between dictionaries of the same English variety. In Finnish, Italian, Portuguese, Japanese (Romaji), Korean (Romanized) and other nearly phonemically spelled languages, writers can in principle correctly syllabify any existing or newly created word using only general rules. In Finland, children are first taught to hyphenate every word until they produce the correct syllabification reliably, after which the hyphens can be omitted.
Алгоритм
Алгоритм переноса слов — это набор правил, особенно кодифицированных для реализации в компьютерной программе, который определяет, в каких точках слово можно разделить на две строки с помощью дефиса. Например, алгоритм переноса слов может определить, что слово "impeachment" можно разделить как "impeach-ment" или "im-peachment", но не как "impe-achment". Одна из причин сложности правил переноса слов заключается в том, что разные диалекты английского языка по-разному подходят к переносу: в американском английском переносы обычно основываются на звучании, а в британском — на происхождении слова и затем на звучании. Кроме того, существует большое количество исключений, что еще больше усложняет задачу. Некоторые общие рекомендации можно найти в книге майора Киари "О переносе слов – анархия педантизма". Среди алгоритмических подходов к переносу слов широко используется алгоритм, реализованный в типографской системе TeX. Он подробно описан в первых двух томах "Компьютеры и типографское дело" Дональда Кнута и в диссертации Франклина Марка Лянга. Целью работы Лянга было добиться максимальной точности алгоритма и свести количество исключений к минимуму. В исходных шаблонах переноса слов TeX для американского английского языка список исключений содержит всего 14 слов.
A hyphenation algorithm is a set of rules, especially one codified for implementation in a computer program, that decides at which points a word can be broken over two lines with a hyphen. For example, a hyphenation algorithm might decide that impeachment can be broken as impeach ment or im peachment but not impe achment. One of the reasons for the complexity of the rules of word breaking is that different dialects of English tend to differ on hyphenation: American English tends to work on sound, but British English tends to look to the origins of the word and then to sound. There are also a large number of exceptions, which further complicates matters. Some rules of thumb can be found in the Major Keary's "On Hyphenation – Anarchy of Pedantry." Among the algorithmic approaches to hyphenation, the one implemented in the TeX typesetting system is widely used. It is thoroughly documented in the first two volumes of Computers and Typesetting by Donald Knuth and in Franklin Mark Liang's dissertation. The aim of Liang's work was to get the algorithm as accurate as possible and to keep exceptions to a minimum. In TeX's original hyphenation patterns for American English, the exception list contains only 14 words.