Введение
Кодирование скрипта Unicode Начиная с версии Unicode, кириллица кодируется в нескольких блоках: Кириллица: U+0400U+04FF, 256 символов Кириллическая Дополнение: U+0500U+052F, 48 символов Кириллица Расширенная A: U+2DE0U+2DFF, 32 символа Кириллица Расширенная B: U+A640U+A69F, 96 символов Кириллица Расширенная C: U+1C80U+1C8F, 9 символов Кириллица Расширенная D: U+1E030U1+E08F, 63 символа P Фонетические расширения: U+1D2B, U+1D78, 2 символа Кириллица Объединяющие полузнаки: U+2FE+FE+U2F, 2 символа Кириллица Диапазон символов в диапазоне U+0400U+45F в основном перемещен с позиций ISO 5859 на 864 символа. Следующие символы в кириллице, диапазон U+0460U+0489, являются историческими буквами, некоторые из которых до сих пор используются для церковнославянского языка. Знаки в диапазоне U+048AU+04FF и полный блок Кириллической добавки (U+0500 U+052F) являются дополнительными буквами для различных языков, которые написаны кириллицей. В блоке Фонетических расширений есть два символа: от уральского фонетического алфавита и для транскрибирования носовых гласных. Unicode включает в себя несколько предварительно составленных акцентированных кириллических букв; другие могут быть объединены путем добавления U+0301 ("комбинирующий острый акцент") после акцентированного гласного (например, е́ у́ э́); см. ниже. Несколько диакритических знаков, не относящихся к кириллице, могут использоваться с кириллическим текстом, в том числе: в блоке "Комбинирование диакритических знаков" U+0300U+036F. (как обычный кириллический знак подчеркивания). Чтобы ввести акцентированную букву с острым акцентом: для буквы R (например, цифра R0301 (без пробела между буквой и числом), затем выберите только и нажмите + = . (как знак натяжения на болгарском языке). (в неславянских языках) (в неславянских языках) (с й, но также и другими буквами в неславянских языках) (в транслитерациях других систем письма) (в неславянских языках) (в неславянских языках) (в неславянских языках) (в неславянских языках) (с в старом правописании) (в алфавите алеутов XIX века) (в транслитерациях других систем письма) (в литовских или польских кириллических алфавитах XIX века) (в транслитерациях других систем письма) (в польском кириллическом алфавите XIX века) в Комбинирующие диакритические знаки для символов блока U+20D0U+20F0 (как кириллический знак десяти тысяч). В таблице ниже, мелкие буквы упорядочены в соответствии с их номерами Unicode; заглавные буквы помещаются непосредственно перед соответствующими мелкими буквами. Включены стандартные названия Unicode и канонические декомпозиции.
As of Unicode version , Cyrillic script is encoded across several blocks:
Cyrillic: U+0400–U+04FF, 256 characters
Cyrillic Supplement: U+0500–U+052F, 48 characters
Cyrillic Extended A: U+2DE0–U+2DFF, 32 characters
Cyrillic Extended B: U+A640–U+A69F, 96 characters
Cyrillic Extended C: U+1C80–U+1C8F, 9 characters
Cyrillic Extended D: U+1E030–U+1E08F, 63 characters
Phonetic Extensions: U+1D2B, U+1D78, 2 Cyrillic characters
Combining Half Marks: U+FE2E–U+FE2F, 2 Cyrillic characters
The characters in the range U+0400–U+045F are basically the characters from ISO 8859 5 moved upward by 864 positions. The next characters in the Cyrillic block, range U+0460–U+0489, are historical letters, some of which are still used for Church Slavonic. The characters in the range U+048A–U+04FF and the complete Cyrillic Supplement block (U+0500 U+052F) are additional letters for various languages that are written with Cyrillic script. Two characters are in the Phonetic Extensions block: from the Uralic Phonetic Alphabet and for transcribing nasal vowels. Unicode includes few precomposed accented Cyrillic letters; the others can be combined by adding U+0301 ("combining acute accent") after the accented vowel (e. g., е́ у́ э́); see below. Several diacritical marks not specific to Cyrillic can be used with Cyrillic text, including:
in Combining Diacritical Marks block U+0300–U+036F. (as common Cyrillic stress mark). To input an accented letter with acute accent: for the letter R (for example), digit R0301 (without space between letter and number), then select only and press + = Ŕ. (as stress mark in Bulgarian). (in non Slavic languages)
(in non Slavic languages)
(with й but also other letters in non Slavic languages)
(in transliterations of other writing systems)
(in non Slavic languages)
(in non Slavic languages)
(in non Slavic languages)
(in non Slavic languages)
(with ѷ in old spelling)
(in 19th century Aleut alphabet)
(in transliterations of other writing systems)
(in 19th century Lithuanian or Polish cyrillic alphabets)
(in transliterations of other writing systems)
(in 19t century Polish cyrillic alphabet)
in Combining Diacritical Marks for Symbols block U+20D0–U+20F0
(as Cyrillic ten thousands sign). In the table below, small letters are ordered according to their Unicode numbers; capital letters are placed immediately before the corresponding small letters. Standard Unicode names and canonical decompositions are included.
Блоки
Кириллический блок (U+0400 U+04FF) был добавлен в стандарт Unicode в октябре 1991 года с выпуском версии 1.0: Кириллический блок дополнения (U+0500 U+052F) был добавлен в стандарт Unicode в марте 2002 года с выпуском версии 3.2: Кириллический расширенный блок A (U+2DE0 U+2DFF) и Кириллический расширенный блок B (U+A640 U+A69F) были добавлены в стандарт Unicode в апреле 2008 года с выпуском версии 5.1: Кириллический расширенный блок C (U+1C80 U+1C8F) был добавлен в стандарт Unicode в июне 2016 года с выпуском версии 9.0: Кириллический расширенный блок D (U+1E030 U+1E08F) был добавлен в стандарт Unicode в сентябре 2022 года с выпуском версии 15.0:
The Cyrillic Supplement block (U+0500 – U+052F) was added to the Unicode Standard in March, 2002 with the release of version 3.2:
The Cyrillic Extended A (U+2DE0 – U+2DFF) and Cyrillic Extended B (U+A640 – U+A69F) blocks were added to the Unicode Standard in April, 2008 with the release of version 5.1:
The Cyrillic Extended C block (U+1C80 – U+1C8F) was added to the Unicode Standard in June, 2016 with the release of version 9.0:
The Cyrillic Extended D block (U+1E030 – U+1E08F) was added to the Unicode Standard in September, 2022 with the release of version 15.0: