Введение
Упрощенный набор китайских символов GB/T 2312 1980 является ключевым официальным набором символов Китайской Народной Республики, используемым для упрощенных китайских иероглифов. GB2312 – зарегистрированное в интернете название EUC CN, представляющее собой его обычную кодированную форму. GB относится к стандартам Guobiao (国家标准), а суффикс T (c=[[wikt:推薦) обозначает необязательный стандарт. Изначально GB/T 2312 1980 был обязательным национальным стандартом под обозначением GB 2312 1980. Однако, после публикации Национального бюллетеня стандартов Китайской Народной Республики в 2017 году, GB 2312 перестал быть обязательным, и его стандартный код был изменен на GB/T 2312 1980. GB/T 2312 1980 был вытеснен стандартами GBK и GB 18030, которые включают дополнительные символы, но GB/T 2312 по-прежнему широко используется как подмножество этих кодировок. По состоянию на 2022 год GB2312 является второй по популярности кодировкой, используемой на серверах в Китае и территориях (после UTF-8), при этом 5,5% веб-серверов отдают страницы, декларирующие его использование. В мировом масштабе GB2312 заявлен на 0,1% всех веб-страниц. Однако, все основные веб-браузеры декодируют документы, помеченные как GB2312, как если бы они были закодированы в GBK, за исключением Safari и Edge, которые распознают метку GB 2312. Существует аналогичный набор символов, известный как GB/T 12345 – Код набора китайских иероглифов для обмена информацией (дополнительный набор), который дополняет GB/T 2312 традиционными формами иероглифов, заменяя упрощенные формы в их коде qūwèi, а также включает 62 дополнительных символа. Шрифты, кодированные в GB, часто поставляются парами: один с набором символов GB/T 2312 (упрощенный) и другой с набором символов GB/T 12345 (традиционный). Существуют и другие дополнительные наборы кодировок GB, дополняющие GB/T 2312, включая GB/T 7589 – Код набора китайских иероглифов для обмена информацией (2-й дополнительный набор) и GB/T 7590 – Код набора китайских иероглифов для обмена информацией (4-й дополнительный набор), которые предоставляют дополнительные [варианты китайских иероглифов] в том же формате кодирования qūwèi (позже использованном в ISO 2022 CN), но не связаны с символами, закодированными в GB/T 2312.
GB/T 2312 1980 is a key official character set of the People's Republic of China, used for Simplified Chinese characters. GB2312 is the registered internet name for EUC CN, which is its usual encoded form. GB refers to the Guobiao standards (国家标准), whereas the T suffix (c=[[wikt:推薦) denotes a non mandatory standard. GB/T 2312 1980 was originally a mandatory national standard designated GB 2312 1980. However, following a National Standard Bulletin of the People's Republic of China in 2017, GB 2312 is no longer mandatory, and its standard code is modified to GB/T 2312 1980. GB/T 2312 1980 has been superseded by GBK and GB 18030, which include additional characters, but GB/T 2312 remains in widespread use as a subset of those encodings. as of 2022, GB2312 is the second most popular encoding served from China and territories (after UTF 8), with 5.5% of web servers serving a page declaring it. Globally, GB2312 is declared on 0.1% of all web pages. However, all major web browsers decode GB2312 marked documents as if they were marked with the superset GBK encoding, except for Safari and Edge on the label GB 2312. There is an analogous character set known as GB/T 12345 Code of Chinese ideogram set for information interchange supplementary set, which supplements GB/T 2312 with traditional character forms by replacing simplified forms in their qūwèi code, and some extra 62 supplemental characters. GB encoded fonts often come in pairs, one with the GB/T 2312 (simplified) character set and the other with the GB/T 12345 (traditional) character set. There exists more GB supplementary encoding sets that supplements GB/T 2312, including GB/T 7589 Code of Chinese ideograms set forinformation interchange The 2nd supplementary set and GB/T 7590 Code of Chinese ideograms set forinformation interchange The 4th supplementary set which provides additional [Variant Chinese characters|variant characters] in the same qūwèi encoding format (later used in ISO 2022 CN), but has no relation with characters encoded in GB/T 2312.
ЕСК-КН
EUC CN часто используется в качестве кодировки символов (т.е. для внешнего хранения) в программах, работающих с GB/T 2312, тем самым обеспечивая совместимость с ASCII. Для представления каждого символа, отсутствующего в ASCII, используются два байта. Значение первого байта находится в диапазоне от 0xA1 до 0xF7 (161–247), а значение второго байта – от 0xA1 до 0xFE (161–254). Поскольку все эти диапазоны находятся за пределами ASCII, как и в UTF-8, при использовании EUC CN можно определить, является ли байт частью многобайтовой последовательности, но нельзя определить, является ли он первым или последним байтом в этой последовательности. По сравнению с UTF-8, GB/T 2312 (как в исходном виде, так и в кодировке EUC CN) более экономичен с точки зрения хранения: в то время как UTF-8 использует три байта на один иероглиф CJK, GB/T 2312 использует только два. Однако GB/T 2312 охватывает меньше иероглифов, чем Unicode. Чтобы сопоставить кодовые точки qūwèi с байтами EUC, к номеру строки (или qū, 区) и номеру ячейки/столбца (ten или wèi, 位) необходимо добавить 160 (0xA0). Результат сложения с номером строки кодовой точки формирует старший байт, а результат сложения с номером ячейки кодовой точки – младший байт. Например, для кодирования символа "外" в ячейке qūwèi 45 66, старший байт будет использовать номер строки 45: 45+160=205=0xCD, а младший байт будет получен из номера ячейки 66: 66+160=226=0xE2. Таким образом, полная кодировка – <CD E2>.
Набор символов 0x24/0xA4 (ряд 4: хирагана)
В этом наборе содержатся символы хираганы для записи японского языка. Сопоставьте их со строкой 4 стандарта JIS X 0208, которой они соответствуют, а также со строкой 10 стандартов KS X 1001 и KPS 9566, которые используют ту же раскладку, но в другой строке.
Набор символов 0x27/0xA7 (ряд 7: кириллица)
В этот набор входят оба регистра из 33 букв кириллицы, достаточных для написания современного русского и болгарского алфавитов, хотя для других форм кириллицы требуются дополнительные буквы. Сравните со строкой 7 стандарта JIS X 0208, которой соответствует данная строка, и со строкой 12 стандарта KS X 1001 и строкой 5 стандарта KPS 9566, которые используют ту же раскладку, но в других строках.