Введение

Упрощенный набор китайских символов GB/T 2312 1980 является ключевым официальным набором символов Китайской Народной Республики, используемым для упрощенных китайских иероглифов. GB2312 – зарегистрированное в интернете название EUC CN, представляющее собой его обычную кодированную форму. GB относится к стандартам Guobiao (国家标准), а суффикс T (c=[[wikt:推薦) обозначает необязательный стандарт. Изначально GB/T 2312 1980 был обязательным национальным стандартом под обозначением GB 2312 1980. Однако, после публикации Национального бюллетеня стандартов Китайской Народной Республики в 2017 году, GB 2312 перестал быть обязательным, и его стандартный код был изменен на GB/T 2312 1980. GB/T 2312 1980 был вытеснен стандартами GBK и GB 18030, которые включают дополнительные символы, но GB/T 2312 по-прежнему широко используется как подмножество этих кодировок. По состоянию на 2022 год GB2312 является второй по популярности кодировкой, используемой на серверах в Китае и территориях (после UTF-8), при этом 5,5% веб-серверов отдают страницы, декларирующие его использование. В мировом масштабе GB2312 заявлен на 0,1% всех веб-страниц. Однако, все основные веб-браузеры декодируют документы, помеченные как GB2312, как если бы они были закодированы в GBK, за исключением Safari и Edge, которые распознают метку GB 2312. Существует аналогичный набор символов, известный как GB/T 12345 – Код набора китайских иероглифов для обмена информацией (дополнительный набор), который дополняет GB/T 2312 традиционными формами иероглифов, заменяя упрощенные формы в их коде qūwèi, а также включает 62 дополнительных символа. Шрифты, кодированные в GB, часто поставляются парами: один с набором символов GB/T 2312 (упрощенный) и другой с набором символов GB/T 12345 (традиционный). Существуют и другие дополнительные наборы кодировок GB, дополняющие GB/T 2312, включая GB/T 7589 – Код набора китайских иероглифов для обмена информацией (2-й дополнительный набор) и GB/T 7590 – Код набора китайских иероглифов для обмена информацией (4-й дополнительный набор), которые предоставляют дополнительные [варианты китайских иероглифов] в том же формате кодирования qūwèi (позже использованном в ISO 2022 CN), но не связаны с символами, закодированными в GB/T 2312.

ЕСК-КН

EUC CN часто используется в качестве кодировки символов (т.е. для внешнего хранения) в программах, работающих с GB/T 2312, тем самым обеспечивая совместимость с ASCII. Для представления каждого символа, отсутствующего в ASCII, используются два байта. Значение первого байта находится в диапазоне от 0xA1 до 0xF7 (161–247), а значение второго байта – от 0xA1 до 0xFE (161–254). Поскольку все эти диапазоны находятся за пределами ASCII, как и в UTF-8, при использовании EUC CN можно определить, является ли байт частью многобайтовой последовательности, но нельзя определить, является ли он первым или последним байтом в этой последовательности. По сравнению с UTF-8, GB/T 2312 (как в исходном виде, так и в кодировке EUC CN) более экономичен с точки зрения хранения: в то время как UTF-8 использует три байта на один иероглиф CJK, GB/T 2312 использует только два. Однако GB/T 2312 охватывает меньше иероглифов, чем Unicode. Чтобы сопоставить кодовые точки qūwèi с байтами EUC, к номеру строки (или qū, 区) и номеру ячейки/столбца (ten или wèi, 位) необходимо добавить 160 (0xA0). Результат сложения с номером строки кодовой точки формирует старший байт, а результат сложения с номером ячейки кодовой точки – младший байт. Например, для кодирования символа "外" в ячейке qūwèi 45 66, старший байт будет использовать номер строки 45: 45+160=205=0xCD, а младший байт будет получен из номера ячейки 66: 66+160=226=0xE2. Таким образом, полная кодировка – <CD E2>.

Набор символов 0x24/0xA4 (ряд 4: хирагана)

В этом наборе содержатся символы хираганы для записи японского языка. Сопоставьте их со строкой 4 стандарта JIS X 0208, которой они соответствуют, а также со строкой 10 стандартов KS X 1001 и KPS 9566, которые используют ту же раскладку, но в другой строке.

Набор символов 0x27/0xA7 (ряд 7: кириллица)

В этот набор входят оба регистра из 33 букв кириллицы, достаточных для написания современного русского и болгарского алфавитов, хотя для других форм кириллицы требуются дополнительные буквы. Сравните со строкой 7 стандарта JIS X 0208, которой соответствует данная строка, и со строкой 12 стандарта KS X 1001 и строкой 5 стандарта KPS 9566, которые используют ту же раскладку, но в других строках.