Введение

Национальный стандартный кодированный набор символов Республики Китай (Тайвань)

Набор символов CNS 11643 (Китайский национальный стандарт 11643), также официально известный как Китайский стандартный код обмена или CSIC (tr=), является официальным стандартным набором символов Тайваня (Китайская Республика). На практике, варианты соответствующего набора символов Big5 являются де-факто стандартом. CNS 11643 разработан в соответствии с ISO 2022. Он содержит 16 плоскостей, поэтому максимальное возможное количество кодируемых символов составляет 16×94×94 = 141376. Плоскости с 1 по 7 определены стандартом; с 2007 года стандартом также определены плоскости с 10 по 15. См. также Kangxi Radicals (блок Юникода). Расширения стандарта были опубликованы позднее в 1988 году (6319 символов, занимающих плоскость 14) и в 1990 году (7169 символов, занимающих плоскость 15). Unicode 1.0.0, хотя и не включал ханзи, содержал символы для совместимости с CNS 11643: блок CJK Compatibility Forms был назван "CNS 11643 Compatibility" в Unicode 1.0.0. При составлении набора Unicode CJK Unified Ideographs для Unicode 1.0.1, национальные органы представили наборы символов для включения в совместную исследовательскую группу CJK. Представленная версия CNS 11643 включала расширение плоскости 14, а также дополнительные желаемые символы, добавленные к плоскости 14 (после 68–21, последней использованной кодовой точки в стандартной версии расширения).

Отношения с Big5

Уровни 1 и 2 кодировки Big5 в основном соответствуют плоскостям 1 и 2 CNS 11643 соответственно, с редкими различиями в порядке и наличием двух повторяющихся иероглифов ханзи в Big5, которых нет в CNS 11643. Их можно сопоставить, используя список диапазонов. Однако 213 классических радикалов в плоскости 1 CNS 11643 являются дополнительными к иероглифам, доступным в Big5 (хотя их можно приблизительно сопоставить соответствующим иероглифам ханзи в Big5 или HKSCS), а U+5F5D отдельно включен в плоскость 3 CNS 11643. Аналогично, один иероглиф с уровня 2 Big5 (включая его вариант IBM) сопоставляется с другой кодовой точкой Unicode, чем его аналог с уровня 2 CNS 11643: а именно U+5284 (劄), в то время как база данных Unihan в настоящее время сопоставляет иероглиф CNS 11643 с U+7B9A (箚); U+5284 встречается в плоскости 14 CNS 11643.