Введение
Идентификатор кодированного набора символов
CCSID (идентификатор кодированного набора символов) — это 16-битное число, представляющее конкретное кодирование определенной страницы кодов. Например, Unicode — это страница кодов, которая имеет несколько схем кодирования символов (именуемых "формами преобразования"), включая UTF-8, UTF-16 и UTF-32, но которой может и не быть присвоен номер CCSID для указания использования данной кодировки.
A CCSID (coded character set identifier) is a 16 bit number that represents a particular encoding of a specific code page. For example, Unicode is a code page that has several character encoding schemes (referred to as "transformation forms")—including UTF 8, UTF 16 and UTF 32—but which may or may not actually be accompanied by a CCSID number to indicate that this encoding is being used.
Разница между страницей кода и CCSID
Термины "страница кода" и "CCSID" часто используются взаимозаменяемо, хотя они не являются синонимами. Страница кода может быть лишь частью того, что составляет CCSID. Следующие определения от IBM помогают проиллюстрировать это:
Глиф – это фактический физический рисунок пикселей или чернил, который отображается на экране или при печати. Символ – это понятие, охватывающее все глифы, связанные с определенным знаком. Например, "F", "F", "F", "", "F" и "" – это разные глифы, но используют один и тот же символ. Различные модификаторы (полужирный, курсив, подчеркивание, цвет и шрифт) не меняют сущность символа "F". Набор символов содержит символы, необходимые для обеспечения осмысленного взаимодействия человека с компьютером. Он не определяет, как эти символы представлены в компьютере. Этот уровень является первым, который разделяет символы на различные алфавиты (латинский, арабский, иврит, кириллический и т. д.) или идеографические группы (например, китайский, корейский). Он соответствует "репертуару символов" в модели кодирования Unicode. Страница кода представляет собой конкретное соответствие между значениями кодовых точек и символами. Он соответствует "кодированному набору символов" в модели кодирования Unicode. Кодовая точка символа – это внутреннее представление этого символа в компьютере в заданной странице кода. Многие символы представлены разными кодовыми точками в разных страницах кода. Некоторые наборы символов могут быть адекватно представлены страницами кода с одним байтом (которые имеют максимум 256 кодовых точек, а значит, максимум 256 символов), но многие требуют большего. Примеры включают JIS X 0208 и Unicode. Схема кодирования – это байтовый формат страницы кода. Она сопоставляет значения кодовых точек с последовательностями из одного или нескольких байтов в компьютере. Например, UTF-8 и UTF-16BE – это два кодирования одной и той же страницы кода Unicode (отличающиеся только количеством байтов, необходимых для представления определенного значения символа Unicode, способом его размещения в этих байтах и способом указания наличия информации Unicode). Между тем, в архитектуре представления символьных данных IBM (CDRA) это обычно представляется с помощью ESID (идентификатора схемы кодирования). EUC и ISO 2022 – другие примеры схем кодирования. Идентификатор кодированного набора символов (CCSID) содержит всю информацию, необходимую для присвоения и сохранения значения и отображения символов на различных этапах обработки и обмена данными. Эта информация всегда включает по крайней мере одну страницу кода, но может включать несколько страниц кода разной длины байтов. CCSID также имеет связанную схему кодирования, которая определяет, как обрабатываются различные кодовые точки. Этот механизм позволяет программе распознавать двунаправленную ориентацию, формирование символов (в основном арабских символов) и другую сложную кодирующую информацию.