Кіріспе
Кодталған таңбалар жиынтығының идентификаторы
CCSID (кодталған таңбалар жиынтығының идентификаторы) – нақты код парағының нақты кодталуын білдіретін 16 биттік сан. Мысалы, Юникод – бірнеше таңба кодтау схемалары бар код беті ("трансформациялық формалар"), оның ішінде UTF-8, UTF-16 және UTF-32, бірақ осы кодтау қолданылып жатқанын көрсету үшін CCSID нөмірімен бірге келуі міндетті емес.
A CCSID (coded character set identifier) is a 16 bit number that represents a particular encoding of a specific code page. For example, Unicode is a code page that has several character encoding schemes (referred to as "transformation forms")—including UTF 8, UTF 16 and UTF 32—but which may or may not actually be accompanied by a CCSID number to indicate that this encoding is being used.
Код парағы мен CCSID арасындағы айырмашылық
Код парағы және CCSID терминдері бір-біріне ұқсас болмаса да, жиі алмастырылып қолданылады. Код парағы CCSID құрамының бір бөлігі ғана болуы мүмкін. IBM-нің келесі анықтамалары осы мәселені түсіндіруге көмектеседі: Глиф – дисплейде немесе басып шығаруда көрінетін пиксельдер немесе сияның нақты физикалық бейнесі. Таңба – белгілі бір символмен байланысты барлық глифтерді қамтитын түсінік. Мысалы, "F", "F", "F", "", "F" және "" – әр түрлі глифтер, бірақ бірдей таңбаны қолданады. Әртүрлі модификаторлар (қалың, курсив, сызық, түс және шрифт) F-тің мәнін өзгертпейді. Таңбалар жиынтығы белгілі бір адамға компьютермен мағыналы әрекеттесуді жүргізуге қажетті таңбаларды қамтиды. Ол осы таңбалардың компьютерде қалай бейнеленетінін нақты көрсетпейді. Бұл деңгей әр түрлі әліпбилерге (латын, араб, еврей, кириллица және т.б.) немесе идеографиялық топтарға (мысалы, қытай, корей) бөлудің алғашқы деңгейі болып табылады. Unicode кодтау моделіндегі "таңба репертуарына" сәйкес келеді. Код парағы – таңбаларға белгілі бір кодтық нүктелердің мәнін сәйкестендіру. Ол Unicode кодтау моделіндегі "кодталған таңбалар жиынтығына" сәйкес келеді. Таңбаның кодтық нүктесі – компьютердегі осы таңбаның берілген код парағындағы ішкі бейнесі. Көптеген таңбалар әртүрлі код парақтарында әртүрлі кодтық нүктелермен бейнеленеді. Кейбір таңбалар жиынтығын бір байттық код парақтарымен (оларда ең көп 256 кодтық нүкте бар, демек, ең көп 256 таңба) жеткілікті түрде көрсетуге болады, бірақ көбіне одан да көп қажет. Мысалдар: JIS X 0208 және Unicode. Кодтау схемасы – код парағының байт форматы. Ол кодтық нүктелердің мәнін компьютердегі бір немесе бірнеше байттың тізбегіне сәйкестендіреді. Мысалы, UTF-8 және UTF-16BE – бір Unicode код парағының екі кодтауы. (Олар тек белгілі бір Unicode таңбасының мәнін көрсету үшін қанша байт қажет екендігі, оның осы байттарда қалай орналасқаны және Unicode ақпаратының бар екендігі қалай көрсетілуі бойынша өзгеше.) Ал IBM-нің таңбалық деректерді бейнелеу архитектурасында (CDRA) бұл әдетте ESID (кодтау схемасы идентификаторы) арқылы бейнеленеді. EUC және ISO 2022 – кодтау схемаларының басқа мысалдары. Кодталған таңбалар жиынтығының идентификаторы (CCSID) – әртүрлі өңдеу және алмасу кезеңдерінде таңбалардың мағынасын және бейнелеуін тағайындау және сақтау үшін қажетті барлық ақпаратты қамтиды. Бұл ақпарат әрқашан кем дегенде бір код парағын қамтиды, бірақ байт ұзындығы әртүрлі бірнеше код парақтарын қамтуы мүмкін. CCSID-де әртүрлі кодтық нүктелерді қалай өңдеу керектігін анықтайтын кодтау схемасы бар. Бұл механизм бағдарламаға екі бағытты бағдарлануды, таңбалардың пішінін (әсіресе араб таңбалары) және басқа да күрделі кодтау ақпаратын тануға мүмкіндік береді.
A glyph is the actual physical pattern of pixels or ink that shows up on a display or printout. A character is a concept that covers all glyphs associated with a certain symbol. For instance, "F", "F", "F", "", "F", and "" are all different glyphs, but use the same character. The various modifiers (bold, italic, underline, color, and font) do not change the F's essential F ness. A character set contains the characters necessary to allow a particular human to carry on a meaningful interaction with the computer. It does not specify how those characters are represented in a computer. This level is the first one to separate characters into various alphabets (Latin, Arabic, Hebrew, Cyrillic, and so on) or ideographic groups (e. g., Chinese, Korean). It corresponds to a "character repertoire" in the Unicode encoding model. A code page represents a particular assignment of code point values to characters. It corresponds to a "coded character set" in the Unicode encoding model. A code point for a character is the computer's internal representation of that character in a given code page. Many characters are represented by different code points in different code pages. Certain character sets can be adequately represented with single byte code pages (which have a maximum 256 code points, hence a maximum of 256 characters), but many require more than that. Examples include JIS X 0208 and Unicode. An encoding scheme is the byte format of a code page. It maps code point values to sequences of one or more byte values in a computer. For example, UTF 8 and UTF 16BE are two encodings of the same Unicode code page. (Varying only in how many bytes are needed to represent a particular Unicode character value, how it is contained within those bytes, and how the presence of Unicode information is indicated.) Meanwhile, in IBM's character data representation architecture (CDRA), this is typically represented with an ESID (encoding scheme identifier). EUC and ISO 2022 are other examples of encoding schemes. A coded character set identifier (CCSID) contains all of the information necessary to assign and preserve the meaning and rendering of characters through various stages of processing and interchange. This information always includes at least one code page, but may include multiple code pages of differing byte lengths. The CCSID also has an associated encoding scheme that governs how various code points are to be handled. This mechanism allows a program to recognize bidirectional orientation, character shaping (mainly of Arabic characters), and other complex encoding information.