Кіріспе

Кодталған таңбалар жиынтығының идентификаторы
CCSID (кодталған таңбалар жиынтығының идентификаторы) – нақты код парағының нақты кодталуын білдіретін 16 биттік сан. Мысалы, Юникод – бірнеше таңба кодтау схемалары бар код беті ("трансформациялық формалар"), оның ішінде UTF-8, UTF-16 және UTF-32, бірақ осы кодтау қолданылып жатқанын көрсету үшін CCSID нөмірімен бірге келуі міндетті емес.

Код парағы мен CCSID арасындағы айырмашылық

Код парағы және CCSID терминдері бір-біріне ұқсас болмаса да, жиі алмастырылып қолданылады. Код парағы CCSID құрамының бір бөлігі ғана болуы мүмкін. IBM-нің келесі анықтамалары осы мәселені түсіндіруге көмектеседі: Глиф – дисплейде немесе басып шығаруда көрінетін пиксельдер немесе сияның нақты физикалық бейнесі. Таңба – белгілі бір символмен байланысты барлық глифтерді қамтитын түсінік. Мысалы, "F", "F", "F", "", "F" және "" – әр түрлі глифтер, бірақ бірдей таңбаны қолданады. Әртүрлі модификаторлар (қалың, курсив, сызық, түс және шрифт) F-тің мәнін өзгертпейді. Таңбалар жиынтығы белгілі бір адамға компьютермен мағыналы әрекеттесуді жүргізуге қажетті таңбаларды қамтиды. Ол осы таңбалардың компьютерде қалай бейнеленетінін нақты көрсетпейді. Бұл деңгей әр түрлі әліпбилерге (латын, араб, еврей, кириллица және т.б.) немесе идеографиялық топтарға (мысалы, қытай, корей) бөлудің алғашқы деңгейі болып табылады. Unicode кодтау моделіндегі "таңба репертуарына" сәйкес келеді. Код парағы – таңбаларға белгілі бір кодтық нүктелердің мәнін сәйкестендіру. Ол Unicode кодтау моделіндегі "кодталған таңбалар жиынтығына" сәйкес келеді. Таңбаның кодтық нүктесі – компьютердегі осы таңбаның берілген код парағындағы ішкі бейнесі. Көптеген таңбалар әртүрлі код парақтарында әртүрлі кодтық нүктелермен бейнеленеді. Кейбір таңбалар жиынтығын бір байттық код парақтарымен (оларда ең көп 256 кодтық нүкте бар, демек, ең көп 256 таңба) жеткілікті түрде көрсетуге болады, бірақ көбіне одан да көп қажет. Мысалдар: JIS X 0208 және Unicode. Кодтау схемасы – код парағының байт форматы. Ол кодтық нүктелердің мәнін компьютердегі бір немесе бірнеше байттың тізбегіне сәйкестендіреді. Мысалы, UTF-8 және UTF-16BE – бір Unicode код парағының екі кодтауы. (Олар тек белгілі бір Unicode таңбасының мәнін көрсету үшін қанша байт қажет екендігі, оның осы байттарда қалай орналасқаны және Unicode ақпаратының бар екендігі қалай көрсетілуі бойынша өзгеше.) Ал IBM-нің таңбалық деректерді бейнелеу архитектурасында (CDRA) бұл әдетте ESID (кодтау схемасы идентификаторы) арқылы бейнеленеді. EUC және ISO 2022 – кодтау схемаларының басқа мысалдары. Кодталған таңбалар жиынтығының идентификаторы (CCSID) – әртүрлі өңдеу және алмасу кезеңдерінде таңбалардың мағынасын және бейнелеуін тағайындау және сақтау үшін қажетті барлық ақпаратты қамтиды. Бұл ақпарат әрқашан кем дегенде бір код парағын қамтиды, бірақ байт ұзындығы әртүрлі бірнеше код парақтарын қамтуы мүмкін. CCSID-де әртүрлі кодтық нүктелерді қалай өңдеу керектігін анықтайтын кодтау схемасы бар. Бұл механизм бағдарламаға екі бағытты бағдарлануды, таңбалардың пішінін (әсіресе араб таңбалары) және басқа да күрделі кодтау ақпаратын тануға мүмкіндік береді.