Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Компьютерлерде CJK таңбаларының бейнеленуі
Representation of CJK characters on computers
Компьютерде қытай таңбаларының кодтамасы CJK тілдерінде – қытай, жапон, корей және сирек қолданылатын, көне вьетнам тілдерінде жазылған мәтінді бейнелеу үшін пайдаланылуы мүмкін, олардың барлығы қытай таңбаларын қолданады. Бірнеше жалпы мақсаттағы таңба кодтамалары қытай таңбаларын қамтиды, ал олардың кейбіреулері қытай тілі үшін арнайы әзірленген. Юникодтан (CJK біріктірілген идеографтар жиынтығымен бірге) басқа, жергілікті кодтау жүйелері де бар. Қытайдың Guobiao (немесе GB, "ұлттық стандарт") жүйесі Қытай материгі мен Сингапурда қолданылады, ал Тайваньның Big5 жүйесі Тайвань, Гонконг және Макаода екі негізгі "ескі" жергілікті кодтау жүйесі ретінде қолданылады. Guobiao әдетте қарапайым таңбаларды қолданумен, ал Big5 – дәстүрлі таңбаларды қолданумен байланысты. Дегенмен, кодтау жүйесі мен таңбаларды көрсетуге қолданылатын қаріп арасында міндетті байланыс жоқ; қаріп пен кодтау әдетте практикалық себептермен біріктіріледі. Қай кодтауды қолдану мәселесі саяси тұрғыдан да маңызды болуы мүмкін, себебі GB – Қытай Халық Республикасының ресми стандарты, ал Big5 – Тайваньның де-факто стандарты. Жапон тіліндегі жағдайдан өзгеше, Юникодқа айқын қарсылық болған жоқ, ол GB және Big5 жүйелерімен байланысты көптеген мәселелерді шешеді. Юникод саяси бейтарап деп есептеледі, қарапайым және дәстүрлі таңбаларды жақсы қолдайды және оны GB және Big5 жүйелеріне оңай түрлендіруге болады. Сонымен қатар, Юникодтың тек қытай тілімен ғана шектелмеуінің артықшылығы бар, өйткені ол (барлық дерлік) тілдердің таңбалық кодтарын қамтиды.
In computing, Chinese character encodings can be used to represent text written in the CJK languages—Chinese, Japanese, Korean—and (rarely) obsolete Vietnamese, all of which use Chinese characters. Several general purpose character encodings accommodate Chinese characters, and some of them were developed specifically for Chinese. In addition to Unicode (with the set of CJK Unified Ideographs), local encoding systems exist. The Chinese Guobiao (or GB, "national standard") system is used in Mainland China and Singapore, and the (mainly) Taiwanese Big5 system is used in Taiwan, Hong Kong and Macau as the two primary "legacy" local encoding systems. Guobiao is usually displayed using simplified characters and Big5 is usually displayed using traditional characters. There is however no mandated connection between the encoding system and the font used to display the characters; font and encoding are usually tied together for practical reasons. The issue of which encoding to use can also have political implications, as GB is the official standard of the People's Republic of China and Big5 is a de facto standard of Taiwan. In contrast to the situation with Japanese, there has been relatively little overt opposition to Unicode, which solves many of the issues involved with GB and Big5. Unicode is widely regarded as politically neutral, has good support for both simplified and traditional characters, and can be easily converted to and from the GB and Big5. Furthermore, Unicode has the advantage of not being limited only to Chinese, since it contains character codes for (nearly) every language.
Гуобиао
Гуобиао (GB) таңба кодтамалары 1980 жылы жарияланған GB 2312 қарапайым қытай таңбалар жиынтығынан басталады. GB 2312 үшін екі кодтау схемасы болды: кеңінен қолданылатын бір немесе екі байттық 8 биттік EUC CN кодтау және usenet хабарламалары үшін HZ деп аталатын 7 биттік кодтау. 1990 жылы GB/T 12345 деп аталатын дәстүрлі нұсқа жарияланды. EUC CN форматы кейіннен 1993 жылы GBK-ға барлық Unicode 1.1 CJK идеограммаларын қосу үшін кеңейтілді, ISO 2022 үлгісінен бас тартылды. Осылайша GBK, GB2312-дегі оңайлатылған таңбалардан өзге, дәстүрлі қытай таңбаларын да қамтиды. GBK, Microsoft Windows 95 жүйесінде кең таралған 936 кодтық бетінің (Code page 936) іске асырылуы арқылы танымал болды. 2000 жылы GB 18030, GBK-ның ізбасары ретінде жарияланды. Бұл жаңа кодтамаға төрт байттық UTF кіреді, ол бұрын кодталмаған барлық Unicode код нүктелерін кодтайды. 2005 жылы GB 18030 қайта жарияланды, онда Қытайдағы этникалық азшылықтар қолданатын жазу жүйелері үшін анықтамалық глифтер, сондай-ақ Unicode жаңартылғаннан кейін CJK Бірыңғай Идеограммалар кеңейтуі B бөлімінен глифтер енгізілді. Adobe GB1 – GB кодтамаларына сәйкес PostScript таңбалар жиынтығы.
The Guobiao (GB) line of character encodings start with the Simplified Chinese charset GB 2312 published in 1980. Two encoding schemes existed for GB 2312: a one or two byte 8 bit EUC CN encoding commonly used, and a 7 bit encoding called HZ for usenet posts. A traditional variant called GB/T 12345 was published in 1990. The EUC CN form was later extended into GBK to include all Unicode 1.1 CJK Ideographs in 1993, abandoning the ISO 2022 model. By doing so, GBK includes Traditional Chinese characters in addition to simplified ones in GB2312. GBK gained popularity through the widespread Code page 936 implementation found in Microsoft Windows 95. In 2000, GB 18030 was published as GBK's successor. This new encoding includes a four byte UTF which encodes all Unicode codepoints not previously encoded. In 2005, GB 18030 was published to contain reference glyphs for scripts used by ethnic minorities in China, as well as glyphs from CJK Unified Ideographs Extension B due to the update of Unicode. Adobe GB1 is the corresponding PostScript charset for GB encodings.
Үлкен5
Big5 таңба кодтамалары отбасы Тайваньдағы бес компаниядан тұратын консорциум оны әзірлеген бастапқы анықтамасымен басталады. Бұл екі байттық таңба жиынтығы (DBCS), Shift JIS-ке едәуір ұқсас, және көбінесе ASCII сияқты MBCS жүйелерімен біріктіріледі. Көптеген өндірушілер және ресми кеңейтімдер бар, олардың ішінде ETEN, HKSCS (Гонконг) және Big5 2003 (Тайваньдың CNS 11643 стандартының бір бөлігі) ең белгілілері. Adobe CNS1 – Big5 кодтамалары отбасына сәйкес келетін PostScript таңба жиынтығы.
The Big5 family of character encodings start with the initial definition by the consortium of five companies in Taiwan that developed it. It is a double byte character set (DBCS) somehow similar to Shift JIS, often combined with a MBCS like ASCII. Quite a few vendors as well as official extensions exist, of which ETEN, HKSCS (Hong Kong) and Big5 2003 (as a part of CNS 11643 by Taiwan) are the most well known ones. Adobe CNS1 is the PostScript charset corresponding to the Big5 family of encodings.
Қайта құру
GBK-ға дейін, дәстүрлі және оңайлатылған таңбаларды қамтитын, дәстүрлі қытай және оңайлатылған қытай таңбалар жиынтығын түрлендіру, қытай тілінің екі нұсқасы арасында мәтінді жазу қажеттілігімен қиындатылды, себебі бір таңбалар жиынтығы екіншісінің көптеген таңбаларын тек өзінің нұсқасында ғана қамтитын. Дәстүрлі және оңайлатылған қытай тілдері арасындағы түрлендіру көбінесе қиындық тудырады, өйткені кейбір дәстүрлі пішіндердің оңайлатылуы екі немесе одан да көп әртүрлі таңбаларды бір оңайлатылған пішінге біріктірді. Дәстүрліден оңайлатылғанға (көптен бірге) түрлендіру техникалық тұрғыдан қарапайым. Кері түрлендіру, GB 2312-ге түрлендіру кезінде жиі деректерді жоғалтуға әкеледі: оңайлатылған глифтерге дәстүрлі глифтерді тағайындауда, біреуі көпке сәйкес келуде, кейбір таңбалар қолданылуының кейбір жағдайларында дұрыс таңдалмайды. Сондықтан оңайлатылғаннан дәстүрліге түрлендіру көбінесе контекстті немесе жиі қолданылатын сөздер тізімін қажет етеді, ол қайшылықтарды шешуге көмектеседі. Бұл мәселе GBK, GB 18030 және Unicode сияқты жаңа стандарттарда азырақ кездеседі, себебі оларда оңайлатылған және дәстүрлі таңбалар үшін бөлек кодтық нүктелер қарастырылған. Тағы бір мәселе – көптеген кодтау жүйелерінде кейбір таңбалардың жоқ болуы. Бұл таңбалар көбінесе әдебиетте қолданылады және күнделікті мәтінде жиі кездеспейді, бірақ бұл мәселе туындайды, өйткені адамдардың есімдерінде осы таңбалар болуы мүмкін. Мысалы, Тайвань саясаткері Ван Цяньшеньнің есімінде (煊) пиньині бар, ол кейбір таңба жүйелерінде жоқ, ал бұрынғы Қытай премьер-министрі Чжу Жунцзидің есіміндегі (镕) пиньині GB 2312-де жоқ. Ең жаңа GB стандарты, GB 18030, Unicode 4.0-тың толық таңба жиынтығын, соның ішінде қосымша идеографиялық жазықтықтағы Unihan кеңейтімдерін қамтиды.
Prior to GBK which includes both traditional and simplified characters, conversion between Traditional Chinese and Simplified Chinese charsets was complicated by the need of transcribing text between the two variants of Chinese, as one charset cover many of the other's characters only in its own variant. The conversion between traditional and simplified Chinese is usually problematic, because the simplification of some traditional forms merged two or more different characters into one simplified form. The traditional to simplified (many to one) conversion is technically simple. The opposite conversion often results in a data loss when converting to GB 2312: in mapping one to many when assigning traditional glyphs to the simplified glyphs, some characters will inevitably be the wrong choices in some of the usages. Thus simplified to traditional conversion often requires usage context or common phrase lists to resolve conflicts. This issue is less of a problem with newer standards such as GBK, GB 18030 and Unicode, which have separate code points for both simplified and traditional characters. One other issue is that many of the encoding systems are missing characters. While the missing characters are often literary and not commonly used in ordinary text, this does become a problem because people's names often contain these characters. An example of the problem is the Taiwanese politician Wang Chien shien who has a pinyin (煊) character in his name which is not in some character systems, and former Chinese premier Zhu Rongji, whose pinyin (镕) character is not in GB 2312. The newest GB standard, GB 18030 has the complete character repertoire of Unicode 4.0, including the Unihan extensions in the Supplementary Ideographic Plane.