Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Жай қытай таңбалары жиынтығы
Simplified Chinese character set
GB/T 2312 1980 – Қытай Халық Республикасының маңызды ресми таңбалар жиынтығы, жай қытай таңбалары үшін қолданылады. GB2312 – EUC CN-нің интернетте тіркелген атауы, ол оның әдеттегі кодталған түрі. GB – Guobiao стандарттарына (国家标准) сілтеме жасайды, ал T әрпі (c=[[wikt:推薦) міндетті емес стандартты білдіреді. GB/T 2312 1980 бастапқыда GB 2312 1980 деп белгіленген міндетті ұлттық стандарт болды. Алайда, 2017 жылғы Қытай Халық Республикасының Ұлттық стандарттар бюллетенінде GB 2312 енді міндетті емес деп жарияланды және оның стандарттық коды GB/T 2312 1980 болып өзгертілді. GB/T 2312 1980 GBK және GB 18030 арқылы жаңартылды, олар қосымша таңбаларды қамтиды, бірақ GB/T 2312 осы кодтамалардың ішкі жиынтығы ретінде кеңінен қолданылады. 2022 жылғы мәліметтерге сәйкес, GB2312 Қытайдан және аумақтардан (UTF 8-ден кейін) қызмет көрсететін екінші ең танымал кодтау болып табылады, веб-серверлердің 5,5% оны жариялайтын беттерді ұсынады. Әлемдік деңгейде GB2312 барлық веб-беттердің 0,1% -ында кездеседі. Дегенмен, барлық негізгі веб-браузерлер GB2312 белгіленген құжаттарды GBK кодтамасымен белгіленгендей өңдейді, тек Safari және Edge ғана GB 2312 белгісін сақтайды. GB/T 2312-ні дәстүрлі таңбалар формаларымен толықтыратын және олардың qūwèi кодындағы жай таңбаларын алмастыратын, сондай-ақ 62 қосымша таңбаны қамтитын GB/T 12345 – Қытай идеограммалары жиынтығының ақпарат алмасу кодексі сияқты ұқсас таңбалар жиынтығы бар. GB кодталған қаріптер көбінесе жұптар түрінде келеді: бірі GB/T 2312 (жай) таңбалар жиынтығымен, екіншісі GB/T 12345 (дәстүрлі) таңбалар жиынтығымен. GB/T 2312-ні толықтыратын тағы да бірнеше GB қосымша кодтау жиынтығы бар, соның ішінде GB/T 7589 – Ақпарат алмасу үшін қытай идеограммаларының кодексінің 2-ші қосымша жиынтығы және GB/T 7590 – Ақпарат алмасу үшін қытай идеограммаларының кодексінің 4-ші қосымша жиынтығы, олар бірдей qūwèi кодтау форматында қосымша [қытай таңбаларының варианттары] ұсынады (кейін ISO 2022 CN-де қолданылды), бірақ GB/T 2312-де кодталған таңбалармен байланысы жоқ.
GB/T 2312 1980 is a key official character set of the People's Republic of China, used for Simplified Chinese characters. GB2312 is the registered internet name for EUC CN, which is its usual encoded form. GB refers to the Guobiao standards (国家标准), whereas the T suffix (c=[[wikt:推薦) denotes a non mandatory standard. GB/T 2312 1980 was originally a mandatory national standard designated GB 2312 1980. However, following a National Standard Bulletin of the People's Republic of China in 2017, GB 2312 is no longer mandatory, and its standard code is modified to GB/T 2312 1980. GB/T 2312 1980 has been superseded by GBK and GB 18030, which include additional characters, but GB/T 2312 remains in widespread use as a subset of those encodings. as of 2022, GB2312 is the second most popular encoding served from China and territories (after UTF 8), with 5.5% of web servers serving a page declaring it. Globally, GB2312 is declared on 0.1% of all web pages. However, all major web browsers decode GB2312 marked documents as if they were marked with the superset GBK encoding, except for Safari and Edge on the label GB 2312. There is an analogous character set known as GB/T 12345 Code of Chinese ideogram set for information interchange supplementary set, which supplements GB/T 2312 with traditional character forms by replacing simplified forms in their qūwèi code, and some extra 62 supplemental characters. GB encoded fonts often come in pairs, one with the GB/T 2312 (simplified) character set and the other with the GB/T 12345 (traditional) character set. There exists more GB supplementary encoding sets that supplements GB/T 2312, including GB/T 7589 Code of Chinese ideograms set forinformation interchange The 2nd supplementary set and GB/T 7590 Code of Chinese ideograms set forinformation interchange The 4th supplementary set which provides additional [Variant Chinese characters|variant characters] in the same qūwèi encoding format (later used in ISO 2022 CN), but has no relation with characters encoded in GB/T 2312.
EUC-CN
EUC CN жиі GB/T 2312-мен жұмыс істейтін бағдарламаларда таңбалық кодтау ретінде (яғни, сыртқы сақтау үшін) қолданылады, осылайша ASCII-мен үйлесімділікті сақтайды. ASCII-де кездеспейтін әрбір таңбаны көрсету үшін екі байт қолданылады. Бірінші байттың мәні 0xA1–0xF7 (161–247) аралығында, ал екінші байттың мәні 0xA1–0xFE (161–254) аралығында болады. Бұл диапазонның бәрі ASCII-ден тыс болғандықтан, UTF-8 сияқты, EUC CN қолданғанда байттың көп байттық құрылымның бөлігі екенін тексеруге болады, бірақ байттың бірінші немесе соңғы байт екенін анықтау мүмкін емес. UTF-8-ге қарағанда, GB/T 2312 (туылған немесе EUC CN-де кодталған) сақтау жағынан тиімді: UTF-8 әрбір CJK идеографы үшін үш байтты пайдаланса, GB/T 2312 тек екі байтты ғана пайдаланады. Дегенмен, GB/T 2312 Unicode сияқты көптеген идеографтарды қамтымайды. Qūwèi кодтық нүктелерін EUC байттарына сәйкестендіру үшін жол нөміріне (немесе qū, 区) және ұяшық/баған нөміріне (он немесе wèi, 位) 160 (0xA0) санын қосыңыз. Кодтық нүктенің жол нөміріне қосу нәтижесі жоғары байтты, ал ұяшық нөміріне қосу нәтижесі төмен байтты құрайды. Мысалы, 45 66 ұяшығындағы "外" таңбасын кодтау үшін жоғары байт 45: 45+160=205=0xCD жол нөмірін пайдаланады, ал төменгі байт 66 ұяшығынан алынады: 66+160=226=0xE2. Осылайша, толық кодтау <CD E2> болады.
EUC CN is often used as the character encoding (i. e. for external storage) in programs that deal with GB/T 2312, thus maintaining compatibility with ASCII. Two bytes are used to represent every character not found in ASCII. The value of the first byte is from 0xA1–0xF7 (161–247), while the value of the second byte is from 0xA1–0xFE (161–254). Since all of these ranges are beyond ASCII, like UTF 8, it is possible to check if a byte is part of a multi byte construct when using EUC CN, but not if a byte is first or last. Compared to UTF 8, GB/T 2312 (whether native or encoded in EUC CN) is more storage efficient: while UTF 8 uses three bytes per CJK ideograph, GB/T 2312 only uses two. However, GB/T 2312 does not cover as many ideographs as Unicode does. To map the qūwèi code points to EUC bytes, add 160 (0xA0) to both the row number (or qū, 区) and cell/column number (ten or wèi, 位). The result of addition to the row number of the code point will form the high byte, and the result of addition to the cell number of the code point will form the low byte. For example, to encode the character "外" at qūwèi cell 45 66, the high byte will use the row number 45: 45+160=205=0xCD, and the low byte will come from the cell number 66: 66+160=226=0xE2. So, the full encoding is <CD E2>.
Таңбалар жиынтығы 0x24/0xA4 (4-жол: Хирагана)
Бұл жинақта жапон тілінде жазуға арналған хирагана әріптері бар. Оны JIS X 0208 стандартының 4-қатарымен, осы қатарға толық сәйкес келетін, сондай-ақ KS X 1001 және KPS 9566 стандартының 10-қатарымен салыстырыңыз, олар да осы реттелуді қолданады, бірақ басқа қатарда орналасқан.
This set contains Hiragana for writing the Japanese language. Compare with row 4 of JIS X 0208, which this row matches, and with row 10 of KS X 1001 and of KPS 9566, which use the same layout, but in a different row.
Таңбалар жиынтығы 0x27/0xA7 (7-жол: кириллица)
Бұл жиынтыққа кириллица әліпбиінің 33 әрпі кіреді, қазіргі орыс және болгар әліпбилерін жазу үшін жеткілікті, бірақ кириллицаның басқа түрлеріне қосымша әріптер қажет. Бұл қатарға сәйкес келетін JIS X 0208 стандартының 7-қатарымен, сондай-ақ KS X 1001 стандартының 12-қатарымен және KPS 9566 стандартының 5-қатарымен салыстырыңыз, олардың барлығы бірдей орналасуды қолданады, бірақ әртүрлі қатарларда орналасқан.
This set includes both cases of 33 letters from the Cyrillic script, sufficient to write the modern Russian alphabet and Bulgarian alphabet, although other forms of Cyrillic require additional letters. Compare with row 7 of JIS X 0208, which this row matches, and with row 12 of KS X 1001 and row 5 of KPS 9566, which use the same layout but in different rows.