Екі байттық таңба жиынтығы және ұлттық тілдердегі кодтау
Double-byte character set
Қос байтты жинақтар (DBCS) – ұлттық тілдерді кодтау жүйесі. Жапон, қытай, корей тілдеріндегі әріптерді көрсетуге мүмкіндік береді. Көп символдарды қолдайды.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Екі байттық таңбалар жиынтығы (DBCS) — барлық таңбалардың (бақылау таңбалары да қоса) екі байтпен кодталатын немесе бір байттық таңбалар жиынтығымен (SBCS) көрсетілмейтін әрбір графикалық таңбаның екі байтпен кодталатын таңбалар кодтамасы болып табылады (хан таңбалары әдетте осы екі байттық таңбалардың көп бөлігін құрайды). DBCS көптеген ерекше таңбалар немесе символдар бар ұлттық тілдерді қолдайды (бір байтпен көрсетуге болатын таңбалардың максималды саны 256, ал екі байтпен 65 536 таңбаға дейін көрсетуге болады). Мұндай тілдердің мысалдары — жапон және қытай тілдері. Корей хангулы көп таңбаларды қамтымайды, бірақ KS X 1001 хангул және ханжаны қолдайды және әр таңбаға екі байт қолданады.
A double byte character set (DBCS) is a character encoding in which either all characters (including control characters) are encoded in two bytes, or merely every graphic character not representable by an accompanying single byte character set (SBCS) is encoded in two bytes (Han characters would generally comprise most of these two byte characters). A DBCS supports national languages that contain many unique characters or symbols (the maximum number of characters that can be represented with one byte is 256 characters, while two bytes can represent up to 65,536 characters). Examples of such languages include Japanese and Chinese. Korean Hangul does not contain as many characters, but KS X 1001 supports both Hangul and Hanja, and uses two bytes per character.
CJK есептеуінде
DBCS термині дәстүрлі түрде әр графикалық таңба екі байтта кодталатын таңба кодтамасын білдіреді. 8 биттік кодта, мысалы Big 5 немесе Shift JIS, DBCS-тен бір таңба ең маңызды біті орнатылған (яғни жеті биттен үлкен) жетекші (алғашқы) байтпен көрсетіледі және бір байттық таңбалар жиынтығымен (SBCS) жұпталады. Өзгертілмеген, тікелей қораптан алынған бағдарламалық құралдармен үйлесімділікті сақтау үшін SBCS жартылай енді таңбалармен, ал DBCS толық енді таңбалармен байланыстырылады. ISO 2022 JP сияқты 7 биттік кодта SBCS және DBCS арасында ауысу үшін қашқыш тізбектер немесе ауысу кодтары қолданылады. Кейде "DBCS" термині ISO 2022 стандартына сәйкес келмейтін жасырын құрылымды білдіруі мүмкін. Мысалы, "DBCS" кейде кеңейтілген Unix коды (EUC) емес, екі байттық кодтаманы білдіруі мүмкін. DBCS-тің бұл бастапқы мағынасы бүгінгі күні дұрыс деп саналатын қолданыстан өзгеше. Кейбіреулер осы таңба кодтамаларын дұрысырақ көп байттық таңба жиынтығы (MBCS) немесе өзгермелі ендік кодтамалар деп атауды қалайды, себебі EUC JP, EUC KR, EUC TW, GB 18030 және UTF-8 сияқты таңба кодтамалары кейбір таңбалар үшін екі байттан астамды пайдаланады, ал басқа таңбалар үшін бір байтты қолдайды.
The term DBCS traditionally refers to a character encoding where each graphic character is encoded in two bytes. In an 8 bit code, such as Big 5 or Shift JIS, a character from the DBCS is represented with a lead (first) byte with the most significant bit set (i. e., being greater than seven bits), and paired up with a single byte character set (SBCS). For the practical reason of maintaining compatibility with unmodified, off the shelf software, the SBCS is associated with half width characters and the DBCS with full width characters. In a 7 bit code such as ISO 2022 JP, escape sequences or shift codes are used to switch between the SBCS and DBCS. Sometimes, the use of the term "DBCS" can imply an underlying structure that does not comply with ISO 2022. For example, "DBCS" can sometimes mean a double byte encoding that is specifically not Extended Unix Code (EUC). This original meaning of DBCS is different from what some consider correct usage today. Some insist that these character encodings be properly called multi byte character sets (MBCS) or variable width encodings, because character encodings such as EUC JP, EUC KR, EUC TW, GB 18030, and UTF 8 use more than two bytes for some characters, and they support one byte for other characters.
Айқындық
Кейбір адамдар DBCS терминін UTF-16 және UTF-8 кодтамаларын білдіру үшін қолданады, ал басқалары DBCS терминін әрбір таңбаға бір байттан артық қолданылатын, Unicode-қа дейінгі ескі таңба кодтамаларын білдіру үшін қолданады. Shift JIS, GB 2312 және Big5 – әрбір таңбаға бір байттан артық байттарды қолдануы мүмкін бірнеше таңба кодтамалары. Бірақ тіпті осы таңба кодтамалары үшін DBCS терминін қолдану да дұрыс емес, себебі бұл таңба кодтамалары өзгермелі енді кодтамалар болып табылады (UTF-16 және UTF-8 сияқты). Кейбір IBM мейнфреймдерінде шынайы DBCS кодтық беттері бар, олар көп байттық кодтық беттің тек екі байттық бөлігін ғана қамтиды. Егер біреу бағдарламалық құралды халықаралық деңгейде қолдану үшін "DBCS мүмкіндіктерін" қолданса, ол екіұшты терминология қолданып отыр. Олар бұрынғы технологияларды пайдаланып Шығыс Азия нарықтарына арналған бағдарламалық құралды жасауды немесе Unicode-ты қолдануды көздеп отыр. Кейде бұл термин Шығыс Азия тілдеріне аударуды да білдіреді. Әдетте, "Unicode мүмкіндіктері" Unicode-ты қолдану арқылы бағдарламалық құралды халықаралық деңгейде қолдануды білдіреді, ал "DBCS мүмкіндіктері" – Шығыс Азия елдері арасындағы үйлесімсіз таңба кодтамаларын қолдануды білдіреді. Unicode, көптеген басқа таңба кодтамаларынан айырмашылығы, Шығыс Азиядағы барлық негізгі тілдерді қолдайды, сондықтан Unicode-ты қолданатын бағдарламалық құралды іске қосу және күтіп ұстау әдетте оңайырақ. DBCS (Unicode емес) мүмкіндіктерін пайдалану әдетте ескі операциялық жүйелер немесе қолданбалар Unicode-ты қолдамайтын жағдайларда ғана қажет болады.
Some people use DBCS to mean the UTF 16 and UTF 8 encodings, while other people use the term DBCS to mean older (pre Unicode) character encodings that use more than one byte per character. Shift JIS, GB 2312 and Big5 are a few character encodings that can contain more than one byte per character, but even using the term DBCS for these character encodings is incorrect terminology because these character encodings are really variable width encodings (as are both UTF 16 and UTF 8). Some IBM mainframes do have true DBCS code pages, which contain only the double byte portion of a multi byte code page. If a person uses the term "DBCS enablement" for software internationalization, they are using ambiguous terminology. They either mean they want to write software for East Asian markets using older technology with code pages, or they are planning on using Unicode. Sometimes this term also implies translation into an East Asian language. Usually "Unicode enablement" means internationalizing software by using Unicode, and "DBCS enablement" means using incompatible character encodings that exist between the various countries in East Asia for internationalizing software. Since Unicode, unlike many other character encodings, supports all the major languages in East Asia, it is generally easier to enable and maintain software that uses Unicode. DBCS (non Unicode) enablement is usually only desired when much older operating systems or applications do not support Unicode.
ТБКС
Үш байттық таңбалар жиынтығы (TBCS) — таңбалардың (бақылау таңбалары да оның ішінде) үш байтқа кодталған таңбалық кодтамасы.
A triple byte character set (TBCS) is a character encoding in which characters (including control characters) are encoded in three bytes.