Введение
Представление символов CJK на компьютерах
В вычислительной технике китайские кодировки символов могут использоваться для представления текста, написанного на языках CJK — китайском, японском, корейском и (редко) устаревшем вьетнамском, все из которых используют китайские иероглифы. Несколько кодировок символов общего назначения поддерживают китайские иероглифы, и некоторые из них были разработаны специально для китайского языка. Помимо Unicode (с набором унифицированных идеограмм CJK), существуют локальные системы кодирования. Китайская система Guobiao (или GB, «национальный стандарт») используется в материковом Китае и Сингапуре, а тайваньская система Big5 — в Тайване, Гонконге и Макао, как две основные устаревшие локальные системы кодирования. Guobiao обычно отображается с использованием упрощенных иероглифов, а Big5 — с использованием традиционных иероглифов. Однако не существует обязательной связи между системой кодирования и шрифтом, используемым для отображения иероглифов; шрифт и кодировка обычно связаны друг с другом по практическим соображениям. Выбор кодировки также может иметь политическое значение, поскольку GB является официальным стандартом Китайской Народной Республики, а Big5 — де-факто стандартом Тайваня. В отличие от ситуации с японским языком, Unicode не встретил значительного открытого сопротивления, поскольку он решает многие проблемы, связанные с GB и Big5. Unicode широко признан политически нейтральным, обеспечивает хорошую поддержку как упрощенных, так и традиционных иероглифов и может быть легко преобразован в GB и Big5 и обратно. Кроме того, Unicode имеет преимущество в том, что он не ограничивается только китайским языком, поскольку содержит коды символов для (почти) всех языков.
Губьяо
Линия кодировок символов Guobiao (GB) начинается с набора символов упрощенного китайского языка GB 2312, опубликованного в 1980 году. Для GB 2312 существовали две схемы кодирования: широко используемое одно- или двухбайтовое 8-битное кодирование EUC CN и 7-битное кодирование HZ, предназначенное для сообщений Usenet. Традиционный вариант GB/T 12345 был опубликован в 1990 году. В 1993 году формат EUC CN был расширен до GBK, включив в себя все идеограммы Unicode 1.1 CJK, при этом от модели ISO 2022 отказались. Таким образом, GBK включает в себя традиционные китайские символы в дополнение к упрощенным символам GB 2312. GBK получил распространение благодаря широко распространенной реализации кодовой страницы 936, используемой в Microsoft Windows 95. В 2000 году GB 18030 был опубликован в качестве преемника GBK. Эта новая кодировка включает в себя четырехбайтовый UTF, который кодирует все кодовые точки Unicode, ранее не закодированные. В 2005 году GB 18030 был обновлен и включил в себя эталонные глифы для письменности, используемой этническими меньшинствами Китая, а также глифы из CJK Unified Ideographs Extension B в связи с обновлением Unicode. Adobe GB1 — соответствующий набор символов PostScript для кодировок GB.
Большая 5
Семейство кодировок символов Big5 берет начало с первоначальной спецификации, разработанной консорциумом из пяти тайваньских компаний. Это набор символов с двойным кодированием байтов (DBCS), в некоторой степени похожий на Shift JIS, который часто используется в сочетании с многобайтовой кодовой страницей (MBCS), такой как ASCII. Существует множество различных реализаций и официальных расширений, среди которых наиболее известны ETEN, HKSCS (Гонконг) и Big5 2003 (входящий в состав CNS 11643, разработанного Тайванем). Adobe CNS1 — это набор символов PostScript, соответствующий семейству кодировок Big5.
Перевод
До появления GBK, который включает как традиционные, так и упрощенные иероглифы, преобразование между традиционным и упрощенным китайским было осложнено необходимостью транскрибирования текста между двумя вариантами китайского языка, поскольку один набор иероглифов мог содержать множество иероглифов другого варианта, представленных только в нём. Преобразование между традиционным и упрощенным китайским обычно представляет собой проблему, так как упрощение некоторых традиционных форм объединяло два или более различных иероглифа в один упрощенный. Преобразование из традиционного в упрощенный (многие к одному) технически просто. Обратное преобразование часто приводит к потере данных при преобразовании в GB 2312: при сопоставлении одного к многим, когда традиционным глифам присваиваются упрощенные глифы, некоторые иероглифы неизбежно оказываются неверным выбором в определенных контекстах. Таким образом, преобразование из упрощенного в традиционный часто требует учета контекста использования или списков распространенных фраз для разрешения конфликтов. Эта проблема менее актуальна для новых стандартов, таких как GBK, GB 18030 и Unicode, которые имеют отдельные кодовые точки для упрощенных и традиционных иероглифов. Другая проблема заключается в том, что во многих системах кодирования отсутствуют некоторые иероглифы. Хотя отсутствующие иероглифы часто используются в литературе и редко встречаются в обычном тексте, это становится проблемой, поскольку имена людей часто содержат эти иероглифы. Примером является тайваньский политик Ван Цяньшэнь, в имени которого есть иероглиф (煊), отсутствующий в некоторых системах кодирования, и бывший премьер-министр Китая Чжу Жунцзи, иероглиф (镕) в имени которого отсутствует в GB 2312. Новейший стандарт GB, GB 18030, содержит полный набор иероглифов Unicode 4.0, включая расширения Unihan в Дополнительной идеографической плоскости.