Введение

Кодировка для традиционных китайских иероглифов

Big 5 или Big5 (t=大五碼) — это метод кодирования китайских иероглифов, используемый на Тайване, в Гонконге и Макао для традиционных китайских иероглифов. Китайская Народная Республика (КНР), использующая упрощенные китайские иероглифы, использует вместо него набор символов GB 18030. Название Big5 происходит от консорциума из пяти тайваньских компаний, которые его разработали.

Дубликаты

Big5 кодирует два повторяющихся символа: "兀" по кодам 0xA461 (U+5140) и 0xC94A (U+FA0C), "嗀" по кодам 0xDCD1 (U+55C0) и 0xDDFC (U+FA0D). Некоторые таблицы кодирования также отображают три числа Сучжоу, "〸", "〹" и "〺", в графической области на символы иероглифов (U+5341, U+5344 и U+5345 соответственно) вместо символов CJK и знаков пунктуации (U+3038, U+3039 и U+303A соответственно).

Что на самом деле кодирует код Big5

Индивидуальный код Big5 не всегда представляет собой полную семантическую единицу. Коды логограмм Big5 всегда являются логограммами, но коды в разделе «графические символы» не всегда являются полноценными «графическими символами». Big5 кодирует конкретные графические представления символов или их частей, которые случайно помещаются в пространство, занимаемое двумя моноширинными символами ASCII. Это свойство двухбайтовых кодировок CJK, и это не уникальная проблема Big5. (Вышесказанное может потребовать пояснения с точки зрения исторической перспективы, поскольку теоретически это неверно: когда текстовый режим в персональных компьютерах был нормой, символы обычно представлялись отдельными байтами, и каждый символ занимал одну позицию на экране. Поэтому существовала практическая причина настаивать на том, чтобы двухбайтовые символы занимали два экранных положения, а именно, чтобы готовое американское программное обеспечение можно было использовать без изменений в системе на основе DBCS. Если символ может занимать произвольное количество экранных позиций, программное обеспечение, предполагающее, что один байт текста занимает одну экранную позицию, будет выдавать некорректный результат. Разумеется, если компьютер никогда не работал с текстовым экраном, производитель не стал бы вводить это искусственное ограничение; примером является Apple Macintosh. Тем не менее, сама кодировка должна быть разработана таким образом, чтобы она корректно работала в системах с текстовым экраном.) Для иллюстрации этого рассмотрим код Big5 ( ). Для носителей английского языка это выглядит как многоточие, и стандарт Unicode идентифицирует его как таковое; однако в китайском языке многоточие состоит из шести точек, которые помещаются в пространство двух китайских символов ( ), поэтому кода Big5 для китайского многоточия как такового не существует, а код Big5 представляет собой лишь половину китайского многоточия. Он представляет собой только половину многоточия, потому что полное многоточие должно занимать пространство двух китайских символов, а во многих системах DBCS один символ DBCS должен занимать ровно пространство одного китайского символа. Символы, закодированные в Big5, не всегда представляют собой элементы, которые можно легко использовать в обычных текстовых файлах; примером является «знак цитирования» (, ﹋), который при использовании требуется размещать под заголовком литературных произведений. Другой пример – цифры Сучжоу, представляющие собой форму научной нотации, требующую представления числа в двухмерной форме, состоящей как минимум из двух строк.

Соответствующая SBCS

На практике Big5 не может использоваться без соответствующей SBCS; это в основном связано с соображениями совместимости. Однако, как и в случае других кодовых страниц CJK DBCS, конкретная SBCS для использования никогда не была определена. Big5 всегда определялся как DBCS, хотя при использовании он должен быть сопряжен с подходящей, неопределенной SBCS и, следовательно, используется как то, что некоторые называют MBCS; тем не менее, Big5 сам по себе, согласно определению, является строго DBCS. Отсутствие спецификации SBCS подразумевает, что используемая SBCS теоретически может различаться от системы к системе. В настоящее время ASCII – единственная возможная SBCS, которую можно использовать. Однако в старых системах на базе DOS кодовая страница 437 – с ее дополнительными специальными символами в области управляющих кодов, включая позицию 127 – была гораздо более распространена. Однако на системе Macintosh с китайским языковым комплектом или на системе Unix, работающей в эмуляторе терминала cxterm, SBCS, сопряженная с Big5, не была бы кодовой страницей 437. За пределами допустимого диапазона Big5 старые системы на базе DOS обычно интерпретировали данные в соответствии с SBCS, сопряженной с Big5 в данной системе. В таких системах, например, символы 127–160, скорее всего, не избегались, поскольку они привели бы к недействительному Big5, а использовались, потому что они были бы допустимыми символами в кодовой странице 437. Следовательно, современная характеристика Big5 как MBCS, состоящей из DBCS Big5 плюс SBCS ASCII, исторически неверна и потенциально ошибочна, поскольку выбор соответствующей SBCS был и теоретически остается полностью независимым от конкретной реализации Big5.

Расширения

Оригинальная кодировка Big5 включает только иероглифы CJK из "Графиков стандартных форм общеупотребительных иероглифов" (4808 иероглифов) и "Графиков стандартных форм менее употребительных иероглифов" (6343 иероглифа), но не содержит буквы из имён людей, названий мест, диалектов, терминов химии и биологии, а также японской слогописи кана. В результате многие программы, поддерживающие Big5, включают расширения для решения этих проблем. Разнообразие вариантов делает UTF-8 или UTF-16 более единообразными кодировками для современного использования.

Страницы кода Microsoft

Microsoft (微軟) создала собственную версию расширения Big5 в виде кодовой страницы 950 для использования в Microsoft Windows, которая поддерживает кодовые точки F9D6 и F9FE из расширений ETEN. В некоторых версиях Windows символ евро сопоставлен с кодовой точкой A3E1 кодировки Big 5. После установки патча HKSCS от Microsoft поверх традиционной китайской версии Windows (или любой версии Windows 2000 и выше с установленным соответствующим языковым пакетом), приложения, использующие кодовую страницу 950, автоматически начинают использовать скрытую таблицу кодовой страницы 951. Эта таблица поддерживает все кодовые точки HKSCS 2001, за исключением кодовых точек совместимости, определенных стандартом.

Страницы кода IBM

В отличие от кодовой страницы 950 от Microsoft, CCSID 950 от IBM состоит из однобайтовой кодовой страницы 1114 (CCSID 1114) и двухбайтовой кодовой страницы 947 (CCSID 947). Она включает расширения ETEN для лидирующих байтов , , и , исключая при этом те, что имеют лидирующий байт (которые включает Microsoft), и вместо этого отображает их в область частного использования как пользовательские символы. Также в неё включены две области расширения, не относящиеся к ETEN, с завершающими байтами, то есть за пределами обычного диапазона завершающих байтов Big5, но аналогичные диапазону завершающих байтов Big5+: область 5 имеет лидирующие байты и содержит символы, выбранные IBM, а область 9 имеет лидирующие байты и является пользовательской областью. IBM называет обновление знака евро в своем варианте Big 5 CCSID 1370, который включает как однобайтовые, так и двухбайтовые знаки евро. Она состоит из однобайтовой кодовой страницы 1114 (CCSID 5210) и двухбайтовой кодовой страницы 947 (CCSID 21427). Для обеспечения лучшей совместимости с вариантом Microsoft в IBM Db2, IBM также определяет чисто двухбайтовую кодовую страницу 1372 и связанную с ней кодовую страницу переменной ширины CCSID 1373, которая соответствует кодовой странице 950 от Microsoft. IBM присваивает CCSID 5471 кодовой странице HKSCS 2001 Big5 (с CPGID 1374 в качестве CCSID 5470 как двухбайтового компонента), CCSID 9567 кодовой странице HKSCS 2004 (с CPGID 1374 в качестве CCSID 9566 как двухбайтового компонента) и CCSID 13663 кодовой странице HKSCS 2008 (с CPGID 1374 в качестве CCSID 13662 как двухбайтового компонента), в то время как CCSID 1375 присваивается развивающейся кодовой странице HKSCS, которая в настоящее время эквивалентна CCSID 13663.

Шрифт ChinaSea

Шрифты ChinaSea (中國海字集) – традиционные китайские шрифты, разработанные компанией ChinaSea. Эти шрифты редко продаются отдельно, но поставляются в комплекте с другими продуктами, например, с китайской версией Microsoft Office 97. Они поддерживают японские кана, кокудзи и другие символы, отсутствующие в кодировке Big5. Благодаря этому расширения ChinaSea стали более популярными, чем расширения, поддерживаемые правительством. Некоторые BBS в Гонконге использовали кодировки, основанные на шрифтах ChinaSea, до появления стандарта HKSCS.

Шрифт "Sakura"

Шрифт "Sakura" (日和字集 Sakura Version) разработан в Гонконге и предназначен для совместимости с HKSCS. Он добавляет поддержку кокудзи и фирменных символов (дингбатов), включая Doraemon, которых нет в HKSCS.

Unicode-at-on (уникод в режиме включения)

Unicode at on (Unicode補完計畫), ранее расширение BIG5, расширяет кодировку BIG 5 путем изменения таблиц кодовых страниц, но начиная с версии 2 использует расширения ChinaSea. Однако, банкротство ChinaSea, запоздалое развитие и растущая популярность HKSCS и Unicode (проект несовместим с HKSCS) сильно ограничили успех этого расширения. Несмотря на эти проблемы, символы, которые ранее были сопоставлены с Unicode Private Use Area, при экспорте в формат Unicode переназначаются на стандартизированные эквиваленты.

ОПГ

Веб-сайты Oriental Daily News и Sun Daily, принадлежащие компании Oriental Press Group Limited (東方報業集團有限公司) в Гонконге, использовали шрифт для скачивания с кодировкой Big 5, отличной от кодировки HKSCS.

Тайваньский шрифт Министерства образования

Министерство образования Тайваня разработало собственный шрифт, шрифт Министерства образования Тайваня (臺灣教育部造字檔), для внутреннего использования.

Тайваньский совет сельского хозяйства

Тайваньский совет сельского хозяйства при исполнительном юане представил 133-символьный пользовательский шрифт – шрифт Тайваньского совета сельского хозяйства (臺灣農委會常用中文外字集), включающий 84 иероглифа с радикалом "рыба" и 7 иероглифов с радикалом "птица".

Большой5+

Китайский фонд цифровых технологий (中文數位化技術推廣委員會) представил Big5+ в 1997 году, который использовал более 20000 кодовых точек для включения всех иероглифов CJK, представленных в Unicode 1.1. Однако, дополнительные кодовые точки выходили за пределы первоначального определения Big 5 (Big5+ использует старшие байты 81 FE и младшие байты 40–7E и 80–FE), что делало невозможной его установку в Microsoft Windows без новых файлов кодовой страницы.

Большой-5Е

Чтобы пользователи Windows могли использовать собственные шрифты, Китайский фонд цифровых технологий представил Big 5E, который добавил 3954 символа (в трех блоках кодовых точек: 8E40–A0FE, 8140–86DF, 86E0–875C) и удалил японскую кану из расширения ETEN. В отличие от Big 5+, Big5E расширяет Big 5, оставаясь в рамках его первоначального определения. Mac OS X 10.3 и более поздние версии поддерживают Big 5E в шрифтах LiHei Pro (儷黑 Pro.ttf) и LiSong Pro (儷宋 Pro.ttf).

Большая5-2003

Китайский фонд технологий цифровизации разработал определение кодировки Big5 и включил его в стандарт CNS 11643 в примечании, сделав его частью официального стандарта Тайваня. Big5 2003 включает в себя все символы Big5, представленные в расширениях ETEN 1984 года (кодовые точки A3C0–A3E0, C6A1–C7F2 и F9D6–F9FE), а также символ евро. Кириллические символы не были включены, поскольку ответственные органы заявили, что стандарт CNS 11643 не предусматривает включение таких символов.

CDP

Академия Синика создала шрифт для обработки китайских данных (漢字構形資料庫) в конце 1990-х годов, последняя версия 2.5 которого содержала 112 533 иероглифа, что несколько меньше, чем количество иероглифов в шрифтах Mojikyo.