Введение
Китайская система ввода символов с клавиатуры
Метод ввода Чанцзя (Tsang chieh input method, иногда называемый Чанцзя, Чанцзя, Чанцзе или Чонкит) — это система для ввода китайских иероглифов в компьютер с использованием стандартной компьютерной клавиатуры. В названиях файлов и в других местах имя Cangjie иногда сокращается как cj. Метод ввода был изобретен в 1976 году Чу Бон Фу и назван в честь Чанцзя (Цан Чжи), мифологического изобретателя китайской письменности, по предложению Чан Вэй Куо, бывшего министра обороны Тайваня. Чу Бонг Фу опубликовал патент на Чанцзе в 1982 году, поскольку считал, что метод должен принадлежать китайскому культурному наследию. Поэтому Cangjie стал программным обеспечением с открытым исходным кодом и предустановлен на каждой компьютерной системе, поддерживающей традиционные китайские иероглифы, а также был расширен для совместимости с упрощенным набором китайских иероглифов. Cangjie — первый китайский метод ввода, использующий клавиатуру QWERTY. Чу заметил, что QWERTY-клавиатура стала международным стандартом, и поэтому полагал, что ввод китайского языка должен быть основан на ней. Другие, более ранние методы использовали большие клавиатуры с 40 до 2400 клавиш, за исключением метода четырех углов, который использует только цифровые клавиши. В отличие от метода ввода пиньинь, Cangjie основан на графологическом аспекте иероглифов: каждая графическая единица, называемая «радикалом» (не следует путать с радикалами Кангси), представлена базовым структурным элементом иероглифа, всего 24, каждый из которых сопоставлен с определенной буквенной клавишей на стандартной клавиатуре QWERTY. Дополнительная функция «сложный иероглиф» сопоставлена с клавишей X. Клавиши разделены на четыре группы для облегчения изучения и запоминания. Кодирование китайских иероглифов осуществляется путем разделения составляющих их «радикалов».
Раннее развитие
Первоначально метод ввода Цанцзе не предназначался для создания символа в каком-либо наборе символов. Вместо этого он был частью интегрированной системы, состоящей из правил ввода Цанцзе и платы контроллера Цанцзе. Эта плата контроллера содержит прошивку генератора символов, которая динамически генерирует китайские символы из кодов Цанцзе при выводе символов, используя графический режим высокого разрешения компьютера Apple II. В предисловии к руководству пользователя Цанцзе Чу Бонг Фу написал в 1982 году: «В отношении вывода: вывод и ввод, по сути, образуют единое целое; нет оснований догматически разделять их на два отдельных компонента. Это действительно необходимо». В этой ранней системе, когда пользователь вводил, например, «yk» для получения китайского символа 文, коды Цанцзе не преобразовывались в какую-либо кодировку символов, а фактически строка «yk» сохранялась. Код Цанцзе для каждого символа (последовательность из 1–5 строчных букв плюс пробел) являлся кодированием именно этого символа. Особенностью этой ранней системы было то, что если отправлять ей случайные последовательности строчных букв, генератор символов пытался бы создать китайские символы в соответствии с правилами разложения Цанцзе, что иногда приводило к появлению странных, неизвестных символов. Эта непреднамеренная функция, «автоматическое генерирование символов», описана в руководстве и отвечает за создание более 10 000 из 15 000 символов, которые система может обрабатывать. Название Цанцзе, вызывающее ассоциации с созданием новых символов, действительно подходило для этой ранней версии. Наличие интегрированного генератора символов также объясняет историческую необходимость существования клавиши «X», используемой для устранения неоднозначности при коллизиях разложения: поскольку символы «выбираются» при «выводе» кодов, каждый символ, который может быть отображен, должен иметь уникальное разложение Цанцзе. Было бы неразумно и непрактично, чтобы система предлагала выбор символов-кандидатов при отображении случайного текстового файла, поскольку пользователь не знал бы, какой из кандидатов является правильным.
[in translation]In terms of output: The output and input, in fact, [form] an integrated whole; there is no reason that [they should be] dogmatically separated into two different facilities. This is in fact necessary. In this early system, when the user types "yk", for example, to get the Chinese character c=文, the Cangjie codes do not get converted to any character encoding and the actual string "yk" is stored. The Cangjie code for each character (a string of 1 to 5 lowercase letters plus a space) was the encoding of that particular character. A particular "feature" of this early system is that, if one sends random lowercase words to it, the character generator will attempt to construct Chinese characters according to the Cangjie decomposition rules, sometimes causing strange, unknown characters to appear. This unintended feature, "automatic generation of characters", is described in the manual and is responsible for producing more than 10,000 of the 15,000 characters that the system can handle. The name Cangjie, evocative of the creation of new characters, was indeed apt for this early version of Cangjie. The presence of the integrated character generator also explains the historical necessity for the existence of the "X" key, which is used for the disambiguation of decomposition collisions: because characters are "chosen" when the codes are "output", every character that can be displayed must in fact have a unique Cangjie decomposition. It would not make sense—nor would it be practical—for the system to provide a choice of candidate characters when a random text file is displayed, as the user would not know which of the candidates is correct.
Проблемы
Чанцзя был разработан как простая в использовании система для популяризации использования китайской вычислительной техники. Однако многие пользователи считают Чанцзя сложной в освоении и использовании, причём многие трудности вызваны недостаточной качеством обучения.
Ощущаемые трудности
Для ввода текста с помощью метода Цанцзе необходимо знание как названий радикалов, так и их вспомогательных форм. Обычно на мониторы пользователей компьютеров приклеивают таблицы радикалов Цанцзе с указанием их вспомогательных форм. Также необходимо владеть правилами разложения иероглифов, незнание которых значительно затрудняет ввод нужных символов. Пользователь не сможет ввести иероглиф, если забыл, как он пишется (это общая проблема для всех методов ввода, не основанных на фонетике). Однако, при достаточной практике пользователи могут преодолеть эти трудности. Опытные слепые машинисты могут печатать на китайском языке со скоростью 25 символов в минуту (cpm) и выше, используя Цанцзе, несмотря на сложности с запоминанием списка вспомогательных форм или правил разложения. Сообщается, что опытные пользователи Цанцзе могут достигать скорости набора от 60 до более 200 символов в минуту. По словам Чэнь Минчжэна, его опыт преподавания в начальной школе Лунтянь уезда Тайдун в 1990 году показал, что средняя скорость набора текста у детей составляла 90 слов в минуту, а некоторые дети достигали более 130 слов в минуту.
Ограничения в реализации
Разложение символа зависит от заранее определенного набора "стандартных форм" (c=標準字形). Однако, поскольку существует множество вариаций Cangjie в разных странах, стандартная форма определенного символа в Cangjie не всегда совпадает с той, которую изучил пользователь. Изучение Cangjie предполагает освоение не только самого метода, но и незнакомых стандартных форм для некоторых иероглифов. Редактор метода ввода Cangjie (IME) не исправляет ошибки в разложении, а лишь уведомляет пользователя о них (обычно звуковым сигналом). Однако, Cangjie изначально был разработан для присвоения различных кодов разным вариантам иероглифа. Например, в версии Cangjie, поставляемой с Windows, код для c=產 – YHHQM, который соответствует не форме этого иероглифа, а другому варианту, c=産. Это проблема, возникшая из-за реализации Cangjie в Windows. В оригинальном Cangjie, c=產 должно быть YKMHM (первая часть – c=文), а c=産 – YHHQM (первая часть – c=产). Знаки препинания не подвергаются геометрическому разложению, им присваиваются заранее определенные коды, начинающиеся с ZX, за которым следует строка из трех букв, связанных с порядком иероглифов в кодировке Big5. (Этот набор кодов был добавлен в Cangjie в традиционной китайской версии Windows 95. В Windows 3.1 у Cangjie не было кодов для знаков препинания.) Таким образом, ввод знаков препинания в Cangjie становится утомительным процессом, требующим запоминания или подбора. Однако, на современных системах эта проблема решается за счет доступа к виртуальной клавиатуре на экране (в Windows она активируется нажатием клавиш Ctrl + Alt + запятая). Обычно допускаемые ошибки не рассматриваются как альтернативные коды. Например, если не разложить c=方 сверху вниз в YHS, а вместо этого ввести YSH в соответствии с порядком черт, Cangjie не предложит иероглиф c=方 в качестве варианта. Поскольку Cangjie требует использования всех 26 клавиш клавиатуры QWERTY, его нельзя использовать для ввода китайских иероглифов на кнопочных телефонах, имеющих только 12-кнопочную клавиатуру. Вместо этого используются альтернативные методы ввода, такие как Zhuyin, 5 ударов (или 9 ударов от Motorola) и метод ввода Q9.
Версии
Обычно считается, что метод ввода Цанцзе прошёл через пять поколений (обычно называемых "версиями" на английском языке), каждое из которых в некоторой степени несовместимо с другими. В настоящее время версия 3 (c=第三代倉頡) является наиболее распространённой и поддерживается по умолчанию в Microsoft Windows. Версия 5 (c=第五代倉頡), поддерживаемая Free Cangjie IME и ранее являвшаяся единственной версией Цанцзе, поддерживаемой SCIM, представляет собой значительное меньшинство и поддерживается iOS. Ранняя система Цанцзе, поддерживаемая картой Zero One на Apple II, была версией 2; версия 1 так и не была выпущена. Метод ввода Цанцзе, поддерживаемый классической Mac OS, имеет сходство как с версией 3, так и с версией 5. Версия 5, как и оригинальный метод ввода Цанцзе, была разработана непосредственно Чу. Он надеялся, что выпуск версии 5, изначально планировавшейся как версия 6, положит конец существованию "более чем десяти версий метода ввода Цанцзе" (незначительно несовместимых версий, созданных разными производителями). Версия 6 пока не была выпущена для широкой публики, но используется для создания базы данных, способной точно хранить все исторические китайские тексты.
Приложения
Многие исследователи обсуждали способы разложения китайских иероглифов на основные компоненты и пытались создать приложения на основе этой системы разложения. Эту идею можно назвать изучением 漢字基因 (ханьцзы-генов). Коды Цанцзе предлагают основу для подобных начинаний. Academia Sinica на Тайване и Университет Цзяотун в Шанхае также ведут схожие проекты. Одним из прямых применений использования разложенных иероглифов является возможность вычисления степени сходства между различными китайскими иероглифами. Метод ввода Цанцзе предоставляет хорошую отправную точку для такого рода приложений. Ослабляя ограничение в пять кодов на иероглиф и используя более детализированные коды Цанцзе, можно вычислительно находить визуально похожие иероглифы. Интеграция этого с информацией о произношении позволяет использовать компьютер для помощи в изучении китайских иероглифов.