Введение

Схема кодирования символов (文字鏡), также известная под своим полным названием, является схемой кодирования символов. Институт Моджикё (文字鏡研究会), который опубликовал набор символов, также опубликовал компьютерное программное обеспечение и шрифты TrueType для сопровождения. Институт Моджикё, возглавляемый Тадахисой Исикавой (石川忠久), первоначально распространял свой набор символов, а также связанное с ним программное обеспечение и данные на CD-ROM, продаваемых в магазинах Kinokuniya. Разработка концепции началась в 1996 году, а первая версия CD-ROM была выпущена в июле 1997 года. В течение некоторого времени Институт Моджикё также предлагал веб-подписку под названием "WEB" (文字鏡WEB), которая содержала более актуальные символы. Среди них 150 366 символов (≈86%) относились к расширенной китайско-японско-корейско-вьетнамской (CJKV) группе. Многие символы Моджикё считаются устаревшими или малоизвестными и не кодируются другими наборами символов, включая наиболее широко используемый международный стандарт кодирования текста – Unicode. Изначально являясь платным проприетарным программным продуктом, с 2015 года Институт Моджикё начал загружать свои последние версии в Internet Archive в качестве бесплатного программного обеспечения в память о Токио Фуруя (古家時雄), одном из его разработчиков, скончавшемся в том же году. Однако, имеет гораздо менее строгие стандарты кодирования, чем Unicode, что приводит к тому, что в ней закодировано множество глифов сомнительного или даже непреднамеренно вымышленного происхождения. Таким образом, хотя многие символы, не входящие в Unicode, подходят для добавления в него, не все могут стать символами Unicode из-за различных требований к доказательствам, предъявляемых каждой системой.

Состав

Шрифты (文字鏡フォント) — это шрифты TrueType, поставляемые в ZIP-архиве, каждый из которых занимает около 25 мегабайт; различные шрифты содержат разное количество символов. В комплект также входит исполняемый файл Windows, реализующий графическую карту символов "Карта символов" (文字鏡MAP), которая позволяет пользователям просматривать шрифты и копировать/вставлять символы вместо ввода с клавиатуры. В отличие от стандартной карты символов Windows или, например, KCharSelect, которые также поддерживают шрифты TrueType, эта программа отображает пронумерованный слот кодировки запрошенного символа. Для корректной работы необходимо установить все шрифты.

Кодирование

При упоминании символа, закодированного в , часто используется формат MJXXXXXX, аналогичный формату U+XXXX, используемому для Unicode. Например, хентаигана имеет кодировку MJ090007 и кодировку Unicode U+1B008. Однако, различие заключается в том, что кодировки, отображаемые таким образом, являются десятичными, в то время как кодировки Unicode U+ – шестнадцатеричными. С самых ранних дней Unicode, оказывал влияние на стандарт и сам находился под его влиянием. Глифы, происходящие из , впервые появляются в предложении, представленном в Ideographic Rapporteur Group (IRG), которая отвечает за поддержку всех блоков CJK в Unicode, 18 апреля 2002 года. В мае 2007 года сыграл незначительную роль в серии предложений, в конечном итоге увенчавшихся успехом, по кодированию тангутского письма в Unicode; к октябрю 2002 года уже содержал в своей кодировке 6000 тангутских символов. Сокращенно "JK". Идеограф, читаемый на японском языке как , имеет J Source, равный JK 66038. Согласно Кену Лунде, эксперту в области кодирования символов и восточноазиатских языков, по состоянию на Unicode 13.0, 782 идеографа в Unicode происходят из , примерно поровну распределенные между двумя блоками: CJK Unified Ideographs Extension C (367 символов) и CJK Unified Ideographs Extension E (415 символов). Не все символы Unicode с источниками (J Sources с префиксом JK) имеют тот же графический символ в таблице кодов, что и в шрифте ; некоторые символы изменили свою форму до окончательной кодировки, поскольку выяснилось, что формы, присвоенные Институтом Моджикио, были неверными.

Блоки

В 2006 году в нем было закодировано 174 975 символов.

Нет объединения

В отличие от Юникода, намеренно избегает унификации иероглифов хань; не делается попыток компактности кодировки, и также не предпринимается попытка сохранить все часто используемые символы ниже U+FFFF, как это сделано в Юникоде. Юникод, напротив, группирует свои CJK символы в блоки в зависимости от их распространенности: наиболее часто используемые обычно помещаются в базовую многоязычную плоскость. Сами по себе данные, иногда включая формы букв, во многих юрисдикциях рассматриваются как общественное достояние, поскольку они не достигают порога оригинальности. Однако, из-за этой практики, использование данных было запрещено в 2020 году.