Кіріспе

Таңба кодтау схемасы (文字鏡), толық атауымен де белгілі, — таңба кодтау схемасы. Можикё институты (文字鏡研究会), бұл таңбалар жиынтығын жариялаған, сонымен қатар оны қолдау үшін компьютерлік бағдарламалық қамтамасыз ету және TrueType қаріптерін де жариялады. Тадахиса Ишикава (石川忠久) басқарған Можикё институты бастапқыда өзінің таңбалар жиынтығы мен оған байланысты бағдарламалық қамтамасыз ету және деректерін Кинокуния дүкендерінде сатылатын CD-ROM дискілерінде қайта таратып келді. 1996 жылы жобаланған CD-ROM-ның алғашқы нұсқасы 1997 жылдың шілдесінде жарық көрді. Бір кезде Можикё институты "WEB" (文字鏡WEB) деп аталатын веб-абоненттік қызмет ұсынды, онда жаңарып отыратын таңбалар болды. Олардың ішінде 150 366 таңба (≈86%) кеңейтілген қытай-жапон-корей-вьетнам (CJKV) отбасының құрамына кірді. Можикё таңбаларының көпшілігі қазіргі уақытта қолданылмайтын немесе сирек кездесетін болып саналады және тіпті ең көп қолданылатын халықаралық мәтін кодтау стандарты – Юникодқа дейін басқа таңбалар жиынтығымен кодталмаған. Бастапқыда ақылы, жекеменшік бағдарламалық өнім болған Можикё институты 2015 жылдан бастап өзінің соңғы нұсқаларын Internet Archive-ке тегін бағдарлама ретінде жүктеуге бастады, бұл сол жылы қайтыс болған әзірлеушілерінің бірі Токио Фуруяны (古家時雄) еске алу мақсатында жасалды. Дегенмен, бұл схема кодтау үшін Юникодқа қарағанда әлдеқайда бос стандарттарға ие, бұл күмәнді немесе тіпті қасақана ойдан шығарылған көптеген глифтердің кодталуына әкеледі. Сондықтан, Юникодқа қосылуға лайық Юникод емес таңбалар көп болғанымен, олардың барлығы Юникод таңбалары бола алмайды, себебі әрқайсысы үшін талап етілетін дәлелдердің стандарттары әртүрлі.

Құрамы

Шрифттер (文字鏡フォント) – бұл ZIP файлында келетін TrueType шрифттері, олардың әрқайсысы шамамен 25 мегабайт көлемде; әртүрлі шрифттерде әртүрлі санда таңбалар бар. Сонымен қатар, Windows-тың графикалық таңба картасын іске асыратын орындалатын файлы да қоса берілген, "Таңба картасы" (文字鏡MAP) пайдаланушыларға шрифттерді қарауға және пернетақтадан терудің орнына таңбаларды көшіріп жабыстыруға мүмкіндік береді. Құрамында TrueType шрифттерін қолдайтын әдеттегі Windows таңба картасынан немесе KCharSelect-тен айырмашылығы, ол сұралған таңбаның нөмірленген кодтау ұясын көрсетеді. Бұл жұмыс істеуі үшін барлық шрифттер орнатылған болуы керек.

Кодтау

Анықтама үшін , MJXXXXXX форматы жиі қолданылады, бұл Unicode үшін қолданылатын U+XXXX форматына ұқсас. Мысалы, хентаигананың кодтамасы MJ090007 және Unicode кодтамасы U+1B008. Дегенмен, айырмашылығы, осылай көрсетілген кодтамалар ондық, ал Unicode-тың U+ кодтамасы он алтылық болып табылады. Unicode-тың бастапқы күндерінен бері , стандартқа әсер етіп, одан әсер алды. -ден шыққан глифтер алғаш рет 2002 жылдың 18 сәуірінде Идеографиялық есеп беруші топқа (IRG) ұсынылған ұсыныста пайда болды, ол Unicode-тағы барлық CJK блоктарын сақтауға жауапты. 2007 жылдың мамырында , Тангут жазуын Unicode-қа кодтау бойынша сәтті аяқталған ұсыныстар сериясында шағын рөл атқарды; 2002 жылдың қазанында оның кодтамасында 6000 Тангут таңбасы болды. "JK" деп қысқартылған, жапон тілінде деп оқылатын идеографтың J көзі JK 66038-ге тең. Unicode-тағы JK префиксі бар барлық Unicode таңбалары J Source-тан шыққан. Таңба кодтамалары және Шығыс Азия тілдері саласындағы сарапшы Кен Лундеге сәйкес, Unicode 13.0 нұсқасы бойынша Unicode-тағы 782 идеограф -ден шыққан, олар шамамен тең үлесте екі блокқа бөлінген: CJK Бірыңғай идеографтар кеңейтуі C, 367 және CJK Бірыңғай идеографтар кеңейтуі E, 415. -нің шығу тегі бар Unicode таңбаларының (JK префиксімен J Source) барлығы код кестесіндегі және қаріптегі бірдей глифке ие емес; кейбір таңбалардың пішіні соңғы кодтау алдында өзгертілді, себебі Mojikyō институтының тағайындаған пішіндері дұрыс емес екені анықталды.

Блоктар

2006 жылы ол 174 975 символды қамтыды.

Біріктіру жоқ

Юникодтан айырмашылығы, ол әдейі түрде хан біріктіруден қашып қалады; кодтаудың ықшамдығына ешқандай тырысқандық жоқ, және Юникодтағыдай барлық жиі кездесетін таңбаларды U+FFFF-тен төмен ұстауға да тырыспайды. Юникод, керісінше, өзінің CJK таңбаларын олардың таралу жиілігіне қарай блоктарға бөледі: ең көп қолданылатындары әдетте Негізгі көптілді жазықтыққа (Basic Multilingual Plane) енгізіледі. Көптеген заңнамаларда әріптердің пішіндерін қоса алғанда, мәліметтер түпнұсқалық деңгейге жетпегендіктен, жалпыға ортақ мүлік деп есептеледі. Дегенмен, осы тарихи себептерге байланысты, 2020 жылдан бастап деректерге рұқсат берілмейді.