Кіріспе

Бұрмаланған мәтін, дұрыс емес таңба кодтамаларының нәтижесінде

Моджибаке (文字化け; , "таңба түрленуі") – мәтіннің қате таңба кодтамасын қолдану арқылы декодталғанда туындайтын бұрмаланған немесе түсініксіз мәтін. Нәтижесінде таңбалар мүлдем байланысы жоқ, көбінесе басқа жазу жүйесінен алынған таңбалармен ауыстырылады. Бұл жағдайда екілік өрнегі жарамсыз саналатын жерлерде жалпы алмастыру таңбасы ("�") пайда болуы мүмкін. Алмастыру бір кодтамада көрсетілген бірнеше тізбекті таңбаларды қамтуы мүмкін, егер сол екілік код екінші кодтамада бір таңбаны білдірсе. Бұл тұрақты ұзындығы әртүрлі кодтамалардың (мысалы, Азияның 16 биттік және Еуропаның 8 биттік кодтамалары) немесе өзгермелі ұзындығы бар кодтамалардың (әсіресе UTF-8 және UTF-16) қолданылуынан туындайды. Қаріптердің болмауы немесе қаріпте қаріптердің жоқ болуынан туындайтын глифтердің дұрыс көрсетілмеуі – моджибакемен шатастырылмауы тиіс бөлек мәселе. Бұл қате көрсетудің белгілері гексадецималды форматта код нүктесі көрсетілген немесе жалпы алмастыру таңбасы қолданылған блоктарды қамтиды. Маңыздысы, бұл алмастырулар жарамды және бағдарламалық құралдың қателерді дұрыс өңдеуінің нәтижесі болып табылады.

Төменгі сипаттама

Егер кодтау көрсетілмесе, оны анықтау бағдарламалық жасақтамаға жүктеледі. Бағдарламалық жасақтама түріне қарай, әдеттегі шешім – конфигурация немесе таңбалар жиынтығын анықтау эвристикасы. Екеуі де қате болжам жасауға бейім. Мәтіндік файлдардың кодтауы жергілікті параметрлерге байланысты, ал жергілікті параметрлер пайдаланушының тіліне, операциялық жүйенің түріне және басқа да көптеген жағдайларға тәуелді. Сондықтан, басқа параметрлермен орнатылған компьютерден немесе тіпті осы жүйедегі басқа локальді бағдарламалық жасақтамадан алынған файлдар үшін болжамды кодтау жүйелі түрде дұрыс болмайды. Юникод үшін бір шешім – байт реті белгісін пайдалану, бірақ бастапқы код пен басқа машинамен оқылатын мәтін үшін көптеген талдаушылар оны қабылдамайды. Тағы бір жолы – кодтауды файл жүйесіндегі метадеректер ретінде сақтау. Кеңейтілген файл атрибуттарын қолдайтын файл жүйелері оны `user.charset` ретінде сақтай алады. Бұл сондай-ақ оны пайдаланғысы келетін, бірақ басқа бағдарламаларға кедері келтірмейтін бағдарламалық жасақтаманы қажет етеді. Кейбір кодтамаларды, мысалы UTF-8-ді анықтау оңай болса, көптерін ажырату қиын (таңбалар жиынтығын анықтау қараңыз). Веб-браузер EUC-JP-де кодталған бетті Shift JIS-тегі басқа бір беттен ажырата алмайды, егер кодтау құжаттармен бірге жіберілген HTTP тақырыптары арқылы нақты көрсетілмесе немесе серверді дұрыс HTTP тақырыптарын жіберу үшін конфигурациялай алмаса, жоғалған HTTP тақырыптарын ауыстыру үшін қолданылатын HTML құжатының мета тегтері арқылы көрсетілмесе; HTML-дегі таңба кодтауларын қараңыз.

Қате анықтамасы

Моджибаке кодтау қате көрсетілген кезде де пайда болады. Мұндай жағдай көбінесе ұқсас кодтаулар арасында туындайды. Мысалы, Windows жүйесі үшін Eudora электрондық пошта бағдарламасы ISO 8859-1 деп белгіленген, бірақ іс жүзінде Windows 1252 кодировкасында жіберілген электрондық хаттарды жібергені белгілі болды. Windows 1252 кодировкасында C1 диапазонындағы қосымша басылатын символдар бар (көбінесе икемді тырнақшалар мен қосымша дефистер кездеседі), олар ISO стандартына сәйкес келетін бағдарламалық құралдарда дұрыс көрсетілмейтін. Бұл әсіресе Unix сияқты басқа операциялық жүйелерде жұмыс істейтін бағдарламалық құралдарға әсер етті.

Пайдаланушыны қадағалау

Әлі де жиі қолданылатын кодтамалардың көптегені ASCII-ді негізге алып, оған қосымша белгілер енгізу арқылы жасалды. Сондықтан, бұл кодтамалар бір-бірімен ішінара үйлесімді келеді. Мысалы, Windows 1252 және ISO 8859-1 осыған жатады. Сондықтан адамдар өздері қолданып жүрген кеңейтілген кодтаманы қарапайым ASCII деп жаңылыстыруы мүмкін.

Артық сипаттама

Әрқайсысы әртүрлі ақпаратқа негізделген кодтаманы анықтауға тырысатын протоколдардың бірнеше қабаттары болғанда, ең сенімсіз ақпарат алушыны жаңылыстыруы мүмкін. Мысалы, HTTP арқылы статикалық HTML файлын қызмет көрсететін веб-серверді қарастырайық. Символдар жиынтығы клиентке үш түрлі жолмен жеткізілуі мүмкін: HTTP тақырыбында. Бұл ақпарат сервер конфигурациясына негізделуі мүмкін (мысалы, файлды дискіден беру кезінде) немесе серверде іске қосылған бағдарламамен (динамикалық веб-сайттар үшін) басқарылуы мүмкін. файлда HTML мета-тег ретінде (http-equiv немесе charset) немесе XML декларациясының кодтау атрибуты ретінде. Бұл автордың нақты файлды қандай кодтаумен сақтауға ниеттенгені. файлда байт ретінің белгісі ретінде. Бұл автордың редакторы файлды қандай кодтаумен сақтағаны. Кездейсоқ кодтау түрлендірілісі болмаса (бір кодта ашып, басқа кодта сақтау арқылы), бұл дұрыс болады. Дегенмен, ол тек UTF-8 немесе UTF-16 сияқты Юникод кодтамаларында ғана қолжетімді.

Жабдықтар мен бағдарламалық қамтамасыз етудің болмауы

Көне аппараттық құралдар көбінесе тек бір таңбалар жиынтығын қолдау үшін жасалған, және таңбалар жиынтығын өзгерту мүмкін емес. Дисплейдің бағдарламалық құралындағы таңбалар кестесі құрылғы сатылатын елге сәйкес таңбаларды қамтиды, және кесте әдетте елден елге өзгереді. Сондықтан, мұндай жүйелер басқа елде жасалған мәтінді жүктегенде моджибаке көрсетуі мүмкін. Сонымен қатар, көптеген ерте операциялық жүйелер бірнеше кодтау форматтарын қолдамайды, демек, егер стандартты емес мәтінді көрсетуге тырысса, моджибаке пайда болады. Мысалы, Microsoft Windows және Palm OS-тің алғашқы нұсқалары ел бойынша локалдастырылған және тек локалдастырылған нұсқа сатылатын елге қатысты кодтау стандарттарын қолдайды, ал егер операциялық жүйенің қолдауына арналған нұсқасынан өзге кодтау форматында мәтін бар файл ашылса, моджибаке көрсетіледі.

Қаулылар

UTF-8 кодтамасын әдепкі кодтама ретінде пайдаланатын бағдарламалар, оның кеңінен қолданылуы және US ASCII-мен кері үйлесімділігінің арқасында өзара іс-қимылдың жоғары деңгейіне қол жеткізе алады. UTF-8 сондай-ақ қарапайым алгоритм арқылы тікелей анықталу мүмкіндігіне ие, сондықтан жақсы жазылған бағдарламалық жасақтама UTF-8-ді басқа кодтамалармен шатастырудан сақтануы керек. Моджибеке мәселесін шешудің қиындығы, оның пайда болған бағдарламасына және себептеріне байланысты өзгереді. Моджибеке ең көп кездесетін екі бағдарлама – веб-браузерлер мен мәтін өңдеушілер. Заманауи браузерлер мен мәтін өңдеушілер әртүрлі таңба кодтамаларын қолдайды. Браузерлер көбінесе пайдаланушыға көрсету қозғалтқышының кодтамасын өзгертуге мүмкіндік береді, ал мәтін өңдеушілер файлды ашқанда тиісті кодтаманы таңдауға рұқсат етеді. Пайдаланушылар дұрыс кодтаманы табу үшін әртүрлі әрекеттер жасауы мүмкін. Мәселе, әдетте, Unicode емес компьютерлік ойындар сияқты кең ауқымдағы таңба кодтамаларын қолдамайтын бағдарламаларда туындайды. Мұндай жағдайда пайдаланушы операциялық жүйенің кодтамасын ойынның кодтамасына сәйкес өзгертуі керек. Алайда, жүйелік кодтаманы өзгерту бұрынғы бағдарламаларда моджибекеге әкелуі мүмкін. Windows XP немесе одан кейінгі нұсқаларында пайдаланушы Microsoft AppLocale қолданбасын пайдалана алады, ол әр бағдарламаның жергілікті параметрлерін өзгертуге мүмкіндік береді. Дегенмен, Windows 98 сияқты ескі операциялық жүйелерде жүйелік кодтаманы өзгерту мүмкін емес; бұл мәселені шешу үшін пайдаланушы үшінші тараптың қаріптерді көрсету бағдарламаларын қолдануы керек.

Ағылшынша

Моджибаке ағылшын мәтіндерінде көбінесе пунктуациялық белгілерде кездеседі, мысалы, em тирелер (—), en тирелер (–) және иісті тырнақшалар (“,”,‘,’), бірақ әріптік мәтінде сирек, өйткені көптеген кодтаулар ASCII-мен ағылшын алфавитінің кодтауында келіседі. Мысалы, фунт белгісі £ жіберуші UTF-8 ретінде кодтаса, ал алушы оны Батыс Еуропалық кодтамалардың бірі ретінде (CP1252 немесе ISO 8859-1) түсінсе, онда £ символы бұрмаланып көрінеді. Сол сияқты, оң жаққа бағытталған бірлік тырнақшасы (’), UTF-8-де кодталғанда және Windows 1252 арқылы декодталғанда, ’, ’, ’ және т.б. сияқты түрленулерге ұшырайды. Кейбір компьютерлер бұрынғы заманда өндірушіге тән кодтауларды қолданды, бұл ағылшын мәтіні үшін де үйлесімсіздікке әкелді. Commodore 8-биттік компьютерлері PETSCII кодтауын пайдаланды, ол стандартты ASCII-ге қарағанда әріптерді кері аударумен ерекшеленді. PETSCII принтерлері сол дәуірдегі басқа компьютерлерде жақсы жұмыс істеді, бірақ барлық әріптердің регистрін өзгертіп жіберді. IBM мейнфреймдері ASCII-ге мүлдем сәйкес келмейтін EBCDIC кодтауын қолданады.

Орталық және Шығыс Еуропа

Орталық және Шығыс Еуропа тілдерін пайдаланушылар да зардап шегуі мүмкін. 1980 жылдардың ортасы мен соңында көптеген компьютерлер желіге қосылмағандықтан, әр тіл үшін әртүрлі символдар кодтамасы болды, әсіресе әдеби белгілері бар тілдерде (ISO/IEC 8859 және KOI 8 қараңыз), және бұл кодтамалар көбінесе операциялық жүйеге қарай өзгеріп отырды.

Венгрия тілі

Венгр тілінде бұл құбылыс betűszemét деп аталады, яғни "әріп қоқысы" дегенді білдіреді. Венгр тілі ерекше сезімтал, себебі ол á, é, í, ó, ú, ö, ü (барлығы Latin 1 таңбалар жиынтығында кездеседі) әріптерін, сондай-ақ Latin 1-де жоқ ő және ű әріптерін қамтиды. Бұл екі әріп Latin 2, Windows 1250 және Unicode жүйелерінде дұрыс кодталады. Алайда, Unicode электрондық пошта бағдарламаларында кеңінен қолданылғанға дейін, венгр мәтіні бар электрондық хаттардағы ő және ű әріптері жиі бұрмаланып, кейде тану мүмкін болмайтын жағдайға жететін. Бұрмаланған электрондық хатқа венгр тілінде қолданылатын барлық дауысты әріптерді қамтитын "Árvíztűrő tükörfúrógép" (сөзбе-сөз "Су тасқынына төзімді айна бұрғылайтын машина") деген мағынасыз фразамен жауап беру кең таралған.

Мысалдар

Венгриялық мысал Көлемі кодтамасы Мақсатты кодтамасы Нәтижесі Кездесуі ÁRVÍZTŰRŐ TÜKÖRFÚRÓGÉPárvíztűrő tükörfúrógép UTF-8 Цитатасы басылатын 7 биттік ASCII =C3=81RV=C3=8DZT=C5=B0R=C5=90 T=C3=9CK=C3=96RF=C3=9AR=C3=93G=C3=89P =C3=A1rv=C3=ADzt=C5=B1r=C5=91 t=C3=BCk=C3=B6rf=C3=BAr=C3=B3g=C3=A9p Көбінесе дұрыс конфигурацияланбаған пошта серверлерінен туындайды, бірақ кейбір ұялы телефондардағы SMS хабарламаларында да кездесуі мүмкін. ISO 8859-2 Цитатасы басылатын =C1RV=CDZT=DBR=D5 T=DCK=D6RF=DAR=D3G=C9P=E1rv=EDzt=FBr=F5 t=FCk=F6rf=FAr=F3g=E9p CWI 2 CP 437 ÅRVìZTÿRº TÜKÖRFùRòGÉPárvíztûrô tükörfúrógép CWI 2 кодтамасы венгр мәтіні қабылдаушы құрылғы әдепкі кодтамалардың бірін (CP 437 немесе CP 850) қолданса да, оқылымды қалпында сақтау үшін жасалған. Бұл кодтау 1980 жылдардың басында және 1990 жылдардың басында кеңінен қолданылған, бірақ қазіргі уақытта толығымен ескірген. CP 852 ╡RV╓ZTδRè TÜKÖRFΘRαGÉPárvízt√rï tükörfúrógép DOS дәуірінде кең таралған, себебі мәтін көбінесе 852 ("Орталық Еуропалық") кодты бетін пайдаланып кодталған, бірақ қабылдаушы бағдарламалық жасақтама көбінесе CP 852 қолдау көрсетпеді және оның орнына CP 437 немесе CP 850 арқылы мәтінді көрсетуге тырысты. Кіші әріптер көбінесе дұрыс, ű және ő әріптерінен басқа. Ü/ü және Ö/ö әріптері дұрыс, себебі CP 437 және CP 850 неміс тілімен үйлесімді болды. Бұл қазір сирек кездеседі, бірақ оны рецепттер мен чектер сияқты жерлерде кездестіруге болады. CP 850 ÁRVÍZTÙRè TÜKÖRFÚRÓGÉPárvízt¹rï tükörfúrógép Windows 1250 µRVÖZTëRŠ TšKTMRFéRŕG P rvˇztűr‹ tk"rfŁr˘g‚p Екі кодтау да Орталық Еуропалық, бірақ мәтін DOS кодтаумен кодталған және Windows кодтаумен декодталған. ű әрпінің қолданылуы дұрыс. Mac Roman µRV÷ZTÎRä TöKôRFÈR‡GêP†rv°zt˚rã tÅkîrf£r¢gÇp DOS дәуірінде де жиі кездесетін, Apple компьютерлері DOS немесе Windows машиналарын пайдаланып жіберілген венгр мәтінін көрсетуге тырысқанда, олар көбінесе Apple-дің жеке кодтамасына ауысатын. Windows 1250 ¡RVÕZT€R’ T‹K÷RF⁄R”G P·rvÌzt˚rı t¸kˆrf˙rÛgÈp CP 852 ┴RV═ZT█RŇ T▄KÍRF┌RËG╔PßrvÝztűr§ tŘk÷rf˙rˇgÚp Екі кодтау да Орталық Еуропалық, бірақ мәтін Windows кодтаумен кодталған және DOS кодтаумен декодталған. ű әрпінің қолданылуы дұрыс. Windows 1252 ÁRVÍZTÛRÕ TÜKÖRFÚRÓGÉPárvíztûrõ tükörfúrógép Әдепкі Батыс Еуропалық Windows кодтамасы Орталық Еуропалық кодтаманың орнына қолданылады. Тек ő Ő (õ Õ) және ű Ű (û Û) әріптері бұрыс, ал мәтін толығымен оқылады. Бұл қазіргі уақыттағы ең көп таралған қателік; білімсіздіктің салдарынан, ол веб-беттерде немесе тіпті баспа құралдарында жиі кездеседі. UTF-8 à RVà ZTŰRÅ TÜKÖRFÚRÃ"GÉPárvÃztűrÅ‘ tükörfúrógép Көбінесе дұрыс конфигурацияланбаған немесе халықаралық пайдалану үшін сынақтан өтпеген веб-сервистер немесе веб-пошта клиенттерінен туындайды (себебі проблема ағылшын мәтіндері үшін жасырын қалады). Бұл жағдайда нақты (көбінесе құрылған) мазмұн UTF-8-де болады, бірақ кейбір ескі бағдарламалық жасақтамаларда UTF-8 HTML-бастықтарында нақты көрсетілмесе, жергілікті кодтаулар әдепкі болып қалуы мүмкін. Mac Roman √ÅRV√çZT≈∞R≈ê T√úK√ñRF√öR√ìG√âP√°rv√≠zt≈±r≈ë t√ºk√∂rf√∫r√≥g√©p

Польша тілі

1987 жылы ISO 8859 2 стандарты құрылғанға дейін, әртүрлі есептеу платформаларын пайдаланушылар Amiga-да AmigaPL, Atari ST-де Atari Club, ал IBM PC-де Masovia, IBM CP852, Mazovia және Windows CP1250 сияқты өздерінің таңба кодтамаларын қолданды. Ерте DOS компьютерлерін сатушы поляк компаниялары поляк әріптерін кодтаудың өзара үйлесімсіз әдістерін жасады және бейнекарталардың EPROM-ін (әдетте CGA, EGA немесе Hercules) қайта бағдарламалады, осылайша поляк тіліне қажетті глифтері бар жабдық кодтамаларын жасады – олардың орналасуы басқа компьютер сатушылары қалай орналастырғанына еш қатысы жоқ, кездейсоқ болды. Жағдай академиялық және пайдаланушылар тобының қысымынан кейін ISO 8859 2 стандартының "Интернет стандарты" ретінде қабылдануымен жақсара бастады, бірақ бұл стандарт негізгі өндірушілердің бағдарламалық қамтамасымен шектеулі қолдауға ие болды (қазіргі таңда осы стандарт негізінен Unicode-пен алмастырылды). Кодтамалардың көптеген түрлілігінен туындаған мәселелердің салдарынан, бүгінгі күнге дейін кейбір пайдаланушылар поляк диакритикалық таңбаларын "krzaczki" (әдеби мағынасында "кішкентай бұталар") деп атайды.

Югославия тілдері

Хорват, босния, серб (серб-хорват тілінің бөлініп шыққан түрлері) және словен тілдері латын әліпбиіне š, đ, č, ć, ž әріптерін және олардың үлкен әріптері Š, Đ, Č, Ć, Ž (словен тілінде тек č / Č, š / Š және ž / Ž; ресми түрде, басқалары қажет болған кезде, көбінесе шетелдік атауларда да қолданылады) қосады. Бұл әріптердің барлығы Latin 2 және Windows 1250 кодировкасында анықталған, ал тек кейбіреулері (š, Š, ž, Ž, Đ) әдеттегі Windows 1252 операциялық жүйесінде бар, себебі олар басқа тілдерге байланысты пайда болған. Моджибаке осы таңбалардың кез келгенінде пайда болуы мүмкін болса да, Windows 1252-ге кірмейтін әріптер қателерге көбірек ұшырайды. Сондықтан, тіпті қазіргі күні де "šđčćž ŠĐČĆŽ" көбінесе "šðèæž ŠÐÈÆŽ" деп көрсетіледі, бірақ ð, È және Æ славян тілдерінде қолданылмайды. Негізгі ASCII кодировкасына (мысалы, пайдаланушы атында) шектелген жағдайда, жиі қолданылатын алмастырулар: š→s, đ→dj, č→c, ć→c, ž→z (үлкен әріптер үшін де сәйкес, яғни Đ→Dj немесе Đ→DJ сөздің грамматикалық түріне байланысты). Бұл алмастырулардың барлығы түсініксіздіктер тудырады, сондықтан түпнұсқаны осындай нысаннан қайта құру қажет болған жағдайда көбінесе қолмен жасалады. Windows 1252 кодировкасы маңызды, өйткені Windows операциялық жүйесінің ағылшын тіліндегі нұсқалары жергілікті емес, ең көп таралған. Бұған себептердің бірі – салыстырмалы түрде шағын және бөлшектенген нарық, жоғары сапалы локализацияның бағасын арттыру, бағдарламалық жасақтаманың пираттығының жоғары деңгейі (өз кезегінде бағдарламалық жасақтаманың табысқа қарағанда жоғары бағасы), бұл локализация жұмыстарын тежейді, сондай-ақ адамдар Windows және басқа бағдарламалық жасақтаманың ағылшын тіліндегі нұсқаларын артық көреді. Хорват тілін серб тілінен, босния тілін хорват тілінен, серб тілінен, ал қазір тіпті черногория тілін басқа үш тілден ажырату көптеген қиындықтар туғызады. Әр түрлі стандарттар мен әр түрлі сапалы көптеген локализациялар бар. Ағылшын тілінен шыққан компьютерлік терминологияның көп бөлігі үшін жалпы аудармалар жоқ. Соңында, адамдар ағылшын тілінен алынған сөздерді ("компьютер" үшін "компьютер", "компиляция" үшін "компиляция" және т.б.) қолданады, ал егер олар аударма терминдеріне үйренбесе, онда мәзірдегі кейбір опциялардың аударма сөз тіркесінің негізінде не істеу керектігін түсінбеуі мүмкін. Сондықтан ағылшын тілін түсінетін адамдар, сондай-ақ ағылшын терминологиясына үйренгендер (бұл көпшілік, өйткені ағылшын терминологиясы осы проблемалардың салдарынан мектептерде көбінесе оқытылады) арнайы емес бағдарламалық жасақтаманың ағылшын тіліндегі түпнұсқа нұсқаларын үнемі таңдайды. Кириллица қолданғанда (македония және ішінара серб тілінде) бұл проблема басқа кириллицаға негізделген жазуларға ұқсас. Ағылшын Windows-тың жаңа нұсқалары код бетін өзгертуге мүмкіндік береді (ескі нұсқалар осы қолдаумен арнайы ағылшын нұсқаларын қажет етеді), бірақ бұл параметр дұрыс емес және жиі дұрыс орнатылмайды. Мысалы, Windows 98 және Windows Me-ді ең көп оңнан солға емес, бір байтты кодты беттерге, соның ішінде 1250-ге орнатуға болады, бірақ тек орнату кезінде ғана.

Кавказ тілдері

Кейбір Кавказ аймағының тілдерінің жазу жүйелері, оның ішінде грузин және армян жазулары, моджибаке тудыруы мүмкін. Бұл мәселе әсіресе Армян әліпбиіне арналған ескірген таңба кодтамалары жиынтығы – ArmSCII немесе ARMSCII жағдайында өте айқын. ArmSCII компьютер индустриясы тарапынан қолдаудың жетіспеуіне байланысты кеңінен қолданылмайды. Мысалы, Microsoft Windows оны қолдамайды.

Азия кодтамалары

Моджибактың тағы бір түрі – бір байттық кодтамада кодталған мәтін, Шығыс Азия тілдерінің кодтамалары сияқты көп байттық кодтамада қате талданғанда пайда болады. Осы типтегі моджибакеде бірден бірнеше (әдетте екі) символ бұзылады. Мысалы, егер швед сөзі kärlek Windows 1252-де кодталған болса, ал GBK арқылы декодталғанда, ол "k鋜lek" болып көрінеді, мұнда "är" символы "鋜" деп талданды. Жоғарыдағы моджибакемен салыстырғанда, оқылуы қиын, себебі проблемалық å, ä немесе ö әріптерімен байланысы жоқ әріптер жоғалып кетеді, және әсіресе å, ä немесе ö әріптерімен басталатын қысқа сөздер үшін қиындық тудырады (мысалы, "än" сөзі "鋘" болып өзгереді). Екі әріп біріктірілгендіктен, моджибаке көбірек кездейсоқ сипатта болады (сирек кездесетін үлкен әріптерді есептемегенде, әдеттегі үш нұсқамен салыстырғанда 50-ден астам нұсқасы бар). Сирек жағдайларда, "Bush hid the facts" сияқты нақты сөз ұзындығының үлгісін қамтитын бүкіл мәтіндік тізбек қате түсіндірілуі мүмкін.

Индия мәтіні

Осыған ұқсас әсер Оңтүстік Азияның брахми немесе индик жазуларында, инду-арий немесе индик тілдерінде, мысалы, хинди-урду, бенгал, пәнджәби, маратхи және басқаларда кездесуі мүмкін, тіпті қолданба қолданылған әріптер жиынтығын дұрыс таныса да. Себебі, көптеген индик жазуларында жеке әріптердің белгілері буынды білдіретін белгілерді құру үшін қалай біріктірілетінін тиісті бағдарламалық жасақтамасы жоқ компьютер дұрыс түсінбейді, тіпті әлдемелердің пішіндері болса да. Мысалы, «Википедия» логотипінің ескі нұсқасы «wi» буынына сәйкес келетін деванагари әрпін көрсетуге тырысқан, бірақ оның орнына «wa» әрпін және жұпталмаған «i» дауысты модификаторын көрсеткен. Бұл индик мәтінін көрсетуге қалыптастырылмаған компьютер жасаған моджибаке ретінде оңай анықталады. 2010 жылы жаңартылған логотип бұл қателерді жойды. «Жай мәтін» тұжырымы операциялық жүйенің Unicode кодтарын көрсету үшін шрифттерді ұсынуын қажет етеді. Сингала тілі үшін бұл шрифттер операциялық жүйелерде әртүрлі болады және барлық операциялық жүйелерде кейбір әріптерге (буындарға) орфографиялық дұрыс емес пішіндерді жасайды. Мысалы, «reph» – «r» әрпінің қысқартылған түрі, ол әдетте қарапайым әріптің үстіне қойылатын диакритикалық белгі. Алайда, белгілі бір контексттерде «я» немесе «ла» сияқты әріптердің үстіне қою дұрыс емес. Санскрит сөздері немесе қазіргі тілдерге мұра болып келген атаулар үшін, мысалы, कार्य, IAST: kārya, немесе आर्या, IAST: āryā, оларды осы әріптердің үстіне қою орынды. Керісінше, қазіргі тілдердегі ұқсас дыбыстар, олардың ерекше ережелерінен туындаса, онда олардың үстіне қойылмайды, мысалы, маратхи тіліндегі करणाऱ्या, IAST: karaṇāryā сөзі, жиі қолданылатын करणारा/री, IAST: karaṇārā/rī сөзінің түбір пішіні. Бірақ мұндай жағдай көптеген операциялық жүйелерде кездеседі. Бұл шрифттердің ішкі бағдарламалауындағы қате болуы мүмкін. Mac OS және iOS жүйелерінде қара «l» (muurdhaja l) және «u» әрпінің комбинациясы, сондай-ақ оның созылған түрі дұрыс емес пішінде шығады. Лао тілі сияқты кейбір индик және индикке туыс жазулар Windows XP жүйесінде Vista нұсқасы шыққанға дейін ресми түрде қолдау алмады. Алайда, әртүрлі сайттарда шрифттерді тегін жүктеуге болады.

Бірман тілінде

Батыс санкциялары мен компьютерлерде мьянма тіліне қолдаудың кешіккендігіне байланысты, Zawgyi шрифтінде мьянма жазуының кейбір кодтық нүктелері Unicode стандартында көрсетілгендей іске асырылды, ал қалғандары жоқ. Unicode консорциумы мұны «ad hoc» қаріптер кодтамасы деп атайды. Ұялы телефондардың пайда болуымен, Samsung және Huawei сияқты ұялы телефон өндірушілер Unicode стандартына сәйкес келетін жүйелік қаріптерді Zawgyi нұсқаларымен алмастырды. Мьянма үкіметі 2019 жылдың 1 қазаны күнін Unicode-ке ресми көшу үшін «U күні» деп жариялады.

Африка тілдері

Африканың кейбір жазу жүйелерінде кодталмаған мәтінді оқуға болмайды. Моджибаке пайда болатын мәтіндерге Африка мүйісіндегі мәтіндер жатады, мысалы, Эфиопия мен Эритреяда қолданылатын геиз жазуы (амхар, тигр және басқа тілдер үшін), сондай-ақ Османья әліпбиін пайдаланатын сомали тілі. Оңтүстік Африкада Малави тілдерін жазу үшін Мвангвего әліпбиі қолданылады, ал Конго Демократиялық Республикасы үшін Мандомбе әліпбиі жасалған, бірақ олар көбінесе қолдау көрсетілмейді. Батыс Африкаға тән басқа да жазу жүйелері де ұқсас мәселелер тудырады, мысалы, Гвинеяда мандинг тілдерінде қолданылатын Н'Ко әліпбиі және Либерияда қолданылатын Вай әліпбиі.

Араб тілі

Тағы бір зардап шеккен тіл – араб тілі (төменде қараңыз), онда кодтамалар сай келмесе мәтін толығымен оқылмай қалады.