Введение

В отношении японского языка и компьютеров возникает множество проблем адаптации, некоторые из которых уникальны для японского языка, а другие характерны для языков с очень большим количеством символов. Количество символов, необходимых для письма на английском языке, относительно невелико, поэтому для кодирования каждого английского символа можно использовать всего один байт (2⁸ = 256 возможных значений). Однако количество символов в японском языке значительно превышает 256, и поэтому его нельзя закодировать одним байтом. Таким образом, японский язык кодируется с использованием двух или более байтов, в так называемой "двухбайтовой" или "многобайтовой" кодировке. Возникающие проблемы связаны с транслитерацией, романизацией, кодировкой символов и вводом японского текста.

Ввод текста

В письменной японской письменности используется несколько различных систем письма: кандзи (китайские иероглифы), 2 набора кана (фонетические слоговые азбуки) и латинские буквы. В то время как кана и латинские буквы можно вводить непосредственно в компьютер, ввод кандзи – более сложный процесс, поскольку количество кандзи значительно превышает количество клавиш на большинстве клавиатур. Для ввода кандзи на современных компьютерах обычно сначала вводится чтение кандзи, затем редактор метода ввода (IME), также иногда называемый фронтендом, показывает список кандидатов кандзи, фонетически соответствующих вводу, и позволяет пользователю выбрать нужный иероглиф. Более продвинутые IME работают не по словам, а по фразам, что повышает вероятность появления желаемого символа в качестве первого предложенного варианта. Ввод чтения кандзи может осуществляться либо через романизацию (rōmaji nyūryoku), либо через прямой ввод кана (kana nyūryoku). Ромадзи-ввод более распространен на ПК и других полноразмерных клавиатурах (хотя прямой ввод также широко поддерживается), в то время как прямой ввод кана обычно используется на мобильных телефонах и подобных устройствах – каждая из 10 цифр (1–9, 0) соответствует одному из 10 столбцов в таблице годзюон кана, а многократное нажатие выбирает строку. Существует две основные системы романизации японского языка, известные как Кунрэй-сики и Хэпбёрн; на практике «клавиатурный ромадзи» (также известный как вапуро ромадзи или «ромадзи текстового процессора») обычно допускает свободное сочетание обеих систем. Реализации IME могут даже обрабатывать клавиши для букв, не используемых ни в одной из схем романизации, например, L, преобразуя их в наиболее подходящий эквивалент. При вводе кана каждая клавиша на клавиатуре напрямую соответствует одному символу кана. Клавиатура JIS является национальным стандартом, но существуют альтернативы, такие как клавиатура с переключением большим пальцем, обычно используемая профессиональными набирающими тексты.

Направление текста

Японский язык можно записывать в двух направлениях. Стиль ёкогаки пишет слева направо, сверху вниз, как и английский язык. Стиль татегаки пишет сначала сверху вниз, а затем справа налево. Чтобы конкурировать с Ichitaro, Microsoft выпустила несколько обновлений для ранних японских версий Microsoft Word, включая поддержку вертикального текста, например, Word 5.0 Power Up Kit и Word 98. QuarkXPress был самым популярным программным обеспечением для верстки (DTP) в Японии в 1990-х годах, несмотря на длительный цикл разработки. Однако из-за отсутствия поддержки вертикального текста, он был превзойден Adobe InDesign, который обеспечивал сильную поддержку вертикального текста благодаря нескольким обновлениям. В настоящее время обработка вертикального текста остаётся неполной. Например, HTML не поддерживает татегаки, и японским пользователям приходится использовать таблицы HTML для его имитации. Однако в CSS уровня 3 предусмотрено свойство "writing-mode", которое позволяет отображать татегаки при значении "vertical-rl" (то есть сверху вниз, справа налево). Текстовые процессоры и программы для верстки (DTP) обеспечивают более полную поддержку этой функции.