Введение

MIME-совместимая схема сжатия Unicode Binary Ordered Compression for Unicode (BOCU) является MIME-совместимой схемой сжатия Unicode. BOCU 1 сочетает в себе широкую применимость UTF-8 с компактностью Standard Compression Scheme for Unicode (SCSU). Эта кодировка Unicode разработана для сжатия коротких строк и сохраняет порядок кодовых точек. BOCU 1 специфицирован в технической заметке Unicode. Для сравнения, SCSU был принят в качестве стандартной схемы сжатия Unicode с соотношением байт на кодовую точку, аналогичным языкоспецифичным кодовым страницам. SCSU не получил широкого распространения, поскольку он не подходит для MIME-типов носителей "text". Например, SCSU нельзя использовать напрямую в электронных письмах и подобных протоколах. SCSU требует сложной конструкции кодировщика для достижения хорошей производительности. Как правило, zip, bzip2 и другие стандартные алгоритмы более эффективно сжимают большие объемы текста Unicode. И SCSU, и BOCU 1 являются зарегистрированными в IANA наборами символов.

Патент

До 16 ноября 2022 года общий алгоритм BOCU был защищен патентом США № 6 737 994, в котором также упоминается конкретная реализация BOCU 1. Срок действия этого патента истек. IBM, которая в момент создания BOCU 1 была работодателем обоих его изобретателей, заявила в технической заметке Unicode, что для реализации "полностью соответствующей версии BOCU 1" необходимо было обратиться в IBM для получения безвозмездной лицензии. BOCU 1 – единственная схема сжатия Unicode, описанная на веб-сайте Unicode, которая, насколько известно, была обременена ограничениями в отношении интеллектуальной собственности. В отличие от этого, IBM также подала заявку на патент на UTF EBCDIC, но в этом случае предпочла сделать документацию и схему кодирования "свободно доступными для всех, кто заинтересован в включении формата преобразования в стандарты UCS", вместо того, чтобы требовать от разработчиков получения лицензии.