Юникодты қысудың BOCU схемасы және оның ерекшеліктері
Binary Ordered Compression for Unicode
BOCU: Unicode деректерін қысудың тиімді әдісі. UTF-8 үйлесімді, SCSU-дан ықпалданып, қысқа тізбектерді ұтымды қысады. Unicode техникалық ескертпесінде сипатталған.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Кіріспе
MIME үйлесімді Unicode қысу схемасы
MIME compatible Unicode compression scheme
Unicode үшін екілік реттелген қысу (BOCU) – MIME үйлесімді Unicode қысу схемасы. BOCU 1 UTF-8-дің кең қолданылу мүмкіндігін және Unicode үшін стандартты қысу схемасының (SCSU) ықшамдылығын біріктіреді. Бұл Unicode кодтамасы қысқа тізбектерді қысу үшін пайдалы және кодтық нүктенің ретін сақтайды. BOCU 1 Unicode техникалық ескертуінде сипатталған. Алыстатыру үшін SCSU стандартты Unicode қысу схемасы ретінде қабылданды, оның байт/кодтық нүкте қатынасы тілге қатысты кодты беттерге ұқсас. SCSU кеңінен қолданылмады, себебі ол MIME "мәтін" медиа түрлеріне жарамсыз. Мысалы, SCSU электрондық поштада және басқа ұқсас протоколдарда тікелей қолданыла алмайды. SCSU жақсы өнімділік үшін күрделі кодтау дизайнын қажет етеді. Көбінесе zip, bzip2 және басқа да өнеркәсіптік стандартты алгоритмдер Unicode мәтінінің үлкен көлемін тиімдірек қысады. SCSU және BOCU 1 екеуі де IANA тіркелген символ жиынтығы болып табылады.
Binary Ordered Compression for Unicode (BOCU) is a MIME compatible Unicode compression scheme. BOCU 1 combines the wide applicability of UTF 8 with the compactness of Standard Compression Scheme for Unicode (SCSU). This Unicode encoding is designed to be useful for compressing short strings, and maintains code point order. BOCU 1 is specified in a Unicode Technical Note. For comparison SCSU was adopted as standard Unicode compression scheme with a byte/code point ratio similar to language specific code pages. SCSU has not been widely adopted, as it is not suitable for MIME "text" media types. For example, SCSU cannot be used directly in emails and similar protocols. SCSU requires a complicated encoder design for good performance. Usually, the zip, bzip2, and other industry standard algorithms compact larger amounts of Unicode text more efficiently. Both SCSU and BOCU 1 are IANA registered charsets.
Патент
2022 жылдың 16 қарашасына дейін жалпы BOCU алгоритмі АҚШ-тың #6,737,994 патентімен қорғалған, онда BOCU 1 нақты іске асырылуы да көрсетілген. Бұл патенттің мерзімі өткен. Ол жасалған кезде BOCU 1-дің екі ойлап табушысын да жұмысқа алған IBM компаниясы, Unicode техникалық хабарламасында "BOCU 1 толыққанды нұсқасын" іске асырушылардың роялтисіз лицензия алу үшін IBM-ға жүгінуі керек екенін мәлімдеді. BOCU 1 – Unicode веб-сайтында сипатталған және интеллектуалдық меншік құқығымен шектелген жалғыз Unicode сығуы схемасы. Ал, керісінше, IBM UTF EBCDIC патентін де тіркеген, бірақ бұл жағдайда құжаттама мен кодтау схемасын "өзгерту форматын UCS стандарттарының бір бөлігі ретінде жасауға ниетті кез келген адамға тегін қолжетімді етуді" жөн көрді, іске асырушылардан лицензия талап етудің орнына.
Prior to 16 November 2022, the general BOCU algorithm was covered by United States Patent #6,737,994, which also mentions the specific BOCU 1 implementation. This patent has now expired. IBM, which employed both of the inventors of BOCU 1 at the time it was created, stated in the Unicode Technical Note that implementers of a "fully compliant version of BOCU 1" had to contact IBM to request a royalty free license. BOCU 1 is the only Unicode compression scheme described on the Unicode Web site that is known to have been encumbered with intellectual property restrictions. By contrast, IBM also filed for a patent on UTF EBCDIC, but it chose in that case to make the documentation and encoding scheme "freely available to anyone concerned towards making the transformation format as part of the UCS standards", instead of requiring implementers to request a license.