Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Кіріспе
Жоқтайтын деректерді сығымдау схемасы
Lossless data compression scheme
Ақпарат теориясында энтропиялық кодтау (немесе энтропиялық шифрлау) – Шеннонның кодтау теоремасымен белгіленген төменгі шекке жақындауға тырысатын кез келген жоқтайтын деректерді сығымдау әдісі. Бұл теоремаға сәйкес, кез келген жоқтайтын деректерді сығымдау әдісінің күтілетін код ұзындығы дерек көзінің энтропиясынан үлкен немесе оған тең болуы керек. Нақтырақ айтқанда, кодтау теоремасы бойынша, кез келген дерек көзінің үлестірімі үшін күтілетін код ұзындығы , мұндағы – код сөзіндегі символдар саны, – кодтау функциясы, – шығыс кодтарын жасау үшін қолданылатын символдар саны және – дерек көзі символының ықтималдығы. Энтропиялық кодтау осы төменгі шекке жақындауға бағытталған. Энтропиялық кодтаудың ең көп қолданылатын екі әдісі – Хаффман кодтауы және арифметикалық кодтау. Егер дерек ағынының шамамен энтропиялық сипаттамалары алдын ала белгілі болса (әсіресе сигналды сығымдау үшін), қарапайым статикалық кодтар тиімді болуы мүмкін. Бұл статикалық кодтарға әмбебап кодтар (мысалы, Элиас гамма кодтауы немесе Фибоначчи кодтауы) және Голомб кодтары (мысалы, унитарлық кодтау немесе Райс кодтауы) жатады. 2014 жылдан бері деректерді сығымдайтын бағдарламалар энтропиялық кодтау әдістерінің асимметриялық сандық жүйелері отбасын қолдана бастады, бұл арифметикалық кодтаудың сығымдау коэффициентін Хаффман кодтауына ұқсас өңдеу шығындарымен үйлестіруге мүмкіндік береді.
In information theory, an entropy coding (or entropy encoding) is any lossless data compression method that attempts to approach the lower bound declared by Shannon's source coding theorem, which states that any lossless data compression method must have an expected code length greater than or equal to the entropy of the source. More precisely, the source coding theorem states that for any source distribution, the expected code length satisfies , where is the number of symbols in a code word, is the coding function, is the number of symbols used to make output codes and is the probability of the source symbol. An entropy coding attempts to approach this lower bound. Two of the most common entropy coding techniques are Huffman coding and arithmetic coding. If the approximate entropy characteristics of a data stream are known in advance (especially for signal compression), a simpler static code may be useful. These static codes include universal codes (such as Elias gamma coding or Fibonacci coding) and Golomb codes (such as unary coding or Rice coding). Since 2014, data compressors have started using the asymmetric numeral systems family of entropy coding techniques, which allows combination of the compression ratio of arithmetic coding with a processing cost similar to Huffman coding.
Энтропия ұқсастықтың өлшемі ретінде
Энтропиялық кодтауды цифрлық деректерді сығыстыру әдісі ретінде қолданудан бөлек, энтропиялық кодтаушы деректер ағыны мен бұрыннан белгілі деректер кластары арасындағы ұқсастықты анықтау үшін де қолданылуы мүмкін. Бұл әрбір дерек класы үшін энтропиялық кодтаушы/компрессор жасау арқылы іске асырылады; белгісіз деректерді әр компрессорға сығылмаған күйінде жіберіп, қайсысы жоғары сығымдау нәтижесін беретінін бағалау арқылы жіктеу жүргізіледі. Ең жақсы сығымдауды қамтамасыз ететін кодтаушы, әдетте, белгісіз деректерге ең ұқсас деректерге оқытылған кодтаушы болады.
Besides using entropy coding as a way to compress digital data, an entropy encoder can also be used to measure the amount of similarity between streams of data and already existing classes of data. This is done by generating an entropy coder/compressor for each class of data; unknown data is then classified by feeding the uncompressed data to each compressor and seeing which compressor yields the highest compression. The coder with the best compression is probably the coder trained on the data that was most similar to the unknown data.