Кіріспе

Жоқтайтын деректерді сығымдау схемасы

Ақпарат теориясында энтропиялық кодтау (немесе энтропиялық шифрлау) – Шеннонның кодтау теоремасымен белгіленген төменгі шекке жақындауға тырысатын кез келген жоқтайтын деректерді сығымдау әдісі. Бұл теоремаға сәйкес, кез келген жоқтайтын деректерді сығымдау әдісінің күтілетін код ұзындығы дерек көзінің энтропиясынан үлкен немесе оған тең болуы керек. Нақтырақ айтқанда, кодтау теоремасы бойынша, кез келген дерек көзінің үлестірімі үшін күтілетін код ұзындығы , мұндағы – код сөзіндегі символдар саны, – кодтау функциясы, – шығыс кодтарын жасау үшін қолданылатын символдар саны және – дерек көзі символының ықтималдығы. Энтропиялық кодтау осы төменгі шекке жақындауға бағытталған. Энтропиялық кодтаудың ең көп қолданылатын екі әдісі – Хаффман кодтауы және арифметикалық кодтау. Егер дерек ағынының шамамен энтропиялық сипаттамалары алдын ала белгілі болса (әсіресе сигналды сығымдау үшін), қарапайым статикалық кодтар тиімді болуы мүмкін. Бұл статикалық кодтарға әмбебап кодтар (мысалы, Элиас гамма кодтауы немесе Фибоначчи кодтауы) және Голомб кодтары (мысалы, унитарлық кодтау немесе Райс кодтауы) жатады. 2014 жылдан бері деректерді сығымдайтын бағдарламалар энтропиялық кодтау әдістерінің асимметриялық сандық жүйелері отбасын қолдана бастады, бұл арифметикалық кодтаудың сығымдау коэффициентін Хаффман кодтауына ұқсас өңдеу шығындарымен үйлестіруге мүмкіндік береді.

Энтропия ұқсастықтың өлшемі ретінде

Энтропиялық кодтауды цифрлық деректерді сығыстыру әдісі ретінде қолданудан бөлек, энтропиялық кодтаушы деректер ағыны мен бұрыннан белгілі деректер кластары арасындағы ұқсастықты анықтау үшін де қолданылуы мүмкін. Бұл әрбір дерек класы үшін энтропиялық кодтаушы/компрессор жасау арқылы іске асырылады; белгісіз деректерді әр компрессорға сығылмаған күйінде жіберіп, қайсысы жоғары сығымдау нәтижесін беретінін бағалау арқылы жіктеу жүргізіледі. Ең жақсы сығымдауды қамтамасыз ететін кодтаушы, әдетте, белгісіз деректерге ең ұқсас деректерге оқытылған кодтаушы болады.