Введение

Корпус Кентербери – это коллекция файлов, предназначенная для использования в качестве эталона при тестировании алгоритмов сжатия данных без потерь. Он был создан в 1997 году в Университете Кентербери (Новая Зеландия) и разработан для замены корпуса Калгари. Файлы были отобраны исходя из их способности обеспечивать репрезентативные результаты производительности.

Содержание

В наиболее часто используемой форме корпус состоит из 11 файлов, отобранных как "типичные" документы из 11 классов документов, общей сложностью 2 810 784 байта, согласно следующей таблице. Размер (байты) Имя файла Описание 152 089 alice29.txt Английский текст 125 179 asyoulik.txt Шекспир 24 603 cp.html HTML-код 11 150 fields.c Исходный код C 3 721 grammar.lsp Исходный код LISP 1 029 744 kennedy.xls Таблица Excel 426 754 lcet10.txt Техническая документация 481 861 plrabn12.txt Поэзия ("Потерянный рай") 513 216 ptt5 Набор тестов CCITT 38 240 sum Исполняемый файл SPARC 4 227 xargs.1 Страница руководства GNU

Университет Кентербери также предлагает следующие корпуса. Дополнительные файлы могут быть добавлены, поэтому результаты следует представлять только для отдельных файлов. Искусственный корпус – набор файлов с высоко "искусственными" данными, предназначенными для выявления патологического или наихудшего поведения. Последнее обновление – 2000 год (временная метка tar). Большой корпус – набор больших файлов (размером в мегабайты). Содержит геном E. coli, Библию короля Иакова и справочник по фактам о мире ЦРУ. Последнее обновление – 1997 год (временная метка tar). Разнообразный корпус. Содержит миллион знаков числа пи. Последнее обновление – 2000 год (временная метка tar).