Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
Корпус Кентербери – это коллекция файлов, предназначенная для использования в качестве эталона при тестировании алгоритмов сжатия данных без потерь. Он был создан в 1997 году в Университете Кентербери (Новая Зеландия) и разработан для замены корпуса Калгари. Файлы были отобраны исходя из их способности обеспечивать репрезентативные результаты производительности.
The Canterbury corpus is a collection of files intended for use as a benchmark for testing lossless data compression algorithms. It was created in 1997 at the University of Canterbury, New Zealand and designed to replace the Calgary corpus. The files were selected based on their ability to provide representative performance results.
Содержание
В наиболее часто используемой форме корпус состоит из 11 файлов, отобранных как "типичные" документы из 11 классов документов, общей сложностью 2 810 784 байта, согласно следующей таблице. Размер (байты) Имя файла Описание 152 089 alice29.txt Английский текст 125 179 asyoulik.txt Шекспир 24 603 cp.html HTML-код 11 150 fields.c Исходный код C 3 721 grammar.lsp Исходный код LISP 1 029 744 kennedy.xls Таблица Excel 426 754 lcet10.txt Техническая документация 481 861 plrabn12.txt Поэзия ("Потерянный рай") 513 216 ptt5 Набор тестов CCITT 38 240 sum Исполняемый файл SPARC 4 227 xargs.1 Страница руководства GNU
In its most commonly used form, the corpus consists of 11 files, selected as "average" documents from 11 classes of documents, totaling 2,810,784 bytes as follows. Size (bytes) File name Description 152,089 alice29. txt English text 125,179 asyoulik. txt Shakespeare 24,603 cp. html HTML source 11,150 fields. c C source 3,721 grammar. lsp LISP source 1,029,744 kennedy. xls Excel spreadsheet 426,754 lcet10. txt Technical writing 481,861 plrabn12. txt Poetry (Paradise Lost) 513,216 ptt5 CCITT test set 38,240 sum SPARC executable 4,227 xargs.1 GNU manual page
Университет Кентербери также предлагает следующие корпуса. Дополнительные файлы могут быть добавлены, поэтому результаты следует представлять только для отдельных файлов. Искусственный корпус – набор файлов с высоко "искусственными" данными, предназначенными для выявления патологического или наихудшего поведения. Последнее обновление – 2000 год (временная метка tar). Большой корпус – набор больших файлов (размером в мегабайты). Содержит геном E. coli, Библию короля Иакова и справочник по фактам о мире ЦРУ. Последнее обновление – 1997 год (временная метка tar). Разнообразный корпус. Содержит миллион знаков числа пи. Последнее обновление – 2000 год (временная метка tar).
The University of Canterbury also offers the following corpora. Additional files may be added, so results should be only reported for individual files. The Artificial Corpus, a set of files with highly "artificial" data designed to evoke pathological or worst case behavior. Last updated 2000 (tar timestamp). The Large Corpus, a set of large (megabyte size) files. Contains an E. coli genome, a King James bible, and the CIA world fact book. Last updated 1997 (tar timestamp). The Miscellaneous Corpus. Contains one million digits of pi. Last updated 2000 (tar timestamp).