Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Кіріспе
Кентербери корпусы – жоғалтусыз деректерді сығыстыру алгоритмдерін сынауға арналған файлдар жиынтығы, ол өлшемдеме ретінде қолданылады. Ол 1997 жылы Жаңа Зеландиядағы Кентербери университетінде құрылған және Калгари корпусын алмастыру мақсатында жасалған. Файлдар өкілді нәтижелерді қамтамасыз ету мүмкіндігіне сәйкес таңдалды.
The Canterbury corpus is a collection of files intended for use as a benchmark for testing lossless data compression algorithms. It was created in 1997 at the University of Canterbury, New Zealand and designed to replace the Calgary corpus. The files were selected based on their ability to provide representative performance results.
Мазмұны
Ең көп қолданылатын түрінде корпус 11 файлдан тұрады, олар 11 түрдегі құжаттардан "орташа" құжаттар ретінде таңдалған, жалпы көлемі 2,810,784 байтқа жетеді. Көлемі (байт) Файл атауы Сипаттамасы 152,089 alice29.txt Ағылшын мәтіні 125,179 asyoulik.txt Шекспир 24,603 cp.html HTML коды 11,150 fields.c C тілінің коды 3,721 grammar.lsp LISP тілінің коды 1,029,744 kennedy.xls Excel кестесі 426,754 lcet10.txt Техникалық жазу 481,861 plrabn12.txt Өлең (Жұмақтың жоғалғаны) 513,216 ptt5 CCITT сынақ жинағы 38,240 sum SPARC орындалатын файлы 4,227 xargs.1 GNU нұсқаулық беті Кентербери университеті келесі корпус түрлерін ұсынады. Қосымша файлдар қосылуы мүмкін, сондықтан нәтижелер тек жеке файлдар бойынша берілуі керек. Жасанды корпус – патологиялық немесе ең нашар жағдайдағы мінез-құлықты тудыруға арналған, жоғары дәрежеде "жасанды" деректер жиынтығы. Соңғы жаңарту 2000 жыл (tar уақыт белгісі). Үлкен корпус – үлкен (мегабайт көлеміндегі) файлдар жиынтығы. Оған E. coli бактериясының геномы, король Джеймс Киелі кітабы және ЦРУ-ның әлемдік фактілер кітабы кіреді. Соңғы жаңарту 1997 жыл (tar уақыт белгісі). Әртүрлі корпус. Онда пи санының бір миллион цифры бар. Соңғы жаңарту 2000 жыл (tar уақыт белгісі).
In its most commonly used form, the corpus consists of 11 files, selected as "average" documents from 11 classes of documents, totaling 2,810,784 bytes as follows. Size (bytes) File name Description 152,089 alice29. txt English text 125,179 asyoulik. txt Shakespeare 24,603 cp. html HTML source 11,150 fields. c C source 3,721 grammar. lsp LISP source 1,029,744 kennedy. xls Excel spreadsheet 426,754 lcet10. txt Technical writing 481,861 plrabn12. txt Poetry (Paradise Lost) 513,216 ptt5 CCITT test set 38,240 sum SPARC executable 4,227 xargs.1 GNU manual page
The University of Canterbury also offers the following corpora. Additional files may be added, so results should be only reported for individual files. The Artificial Corpus, a set of files with highly "artificial" data designed to evoke pathological or worst case behavior. Last updated 2000 (tar timestamp). The Large Corpus, a set of large (megabyte size) files. Contains an E. coli genome, a King James bible, and the CIA world fact book. Last updated 1997 (tar timestamp). The Miscellaneous Corpus. Contains one million digits of pi. Last updated 2000 (tar timestamp).