Введение
Набор данных американского английского языка 1961 года. Стандартный корпус современного американского английского языка Браунского университета, более известный как просто Брауновский корпус, – это электронная коллекция текстовых образцов американского английского языка, первый крупный структурированный корпус, включающий разнообразные жанры. Этот корпус впервые задал стандарт для научного изучения частоты и распределения категорий слов в повседневном использовании языка. Составленный Генри Кучерой и У. Нельсоном Фрэнсисом в Браунском университете, в штате Род-Айленд, это общий языковой корпус, содержащий 500 текстовых фрагментов на английском языке, общей численностью около одного миллиона слов, собранных из произведений, опубликованных в Соединенных Штатах в 1961 году.
The Brown University Standard Corpus of Present Day American English, better known as simply the Brown Corpus, is an electronic collection of text samples of American English, the first major structured corpus of varied genres. This corpus first set the bar for the scientific study of the frequency and distribution of word categories in everyday language use. Compiled by Henry Kučera and W. Nelson Francis at Brown University, in Rhode Island, it is a general language corpus containing 500 samples of English, totaling roughly one million words, compiled from works published in the United States in 1961.
История
В 1967 году Кучера и Фрэнсис опубликовали свою классическую работу под названием «Вычислительный анализ современного американского английского языка», в которой были представлены основные статистические данные о том, что сегодня известно просто как Брауновский корпус. Брауновский корпус представлял собой тщательно составленную подборку текстов современного американского английского языка, насчитывающую около миллиона слов, взятых из самых разных источников. Кучера и Фрэнсис подвергли его различным вычислительным анализам, на основе которых создали обширное и многогранное исследование, объединяющее элементы лингвистики, психологии, статистики и социологии. Он получил широкое распространение в вычислительной лингвистике и на протяжении многих лет оставался одним из наиболее цитируемых ресурсов в этой области. Вскоре после публикации первого лексикостатистического анализа бостонское издательство Хоутон Миффлин обратилось к Кучере с просьбой предоставить миллион слов, оформленных в виде трехстрочной цитатной базы, для своего нового словаря American Heritage. Этот новаторский словарь, впервые опубликованный в 1969 году, стал первым словарем, составленным с использованием корпусной лингвистики для определения частоты слов и другой информации. Изначально Брауновский корпус содержал только сами слова, а также идентификатор их местоположения в тексте. В течение последующих нескольких лет к словам были добавлены части речи. Программа разметки Грина и Рубина (см. раздел «Разметка частей речи») значительно облегчила эту задачу, однако высокий процент ошибок потребовал проведения обширной ручной вычитки. В размеченном Брауновском корпусе использовался набор из примерно 80 частей речи, а также специальные маркеры для составных форм, сокращений, иностранных слов и некоторых других явлений. Он послужил моделью для многих последующих корпусов, таких как Ланкастер-Осло-Бергенский корпус (британский английский начала 1990-х годов) и Фрайбургский корпус американского английского (FROWN) (американский английский начала 1990-х годов). Разметка корпуса позволила проводить гораздо более сложный статистический анализ, например, работы, разработанные Эндрю Макки, и описанные в книгах по английской грамматике. Один из интересных результатов заключается в том, что даже для достаточно больших выборок графическое представление слов в порядке убывания частоты встречаемости демонстрирует гиперболу: частота n-го по частоте слова приблизительно пропорциональна 1/n. Таким образом, слово «the» составляет почти 7% Брауновского корпуса, «to» и «of» – более 3% каждое, в то время как около половины общего словарного запаса, насчитывающего около 50 000 слов, составляют hapax legomena – слова, которые встречаются в корпусе только один раз. Эта простая зависимость между рангом и частотой была отмечена Джорджем Кингсли Зипфом для широкого спектра явлений (например, см. его книгу «Психобиология языка») и известна как закон Зипфа. Хотя Брауновский корпус стал пионерским в области корпусной лингвистики, современные типичные корпуса (такие как Корпус современного американского английского языка, Британский национальный корпус или Международный корпус английского языка) обычно намного больше – порядка 100 миллионов слов.
Используемые теги части речи
TagDefinitionCC координирующий союз (и, или)CD числительное (один, два, 2 и т.д.)CS подчинительный союз (если, хотя)EX экзистенциальное "there"IN предлог (в, на, у)JJ прилагательноеJJA прилагательное + вспомогательный глаголJJC сравнительное прилагательноеJJCC прилагательное + союзJJS превосходное прилагательное (главный, высший)JJF прилагательное + женский родJJM прилагательное + мужской родNN существительное в единственном или неисчисляемом видеNNA существительное + вспомогательный глаголNNC существительное + союзNNS существительное во множественном числеNNP имя собственное или часть именной группыNNPC имя собственное + союзPRP личное местоимение, единственное числоPRPS личное местоимение, множественное числоPRP$ притяжательное местоимениеRB наречиеRBR сравнительное наречиеRBS превосходное наречиеVB глагол, начальная формаVBA глагол + вспомогательный глагол, единственное число, настоящее времяVBD глагол, прошедшее времяVBG глагол, причастие настоящего времени / герундийVBN глагол, причастие прошедшего времениVBZ глагол, 3-е лицо единственного числа, настоящее времяFW иноязычные словаSYM символыPUN вся пунктуация