Введение

Набор данных американского английского языка 1961 года. Стандартный корпус современного американского английского языка Браунского университета, более известный как просто Брауновский корпус, – это электронная коллекция текстовых образцов американского английского языка, первый крупный структурированный корпус, включающий разнообразные жанры. Этот корпус впервые задал стандарт для научного изучения частоты и распределения категорий слов в повседневном использовании языка. Составленный Генри Кучерой и У. Нельсоном Фрэнсисом в Браунском университете, в штате Род-Айленд, это общий языковой корпус, содержащий 500 текстовых фрагментов на английском языке, общей численностью около одного миллиона слов, собранных из произведений, опубликованных в Соединенных Штатах в 1961 году.

История

В 1967 году Кучера и Фрэнсис опубликовали свою классическую работу под названием «Вычислительный анализ современного американского английского языка», в которой были представлены основные статистические данные о том, что сегодня известно просто как Брауновский корпус. Брауновский корпус представлял собой тщательно составленную подборку текстов современного американского английского языка, насчитывающую около миллиона слов, взятых из самых разных источников. Кучера и Фрэнсис подвергли его различным вычислительным анализам, на основе которых создали обширное и многогранное исследование, объединяющее элементы лингвистики, психологии, статистики и социологии. Он получил широкое распространение в вычислительной лингвистике и на протяжении многих лет оставался одним из наиболее цитируемых ресурсов в этой области. Вскоре после публикации первого лексикостатистического анализа бостонское издательство Хоутон Миффлин обратилось к Кучере с просьбой предоставить миллион слов, оформленных в виде трехстрочной цитатной базы, для своего нового словаря American Heritage. Этот новаторский словарь, впервые опубликованный в 1969 году, стал первым словарем, составленным с использованием корпусной лингвистики для определения частоты слов и другой информации. Изначально Брауновский корпус содержал только сами слова, а также идентификатор их местоположения в тексте. В течение последующих нескольких лет к словам были добавлены части речи. Программа разметки Грина и Рубина (см. раздел «Разметка частей речи») значительно облегчила эту задачу, однако высокий процент ошибок потребовал проведения обширной ручной вычитки. В размеченном Брауновском корпусе использовался набор из примерно 80 частей речи, а также специальные маркеры для составных форм, сокращений, иностранных слов и некоторых других явлений. Он послужил моделью для многих последующих корпусов, таких как Ланкастер-Осло-Бергенский корпус (британский английский начала 1990-х годов) и Фрайбургский корпус американского английского (FROWN) (американский английский начала 1990-х годов). Разметка корпуса позволила проводить гораздо более сложный статистический анализ, например, работы, разработанные Эндрю Макки, и описанные в книгах по английской грамматике. Один из интересных результатов заключается в том, что даже для достаточно больших выборок графическое представление слов в порядке убывания частоты встречаемости демонстрирует гиперболу: частота n-го по частоте слова приблизительно пропорциональна 1/n. Таким образом, слово «the» составляет почти 7% Брауновского корпуса, «to» и «of» – более 3% каждое, в то время как около половины общего словарного запаса, насчитывающего около 50 000 слов, составляют hapax legomena – слова, которые встречаются в корпусе только один раз. Эта простая зависимость между рангом и частотой была отмечена Джорджем Кингсли Зипфом для широкого спектра явлений (например, см. его книгу «Психобиология языка») и известна как закон Зипфа. Хотя Брауновский корпус стал пионерским в области корпусной лингвистики, современные типичные корпуса (такие как Корпус современного американского английского языка, Британский национальный корпус или Международный корпус английского языка) обычно намного больше – порядка 100 миллионов слов.

Используемые теги части речи

TagDefinitionCC координирующий союз (и, или)CD числительное (один, два, 2 и т.д.)CS подчинительный союз (если, хотя)EX экзистенциальное "there"IN предлог (в, на, у)JJ прилагательноеJJA прилагательное + вспомогательный глаголJJC сравнительное прилагательноеJJCC прилагательное + союзJJS превосходное прилагательное (главный, высший)JJF прилагательное + женский родJJM прилагательное + мужской родNN существительное в единственном или неисчисляемом видеNNA существительное + вспомогательный глаголNNC существительное + союзNNS существительное во множественном числеNNP имя собственное или часть именной группыNNPC имя собственное + союзPRP личное местоимение, единственное числоPRPS личное местоимение, множественное числоPRP$ притяжательное местоимениеRB наречиеRBR сравнительное наречиеRBS превосходное наречиеVB глагол, начальная формаVBA глагол + вспомогательный глагол, единственное число, настоящее времяVBD глагол, прошедшее времяVBG глагол, причастие настоящего времени / герундийVBN глагол, причастие прошедшего времениVBZ глагол, 3-е лицо единственного числа, настоящее времяFW иноязычные словаSYM символыPUN вся пунктуация