Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
1961 жылы американдық ағылшын тілінің деректер жинағы
Data set of American English in 1961
Браун университетінің қазіргі заманғы американдық ағылшын тілінің стандартты корпусы, көбінесе жай ғана Браун корпусы деп аталады, американдық ағылшын тілінің мәтін үлгілерінің электрондық жинағы және әртүрлі жанрларды қамтитын алғашқы маңызды құрылымдалған корпус. Бұл корпус күнделікті тілде қолданылатын сөздердің категорияларының жиілігі мен таралуын ғылыми тұрғыдан зерттеуге жаңа стандарт қойды. Генри Кучера және В. Нельсон Френсис Браун университетінде (Род-Айленд штаты) жинаған бұл жалпы тілдік корпусқа ағылшын тілінің 500 үлгісі кіреді, олардың жалпы көлемі шамамен бір миллион сөзді құрайды және 1961 жылы АҚШ-та жарық көрген еңбектерден құрастырылған.
The Brown University Standard Corpus of Present Day American English, better known as simply the Brown Corpus, is an electronic collection of text samples of American English, the first major structured corpus of varied genres. This corpus first set the bar for the scientific study of the frequency and distribution of word categories in everyday language use. Compiled by Henry Kučera and W. Nelson Francis at Brown University, in Rhode Island, it is a general language corpus containing 500 samples of English, totaling roughly one million words, compiled from works published in the United States in 1961.
Тарих
1967 жылы Кучера мен Фрэнсис «Қазіргі американдық ағылшын тілінің есептеулік талдауы» атты классикалық еңбегін жариялады, ол қазіргі кезде жай ғана Браун корпусы деп аталатын негізгі статистикалық мәліметтерді ұсынды. Браун корпусы – бұл әртүрлі көздерден алынған шамамен бір миллион сөзден тұратын, қазіргі американдық ағылшын тілінің мұқият жинақталған жиынтығы. Кучера мен Фрэнсис оны түрлі есептеулік талдауларға салып, лингвистика, психология, статистика және социология элементтерін біріктіретін бай және алуан түрлі еңбектер жинағын жасады. Ол есептеу лингвистикасында кеңінен қолданылып келеді және көп жылдар бойы саладағы ең көп сілтеме жасалған ресурстардың бірі болды. Бірінші лексикостатистикалық талдау жарияланғаннан кейін көп ұзамай Бостондық баспагер Хоутон Миффлин Кучераға жаңа American Heritage сөздігі үшін миллион сөзді, үш жолды цитаталық базаны ұсынуды сұрады. Бұл жаңа сөздік 1969 жылы алғаш рет жарық көрді және сөздердің жиілігі мен басқа да ақпараттар үшін корпус лингвистикасын қолдану арқылы құрастырылған алғашқы сөздік болды. Бастапқы Браун корпусында тек сөздер және олардың орналасқан жерін анықтайтын белгілер болды. Келесі бірнеше жыл ішінде сөздердің сөз түрлеріне қатысты белгілер қосылды. Грин мен Рубиннің сөз түрлерін белгілеу бағдарламасы (сөз түрлерін белгілеу туралы қараңыз) осыған үлкен көмек көрсетті, бірақ қателік деңгейі жоғары болғандықтан, кең көлемді қолмен түзету қажет болды. Белгіленген Браун корпусы шамамен 80 сөз түрін, сондай-ақ күрделі сөздер, қысқартулар, шет тілдерінен алынған сөздер және басқа да кейбір құбылыстарды көрсететін арнайы белгілерді қолданды және Ланкастер-Осло-Берген корпусы (1990 жылдардың басындағы британдық ағылшын тілі) және Фрайбург Браун корпусы (FROWN) (1990 жылдардың басындағы американдық ағылшын тілі) сияқты көптеген келешек корпустар үшін үлгі болды. Корпусты белгілеу Эндрю Макки бағдарламалаған және ағылшын грамматикасы туралы кітаптарда сипатталған, анағұрлым күрделі статистикалық талдау жүргізуге мүмкіндік берді. Бір қызықты нәтиже – тіпті үлкен үлгілерде де сөздерді жиілігінің азаю ретімен кестеге түсіргенде гипербола пайда болады: ең көп кездесетін n-ші сөздің жиілігі шамамен 1/n-ге пропорционал. Осылайша, «the» сөзі Браун корпусының шамамен 7%-ын құрайды, «to» және «of» – тағы 3%-тан астам; ал шамамен 50 000 сөзден тұратын жалпы лексиканың жартысы hapax legomena – корпуста бір рет ғана кездесетін сөздер. Бұл қарапайым дәрежеге қарсы жиілік қатынасын Джордж Кингсли Зипф көптеген құбылыстар үшін атап өтті (мысалы, оның «Тіл психобиологиясы» еңбегін қараңыз) және ол Зипф заңы ретінде белгілі. Браун корпусы корпус лингвистикасы саласын дамытуға бастама бергенімен, қазіргі кездегі типтік корпустар (мысалы, Қазіргі заманғы американдық ағылшын тілі корпусы, британдық ұлттық корпусы немесе ағылшын тілінің халықаралық корпусы) 100 миллион сөзден тұрады және одан да үлкен болады.
In 1967, Kučera and Francis published their classic work, entitled "Computational Analysis of Present Day American English", which provided basic statistics on what is known today simply as the Brown Corpus. The Brown Corpus was a carefully compiled selection of current American English, totalling about a million words drawn from a wide variety of sources. Kučera and Francis subjected it to a variety of computational analyses, from which they compiled a rich and variegated opus, combining elements of linguistics, psychology, statistics, and sociology. It has been very widely used in computational linguistics, and was for many years among the most cited resources in the field. Shortly after publication of the first lexicostatistical analysis, Boston publisher Houghton Mifflin approached Kučera to supply a million word, three line citation base for its new American Heritage Dictionary. This ground breaking new dictionary, which first appeared in 1969, was the first dictionary to be compiled using corpus linguistics for word frequency and other information. The initial Brown Corpus had only the words themselves, plus a location identifier for each. Over the following several years part of speech tags were applied. The Greene and Rubin tagging program (see under part of speech tagging) helped considerably in this, but the high error rate meant that extensive manual proofreading was required. The tagged Brown Corpus used a selection of about 80 parts of speech, as well as special indicators for compound forms, contractions, foreign words and a few other phenomena, and formed the model for many later corpora such as the Lancaster Oslo Bergen Corpus (British English from the early 1990s) and the Freiburg Brown Corpus of American English (FROWN) (American English from the early 1990s). Tagging the corpus enabled far more sophisticated statistical analysis, such as the work programmed by Andrew Mackie, and documented in books on English grammar. One interesting result is that even for quite large samples, graphing words in order of decreasing frequency of occurrence shows a hyperbola: the frequency of the n th most frequent word is roughly proportional to 1/n. Thus "the" constitutes nearly 7% of the Brown Corpus, "to" and "of" more than another 3% each; while about half the total vocabulary of about 50,000 words are hapax legomena: words that occur only once in the corpus. This simple rank vs. frequency relationship was noted for an extraordinary variety of phenomena by George Kingsley Zipf (for example, see his The Psychobiology of Language), and is known as Zipf's law. Although the Brown Corpus pioneered the field of corpus linguistics, by now typical corpora (such as the Corpus of Contemporary American English, the British National Corpus or the International Corpus of English) tend to be much larger, on the order of 100 million words.
Пайдаланылған сөйлеу тегтері
TagDefinitionCC координациялық шылау (және, немесе)CD негізгі сан (бір, екі, 2, т.б.)CS бағынышты шылау (егер, бірақ)EX экзистенциалдық "there"IN предлог (in, at, on)JJ сын есімJJA сын есім + көмекші сөзJJC сын есім, салыстырмалыJJC сын есім + шылауJJS семантикалық жоғарғы дәрежелі сын есім (бас, ең жоғарғы)JJF сын есім + әйелдік атауJJM сын есім + еркектік атауNN дара немесе жиын есімNNA есім + көмекші сөзNNC есім + шылауNNS көпше есімNNP жеке есім немесе есім тіркесінің бөлігіNNPC жеке есім + шылауPRP жеке жалғау, дараPRPS жеке жалғау, көпшеPRP$ иеленуші жалғауRB үстеуRBR салыстырмалы үстеуRBS жоғарғы дәрежелі үстеуVB етістік, бастапқы формаVBA етістік + көмекші сөз, дара, қазіргі уақытVBD етістік, өткен уақытVBG етістік, қазіргі уақыттағы есімше/герундийVBN етістік, өткен уақыттағы есімшеVBZ етістік, үшінші жақ, дара, қазіргі уақытFW шетелдік сөздерSYM СимволдарPUN Барлық тыныс белгілері
TagDefinitionCC coordinating conjunction (and, or)CD cardinal numeral (one, two, 2, etc. )CS subordinating conjunction (if, although)EX existential thereIN preposition (in, at, on)JJ adjectiveJJA adjective + AuxiliaryJJC adjective, ComparativeJJCC Adjective + ConjunctionJJS semantically superlative adjective (chief, top)JJF Adjective + FemaleJJM Adjective + MaleNN singular or mass nounNNA Noun + AuxiliaryNNC Noun + ConjunctionNNS plural nounNNP proper noun or part of name phraseNNPC proper noun + ConjunctionPRP personal pronoun, singularPRPS personal pronoun, pluralPRP$ Possessive pronoun RB adverbRBR comparative adverbRBS superlative adverbVB verb, base formVBA verb + Auxiliary, singular, presentVBD verb, past tenseVBG verb, present participle/gerundVBN verb, past participleVBZ verb, 3rd. singular presentFW Foreign WordsSYM Symbols PUN All Punctuations