Введение

Американский национальный корпус (ANC) – это текстовый корпус американского английского языка, содержащий 22 миллиона слов письменных и устных данных, созданных после 1990 года. В настоящее время АНК включает в себя широкий спектр жанров, в том числе новые, такие как электронная почта, твиты и веб-данные, которые не представлены в более ранних корпусах, таких как Британский национальный корпус. Корпус аннотирован по частям речи и леммам, с проведением поверхностного синтаксического анализа и выделением именованных сущностей. ANC доступен через Консорциум лингвистических данных. Подмножество корпуса объемом 15 миллионов слов, называемое Открытым американским национальным корпусом (OANC), свободно доступно для использования без каких-либо ограничений на веб-сайте ANC. Корпус и его аннотации предоставляются в соответствии со спецификациями Linguistic Annotation Framework ISO/TC 37 SC4. С помощью свободно распространяемого инструмента транскрипции (ANC2Go) корпус и выбранные пользователем аннотации предоставляются в различных форматах, включая формат CoNLL IOB, формат XML, соответствующий стандарту кодирования корпусов XML (XCES) (совместимый с поисковой системой XAIRA Британского национального корпуса), формат, соответствующий требованиям UIMA, и форматы, подходящие для ввода в широкий спектр программного обеспечения для создания конкордансов. Также доступны плагины для импорта аннотаций в General Architecture for Text Engineering (GATE). ANC отличается от других корпусов английского языка богатой аннотацией, включающей различные типы аннотаций по частям речи (теги Penn, теги CLAWS5 и CLAWS7), аннотации поверхностного синтаксического анализа и аннотации для нескольких типов именованных сущностей. Дополнительные аннотации добавляются ко всему корпусу или его частям по мере их появления, часто благодаря вкладу других проектов. В отличие от онлайн-корпусов, доступ к которым из-за ограничений авторского права ограничен отдельными предложениями, весь ANC доступен для исследований, например, для разработки статистических языковых моделей и проведения полной лингвистической аннотации текста. Аннотации ANC генерируются автоматически и не проходят валидацию. Подмножество корпуса объемом 500 000 слов, называемое Рукотворно аннотированным подкорпусом (MASC), аннотировано примерно по 20 различным типам лингвистических аннотаций, все из которых были проверены или созданы вручную. К ним относятся синтаксическая аннотация Penn Treebank, аннотация семантических значений WordNet, аннотации семантических фреймов FrameNet и другие. Как и OANC, MASC свободно доступен для любого использования и может быть загружен с сайта ANC или из Консорциума лингвистических данных. Он также распространяется в форме, помеченной по частям речи, вместе с Natural Language Toolkit. ANC и его подкорпуса отличаются от аналогичных корпусов, прежде всего, широким спектром предоставляемых лингвистических аннотаций и включением современных жанров, отсутствующих в таких ресурсах, как Британский национальный корпус. Кроме того, поскольку первоначальной целью создания корпусов была разработка статистических языковых моделей, полные данные и все аннотации доступны, в отличие от Corpus of Contemporary American English (COCA), доступ к которому осуществляется выборочно через веб-браузер. Дальнейший рост OANC и MASC зависит от вклада данных и аннотаций со стороны сообществ вычислительной и корпусной лингвистики.