Нормализация текста: приведение к единому каноническому виду.
Text normalization
Нормализация текста: приведение к единому формату для обработки и хранения. Устранение неоднозначности чисел, дат, аббревиатур. Важно для синтеза речи.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Процесс приведения текста к единой канонической форме.
Process of transforming text into a single canonical form
Нормализация текста — это процесс преобразования текста в единую каноническую форму, которой он изначально мог не иметь. Нормализация текста перед хранением или обработкой обеспечивает разделение задач, поскольку гарантируется, что входные данные будут согласованы до выполнения каких-либо операций. Нормализация текста требует понимания типа текста, который необходимо нормализовать, и того, как он будет обрабатываться в дальнейшем; не существует универсальной процедуры нормализации.
Text normalization is the process of transforming text into a single canonical form that it might not have had before. Normalizing text before storing or processing it allows for separation of concerns, since input is guaranteed to be consistent before operations are performed on it. Text normalization requires being aware of what type of text is to be normalized and how it is to be processed afterwards; there is no all purpose normalization procedure.
Приложения
Нормализация текста часто используется при преобразовании текста в речь. Числа, даты, акронимы и сокращения — это нестандартные "слова", которые необходимо произносить по-разному в зависимости от контекста. Например:
Text normalization is frequently used when converting text to speech. Numbers, dates, acronyms, and abbreviations are non standard "words" that need to be pronounced differently depending on context. For example:
"$200" будет произноситься как "two hundred dollars" на английском языке, но как "lua selau tālā" на самоанском. "vi" может быть произнесено как "vie", "vee" или "шестой" в зависимости от окружающих слов. Текст также может быть нормализован для хранения и поиска в базе данных. Например, если при поиске "resume" требуется найти и слово "résumé", то текст будет нормализован путем удаления диакритических знаков; а если "john" должно совпадать с "John", текст будет приведен к единому регистру. Для подготовки текста к поиску он также может быть подвергнут стеммингу (например, преобразование слов "flew" и "flying" в "fly"), канонизации (например, последовательное использование американского или британского английского написания) или удалению стоп-слов.
"$200" would be pronounced as "two hundred dollars" in English, but as "lua selau tālā" in Samoan. "vi" could be pronounced as "vie," "vee," or "the sixth" depending on the surrounding words. Text can also be normalized for storing and searching in a database. For instance, if a search for "resume" is to match the word "résumé," then the text would be normalized by removing diacritical marks; and if "john" is to match "John", the text would be converted to a single case. To prepare text for searching, it might also be stemmed (e. g. converting "flew" and "flying" both into "fly"), canonicalized (e. g. consistently using American or British English spelling), or have stop words removed.
Техника
Для простой нормализации, не зависящей от контекста, такой как удаление неалфавитно-цифровых символов или диакритических знаков, будет достаточно регулярных выражений. Например, скрипт sed `sed -e "s/\s+/ /g" inputfile` нормализует последовательности пробельных символов до одного пробела. Более сложная нормализация требует соответственно более сложных алгоритмов, включая знание предметной области языка и используемой лексики. Нормализация текста рассматривалась также как задача токенизации и разметки текстовых потоков, а также как частный случай машинного перевода.
For simple, context independent normalization, such as removing non alphanumeric characters or diacritical marks, regular expressions would suffice. For example, the sed script sed ‑e "s/\s+/ /g" inputfile would normalize runs of whitespace characters into a single space. More complex normalization requires correspondingly complicated algorithms, including domain knowledge of the language and vocabulary being normalized. Among other approaches, text normalization has been modeled as a problem of tokenizing and tagging streams of text and as a special case of machine translation.
Текстовая стипендия
В области текстологии и редактирования исторических текстов термин "нормализация" подразумевает определенную степень модернизации и стандартизации – например, расшифровку сокращений, используемых писцами, и транслитерацию устаревших знаков, обычно встречающихся в рукописях и ранних печатных источниках. Нормализованное издание, таким образом, отличается от дипломатического (или полудипломатического) издания, в котором делается попытка сохранить эти особенности. Цель состоит в том, чтобы найти умеренный баланс между, с одной стороны, строгим соответствием исходному тексту (включая, например, сохранение загадочных и неоднозначных элементов), а с другой – созданием нового текста, понятного и доступного современному читателю. Степень нормализации, следовательно, определяется редактором и может быть различной. Некоторые редакторы, например, предпочитают модернизировать устаревшую орфографию и пунктуацию, в то время как другие этого не делают.
In the field of textual scholarship and the editing of historic texts, the term "normalization" implies a degree of modernization and standardization – for example in the extension of scribal abbreviations and the transliteration of the archaic glyphs typically found in manuscript and early printed sources. A normalized edition is therefore distinguished from a diplomatic edition (or semi diplomatic edition), in which some attempt is made to preserve these features. The aim is to strike an appropriate balance between, on the one hand, rigorous fidelity to the source text (including, for example, the preservation of enigmatic and ambiguous elements); and, on the other, producing a new text that will be comprehensible and accessible to the modern reader. The extent of normalization is therefore at the discretion of the editor, and will vary. Some editors, for example, choose to modernize archaic spellings and punctuation, but others do not.