Введение

Деванагари — индийское письмо, используемое для многих индоарийских языков Северной Индии и Непала, включая хинди, маратхи и непальский, которое применялось для записи классического санскрита. Существует несколько схожих методов транслитерации из деванагари в латинский алфавит (процесс, иногда называемый романизацией), включая влиятельную и не теряющую информацию систему IAST. Романизированное деванагари также называют романагари.

IAST (внутренний)

Международный алфавит транслитерации санскрита (IAST) является подмножеством стандарта ISO 15919, используемого для транслитерации санскрита, пракрита и пали на римский шрифт с диакритическими знаками. IAST – широко используемый стандарт. Он использует диакритические знаки для устранения неоднозначности между фонетически похожими, но не идентичными санскритскими символами. Например, зубные и ретрофлексные согласные различаются с помощью точки под символом: зубные द = d и ретрофлексные ड = ḍ. Важная особенность IAST заключается в том, что он позволяет осуществлять обратную транслитерацию без потери информации, то есть транслитерацию IAST можно однозначно преобразовать обратно в корректный деванагари или другие письмена Южной Азии. Многие шрифты Unicode полностью поддерживают отображение и печать символов IAST.

Охотничьи системы

Хантерская система – это "национальная система романизации в Индии", официально принятая правительством Индии. Система Хантера была разработана в XIX веке Уильямом Уилсоном Хантером, занимавшим тогда должность генерального геодезиста Индии. При её предложении она сразу же встретила сопротивление со стороны сторонников ранее использовавшегося несистематического и часто искажающего "метода сэра Роджера Даулера" (раннее искажение имени Сирадж уд-Даула) фонетической транскрипции, что вылилось в драматическое противостояние на заседании Индийского совета 28 мая 1872 года, где новый метод Хантера одержал победу. Метод Хантера был изначально проще и мог быть применен к нескольким индийским письменностям, поскольку он систематизировал транслитерацию графем, и в итоге получил распространение и признание как в правительственных, так и в академических кругах. Со временем сфера применения метода Хантера расширилась и охватила ряд индийских письменностей, включая бирманскую и тибетскую. Также были предусмотрены правила удаления шва в индоарийских языках, где это уместно: например, хинди कानपुर транслитерируется как kānpur (а не kānapura), а санскритский क्रम – как krama (а не kram). Система претерпела некоторую эволюцию. Например, в первоначальной версии долгота гласных обозначалась диакритическим знаком ударения, но позднее, в обновлении правительства Индии 1954 года, он был заменен макроном. Таким образом, जान (жизнь) ранее романизировалось как ján, а затем стало романизироваться как jān. Система Хантера на протяжении многих лет подвергалась критике за неточность фонетической передачи и за то, что она "бесстыдно ориентирована на англоязычную аудиторию".

Национальная библиотека в Калькутте

Национальная библиотека в Калькутте, система романизации, предназначенная для всех индийских письменностей, является расширением IAST. Она отличается от IAST использованием символов ē и ō для ए и ओ (е и о используются для кратких гласных, присутствующих во многих индийских языках), использованием 'ḷ' для согласного ಳ (в каннада) и отсутствием символов для ॠ, ऌ и ॡ.

ISO 15919 (вводится в действие с 1 января 2014)

Стандартная система транслитерации, применительно не только к деванагари, но и ко всем южноазиатским языкам, была кодифицирована в стандарте ISO 15919 в 2001 году, обеспечив основу для современных цифровых библиотек, соответствующих нормам Международной организации по стандартизации (ISO). ISO 15919 определяет общую основу Unicode для латинской транслитерации текстов Южной Азии, написанных на различных языках и системах письма. Транслитерации ISO 15919 являются платформенно-независимыми, что позволяет использовать их идентично на всех современных операционных системах и программных пакетах, соответствующих нормам ISO. Это является обязательным условием для всех современных платформ, благодаря чему ISO 15919 стал новым стандартом для цифровых библиотек и архивов при транслитерации текстов Южной Азии. ISO 15919 использует диакритические знаки для сопоставления гораздо большего числа брахманских графем латинскому алфавиту. Часть стандарта, относящаяся к деванагари, почти идентична академическому стандарту IAST (Международный алфавит транслитерации санскрита) и ALA LC, стандарту Библиотеки Конгресса США. Другой стандарт, United Nations Romanization Systems for Geographical Names (UNRSGN), был разработан Группой экспертов Организации Объединенных Наций по географическим наименованиям (UNGEGN) и охватывает многие брахманские системы письма. Существуют некоторые различия между ISO 15919 и UNRSGN.

Гарвард - Киото

По сравнению с IAST, Гарвард-Киото выглядит значительно проще. В нем отсутствуют диакритические знаки, которые есть в IAST. Вместо диакритики, Гарвард-Киото использует прописные буквы. Использование прописных букв облегчает набор текста в Гарвард-Киото по сравнению с IAST, но приводит к появлению слов с прописными буквами внутри них.

Вельтуис

Недостатком вышеуказанных схем ASCII является чувствительность к регистру, что означает, что транслитерированные имена могут не начинаться с заглавной буквы. Эта трудность устраняется в системе, разработанной в 1996 году Франсом Велтхуисом для TeX, которая основана на IAST и в которой регистр не имеет значения.

WX

WX-нотация – это схема транслитерации для представления индийских языков в ASCII. Эта схема была разработана в IIT Канпуре для компьютерной обработки индийских языков и широко используется в сообществе специалистов по обработке естественного языка (NLP) в Индии. Эта нотация (хотя и не имеет официального названия) используется, например, в учебнике по NLP, изданном в IIT Канпуре. [1] Основные особенности этой схемы транслитерации заключаются в следующем: каждой согласной и каждой гласной соответствует единственное обозначение латинскими буквами. Таким образом, это префиксный код,[2] что выгодно с точки зрения вычислений. Обычно строчные буквы используются для неаспирированных согласных и кратких гласных, а прописные – для аспирированных согласных и долгих гласных. Ретрофлексные глухие и звонкие согласные отображаются на символы 't, T, d и D', а дентальные – на 'w, W, x и X'. Отсюда и название схемы "WX", отражающее её специфическое соответствие символов. Ubuntu Linux предоставляет поддержку клавиатуры для WX-нотации.

SLP1

SLP1 (Sanskrit Library Phonetic) — это схема, чувствительная к регистру, изначально разработанная для Санскритской библиотеки Питером Шарфом и (покойным) Малкольмом Хайманом, которые впервые описали её в приложении B к своей книге «Лингвистические вопросы кодирования санскрита». Преимущество SLP1 перед другими системами кодирования заключается в том, что для каждой буквы деванагари используется один символ ASCII, что упрощает обратную транслитерацию.

Инглиш

Хинглиш — это ненормированный вариант хинди, записанный латиницей и используемый в сети, особенно в социальных сетях. В Индии латиница является преобладающей формой выражения в интернете. В ходе анализа комментариев на YouTube Палакодети и др. установили, что 52% комментариев были написаны на хинди, записанном латиницей, 46% — на английском языке и 1% — на хинди, записанном деванагари.

Другие

Другие менее популярные схемы ASCII включают нотацию WX, Vedatype и 7-битный ISO 15919. Нотация WX – это схема транслитерации для представления индийских языков в ASCII. Она возникла в IIT Канпуре для вычислительной обработки индийских языков и широко используется в сообществе обработки естественного языка (NLP) в Индии. Эта схема описана в NLP Panini (Приложение B). Она похожа на, но не столь универсальна, как SLP1, в плане охвата ведического санскрита. Сравнение WX с другими схемами можно найти в Huet (2009), Приложение A. Vedatype – это еще одна схема, используемая для кодирования ведических текстов в Университете менеджмента Махариши. В Sanskrit Library предоставляется онлайн-утилита для транскодирования между всеми этими схемами. ISO 15919 включает так называемый "ограниченный набор символов", позволяющий заменять диакритические знаки префиксами для обеспечения совместимости с ASCII. Иллюстративное объяснение представлено Энтони Стоуном здесь.

Сравнение транслитерации

Ниже приводится сравнение основных методов транслитерации, используемых для деванагари.

Голосные

DevanāgarīIASTISO 15919Monier Williams72Harvard KyotoITRANSVelthuisSLP1WXअ aaaaaaaaaaaаааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааааа - Я не могу. - Я не могу. - Я не могу. - Да, я знаю. Не нужно. М. МММА: ХХХХ. - Я не могу. a. a'Z

Согласные

После самостоятельных согласных букв Деванагари следует имплицитный шва (/Ə/). Во всех системах транслитерации этот /Ə/ должен быть явно представлен с использованием "a" или любого эквивалента шва. Devanāgarī IAST ISO 15919 Monier Williams 72 Harvard Kyoto ITRANS Velthuis SLP1WX क kakakakakakakaka काका ख khakhakhakhakhakha खाखा ग gagagagagagagaga गागा घ ghaghaghaghaghagha घाघा ङ ṅaṅan·aGa~Na"naNafa नाफ़ा च cacaćachachacacaca चाचा छ chachaćhachha छछा ज jajajajajajajaja जाजा झ jhajhajhajhajhajha झाझा ञ ñañaṅaJa~na~naYaFa नाफ़ा ट ṭaṭaṭa टाटा ठ ṭhaṭhaṭha ठाठा ड ḍaḍaḍa डाडा ढ ḍhaḍhaḍha ढाढा ण ṇaṇaṇaNaNa नाना त tatatatatatata ताता थ thathathathathatha थाथा द dadadadadadadaxa दादा ध dhadhadhadhadhadha धाधा न nananananananana नाना प papapapapapapapa पापा फ phaphaphaphaphapha फाफा ब babababababababa बाबा भ bhabhabhabhabhabha भाभा म mamamamamamamama मामा य yayayayayayayaya याया र rararararararara रा रा ल lalalalalalalala लाला व vavavavava/wavavava वावा श śaśaṡazasha शाशा ष ṣaṣasha साशा स sasasasasasasasa सासा ह hahahahahahahaha हाहा ळ ḻaḷa लाला. лала.

Нерегулярные группы согласных

DevanāgarīISO 15919Harvard KyotoITRANSVelthuisSLP1WXक्षkṣa kSakSa/kSha/xak. sakzakRaत्रtratratratratrawraज्ञjña jJaGYa/j~naj~najYajFaश्रśrazrashra"sraSraSra

Другие согласные

ДеванагариISO 15919ITRANSWXक़qaqakZaख़кхаКаКZaг़ґаГагZaззазаджZaफ़фафаPZaдṛа. Да/РадЗадṛха. Дха/РхаДЗа

Сравнение IAST с ISO 15919

В таблице ниже показаны только различия между ISO 15919 и IAST для транслитерации деванагари. ДеванагариISO 15919IAST Комментарийए / ेISOeДля различения долгого и краткого 'e' в дравидских языках, 'e' теперь представляет ऎ / ॆ (краткое). Обратите внимание, что использование ISO считается необязательным в ISO 15919, и использование ISO для ए (долгого) допустимо для языков, не различающих долгий и краткий 'e'.ओ / ोISOoДля различения долгого и краткого 'o' в дравидских языках, 'o' теперь представляет ऒ / ॊ (краткое). Обратите внимание, что использование ISO считается необязательным в ISO 15919, и использование ISO для ओ (долгого) допустимо для языков, не различающих долгий и краткий 'o'.ऋ / ृISOṛВ ISO 15919, ṛ используется для представления ड़.ॠ / ॄISOṝДля согласованности с r̥.ौ / ॢISOḷВ ISO 15919, ḷ используется для представления ळ.ॡ / ॣISOḹДля согласованности с l̥◌ंISOṃВ ISO 15919 есть два варианта для анусвары. (1) В упрощенном варианте назализации анусвара всегда транслитерируется как ṁ. (2) В строгом варианте назализации анусвара перед согласным соответствующего класса транслитерируется как назальная соответствующего класса: ṅ перед k, kh, g, gh, ṅ; ñ перед c, ch, j, jh, ñ; ṇ перед ṭ, ṭh, ḍ, ḍh, ṇ; n перед t, th, d, dh, n; m перед p, ph, b, bh, m. ṃ иногда используется для обозначения Гурмукхи Типпи ੰ. ISO◌ँISOm̐Назализация гласных транслитерируется как тильда над транслитерированным гласным (над вторым гласным в случае диграфа, такого как aĩ, aũ), за исключением санскрита.ळḻḷИспользуется только в ведическом санскрите и не встречается в классическом варианте.

Ретрофлексные согласные

Большинство индийских языков различают ретрофлексные и дентальные варианты зубных согласных. В формальных схемах транслитерации для обозначения дентального варианта используются стандартные латинские буквы, а ретрофлексный вариант обозначается специальными диакритическими знаками или другими буквами. Например, в транслитерации IAST ретрофлексные варианты обозначаются как ṇ, ṭ, ḍ и ṣ. В большинстве неформальных транскрипций различие между ретрофлексными и дентальными согласными не указывается. Однако многие используют заглавные ретрофлексные согласные при наборе текста на клавиатуре QWERTY в неформальной переписке. Это обычно избавляет от необходимости транслитерации.

Аспирационные согласные

Там, где буква "h" следует за взрывным согласным в транслитерации Деванагари, она всегда указывает на аспирацию. Таким образом, "ph" произносится как "p" в слове "pit" (с небольшим выдохом воздуха при произнесении), а не как "ph" в слове "photo" (IPA /f/). (С другой стороны, "p" произносится как "p" в слове "spit" без выдоха воздуха.) Аналогично, "th" – это аспирированное "t", не как "th" в слове "this" (звонкое, IPA /ð/), и не как "th" в слове "thin" (глухое, IPA /θ/). Аспирация обычно обозначается как в формальных, так и в неформальных системах транслитерации.

Использование компьютера в качестве драйва для романизации

Поскольку английский язык широко используется в качестве языка профессионального и высшего образования в Индии, количество клавиатур для деванагари значительно уступает количеству английских клавиатур. Аналогично, программное обеспечение и пользовательские интерфейсы, выпускаемые и продвигаемые в Индии, представлены на английском языке, как и большая часть доступного там компьютерного образования. Из-за недостаточной осведомленности о раскладках клавиатуры деванагари многие индийские пользователи пишут хинди латинским шрифтом. До добавления деванагари в Unicode для отображения деванагари в Интернете использовалось множество обходных путей, и многие сайты и сервисы продолжают их использовать, несмотря на широкую доступность шрифтов Unicode, поддерживающих деванагари. Хотя существует несколько правил транслитерации хинди латиницей, большинство из них опираются на диакритические знаки. Поскольку большинство индийцев знакомы с латинским шрифтом благодаря английскому языку (который традиционно не использует диакритические знаки), эти системы транслитерации менее распространены. Большая часть такой "романагари" транслитерируется произвольно, чтобы имитировать английское написание, что приводит к многочисленным неточностям. Это также негативно сказывается на поисковых системах, которые не распознают текст на хинди, написанный латиницей, как хинди. Тот же текст может также не быть распознан как английский. Независимо от физической раскладки клавиатуры, на большинстве современных операционных систем можно установить клавиатуры для хинди на основе Unicode. Существует множество онлайн-сервисов, которые точно транслитерируют текст, написанный латиницей, в деванагари, используя словари хинди для справки, например, Google Транслитерация или Microsoft Indic Language Input Tool. Это решение аналогично редакторам методов ввода, которые традиционно используются для ввода текста на языках, использующих сложные символы, таких как китайский, японский или корейский.

История транслитерации санскрита

Ранние санскритские тексты первоначально передавались устно, посредством запоминания и повторения. После эпохи Хараппы в Индии не существовало системы письменности для индийских языков до создания (в IV–III веках до н.э.) письменности кхарошти и брахми. Эти системы письма, хотя и подходили для среднеиндийских языков, не были хорошо приспособлены для записи санскрита. Однако более поздние производные от брахми были модифицированы таким образом, чтобы они могли точно передавать санскрит на фонетическом уровне. Самый ранний известный физический текст на санскрите – это наскальная надпись правителя Западных Кшатрапов Рудрадамана, датируемая ок. 150 г. н.э. и найденная в Джунагаде, Гуджарат. Вследствие значительного распространения различных вариантов брахми в Средние века, в настоящее время не существует единой письменности для санскрита; скорее, санскритологи могут писать язык в той форме письменности, которая используется для записи их местного языка. Однако, начиная с позднего Средневековья, наблюдается тенденция использовать деванагари для написания санскритских текстов, предназначенных для широкой аудитории. В XIX веке западные ученые приняли деванагари для печатных изданий санскритских текстов. Первое издание «Ригведы» Макса Мюллера было выполнено на деванагари. Лондонские наборщики Мюллера соревновались со своими коллегами из Петербурга, работавшими над словарем Бёхтлинка и Ротта, в изготовлении всех необходимых лигатурных шрифтов. С самого начала западная санскритская филология также ощущала потребность в романизированном написании языка. Франц Бопп в 1816 году использовал схему романизации, наряду с деванагари, которая отличалась от IAST в отображении долготы гласных с помощью циркумфлекса (â, î, û) и аспирации с помощью spiritus asper (например, bʽ для IAST bh). Сибилянты IAST ṣ и ś он передавал с помощью spiritus asper и lenis соответственно (sʽ, sʼ). Монир Уильямс в своем словаре 1899 года использовал ć, ṡ и sh для IAST c, ś и ṣ соответственно. С конца XIX века западный интерес к набору текста на деванагари снизился. Теодор Ауфрехт опубликовал свое издание «Ригведы» 1877 года на романизированном санскрите, а ведическая грамматика Артура Макдонелла 1910 года (и ведическая грамматика для студентов 1916 года) также не используют деванагари (в то время как его вводная санскритская грамматика для студентов сохраняет деванагари наряду с романизированным санскритом). Современные западные издания санскритских текстов в основном публикуются в системе IAST.