Введение
Академическое сообщество обеспокоено вопросами кодирования текста.
Инициатива по кодированию текста (TEI) – это сообщество специалистов, занимающихся текстовой деятельностью в сфере цифровых гуманитарных наук и функционирующее непрерывно с 1980-х годов. Сообщество в настоящее время поддерживает список рассылки, проводит встречи и конференции, а также разрабатывает и поддерживает технический стандарт TEI, журнал, вики, репозиторий GitHub и набор инструментов.
Руководящие принципы TEI
Руководство TEI в совокупности определяет тип формата XML и является ключевым результатом деятельности сообщества специалистов. Этот формат отличается от других известных открытых форматов для текста (таких как HTML и OpenDocument) тем, что он ориентирован прежде всего на семантику, а не на представление: семантика и интерпретация каждого тега и атрибута четко определены. Существует около 500 различных текстовых компонентов и понятий: , , , , и т.д. Каждый из них опирается на одну или несколько академических дисциплин и сопровождается примерами.
etc. Each is grounded in one or more academic disciplines and examples are given.
Примеры
Текст руководства TEI содержит множество примеров. На вики TEI также есть страница с образцами, демонстрирующая примеры реальных проектов, публикующих свои базовые TEI-данные.
ОДН
One Document Does it all ("ODD") – это язык программирования, ориентированный на документирование, для схем XML. В духе программирования с документированием, документы ODD объединяют удобочитаемую для человека документацию и машиночитаемые модели, используя модуль "Элементы документации" инициативы по кодированию текста (TEI). Инструменты генерируют локализованный и интернационализированный вывод в форматах HTML, ePub или PDF, предназначенный для чтения человеком, а также машиночитаемые схемы в форматах DTD, W3C XML Schema, Relax NG Compact Syntax или Relax NG XML Syntax. Веб-приложение Roma построено на основе формата ODD и может использовать его для генерации схем в форматах DTD, W3C XML Schema, Relax NG Compact Syntax или Relax NG XML Syntax, которые используются многими инструментами и сервисами для валидации XML. ODD является форматом, используемым внутри инициативы TEI для технического стандарта TEI. Хотя файлы ODD обычно описывают различия между настроенным XML-форматом и полной моделью TEI, ODD также может использоваться для описания XML-форматов, полностью независимых от TEI. Примером этого является набор тегов интернационализации W3C, который использует формат ODD для генерации схем и документирования своего словаря.
Проекты
Этот формат используется во многих проектах по всему миру. Практически все проекты связаны с одним или несколькими университетами. Некоторые известные проекты, кодирующие тексты с использованием TEI, включают:
+TEI projects Project URL Strengths
British National Corpus http://www.natcorp.ox.ac.uk Снимок в 100 миллионов слов современного английского языка
Oxford Text Archive https://ota.bodleian.ox.ac.uk/repository/xmlui/ Более 1 ГБ лингвистических данных и электронных текстов на 25 языках
Perseus Project https://www.perseus.tufts.edu/ Греческие и латинские тексты
EpiDoc https://sourceforge.net/p/epidoc/wiki/Home/ Эпиграфика и папирология
Women Writers Project https://wwp.northeastern.edu/ Произведения современных женщин-писательниц (Маргарет Кавендиш, Элиза Хейвуд и др.)
New Zealand Electronic Text Centre http://www.nzetc.org/ Тексты Новой Зеландии и островов Тихого океана
The SWORD Project https://www.crosswire.org/sword/ Программное обеспечение для работы с Библией, словари, христианская литература
FreeDict https://freedict.org/ Двуязычные словари
Text Creation Partnership https://textcreationpartnership.org/ Ранние английские и американские книги
CELT https://celt.ucc.ie/publishd.html Древние и средневековые ирландские рукописи
ISTEX https://www.istex.fr/ Архивы научных публикаций
CAB https://cab.geschkult.fu-berlin.de/ Издание ритуалов зороастрийцев на авестанском языке
История
До создания TEI у исследователей в области гуманитарных наук не существовало единых стандартов кодирования электронных текстов, отвечающих их академическим задачам (Hockey 1993, p. 41). В 1987 году группа ученых, представляющих гуманитарные науки, лингвистику и вычислительную технику, собралась в колледже Вассар, чтобы сформулировать набор принципов, известных как «Принципы Покипси». Эти принципы определили направление разработки первого стандарта TEI – «P1». 1987 год – Начало работы Ассоциации по компьютерным и гуманитарным наукам, Ассоциации по вычислительной лингвистике и Ассоциации по литературным и лингвистическим вычислениям над тем, что впоследствии стало TEI. Результатом стала итоговая декларация Планировочной конференции в Вассаре. 1994 год – Выпущен TEI P3, отредактированный Лу Бернардом (в Оксфордском университете) и Майклом Спербергом Маккуином (тогда в Университете Иллинойса в Чикаго, позднее в W3C). 1999 год – TEI P3 обновлен. 2002 год – Выпущен TEI P4, с переходом от SGML к XML и внедрением Unicode, поддержка которого обязательна для XML-парсеров. 2007 год – Выпущен TEI P5, включающий интеграцию с атрибутами xml:lang и xml:id из W3C (ранее эти атрибуты находились в пространстве имен TEI), стандартизацию локальных атрибутов указания с использованием хеша (как в HTML) и унификацию тегов ptr и xptr. Все эти изменения, а также множество других дополнений, сделали P5 более структурированным и приближенным к современной практике XML, продвигаемой W3C и используемой другими вариантами XML. С 2007 года обновления и расширения функциональности TEI P5 выпускаются не реже двух раз в год. 2011 год – Выпущен TEI P5 v2.0.1 с поддержкой генетического редактирования (среди множества других дополнений, функции генетического редактирования позволяют кодировать тексты без интерпретации их конкретной семантики). 2017 год – TEI был удостоен премии Антонио Замполли от Альянса организаций цифровых гуманитарных наук.