Введение
Переводческая память (ТМ) — это база данных, хранящая «сегменты», то есть предложения, абзацы или единицы, подобные предложениям (заголовки, названия или элементы списка), которые уже были переведены, для помощи переводчикам-людям. В памяти перевода исходный текст и соответствующий ему перевод хранятся в виде языковых пар, называемых «единицами перевода». Отдельные слова обрабатываются терминологическими базами и не относятся к области применения ТМ. Программное обеспечение, использующее память перевода, иногда называют менеджерами памяти перевода (TMM) или системами памяти перевода (системы ТМ, что не следует путать с системой управления переводами (TMS), которая представляет собой другой тип программного обеспечения, предназначенного для управления процессом перевода). Память перевода обычно используется в сочетании со специализированным инструментом автоматизированного перевода (CAT), текстовым процессором, системами управления терминологией, многоязычным словарем или даже с результатами машинного перевода без дополнительной обработки. Исследования показывают, что многие компании, выпускающие многоязычную документацию, используют системы памяти перевода. В опросе специалистов по языкам, проведенном в 2006 году, 82,5% из 874 респондентов подтвердили использование ТМ.
Использование ТМ
Программа разбивает исходный текст (текст, подлежащий переводу) на сегменты, ищет совпадения между сегментами и исходной частью ранее переведённых пар «исходный текст – перевод», хранящихся в памяти переводов, и представляет такие совпадающие пары как полные и частичные совпадения перевода. Переводчик может принять совпадение, заменить его новым переводом или изменить его в соответствии с исходным текстом. В последних двух случаях новый или изменённый перевод добавляется в базу данных. Некоторые системы памяти переводов ищут только 100%-е совпадения, то есть извлекают только те сегменты текста, которые точно соответствуют записям в базе данных, в то время как другие используют алгоритмы нечёткого сопоставления для извлечения похожих сегментов, которые представляются переводчику с выделенными различиями. Типичные системы памяти переводов ищут текст только в исходном сегменте. Гибкость и надёжность алгоритма сопоставления во многом определяют эффективность памяти переводов, хотя для некоторых приложений процент восстановления точных совпадений может быть достаточно высоким, чтобы оправдать подход, основанный на 100%-х совпадениях. Сегменты, для которых не найдено совпадений, переводчик должен перевести вручную. Эти вновь переведённые сегменты сохраняются в базе данных, где они могут быть использованы для будущих переводов, а также при повторении этого сегмента в текущем тексте. Памяти переводов наиболее эффективны при работе с текстами, содержащими большое количество повторений, например, с техническими руководствами. Они также полезны для перевода последовательных изменений в ранее переведённом документе, соответствующих, например, незначительным изменениям в новой версии руководства пользователя. Традиционно, память переводов не считалась подходящей для литературных или творческих текстов, поскольку в используемом языке обычно мало повторений. Однако некоторые считают её полезной даже для не повторяющихся текстов, поскольку созданные ресурсы базы данных ценны для конкордантного поиска с целью определения правильности использования терминов, для обеспечения качества (отсутствие пустых сегментов) и упрощения процесса рецензирования (исходный и целевой сегменты всегда отображаются вместе, в то время как переводчикам в традиционной среде рецензирования приходится работать с двумя документами).
Влияние на качество
Использование систем ТМ может оказывать влияние на качество переведенных текстов. Основной эффект явно связан с так называемым "распространением ошибок": если перевод для определенного сегмента неверен, то вероятность повторного использования этого неверного перевода при переводе того же или аналогичного исходного текста возрастает, тем самым увековечивая ошибку. Традиционно выделяют два основных эффекта, влияющих на качество переведенных текстов: эффект "лингвистической каши" (Bédard 2000; цитируется в O'Hagan 2009: 50) и эффект "подглядывания" (Heyn 1998). Первый относится к отсутствию связности на уровне текста при переводе с использованием предложений из ТМ, переведенных разными переводчиками в разных стилях. Согласно второму, переводчики могут адаптировать свой стиль к использованию системы ТМ, чтобы избежать внутритекстовых отсылок, облегчая повторное использование сегментов в будущих текстах, что влияет на согласованность и удобочитаемость (O'Hagan 2009). Существует потенциальное, и, возможно, неосознанное влияние на переведенный текст. Разные языки используют различные последовательности логических элементов в предложении, и переводчику, получившему частично переведенное сложноподчиненное предложение, реже удается полностью перестроить его. Убедительные эмпирические данные (Martín Mor 2011) свидетельствуют о том, что переводчики с большей вероятностью изменят структуру сложноподчиненного предложения при работе с текстовым редактором, чем с системой ТМ. Также существует риск, что переводчик будет обрабатывать текст механически, предложение за предложением, не уделяя внимания связи между предложениями и общим смыслом текста. Исследователи (Dragsted 2004) выявили этот эффект, связанный с функцией автоматической сегментации в этих программах, однако он не обязательно негативно сказывается на качестве перевода. Эти эффекты больше связаны с подготовкой переводчика, чем с особенностями инструмента. По мнению Мартина Мора (2011), использование систем ТМ действительно влияет на качество переведенных текстов, особенно у начинающих переводчиков, но опытные переводчики способны этого избежать. Pym (2013) отмечает, что "переводчики, использующие ТМ/МАП, как правило, редактируют каждый сегмент по мере работы, оставляя мало времени на окончательную вычитку всего текста", что может быть первопричиной некоторых из описанных эффектов.
Типы систем ТМ
Настольные: Настольные инструменты памяти переводов обычно используются отдельными переводчиками для выполнения переводов. Это программы, которые переводчик-фрилансер загружает и устанавливает на свой компьютер. Серверные или централизованные: Централизованные системы памяти переводов хранят данные ТМ на центральном сервере. Они работают совместно с настольными ТМ и могут повысить процент совпадений ТМ на 30–60% по сравнению с эффективностью использования ТМ, достигаемой только настольными ТМ.
Функции
Ниже приводится краткое описание основных функций памяти переводов.
Импорт
Эта функция используется для переноса текста и его перевода из текстового файла в память переводов (ТМ). Импорт можно выполнить из формата "как есть", в котором внешний исходный текст и его перевод доступны для импорта в ТМ. Иногда пользователю может потребоваться повторная обработка текстов. Существует также другой формат для импорта – собственный формат. Этот формат использует ТМ для сохранения памяти переводов в файле.
Экспорт
Экспорт переносит текст из памяти переводов во внешний текстовый файл. Импорт и экспорт должны быть операциями, обратными друг другу.
Онлайн-функции
При переводе одной из главных задач памяти переводов является поиск наиболее релевантных совпадений, чтобы переводчик мог выбрать оптимальный вариант. Память переводов должна отображать как исходный, так и переводной текст, выделяя сходства и различия.
Восстановление
Из ТМ можно получить несколько различных типов совпадений. Точное совпадение Точное совпадение возникает, когда соответствие между текущим сегментом исходного текста и сохраненным сегментом является полным, посимвольным. При переводе предложения точное совпадение означает, что это предложение уже переводилось ранее. Точные совпадения также называют "совпадениями 100%". Точное совпадение в контексте (ICE) или гарантированное совпадение Совпадение ICE – это точное совпадение, которое происходит в точно таком же контексте, то есть в том же месте в абзаце. Контекст часто определяется окружающими предложениями и атрибутами, такими как имя файла документа, дата и права доступа. Нечеткое совпадение Если совпадение не является точным, оно считается "нечетким". Некоторые системы присваивают таким совпадениям процентное значение, в этом случае нечеткое совпадение составляет более 0% и менее 100%. Эти значения нельзя сравнивать между разными системами, если не указан метод их расчета. Конкорданс Когда переводчик выделяет одно или несколько слов в сегменте исходного текста, система извлекает пары сегментов, соответствующие критериям поиска. Эта функция полезна для поиска переводов терминов и идиом, когда база данных терминологии отсутствует.
Обновление
ТМ обновляется новым переводом после его утверждения переводчиком. Как и при любом обновлении базы данных, возникает вопрос о том, что делать с предыдущим содержимым. ТМ можно изменить, внося изменения или удаляя записи. Некоторые системы позволяют переводчикам сохранять несколько вариантов перевода одного и того же исходного сегмента.
Автоматический перевод
Инструменты памяти переводов часто обеспечивают автоматическое извлечение и подстановку. Системы автоматического поиска в памяти переводов выполняют поиск, и результаты автоматически отображаются по мере работы переводчика с документом. Автоматическая подстановка заключается в том, что если при переводе новой версии документа обнаруживается точное совпадение, программное обеспечение повторно использует предыдущий перевод. Если переводчик не сверяет полученный перевод с исходным текстом, ошибка, допущенная в предыдущем переводе, будет повторена.
Сетевые связи
Благодаря сетевому взаимодействию группа переводчиков может переводить текст совместно быстрее, чем если бы каждый работал изолированно, поскольку переводы предложений и фраз, выполненные одним переводчиком, становятся доступны остальным. Более того, если общие базы переводов используются до завершения финальной версии, у других членов команды появляется возможность исправить ошибки, допущенные одним из переводчиков.
Текстовая память
"Текстовая память" является основой предлагаемого стандарта Lisa OSCAR xml:tm. Текстовая память состоит из авторской памяти и памяти переводов.
Переводная память
Уникальные идентификаторы сохраняются в процессе перевода, чтобы обеспечить точное соответствие между исходным и целевым документом на уровне сегмента. Если исходный документ впоследствии изменяется, то неизмененные сегменты могут быть напрямую перенесены в новую версию целевого документа без участия переводчика. Это принцип точного или полного соответствия в памяти переводов. xml:tm также предоставляет механизмы для использования контекста внутри документа и нечеткого сопоставления.
История
1970-е годы – это начальный этап развития систем ТМ, когда ученые провели предварительный раунд исследовательских дискуссий. Изначальная идея систем ТМ часто приписывается статье Мартина Кея «Подходящее место», однако детали в ней не раскрыты полностью. В этой статье была продемонстрирована базовая концепция системы хранения: «Переводчик может начать с команды, заставляющей систему отображать в хранилище все, что может быть релевантно. Прежде чем продолжить, он может изучить предыдущие и последующие фрагменты текста, содержащие аналогичный материал». На это наблюдение Кея повлияло предложение Питера Артерна о том, что переводчики могут использовать похожие, уже переведенные документы в сети. В своей статье 1978 года он представил полную демонстрацию того, что сегодня мы называем системами ТМ: любой новый текст вводился бы в текстовый редактор, и по мере ввода система сверяла бы его с ранее сохраненными текстами в ее памяти, вместе с их переводом на все другие официальные языки [Европейского сообщества]. Одним из преимуществ перед полноценным машинным переводом было бы то, что все найденные фрагменты были бы грамматически верны. По сути, мы бы использовали электронный процесс «вырезания и вставки», который, по моим расчетам, позволил бы сэкономить не менее 15% времени, которое переводчики сейчас тратят на эффективное выполнение переводов. Идея была заимствована из инструментов ALPS (Автоматизированные системы обработки языка), разработанных исследователями из Университета Бригама Янга, и в то время идея систем ТМ смешивалась с инструментом под названием «Обработка повторений», который был направлен только на поиск совпадающих строк. Лишь спустя долгое время сформировалось понятие так называемой памяти переводов. Реальный этап исследования систем ТМ пришелся на 1980-е годы. Одной из первых реализаций системы ТМ стал двухязычный банк знаний Садлера и Вендельманса. Двуязычный банк знаний – это синтаксически и референциально структурированная пара корпусов, один из которых является переводом другого, в которой переводческие единицы перекрестно кодируются между корпусами. Целью двухязычного банка знаний является разработка общедоступного источника знаний на основе корпусов для применения в машинном переводе и компьютерном переводе (Sadler & Vendelman, 1987). Еще один важный шаг был сделан Брайаном Харрисом с его «Би-текстом». Он определил би-текст как «единый текст в двух измерениях» (1988), исходный и целевой тексты, связанные деятельностью переводчика через переводческие единицы, которые создавали аналогичный эффект, как и двухязычный банк знаний Садлера. В своей работе Харрис предложил нечто похожее на систему ТМ, не используя этого названия: базу данных парных переводов, доступную для поиска либо по отдельным словам, либо по «целой переводческой единице», в последнем случае поиск позволял извлекать похожие, а не идентичные единицы. Технология ТМ стала широко доступной в коммерческом масштабе только в конце 1990-х годов благодаря усилиям нескольких инженеров и переводчиков. Заслуживает внимания первый инструмент ТМ под названием Trados (в настоящее время SDL Trados). В этом инструменте при открытии исходного файла и применении памяти переводов мгновенно извлекаются и помещаются в целевой файл любые «100% совпадения» (идентичные совпадения) или «нечеткие совпадения» (похожие, но не идентичные совпадения). Затем «совпадения», предложенные памятью переводов, можно принять или заменить новыми альтернативами. Если переводческая единица обновляется вручную, она сохраняется в памяти переводов для будущего использования, а также для повторения в текущем тексте. Аналогичным образом, все сегменты в целевом файле без «совпадений» переводятся вручную, а затем автоматически добавляются в память переводов. В 2000-х годах онлайн-сервисы перевода начали включать ТМ. Сервисы машинного перевода, такие как Google Translate, а также профессиональные и «гибридные» сервисы перевода, предоставляемые такими сайтами, как Gengo и Ackuna, включают базы данных данных ТМ, предоставляемые переводчиками и волонтерами, чтобы обеспечить более эффективное взаимодействие между языками и предоставлять более быстрые услуги перевода конечным пользователям.
Последние тенденции
Одним из последних достижений является концепция "текстовой памяти" в отличие от памяти переводов. Она также лежит в основе предлагаемого стандарта LISA OSCAR. Текстовая память в xml:tm состоит из "памяти автора" и "памяти переводов". Память автора используется для отслеживания изменений в процессе создания текста. Память переводов использует информацию из памяти автора для реализации сопоставления с памятью переводов. Хотя xml:tm в первую очередь ориентирован на XML-документы, его можно использовать для любого документа, который можно преобразовать в формат XLIFF.
Переводческие памяти второго поколения
Гораздо более мощные, чем системы ТМ первого поколения, они включают в себя движок лингвистического анализа, используют технологию разбиения на фрагменты для разделения сегментов на осмысленные терминологические группы и автоматически генерируют специализированные глоссарии.
ТМХ
Translation Memory eXchange (TMX) — это стандарт, обеспечивающий обмен базами данных переводов между поставщиками услуг перевода. TMX был признан переводческим сообществом наилучшим способом импорта и экспорта баз данных переводов. Текущая версия – 1.4b, она позволяет восстановить исходные и целевые документы на основе данных TMX.
ТБХ
Терминный обмен. Этот стандарт LISA, который был пересмотрен и переопубликован как ISO 30042, обеспечивает возможность обмена терминологическими данными, включая детальную лексическую информацию. Структура TBX определяется тремя стандартами ISO: ISO 12620, ISO 12200 и ISO 16642. ISO 12620 предоставляет перечень чётко определенных "категорий данных" со стандартизированными наименованиями, которые функционируют как типы элементов данных или как предопределенные значения. ISO 12200 (также известный как MARTIF) служит основой для базовой структуры TBX. ISO 16642 (также известный как Terminological Markup Framework) включает в себя структурную метамодель для языков терминологической разметки в общем.
UTX
Формат Universal Terminology eXchange (UTX) — это стандарт, разработанный специально для использования с пользовательскими словарями машинного перевода, однако он также может применяться для создания общих, удобных для чтения глоссариев. Основная цель UTX — ускорить обмен словарями и повторное их использование благодаря своей исключительно простой и практичной спецификации.
SRX
Обмен правилами сегментации (SRX) призван расширить возможности стандарта TMX, чтобы данные памяти переводов, которыми обмениваются приложения, могли использоваться более эффективно. Возможность указать правила сегментации, примененные при предыдущем переводе, может повысить степень повторного использования материала.
GMX
Гилт Метрикс. GILT расшифровывается как (глобализация, интернационализация, локализация и перевод). Стандарт GILT Metrics включает три компонента: GMX V – для метрик объема, GMX C – для метрик сложности и GMX Q – для метрик качества. Предлагаемый стандарт GILT Metrics призван количественно оценить рабочую нагрузку и требования к качеству для любой задачи GILT.
ООПИ
Формат обмена открытым лексиконом. OLIF — это открытый стандарт, соответствующий XML, для обмена терминологическими и лексическими данными. Изначально разработанный как средство обмена лексическими данными между проприетарными лексиконами машинного перевода, он эволюционировал в более общий стандарт для обмена терминологией.
XLIFF
XML Localization Interchange File Format (XLIFF) предназначен для обеспечения единого формата файла обмена, который может быть понят любым поставщиком услуг локализации. XLIFF является предпочтительным способом обмена данными в формате XML в индустрии переводов.
ТрансВС
Веб-сервисы перевода. TransWS определяет вызовы, необходимые для использования веб-сервисов для передачи и получения файлов и сообщений, связанных с проектами локализации. Он разработан как детальная основа для автоматизации значительной части текущего процесса локализации посредством веб-сервисов.
xml:tm
Подход xml:tm (XML based Text Memory) к памяти переводов основан на концепции текстовой памяти, включающей в себя память автора и память переводов. xml:tm был передан в дар Лизе ОСКАР компанией XML INTL.
ОП
Формат переносимого объекта Gettext. Хотя файлы Gettext PO часто не рассматриваются как формат памяти переводов, они являются двуязычными файлами, которые также используются в процессах управления памятью переводов аналогично тому, как используются традиционные системы памяти переводов. Обычно система памяти переводов, работающая с PO-файлами, состоит из множества отдельных файлов, организованных в древовидную структуру каталогов. К распространенным инструментам для работы с PO-файлами относятся GNU Gettext Tools и Translate Toolkit. Существуют также различные инструменты и программы, позволяющие редактировать PO-файлы как обычные текстовые файлы исходного кода.