Введение

Параллельный текст – это текст, представленный вместе со своим переводом или переводами. Параллельное выравнивание текста – это определение соответствия между предложениями в обеих частях параллельного текста. Классическая библиотека Лоэба и Библиотека санскрита из глины – два примера двуязычных серий текстов. Библии с параллельными текстами могут содержать оригиналы на разных языках и перевод, или несколько переводов, для удобства сравнения и изучения; «Hexapla» Оригена (от греч. «шестикратная») представляла шесть версий Ветхого Завета рядом друг с другом. Знаменитым примером является Розеттский камень, открытие которого позволило начать расшифровку древнеегипетского языка. Большие коллекции параллельных текстов называются параллельными корпусами (см. текстовый корпус). Выравнивание параллельных корпусов на уровне предложений является необходимым условием для многих областей лингвистических исследований. В процессе перевода предложения могут быть разделены, объединены, удалены, добавлены или изменены в порядке. Это делает выравнивание непростой задачей. Параллельные тексты могут использоваться в обучении языкам.

Шум в корпусах

Большие корпуса, используемые в качестве обучающих выборок для алгоритмов машинного перевода, обычно извлекаются из больших массивов схожих источников, таких как базы данных новостных статей, написанных на первом и втором языках и описывающих похожие события. Однако извлеченные фрагменты могут содержать шум и включать в себя посторонние элементы в каждом корпусе. Методы извлечения позволяют различать двуязычные элементы, представленные в обоих корпусах, и одноязычные элементы, представленные только в одном корпусе, чтобы получить более качественные параллельные фрагменты. Сравнимые корпуса используются для непосредственного получения знаний, необходимых для перевода. Тем не менее, получить высококачественные параллельные данные сложно, особенно для языков с недостаточными ресурсами.

Битекс

В области переводоведения битекст – это объединенный документ, содержащий исходный текст и его перевод. Битексты создаются с помощью программного обеспечения, называемого инструментом выравнивания или инструментом для работы с битекстами, которое автоматически сопоставляет оригинальную и переведенную версии одного и того же текста. Как правило, инструмент сопоставляет эти тексты по предложениям. Коллекция битекстов называется битекстовой базой данных или двуязычным корпусом и может быть исследована с помощью поискового инструмента.

Битексты и переводные памяти

Битексты имеют некоторое сходство с памятью переводов. Наиболее существенное различие заключается в том, что память переводов теряет исходный контекст, а битекст сохраняет исходный порядок предложений. Однако некоторые реализации памяти переводов, такие как Translation Memory eXchange (TMX) – стандартный формат XML для обмена памятью переводов между программами автоматизированного перевода (CAT), – позволяют сохранять исходный порядок предложений. Битексты предназначены для использования человеком-переводчиком, а не машиной. Следовательно, небольшие ошибки выравнивания или незначительные неточности, которые могли бы привести к сбою памяти переводов, не имеют значения. В своей оригинальной статье 1988 года Харрис также предположил, что битекст отражает способ, которым переводчики удерживают исходный и целевой тексты вместе в своей оперативной памяти в процессе работы. Однако эта гипотеза не получила дальнейшего развития. Онлайн-битексты и память переводов также могут называться онлайн двуязычными конкордансами. Несколько таких ресурсов доступны в открытом доступе в сети Интернет, включая Linguée, Reverso и Tradooit.