Кіріспе

Аударма жады (АЖ) – бұрын аударылған сөйлемдер, абзацтар немесе сөйлем сияқты бөліктер (тақырыптар, атаулар немесе тізімдегі элементтер) болатын "сегменттерді" сақтайтын деректер қоры, ол адам аудармашыларына көмек көрсетуге арналған. Аударма жады бастапқы мәтінді және оның сәйкес аудармасын "аударма бірліктері" деп аталатын тіл жұптарында сақтайды. Жеке сөздер терминологиялық база арқылы өңделеді және АЖ шеңберінде қарастырылмайды. Аударма жадыларын пайдаланатын бағдарламалық құралдар кейде аударма жады менеджерлері (АЖМ) немесе аударма жады жүйелері (АЖ жүйелері) деп аталады (аударманы басқару жүйесімен (АБЖ) шатастыруға болмайды, ол аударма процесін басқаруға бағытталған бағдарламалық құралдың басқа түрі). Аударма жады әдетте арнайы компьютерлік көмекпен аударма жасау (АКК) құралымен, мәтін өңдеу бағдарламасымен, терминологияны басқару жүйелерімен, көптілді сөздікпен немесе тіпті машиналық аударманың бастапқы нәтижесімен бірге қолданылады. Зерттеулер көрсеткендей, көп тілді құжаттама шығаратын көптеген компаниялар аударма жады жүйелерін пайдаланады. 2006 жылы тіл мамандары арасында жүргізілген сауалнамада 874 жауаптың 82,5%-ы АЖ қолданылатынын растады.

ТМ-ны қолдану

Бағдарлама бастапқы мәтінді (аудармаға түсетін мәтінді) сегменттерге бөледі, сегменттерді аударма жадында сақталған бұрын аударылған бастапқы-мақсатты жұптардың бастапқы бөлігімен салыстырып, сәйкес келетін жұптарды толық және ішінара сәйкестіктер ретінде ұсынады. Аудармашы сәйкестікті қабылдай алады, оны жаңа аудармамен алмастыра алады немесе бастапқы мәтінге сәйкес келтіру үшін өңдей алады. Соңғы екі жағдайда жаңа немесе өңделген аударма деректер базасына енгізіледі. Кейбір аударма жады жүйелері тек 100% сәйкестікті іздейді, яғни деректер базасындағы жазбалармен толыққандай сәйкес келетін мәтін сегменттерін ғана табады, ал басқалары ұқсас сегменттерді табу үшін «тұманды» (fuzzy) сәйкестендіру алгоритмдерін қолданады, олар аудармашыға айырмашылықтарды көрсетеді. Көбінесе аударма жады жүйелері тек бастапқы сегменттегі мәтінді іздейді. Сәйкестікті анықтау алгоритмінің икемділігі мен тұрақтылығы аударма жадының тиімділігін анықтайды, бірақ кейбір жағдайларда нақты сәйкестіктерді табу мүмкіндігі 100% сәйкестік тәсілін қолдануға жеткілікті болуы мүмкін. Сәйкестік табылмайтын сегменттерді аудармашы қолмен аударуға тиіс. Осылай аударылған жаңа сегменттер деректер базасында сақталады, оларды болашақ аудармалар үшін, сондай-ақ ағымдағы мәтіндегі қайталаулар үшін пайдалануға болады. Аударма жады ең жақсы түрде қайталанатын мәтіндерде жұмыс істейді, мысалы, техникалық нұсқаулықтарда. Олар бұрын аударылған құжаттардағы шағын өзгерістерді аудару үшін де пайдалы, мысалы, пайдаланушы нұсқаулығының жаңа нұсқасындағы өзгерістерге сәйкес. Әдетте аударма жады әдеби немесе шығармашылық мәтіндер үшін қолайлы емес, себебі қолданылатын тілде қайталау өте аз. Дегенмен, кейбіреулер оларды қайталанбайтын мәтіндер үшін де пайдалы деп санайды, өйткені құрылған деректер қоры терминдердің дұрыс қолданылуын тексеруге (конкорданс іздеу), сапаны бақылауға (бос сегменттердің жоқтығына) және редакциялау процесін жеңілдетуге (көзделген және мақсатты сегмент әрқашан бірге көрсетіледі, ал дәстүрлі редакциялау ортасында аудармашылар екі құжатпен жұмыс істеуге мәжбүр) мүмкіндік береді.

Сапаға әсері

ТМ жүйелерін қолдану аударма мәтіндерінің сапасына әсер етуі мүмкін. Оның негізгі әсері, әдетте "қате таралуы" деп аталатын құбылысқа байланысты: егер нақты бір сегменттің аудармасы дұрыс болмаса, сол бастапқы мәтін немесе оған ұқсас мәтін келесі аударғанда бұл қате аударма қайта қолданылуы мүмкін, соның салдарынан қате жалғаса береді. Дәстүрлі түрде аударма мәтіндерінің сапасына екі негізгі әсері сипатталған: "сөйлем шатағы" әсері (Bédard 2000; O'Hagan 2009: 50-де келтірілген) және "кішкентай терезе" әсері (Heyn 1998). Біріншісі – мәтін деңгейіндегі үйлесімсіздік, яғни мәтін әртүрлі стильдегі аудармашылар аударған ТМ сөйлемдерін пайдаланып аударылғанда туындайды. Екіншісіне сәйкес, аудармашылар ТМ жүйесін пайдалануға ыңғайласып, мәтінішілік сілтемелерді болдырмауға тырысады, осылайша сегменттерді болашақ мәтіндерде оңайырақ қайта қолдануға болады, бұл мәтіннің байланыстылығы мен оқылуына әсер етеді (O'Hagan 2009). Аударма мәтініне әсер ететін, мүмкін, тіпті сезімталдықпен байқамайтын әсер де болуы мүмкін. Әртүрлі тілдер сөйлемдегі логикалық элементтерді әртүрлі ретпен орналастырады, сондықтан жартылай аударылған көп салалы сөйлеммен аудармашының сөйлемді толыққанды қайта құру ықтималдығы төмендеуі мүмкін. Нақты эмпирикалық деректер (Martín Mor 2011) көрсеткендей, аудармашылар мәтіндік процессормен жұмыс істегенде, ТМ жүйесімен емес, көп салалы сөйлемнің құрылымын өзгертуге бейім. Сондай-ақ, аудармашы мәтінді әр сөйлемді жеке қарастырып, оның айналасындағы сөйлемдермен және мәтіннің жалпы мазмұнымен байланысын ескермей механикалық түрде жұмыс істеуі мүмкін. Зерттеушілер (Dragsted 2004) осы бағдарламалардың автоматты сегментациялау мүмкіндігіне байланысты осы әсерді анықтады, бірақ ол аударма сапасына әрдайым кері әсер ете бермейді. Бұл әсерлер құралдың өзіне тән емес, аудармашының дайындығына байланысты. Martín Mor (2011) мәлімдегендей, ТМ жүйелерін қолдану аударма мәтіндерінің сапасына әсер етеді, әсіресе жаңа аудармашылар үшін, бірақ тәжірибелі аудармашылар одан аулақ бола алады. Pym (2013) еске салады: "ТМ/ҚМ қолданатын аудармашылар әр сегментті бірден түзетуге бейім, сондықтан бүкіл мәтінді соңынан қайта қарауға уақыт жетпейді", бұл осы жерде сипатталған кейбір әсерлердің түпкі себебі болуы мүмкін.

ТМ жүйелерінің түрлері

Үстел: Үстел үстіндегі аударма жады құралдары әдетте жеке аудармашылар аудармаларды аяқтау үшін қолданады. Бұл аудармашының жеке компьютеріне жүктеліп орнатылатын бағдарламалар. Серверлік немесе орталықтандырылған: Орталықтандырылған аударма жады жүйелері аударма жадын орталық серверде сақтайды. Олар үстел үстіндегі аударма жадымен бірлесіп жұмыс істейді және үстел үстіндегі аударма жадының ғана есебінен қол жеткізілетін аударма жадының тиімділігін 30–60% дейін арттыра алады.

Функциялар

Төменде аударма жадының негізгі функцияларының шолуы берілген.

Импорт

Бұл функция мәтінді және оның аудармасын мәтін файлынан ТМ-ға көшіру үшін пайдаланылады. Импортты қара форматтан жасауға болады, онда аудармасымен бірге ТМ-ге импорттау үшін сыртқы мәтін қолжетімді. Кейде мәтіндерді пайдаланушы қайта өңдеуі қажет болады. Импорттауға болатын тағы бір формат – түпкілікті формат. Бұл формат ТМ-ді аударма естеліктерін файлға сақтау үшін пайдаланады.

Экспорт

Экспорт мәтінді МТ-дан сыртқы мәтін файлына көшіреді. Импорт және экспорт бір-біріне кері операциялар болуы керек.

Онлайн функциялары

Аударма жасағанда, ТМ-ның басты мақсаты – аудармашыға ең қолайлы нұсқаны таңдау үшін жадтан ең тиімді сәйкестіктерді табу. ТМ бастапқы және мақсатты мәтіндерді, олардың ұқсастықтары мен айырмашылықтарын көрсете білуі керек.

Қайта алу

ТМ-дан бірнеше түрлі сәйкестіктерді алуға болады. Дәл сәйкестік Дәл сәйкестіктер ағымдағы бастапқы сегмент пен сақталған сегмент арасында әріпте әріп сәйкес келген кезде пайда болады. Сөйлемді аудару кезінде дәл сәйкестік – бұл сол сөйлемнің бұрын аударылғанын білдіреді. Дәл сәйкестіктерді "100% сәйкестіктер" деп те атайды. Контекст бойынша дәл (ICE) сәйкестік немесе Кепілді сәйкестік ICE сәйкестігі – дәл сол контексте, яғни абзацтың бірдей бөлігінде кездесетін дәл сәйкестік. Контекст көбінесе айналасындағы сөйлемдермен және құжаттың файлының атауы, күні, рұқсаттары сияқты атрибуттармен анықталады. Бұлыңғыр сәйкестік Сәйкестік дәл болмаған жағдайда, ол "бұлыңғыр" сәйкестік деп аталады. Кейбір жүйелер мұндай сәйкестіктерге проценттік мән береді, онда бұлыңғыр сәйкестік 0%-дан жоғары және 100%-дан төмен болады. Егер бағалау әдісі көрсетілмесе, бұл көрсеткіштерді жүйелер арасында салыстыруға болмайды. Конкорданс Аудармашы бастапқы сегментте бір немесе бірнеше сөзді таңдағанда, жүйе іздеу критерийлеріне сәйкес келетін сегмент жұптарын іздеп шығарады. Бұл мүмкіндік терминологиялық база болмаған жағдайда терминдер мен фразеологиялық тіркестердің аудармаларын табуға көмектеседі.

Жаңарту

ТМ аудармашы мақұлдаған кезде жаңа аудармамен жаңартылады. Деректер базасын жаңарту кезінде, әдеттегідей, базаның бұрынғы мазмұнымен не істеу керек деген сұрақ туындайды. ТМ-ды ТМ-дағы жазбаларды өзгерту немесе жою арқылы өңдеуге болады. Кейбір жүйелер аудармашыларға бір түпнұсқа сегмент үшін бірнеше аударманы сақтауға рұқсат береді.

Автоматты аударма

Аудармалық жад құралдары көбінесе автоматты іздеу және алмастыру мүмкіндіктерін ұсынады. Автоматты іздеу жүйелері аудармашы құжатты өңдеп жатқанда автоматты түрде ізделіп, нәтижелері көрсетіледі. Автоматты алмастыру функциясы арқылы, егер құжаттың жаңа нұсқасын аудару кезінде толық сәйкестік табылса, бағдарлама бұрынғы аударманы қайта қолданады. Егер аудармашы аударманы бастапқы мәтінмен тексермесе, бұрын жасалған қателер қайталанып қалуы мүмкін.

Желі құру

Аудармашылар тобының өзара байланысы бір мәтінді жеке-жеке жұмыс істегеннен гөрі жылдамырақ аударуға мүмкіндік береді, себебі бір аудармашы аударған сөйлемдер мен тіркестер басқаларына қолжетімді болады. Сонымен қатар, түпкілікті аударма жасамас бұрын аударма естеліктері ортақ қолданысқа берілсе, бір аудармашы жіберген қателерді команданың басқа мүшелері түзетуге болады.

Мәтін жады

"Текст жады" ұсынылған Lisa OSCAR xml:tm стандартының негізі болып табылады. Текст жады автор жадысы және аударма жадысынан құралады.

Аударма жады

Аударма кезінде бірегей идентификаторлар сақталады, соның арқасында мақсатты тілдегі құжат мәтін бірлігі деңгейінде "дәл" келісімге ие болады. Егер бастапқы құжат кейіннен өзгертілсе, өзгермеген мәтін бірліктерін аудармашының қатысуынсыз құжаттың жаңа мақсатты нұсқасына тікелей көшіруге болады. Бұл аударма жадымен "нақты" немесе "толық" сәйкестік концепциясы. xml:tm құжат ішінде қолданылатын және шамалы сәйкестіктерді табуға мүмкіндік беретін механизмдерді де ұсына алады.

Тарих

1970 жылдар ТМ жүйелерінің бастапқы кезеңі болды, онда ғалымдар алдын ала зерттеу талқылауларын жүргізді. ТМ жүйелерінің түпкілікті идеясы көбінесе Мартин Кейдің «Орынды жай» атты мақаласына байланысты, бірақ оның толық егжей-тегжейі берілмеген. Осы мақалада сақтау жүйесінің негізгі қағидасы көрсетілген: «Аудармашы жүйеге сақталымдағы маңызды болуы мүмкін кез келген ақпаратты көрсетуге бағытталған команда бере алады. Одан әрі жұмысты жалғастыру үшін, ол бұрынғы және болашақ мәтін фрагменттерін қарастыра алады, оларда ұқсас материалдар бар». Кейдің осы тұжырымы Петер Артерннің аудармашылар онлайн режимінде бұрын аударған, ұқсас құжаттарды пайдалана алады деген ұсынысымен шартты. 1978 жылғы мақаласында ол бүгін ТМ жүйелері деп аталатын нәрсені толыққанды көрсетті: кез келген жаңа мәтін сөздік өңдеу стансасына терілетін болады, ал терілген кезде жүйе бұл мәтінді жадында сақталған бұрынғы мәтіндермен салыстырып, оның барлық ресми тілдерге аудармасын тексеретін болады [Еуропалық қауымдастықтың]. Машиналық аудармаға қарағанда, алынған барлық фрагменттер грамматикалық тұрғыдан дұрыс болады. Іс жүзінде, біз электрондық «кесіп, қосатын» процесті қолданып, менің есептеулеріме сәйкес, аудармашылардың аударма жасауға жұмсайтын уақытының кем дегенде 15 пайызын үнемдей аламыз. Бұл идея алғаш рет Бригам Янг университетінің зерттеушісі жасаған ALPS (Автоматтандырылған тілдік өңдеу жүйелері) құралдарынан алынған, ал сол кезде ТМ жүйелерінің идеясы тек сәйкес келетін тізбектерді табуға бағытталған «қайталауларды өңдеу» құралымен біріктірілді. Ұзақ уақыттан кейін ғана «аударма жады» деген ұғым пайда болды. ТМ жүйелерінің нақты зерттеу кезеңі 1980 жылдарда басталды. ТМ жүйесінің алғашқы іске асырылымдарының бірі Садлер мен Венделманның Екі тілді білім банкінде пайда болды. Екі тілді білім банкі – бұл синтаксикалық және анықтамалық тұрғыдан құрылымдалған корпустар жұбы, олардың бірі екіншісінің аудармасы болып табылады, ал аударма бірліктері корпустар арасында өзара кодталған. Екі тілді білім банкінің мақсаты – машиналық аударма және компьютерлік көмекпен аудармада қолданылатын корпусқа негізделген, жалпы мақсаттағы білім көзін әзірлеу (Sadler & Vendelman, 1987). Брайан Харрис өзінің «Би-мәтінімен» маңызды қадам жасады. Ол би-мәтінді «екі өлшемді бір мәтін» (1988) деп анықтады, мұнда бастапқы және мақсатты мәтіндер аудармашының қызметі арқылы аударма бірліктерімен байланыстырылған, бұл Садлердің Екі тілді білім банкімен ұқсас эхо тудырды. Харрис еңбегінде ол осы атауды қолданбай-ақ ТМ жүйесіне ұқсас нәрсені ұсынды: жеке сөзбен немесе «толық аударма бірлігімен» іздеуге болатын жұпталған аудармалардың дерекқоры, соңғы жағдайда іздеу ұқсас емес, бірдей бірліктерді табуға мүмкіндік береді. ТМ технологиясы 1990 жылдардың соңында бірнеше инженерлер мен аудармашылардың күш-жігерінің арқасында кеңінен қолжетімді болды. Алғашқы ТМ құралы Trados (қазір SDL Trados) деп аталды. Бұл құралда бастапқы файлды ашып, аударма жадын қолданған кезде мәтіндегі кез келген «100% сәйкестік» (бірдей сәйкестік) немесе «бұлыңғыр сәйкестік» (ұқсас, бірақ бірдей емес) бірден анықталып, мақсатты файлға орналастырылады. Содан кейін аударма жады ұсынған «сәйкестіктерді» қабылдауға немесе жаңа баламалармен алмастыруға болады. Егер аударма бірлігі қолмен жаңартылса, онда ол болашақта пайдалану үшін, сондай-ақ ағымдағы мәтінде қайта пайдалану үшін аударма жадына сақталады. Осыған ұқсас, мақсатты файлда «сәйкестік» жоқ барлық сегменттер қолмен аударылады, содан кейін автоматты түрде аударма жадына қосылады. 2000 жылдары онлайн аударма қызметтері ТМ-ді енгізе бастады. Google Translate сияқты машиналық аударма қызметтері, сондай-ақ Gengo және Ackuna сияқты сайттар ұсынатын кәсіби және «гибридті» аударма қызметтері аудармашылар мен еріктілер ұсынатын ТМ деректерінің дерекқорын қамтиды, бұл тілдер арасындағы тиімді байланысты қамтамасыз етуге және соңғы пайдаланушыларға жылдам аударма қызметтерін ұсынуға мүмкіндік береді.

Соңғы үрдістер

Соңғы кезде пайда болған бір жаңалық – аударма жадына қарама-қарсы "мәтін жады" тұжырымы. Бұл, сондай-ақ, ұсынылып отырған LISA OSCAR стандартының негізі болып табылады. xml:tm ішіндегі мәтін жады "автор жады" және "аударма жады" түрлерін қамтиды. Автор жады авторлық цикл кезіндегі өзгерістерді қадағалау үшін қолданылады. Аударма жады аударма жадының сәйкестігін іске асыру үшін автор жадынан алынған ақпаратты пайдаланады. Көбінесе XML құжаттарына бағытталған болғанымен, xml:tm XLIFF форматына түрлендірілетін кез келген құжатта қолданылуы мүмкін.

Екінші буын аударма жады

Бірінші буын ТМ жүйелерінен әлдеқайда күшті, олар лингвистикалық талдау механизмін қамтиды, сегменттерді интеллектуалды терминологиялық топтарға жіктеу үшін бөлшектеу технологиясын пайдаланады және арнайы глоссарийлерді автоматты түрде құрайды.

TMX

Translation Memory eXchange (TMX) – аудармалық жадтарды аударма қызметтерін ұсынатын компаниялар арасында алмасуға мүмкіндік беретін стандарт. TMX аударма саласында аудармалық жадтарды импорттау және экспорттаудың ең тиімді жолы ретінде қабылданып, қолданылады. Қазіргі нұсқасы 1.4b болып табылады, ол TMX деректерінен бастапқы мәтін мен аудармаланған құжаттарды қайта жасауға мүмкіндік береді.

TBX

Терминдік базалық алмасу. Бұл LISA стандарты, ISO 30042 ретінде қайта қаралып, жаңадан басылған, терминологиялық деректерді, соның ішінде егжей-тегжейлі лексикалық ақпаратты алмасуға мүмкіндік береді. TBX-тің құрылымдық негізін үш ISO стандарты құрайды: ISO 12620, ISO 12200 және ISO 16642. ISO 12620 нақты анықталған «деректер санаттарының» тізімін ұсынады, олар дерек элементтерінің түрлері немесе алдын ала белгіленген мәндер ретінде стандартталған атаулармен жұмыс істейді. ISO 12200 (MARTIF деп те белгілі) TBX-тің негізгі құрылымының негізін қалайды. ISO 16642 (Терминологиялық белгілеу жүйесі деп те аталады) жалпы терминологиялық белгілеу тілдері үшін құрылымдық метамодельді қамтиды.

UTX

Universal Terminology eXchange (UTX) форматы – машиналық аударма қолданушы сөздіктері үшін жасалған арнайы стандарт, бірақ оны жалпы, адамдар оқи алатын глоссарийлер үшін де пайдалануға болады. UTX-тің мақсаты – өте қарапайым және қолданысқа ыңғайлы ережелері арқасында сөздіктерді ортақ пайдалану мен қайта қолдануды жеделдету.

SRX

Segmentation Rules eXchange (SRX) TMX стандартын жетілдіруге бағытталған, осылайша қолданбалар арасында алмасылатын аударма жады деректерін тиімдірек пайдалануға мүмкіндік береді. Алдыңғы аудармада қолданылған сегменттеу ережелерін көрсету мүмкіндігі қолданылатын материалды көбейтуге септігін тигізеді.

GMX

ГИЛТ көрсеткіштері. GILT – (глобалдастыру, интернационалдастыру, локалдастыру және аударма) деген сөздердің бас әріптерінен құралған аббревиатура. GILT Metrics стандарты үш бөліктен тұрады: көлемдік көрсеткіштер үшін GMX V, күрделілік көрсеткіштері үшін GMX C және сапалық көрсеткіштер үшін GMX Q. Ұсынылып отырған GILT Metrics стандартының мақсаты – кез келген GILT тапсырмасының жұмыс көлемін және сапа талаптарын сандық тұрғыда бағалау.

OLIF

Ашық лексикон алмасу форматы. OLIF – терминологиялық және лексикалық деректерді алмасуға арналған ашық, XML форматына сәйкес стандарт. Бұл бастапқыда меншік иеліктегі машиналық аударма лексикалары арасында лексикалық деректерді алмасу құралы ретінде жоспарланғанмен, қазір терминология алмасудың көбірек қолданылатын жалпы стандартына айналды.

XLIFF

XML Локализация алмасу файл пішімі (XLIFF) кез келген жергіліктілендіру қызметін ұсынатын компания түсіне алатын бірыңғай алмасу файл пішімін қамтамасыз ету үшін жасалған. XLIFF аударма индустриясында XML форматындағы деректерді алмасудың басым әдісі болып табылады.

TransWS

Аударма веб-қызметтері. TransWS локализация жобаларына қатысты файлдар мен хабарламаларды жіберу және алу үшін веб-қызметтерді пайдалануға қажетті шақыруларды көрсетеді. Ол веб-қызметтерді қолдану арқылы ағымдағы локализация процесінің көп бөлігін автоматтандыруға арналған егжей-тегжейлі құрылым ретінде жасалған.

xml:tm

Аударма жадының xml:tm (XML негізіндегі мәтіндік жад) тәсілі авторлық және аударма жадынан құралған мәтіндік жад тұжырымдамасына негізделген. xml:tm XML INTL компаниясы Лиза Оскарға сыйлады.

ТҚ

Gettext портативті нысан форматы. Gettext PO файлдары көбінесе аударма жады форматы ретінде қарастырылмаса да, аударма жадылары қолданылатын тәсілмен аударма жады процестерінде қолданылатын екі тілді файлдар болып табылады. Әдетте, PO аударма жады жүйесі каталог ағашы құрылымындағы бірнеше жеке файлдардан тұрады. PO файлдарымен жұмыс істейтін танымал құралдарға GNU Gettext Tools және Translate Toolkit жатады. Сондай-ақ, PO файлдарын қарапайым мәтіндік файлдар сияқты өңдеуге мүмкіндік беретін бірнеше құралдар мен бағдарламалар бар.