Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Аударма жады (АЖ) – бұрын аударылған сөйлемдер, абзацтар немесе сөйлем сияқты бөліктер (тақырыптар, атаулар немесе тізімдегі элементтер) болатын "сегменттерді" сақтайтын деректер қоры, ол адам аудармашыларына көмек көрсетуге арналған. Аударма жады бастапқы мәтінді және оның сәйкес аудармасын "аударма бірліктері" деп аталатын тіл жұптарында сақтайды. Жеке сөздер терминологиялық база арқылы өңделеді және АЖ шеңберінде қарастырылмайды. Аударма жадыларын пайдаланатын бағдарламалық құралдар кейде аударма жады менеджерлері (АЖМ) немесе аударма жады жүйелері (АЖ жүйелері) деп аталады (аударманы басқару жүйесімен (АБЖ) шатастыруға болмайды, ол аударма процесін басқаруға бағытталған бағдарламалық құралдың басқа түрі). Аударма жады әдетте арнайы компьютерлік көмекпен аударма жасау (АКК) құралымен, мәтін өңдеу бағдарламасымен, терминологияны басқару жүйелерімен, көптілді сөздікпен немесе тіпті машиналық аударманың бастапқы нәтижесімен бірге қолданылады. Зерттеулер көрсеткендей, көп тілді құжаттама шығаратын көптеген компаниялар аударма жады жүйелерін пайдаланады. 2006 жылы тіл мамандары арасында жүргізілген сауалнамада 874 жауаптың 82,5%-ы АЖ қолданылатынын растады.
A translation memory (TM) is a database that stores "segments", which can be sentences, paragraphs or sentence like units (headings, titles or elements in a list) that have previously been translated, in order to aid human translators. The translation memory stores the source text and its corresponding translation in language pairs called “translation units”. Individual words are handled by terminology bases and are not within the domain of TM. Software programs that use translation memories are sometimes known as translation memory managers (TMM) or translation memory systems (TM systems, not to be confused with a translation management system (TMS), which is another type of software focused on managing the process of translation). Translation memories are typically used in conjunction with a dedicated computer assisted translation (CAT) tool, word processing program, terminology management systems, multilingual dictionary, or even raw machine translation output. Research indicates that many companies producing multilingual documentation are using translation memory systems. In a survey of language professionals in 2006, 82.5% out of 874 replies confirmed the use of a TM.
ТМ-ны қолдану
Бағдарлама бастапқы мәтінді (аудармаға түсетін мәтінді) сегменттерге бөледі, сегменттерді аударма жадында сақталған бұрын аударылған бастапқы-мақсатты жұптардың бастапқы бөлігімен салыстырып, сәйкес келетін жұптарды толық және ішінара сәйкестіктер ретінде ұсынады. Аудармашы сәйкестікті қабылдай алады, оны жаңа аудармамен алмастыра алады немесе бастапқы мәтінге сәйкес келтіру үшін өңдей алады. Соңғы екі жағдайда жаңа немесе өңделген аударма деректер базасына енгізіледі. Кейбір аударма жады жүйелері тек 100% сәйкестікті іздейді, яғни деректер базасындағы жазбалармен толыққандай сәйкес келетін мәтін сегменттерін ғана табады, ал басқалары ұқсас сегменттерді табу үшін «тұманды» (fuzzy) сәйкестендіру алгоритмдерін қолданады, олар аудармашыға айырмашылықтарды көрсетеді. Көбінесе аударма жады жүйелері тек бастапқы сегменттегі мәтінді іздейді. Сәйкестікті анықтау алгоритмінің икемділігі мен тұрақтылығы аударма жадының тиімділігін анықтайды, бірақ кейбір жағдайларда нақты сәйкестіктерді табу мүмкіндігі 100% сәйкестік тәсілін қолдануға жеткілікті болуы мүмкін. Сәйкестік табылмайтын сегменттерді аудармашы қолмен аударуға тиіс. Осылай аударылған жаңа сегменттер деректер базасында сақталады, оларды болашақ аудармалар үшін, сондай-ақ ағымдағы мәтіндегі қайталаулар үшін пайдалануға болады. Аударма жады ең жақсы түрде қайталанатын мәтіндерде жұмыс істейді, мысалы, техникалық нұсқаулықтарда. Олар бұрын аударылған құжаттардағы шағын өзгерістерді аудару үшін де пайдалы, мысалы, пайдаланушы нұсқаулығының жаңа нұсқасындағы өзгерістерге сәйкес. Әдетте аударма жады әдеби немесе шығармашылық мәтіндер үшін қолайлы емес, себебі қолданылатын тілде қайталау өте аз. Дегенмен, кейбіреулер оларды қайталанбайтын мәтіндер үшін де пайдалы деп санайды, өйткені құрылған деректер қоры терминдердің дұрыс қолданылуын тексеруге (конкорданс іздеу), сапаны бақылауға (бос сегменттердің жоқтығына) және редакциялау процесін жеңілдетуге (көзделген және мақсатты сегмент әрқашан бірге көрсетіледі, ал дәстүрлі редакциялау ортасында аудармашылар екі құжатпен жұмыс істеуге мәжбүр) мүмкіндік береді.
The program breaks the source text (the text to be translated) into segments, looks for matches between segments and the source half of previously translated source target pairs stored in a translation memory, and presents such matching pairs as translation full and partial matches. The translator can accept a match, replace it with a fresh translation, or modify it to match the source. In the last two cases, the new or modified translation goes into the database. Some translation memory systems search for 100% matches only, i. e. they can only retrieve segments of text that match entries in the database exactly, while others employ fuzzy matching algorithms to retrieve similar segments, which are presented to the translator with differences flagged. Typical translation memory systems only search for text in the source segment. The flexibility and robustness of the matching algorithm largely determine the performance of the translation memory, although for some applications the recall rate of exact matches can be high enough to justify the 100% match approach. Segments where no match is found will have to be translated by the translator manually. These newly translated segments are stored in the database where they can be used for future translations as well as repetitions of that segment in the current text. Translation memories work best on texts which are highly repetitive, such as technical manuals. They are also helpful for translating incremental changes in a previously translated document, corresponding, for example, to minor changes in a new version of a user manual. Traditionally, translation memories have not been considered appropriate for literary or creative texts, for the simple reason that there is so little repetition in the language used. However, others find them of value even for non repetitive texts, because the database resources created have value for concordance searches to determine appropriate usage of terms, for quality assurance (no empty segments), and the simplification of the review process (source and target segment are always displayed together while translators have to work with two documents in a traditional review environment).
Сапаға әсері
ТМ жүйелерін қолдану аударма мәтіндерінің сапасына әсер етуі мүмкін. Оның негізгі әсері, әдетте "қате таралуы" деп аталатын құбылысқа байланысты: егер нақты бір сегменттің аудармасы дұрыс болмаса, сол бастапқы мәтін немесе оған ұқсас мәтін келесі аударғанда бұл қате аударма қайта қолданылуы мүмкін, соның салдарынан қате жалғаса береді. Дәстүрлі түрде аударма мәтіндерінің сапасына екі негізгі әсері сипатталған: "сөйлем шатағы" әсері (Bédard 2000; O'Hagan 2009: 50-де келтірілген) және "кішкентай терезе" әсері (Heyn 1998). Біріншісі – мәтін деңгейіндегі үйлесімсіздік, яғни мәтін әртүрлі стильдегі аудармашылар аударған ТМ сөйлемдерін пайдаланып аударылғанда туындайды. Екіншісіне сәйкес, аудармашылар ТМ жүйесін пайдалануға ыңғайласып, мәтінішілік сілтемелерді болдырмауға тырысады, осылайша сегменттерді болашақ мәтіндерде оңайырақ қайта қолдануға болады, бұл мәтіннің байланыстылығы мен оқылуына әсер етеді (O'Hagan 2009). Аударма мәтініне әсер ететін, мүмкін, тіпті сезімталдықпен байқамайтын әсер де болуы мүмкін. Әртүрлі тілдер сөйлемдегі логикалық элементтерді әртүрлі ретпен орналастырады, сондықтан жартылай аударылған көп салалы сөйлеммен аудармашының сөйлемді толыққанды қайта құру ықтималдығы төмендеуі мүмкін. Нақты эмпирикалық деректер (Martín Mor 2011) көрсеткендей, аудармашылар мәтіндік процессормен жұмыс істегенде, ТМ жүйесімен емес, көп салалы сөйлемнің құрылымын өзгертуге бейім. Сондай-ақ, аудармашы мәтінді әр сөйлемді жеке қарастырып, оның айналасындағы сөйлемдермен және мәтіннің жалпы мазмұнымен байланысын ескермей механикалық түрде жұмыс істеуі мүмкін. Зерттеушілер (Dragsted 2004) осы бағдарламалардың автоматты сегментациялау мүмкіндігіне байланысты осы әсерді анықтады, бірақ ол аударма сапасына әрдайым кері әсер ете бермейді. Бұл әсерлер құралдың өзіне тән емес, аудармашының дайындығына байланысты. Martín Mor (2011) мәлімдегендей, ТМ жүйелерін қолдану аударма мәтіндерінің сапасына әсер етеді, әсіресе жаңа аудармашылар үшін, бірақ тәжірибелі аудармашылар одан аулақ бола алады. Pym (2013) еске салады: "ТМ/ҚМ қолданатын аудармашылар әр сегментті бірден түзетуге бейім, сондықтан бүкіл мәтінді соңынан қайта қарауға уақыт жетпейді", бұл осы жерде сипатталған кейбір әсерлердің түпкі себебі болуы мүмкін.
The use of TM systems might have an effect on the quality of the texts translated. Its main effect is clearly related to the so called "error propagation": if the translation for a particular segment is incorrect, it is in fact more likely that the incorrect translation will be reused the next time the same source text, or a similar source text, is translated, thereby perpetuating the error. Traditionally, two main effects on the quality of translated texts have been described: the "sentence salad" effect (Bédard 2000; cited in O'Hagan 2009: 50) and the "peep hole" effect (Heyn 1998). The first refers to a lack of coherence at the text level when a text is translated using sentences from a TM which have been translated by different translators with different styles. According to the latter, translators may adapt their style to the use of TM system in order for these not to contain intratextual references, so that the segments can be better reused in future texts, thus affecting cohesion and readability (O'Hagan 2009). There is a potential, and, if present, probably an unconscious effect on the translated text. Different languages use different sequences for the logical elements within a sentence and a translator presented with a multiple clause sentence that is half translated is less likely to completely rebuild a sentence. Consistent empirical evidences (Martín Mor 2011) show that translators will most likely modify the structure of a multiple clause sentence when working with a text processor rather than with a TM system. There is also a potential for the translator to deal with the text mechanically sentence by sentence, instead of focusing on how each sentence relates to those around it and to the text as a whole. Researchers (Dragsted 2004) have identified this effect, which relates to the automatic segmentation feature of these programs, but it does not necessarily have a negative effect on the quality of translations. These effects are closely related to training rather than inherent to the tool. According to Martín Mor (2011), the use of TM systems does have an effect on the quality of the translated texts, especially on novices, but experienced translators are able to avoid it. Pym (2013) reminds that "translators using TM/MT tend to revise each segment as they go along, allowing little time for a final revision of the whole text at the end", which might be the ultimate cause of some of the effects described here.
ТМ жүйелерінің түрлері
Үстел: Үстел үстіндегі аударма жады құралдары әдетте жеке аудармашылар аудармаларды аяқтау үшін қолданады. Бұл аудармашының жеке компьютеріне жүктеліп орнатылатын бағдарламалар. Серверлік немесе орталықтандырылған: Орталықтандырылған аударма жады жүйелері аударма жадын орталық серверде сақтайды. Олар үстел үстіндегі аударма жадымен бірлесіп жұмыс істейді және үстел үстіндегі аударма жадының ғана есебінен қол жеткізілетін аударма жадының тиімділігін 30–60% дейін арттыра алады.
Desktop: Desktop translation memory tools are typically what individual translators use to complete translations. They are programs that a freelance translator downloads and installs on a desktop computer. Server based or centralised: Centralized translation memory systems store TM on a central server. They work together with desktop TM and can increase TM match rates by 30–60% more than the TM leverage attained by desktop TM alone.
Функциялар
Төменде аударма жадының негізгі функцияларының шолуы берілген.
The following is a summary of the main functions of a translation memory.
Импорт
Бұл функция мәтінді және оның аудармасын мәтін файлынан ТМ-ға көшіру үшін пайдаланылады. Импортты қара форматтан жасауға болады, онда аудармасымен бірге ТМ-ге импорттау үшін сыртқы мәтін қолжетімді. Кейде мәтіндерді пайдаланушы қайта өңдеуі қажет болады. Импорттауға болатын тағы бір формат – түпкілікті формат. Бұл формат ТМ-ді аударма естеліктерін файлға сақтау үшін пайдаланады.
This function is used to transfer a text and its translation from a text file to the TM. Import can be done from a raw format, in which an external source text is available for importing into a TM along with its translation. Sometimes the texts have to be reprocessed by the user. There is another format that can be used to import: the native format. This format is the one that uses the TM to save translation memories in a file.
Экспорт
Экспорт мәтінді МТ-дан сыртқы мәтін файлына көшіреді. Импорт және экспорт бір-біріне кері операциялар болуы керек.
Export transfers the text from the TM into an external text file. Import and export should be inverses.
Онлайн функциялары
Аударма жасағанда, ТМ-ның басты мақсаты – аудармашыға ең қолайлы нұсқаны таңдау үшін жадтан ең тиімді сәйкестіктерді табу. ТМ бастапқы және мақсатты мәтіндерді, олардың ұқсастықтары мен айырмашылықтарын көрсете білуі керек.
When translating, one of the main purposes of the TM is to retrieve the most useful matches in the memory so that the translator can choose the best one. The TM must show both the source and target text pointing out the identities and differences.
Қайта алу
ТМ-дан бірнеше түрлі сәйкестіктерді алуға болады. Дәл сәйкестік Дәл сәйкестіктер ағымдағы бастапқы сегмент пен сақталған сегмент арасында әріпте әріп сәйкес келген кезде пайда болады. Сөйлемді аудару кезінде дәл сәйкестік – бұл сол сөйлемнің бұрын аударылғанын білдіреді. Дәл сәйкестіктерді "100% сәйкестіктер" деп те атайды. Контекст бойынша дәл (ICE) сәйкестік немесе Кепілді сәйкестік ICE сәйкестігі – дәл сол контексте, яғни абзацтың бірдей бөлігінде кездесетін дәл сәйкестік. Контекст көбінесе айналасындағы сөйлемдермен және құжаттың файлының атауы, күні, рұқсаттары сияқты атрибуттармен анықталады. Бұлыңғыр сәйкестік Сәйкестік дәл болмаған жағдайда, ол "бұлыңғыр" сәйкестік деп аталады. Кейбір жүйелер мұндай сәйкестіктерге проценттік мән береді, онда бұлыңғыр сәйкестік 0%-дан жоғары және 100%-дан төмен болады. Егер бағалау әдісі көрсетілмесе, бұл көрсеткіштерді жүйелер арасында салыстыруға болмайды. Конкорданс Аудармашы бастапқы сегментте бір немесе бірнеше сөзді таңдағанда, жүйе іздеу критерийлеріне сәйкес келетін сегмент жұптарын іздеп шығарады. Бұл мүмкіндік терминологиялық база болмаған жағдайда терминдер мен фразеологиялық тіркестердің аудармаларын табуға көмектеседі.
Several different types of matches can be retrieved from a TM. Exact match Exact matches appear when the match between the current source segment and the stored one is a character by character match. When translating a sentence, an exact match means the same sentence has been translated before. Exact matches are also called "100 % matches". In Context Exact (ICE) match or Guaranteed Match An ICE match is an exact match that occurs in exactly the same context, that is, the same location in a paragraph. Context is often defined by the surrounding sentences and attributes such as document file name, date, and permissions. Fuzzy match When the match is not exact, it is a "fuzzy" match. Some systems assign percentages to these kinds of matches, in which case a fuzzy match is greater than 0% and less than 100%. Those figures are not comparable across systems unless the method of scoring is specified. Concordance When the translator selects one or more words in the source segment, the system retrieves segment pairs that match the search criteria. This feature is helpful for finding translations of terms and idioms in the absence of a terminology database.
Жаңарту
ТМ аудармашы мақұлдаған кезде жаңа аудармамен жаңартылады. Деректер базасын жаңарту кезінде, әдеттегідей, базаның бұрынғы мазмұнымен не істеу керек деген сұрақ туындайды. ТМ-ды ТМ-дағы жазбаларды өзгерту немесе жою арқылы өңдеуге болады. Кейбір жүйелер аудармашыларға бір түпнұсқа сегмент үшін бірнеше аударманы сақтауға рұқсат береді.
A TM is updated with a new translation when it has been accepted by the translator. As always in updating a database, there is the question what to do with the previous contents of the database. A TM can be modified by changing or deleting entries in the TM. Some systems allow translators to save multiple translations of the same source segment.
Автоматты аударма
Аудармалық жад құралдары көбінесе автоматты іздеу және алмастыру мүмкіндіктерін ұсынады. Автоматты іздеу жүйелері аудармашы құжатты өңдеп жатқанда автоматты түрде ізделіп, нәтижелері көрсетіледі. Автоматты алмастыру функциясы арқылы, егер құжаттың жаңа нұсқасын аудару кезінде толық сәйкестік табылса, бағдарлама бұрынғы аударманы қайта қолданады. Егер аудармашы аударманы бастапқы мәтінмен тексермесе, бұрын жасалған қателер қайталанып қалуы мүмкін.
Translation memory tools often provide automatic retrieval and substitution. Automatic retrieval TM systems are searched and their results displayed automatically as a translator moves through a document. Automatic substitution With automatic substitution, if an exact match comes up in translating a new version of a document, the software will repeat the old translation. If the translator does not check the translation against the source, a mistake in the previous translation will be repeated.
Желі құру
Аудармашылар тобының өзара байланысы бір мәтінді жеке-жеке жұмыс істегеннен гөрі жылдамырақ аударуға мүмкіндік береді, себебі бір аудармашы аударған сөйлемдер мен тіркестер басқаларына қолжетімді болады. Сонымен қатар, түпкілікті аударма жасамас бұрын аударма естеліктері ортақ қолданысқа берілсе, бір аудармашы жіберген қателерді команданың басқа мүшелері түзетуге болады.
Networking enables a group of translators to translate a text together faster than if each was working in isolation, because sentences and phrases translated by one translator are available to the others. Moreover, if translation memories are shared before the final translation, there is an opportunity for mistakes by one translator to be corrected by other team members.
Мәтін жады
"Текст жады" ұсынылған Lisa OSCAR xml:tm стандартының негізі болып табылады. Текст жады автор жадысы және аударма жадысынан құралады.
"Text memory" is the basis of the proposed Lisa OSCAR xml:tm standard. Text memory comprises author memory and translation memory.
Аударма жады
Аударма кезінде бірегей идентификаторлар сақталады, соның арқасында мақсатты тілдегі құжат мәтін бірлігі деңгейінде "дәл" келісімге ие болады. Егер бастапқы құжат кейіннен өзгертілсе, өзгермеген мәтін бірліктерін аудармашының қатысуынсыз құжаттың жаңа мақсатты нұсқасына тікелей көшіруге болады. Бұл аударма жадымен "нақты" немесе "толық" сәйкестік концепциясы. xml:tm құжат ішінде қолданылатын және шамалы сәйкестіктерді табуға мүмкіндік беретін механизмдерді де ұсына алады.
The unique identifiers are remembered during translation so that the target language document is 'exactly' aligned at the text unit level. If the source document is subsequently modified, then those text units that have not changed can be directly transferred to the new target version of the document without the need for any translator interaction. This is the concept of 'exact' or 'perfect' matching to the translation memory. xml:tm can also provide mechanisms for in document leveraged and fuzzy matching.
Тарих
1970 жылдар ТМ жүйелерінің бастапқы кезеңі болды, онда ғалымдар алдын ала зерттеу талқылауларын жүргізді. ТМ жүйелерінің түпкілікті идеясы көбінесе Мартин Кейдің «Орынды жай» атты мақаласына байланысты, бірақ оның толық егжей-тегжейі берілмеген. Осы мақалада сақтау жүйесінің негізгі қағидасы көрсетілген: «Аудармашы жүйеге сақталымдағы маңызды болуы мүмкін кез келген ақпаратты көрсетуге бағытталған команда бере алады. Одан әрі жұмысты жалғастыру үшін, ол бұрынғы және болашақ мәтін фрагменттерін қарастыра алады, оларда ұқсас материалдар бар». Кейдің осы тұжырымы Петер Артерннің аудармашылар онлайн режимінде бұрын аударған, ұқсас құжаттарды пайдалана алады деген ұсынысымен шартты. 1978 жылғы мақаласында ол бүгін ТМ жүйелері деп аталатын нәрсені толыққанды көрсетті: кез келген жаңа мәтін сөздік өңдеу стансасына терілетін болады, ал терілген кезде жүйе бұл мәтінді жадында сақталған бұрынғы мәтіндермен салыстырып, оның барлық ресми тілдерге аудармасын тексеретін болады [Еуропалық қауымдастықтың]. Машиналық аудармаға қарағанда, алынған барлық фрагменттер грамматикалық тұрғыдан дұрыс болады. Іс жүзінде, біз электрондық «кесіп, қосатын» процесті қолданып, менің есептеулеріме сәйкес, аудармашылардың аударма жасауға жұмсайтын уақытының кем дегенде 15 пайызын үнемдей аламыз. Бұл идея алғаш рет Бригам Янг университетінің зерттеушісі жасаған ALPS (Автоматтандырылған тілдік өңдеу жүйелері) құралдарынан алынған, ал сол кезде ТМ жүйелерінің идеясы тек сәйкес келетін тізбектерді табуға бағытталған «қайталауларды өңдеу» құралымен біріктірілді. Ұзақ уақыттан кейін ғана «аударма жады» деген ұғым пайда болды. ТМ жүйелерінің нақты зерттеу кезеңі 1980 жылдарда басталды. ТМ жүйесінің алғашқы іске асырылымдарының бірі Садлер мен Венделманның Екі тілді білім банкінде пайда болды. Екі тілді білім банкі – бұл синтаксикалық және анықтамалық тұрғыдан құрылымдалған корпустар жұбы, олардың бірі екіншісінің аудармасы болып табылады, ал аударма бірліктері корпустар арасында өзара кодталған. Екі тілді білім банкінің мақсаты – машиналық аударма және компьютерлік көмекпен аудармада қолданылатын корпусқа негізделген, жалпы мақсаттағы білім көзін әзірлеу (Sadler & Vendelman, 1987). Брайан Харрис өзінің «Би-мәтінімен» маңызды қадам жасады. Ол би-мәтінді «екі өлшемді бір мәтін» (1988) деп анықтады, мұнда бастапқы және мақсатты мәтіндер аудармашының қызметі арқылы аударма бірліктерімен байланыстырылған, бұл Садлердің Екі тілді білім банкімен ұқсас эхо тудырды. Харрис еңбегінде ол осы атауды қолданбай-ақ ТМ жүйесіне ұқсас нәрсені ұсынды: жеке сөзбен немесе «толық аударма бірлігімен» іздеуге болатын жұпталған аудармалардың дерекқоры, соңғы жағдайда іздеу ұқсас емес, бірдей бірліктерді табуға мүмкіндік береді. ТМ технологиясы 1990 жылдардың соңында бірнеше инженерлер мен аудармашылардың күш-жігерінің арқасында кеңінен қолжетімді болды. Алғашқы ТМ құралы Trados (қазір SDL Trados) деп аталды. Бұл құралда бастапқы файлды ашып, аударма жадын қолданған кезде мәтіндегі кез келген «100% сәйкестік» (бірдей сәйкестік) немесе «бұлыңғыр сәйкестік» (ұқсас, бірақ бірдей емес) бірден анықталып, мақсатты файлға орналастырылады. Содан кейін аударма жады ұсынған «сәйкестіктерді» қабылдауға немесе жаңа баламалармен алмастыруға болады. Егер аударма бірлігі қолмен жаңартылса, онда ол болашақта пайдалану үшін, сондай-ақ ағымдағы мәтінде қайта пайдалану үшін аударма жадына сақталады. Осыған ұқсас, мақсатты файлда «сәйкестік» жоқ барлық сегменттер қолмен аударылады, содан кейін автоматты түрде аударма жадына қосылады. 2000 жылдары онлайн аударма қызметтері ТМ-ді енгізе бастады. Google Translate сияқты машиналық аударма қызметтері, сондай-ақ Gengo және Ackuna сияқты сайттар ұсынатын кәсіби және «гибридті» аударма қызметтері аудармашылар мен еріктілер ұсынатын ТМ деректерінің дерекқорын қамтиды, бұл тілдер арасындағы тиімді байланысты қамтамасыз етуге және соңғы пайдаланушыларға жылдам аударма қызметтерін ұсынуға мүмкіндік береді.
1970s is the infancy stage for TM systems in which scholars carried on a preliminary round of exploratory discussions. The original idea for TM systems is often attributed to Martin Kay's "Proper Place" paper, but the details of it are not fully given. In this paper, it has shown the basic concept of the storing system: "The translator might start by issuing a command causing the system to display anything in the store that might be relevant to Before going on, he can examine past and future fragments of text that contain similar material". This observation from Kay was actually influenced by the suggestion of Peter Arthern that translators can use similar, already translated documents online. In his 1978 article he gave fully demonstration of what we call TM systems today: Any new text would be typed into a word processing station, and as it was being typed, the system would check this text against the earlier texts stored in its memory, together with its translation into all the other official languages [of the European Community]. One advantage over machine translation proper would be that all the passages so retrieved would be grammatically correct. In effect, we should be operating an electronic 'cut and stick' process which would, according to my calculations, save at least 15 per cent of the time which translators now employ in effectively producing translations. The idea was incorporated from ALPS (Automated Language Processing Systems) Tools first developed by researcher from Brigham Young University, and at that time the idea of TM systems was mixed with a tool called "Repetitions Processing" which only aimed to find matched strings. Only after a long time, did the concept of so called translation memory come into being. The real exploratory stage of TM systems would be 1980s. One of the first implementations of TM system appeared in Sadler and Vendelmans' Bilingual Knowledge Bank. A Bilingual Knowledge Bank is a syntactically and referentially structured pair of corpora, one being a translation of the other, in which translation units are cross coded between the corpora. The aim of Bilingual Knowledge Bank is to develop a corpus based general purpose knowledge source for applications in machine translation and computer aided translation (Sadler & Vendelman, 1987). Another important step was made by Brian Harris with his "Bi text". He has defined the bi text as "a single text in two dimensions" (1988), the source and target texts related by the activity of the translator through translation units which made a similar echoes with Sadler's Bilingual Knowledge Bank. And in Harris's work he proposed something like TM system without using this name: a database of paired translations, searchable either by individual word, or by "whole translation unit", in the latter case the search being allowed to retrieve similar rather than identical units. TM technology only became commercially available on a wide scale in the late 1990s, through the efforts made by several engineers and translators. Of note is the first TM tool called Trados (SDL Trados nowadays). In this tool, when opening the source file and applying the translation memory so that any "100% matches" (identical matches) or "fuzzy matches" (similar, but not identical matches) within the text are instantly extracted and placed within the target file. Then, the "matches" suggested by the translation memory can be either accepted or overridden with new alternatives. If a translation unit is manually updated, then it is stored within the translation memory for future use as well as for repetition in the current text. In a similar way, all segments in the target file without a "match" would be translated manually and then automatically added to the translation memory. In the 2000s, online translation services began incorporating TM. Machine translation services like Google Translate, as well as professional and "hybrid" translation services provided by sites like Gengo and Ackuna, incorporate databases of TM data supplied by translators and volunteers to make more efficient connections between languages provide faster translation services to end users.
Соңғы үрдістер
Соңғы кезде пайда болған бір жаңалық – аударма жадына қарама-қарсы "мәтін жады" тұжырымы. Бұл, сондай-ақ, ұсынылып отырған LISA OSCAR стандартының негізі болып табылады. xml:tm ішіндегі мәтін жады "автор жады" және "аударма жады" түрлерін қамтиды. Автор жады авторлық цикл кезіндегі өзгерістерді қадағалау үшін қолданылады. Аударма жады аударма жадының сәйкестігін іске асыру үшін автор жадынан алынған ақпаратты пайдаланады. Көбінесе XML құжаттарына бағытталған болғанымен, xml:tm XLIFF форматына түрлендірілетін кез келген құжатта қолданылуы мүмкін.
One recent development is the concept of 'text memory' in contrast to translation memory. This is also the basis of the proposed LISA OSCAR standard. Text memory within xml:tm comprises 'author memory' and 'translation memory'. Author memory is used to keep track of changes during the authoring cycle. Translation memory uses the information from author memory to implement translation memory matching. Although primarily targeted at XML documents, xml:tm can be used on any document that can be converted to XLIFF format.
Екінші буын аударма жады
Бірінші буын ТМ жүйелерінен әлдеқайда күшті, олар лингвистикалық талдау механизмін қамтиды, сегменттерді интеллектуалды терминологиялық топтарға жіктеу үшін бөлшектеу технологиясын пайдаланады және арнайы глоссарийлерді автоматты түрде құрайды.
Much more powerful than first generation TM systems, they include a linguistic analysis engine, use chunk technology to break down segments into intelligent terminological groups, and automatically generate specific glossaries.
TMX
Translation Memory eXchange (TMX) – аудармалық жадтарды аударма қызметтерін ұсынатын компаниялар арасында алмасуға мүмкіндік беретін стандарт. TMX аударма саласында аудармалық жадтарды импорттау және экспорттаудың ең тиімді жолы ретінде қабылданып, қолданылады. Қазіргі нұсқасы 1.4b болып табылады, ол TMX деректерінен бастапқы мәтін мен аудармаланған құжаттарды қайта жасауға мүмкіндік береді.
Translation Memory eXchange (TMX) is a standard that enables the interchange of translation memories between translation suppliers. TMX has been adopted by the translation community as the best way of importing and exporting translation memories. The current version is 1.4b it allows for the recreation of the original source and target documents from the TMX data.
TBX
Терминдік базалық алмасу. Бұл LISA стандарты, ISO 30042 ретінде қайта қаралып, жаңадан басылған, терминологиялық деректерді, соның ішінде егжей-тегжейлі лексикалық ақпаратты алмасуға мүмкіндік береді. TBX-тің құрылымдық негізін үш ISO стандарты құрайды: ISO 12620, ISO 12200 және ISO 16642. ISO 12620 нақты анықталған «деректер санаттарының» тізімін ұсынады, олар дерек элементтерінің түрлері немесе алдын ала белгіленген мәндер ретінде стандартталған атаулармен жұмыс істейді. ISO 12200 (MARTIF деп те белгілі) TBX-тің негізгі құрылымының негізін қалайды. ISO 16642 (Терминологиялық белгілеу жүйесі деп те аталады) жалпы терминологиялық белгілеу тілдері үшін құрылымдық метамодельді қамтиды.
TermBase eXchange. This LISA standard, which was revised and republished as ISO 30042, allows for the interchange of terminology data including detailed lexical information. The framework for TBX is provided by three ISO standards: ISO 12620, ISO 12200 and ISO 16642. ISO 12620 provides an inventory of well defined “data categories” with standardized names that function as data element types or as predefined values. ISO 12200 (also known as MARTIF) provides the basis for the core structure of TBX. ISO 16642 (also known as Terminological Markup Framework) includes a structural meta model for Terminology Markup Languages in general.
UTX
Universal Terminology eXchange (UTX) форматы – машиналық аударма қолданушы сөздіктері үшін жасалған арнайы стандарт, бірақ оны жалпы, адамдар оқи алатын глоссарийлер үшін де пайдалануға болады. UTX-тің мақсаты – өте қарапайым және қолданысқа ыңғайлы ережелері арқасында сөздіктерді ортақ пайдалану мен қайта қолдануды жеделдету.
Universal Terminology eXchange (UTX) format is a standard specifically designed to be used for user dictionaries of machine translation, but it can be used for general, human readable glossaries. The purpose of UTX is to accelerate dictionary sharing and reuse by its extremely simple and practical specification.
SRX
Segmentation Rules eXchange (SRX) TMX стандартын жетілдіруге бағытталған, осылайша қолданбалар арасында алмасылатын аударма жады деректерін тиімдірек пайдалануға мүмкіндік береді. Алдыңғы аудармада қолданылған сегменттеу ережелерін көрсету мүмкіндігі қолданылатын материалды көбейтуге септігін тигізеді.
Segmentation Rules eXchange (SRX) is intended to enhance the TMX standard so that translation memory data that is exchanged between applications can be used more effectively. The ability to specify the segmentation rules that were used in the previous translation may increase the leveraging that can be achieved.
GMX
ГИЛТ көрсеткіштері. GILT – (глобалдастыру, интернационалдастыру, локалдастыру және аударма) деген сөздердің бас әріптерінен құралған аббревиатура. GILT Metrics стандарты үш бөліктен тұрады: көлемдік көрсеткіштер үшін GMX V, күрделілік көрсеткіштері үшін GMX C және сапалық көрсеткіштер үшін GMX Q. Ұсынылып отырған GILT Metrics стандартының мақсаты – кез келген GILT тапсырмасының жұмыс көлемін және сапа талаптарын сандық тұрғыда бағалау.
GILT Metrics. GILT stands for (Globalization, Internationalization, Localization, and Translation). The GILT Metrics standard comprises three parts: GMX V for volume metrics, GMX C for complexity metrics and GMX Q for quality metrics. The proposed GILT Metrics standard is tasked with quantifying the workload and quality requirements for any given GILT task.
OLIF
Ашық лексикон алмасу форматы. OLIF – терминологиялық және лексикалық деректерді алмасуға арналған ашық, XML форматына сәйкес стандарт. Бұл бастапқыда меншік иеліктегі машиналық аударма лексикалары арасында лексикалық деректерді алмасу құралы ретінде жоспарланғанмен, қазір терминология алмасудың көбірек қолданылатын жалпы стандартына айналды.
Open Lexicon Interchange Format. OLIF is an open, XML compliant standard for the exchange of terminological and lexical data. Although originally intended as a means for the exchange of lexical data between proprietary machine translation lexicons, it has evolved into a more general standard for terminology exchange.
XLIFF
XML Локализация алмасу файл пішімі (XLIFF) кез келген жергіліктілендіру қызметін ұсынатын компания түсіне алатын бірыңғай алмасу файл пішімін қамтамасыз ету үшін жасалған. XLIFF аударма индустриясында XML форматындағы деректерді алмасудың басым әдісі болып табылады.
XML Localisation Interchange File Format (XLIFF) is intended to provide a single interchange file format that can be understood by any localization provider. XLIFF is the preferred way of exchanging data in XML format in the translation industry.
TransWS
Аударма веб-қызметтері. TransWS локализация жобаларына қатысты файлдар мен хабарламаларды жіберу және алу үшін веб-қызметтерді пайдалануға қажетті шақыруларды көрсетеді. Ол веб-қызметтерді қолдану арқылы ағымдағы локализация процесінің көп бөлігін автоматтандыруға арналған егжей-тегжейлі құрылым ретінде жасалған.
Translation Web Services. TransWS specifies the calls needed to use Web services for the submission and retrieval of files and messages relating to localization projects. It is intended as a detailed framework for the automation of much of the current localization process by the use of Web Services.
xml:tm
Аударма жадының xml:tm (XML негізіндегі мәтіндік жад) тәсілі авторлық және аударма жадынан құралған мәтіндік жад тұжырымдамасына негізделген. xml:tm XML INTL компаниясы Лиза Оскарға сыйлады.
The xml:tm (XML based Text Memory) approach to translation memory is based on the concept of text memory which comprises author and translation memory. xml:tm has been donated to Lisa OSCAR by XML INTL.
ТҚ
Gettext портативті нысан форматы. Gettext PO файлдары көбінесе аударма жады форматы ретінде қарастырылмаса да, аударма жадылары қолданылатын тәсілмен аударма жады процестерінде қолданылатын екі тілді файлдар болып табылады. Әдетте, PO аударма жады жүйесі каталог ағашы құрылымындағы бірнеше жеке файлдардан тұрады. PO файлдарымен жұмыс істейтін танымал құралдарға GNU Gettext Tools және Translate Toolkit жатады. Сондай-ақ, PO файлдарын қарапайым мәтіндік файлдар сияқты өңдеуге мүмкіндік беретін бірнеше құралдар мен бағдарламалар бар.
Gettext Portable Object format. Though often not regarded as a translation memory format, Gettext PO files are bilingual files that are also used in translation memory processes in the same way translation memories are used. Typically, a PO translation memory system will consist of various separate files in a directory tree structure. Common tools that work with PO files include the GNU Gettext Tools and the Translate Toolkit. Several tools and programs also exist that edit PO files as if they are mere source text files.