Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Мазмұны
Кіріспе
Жазбаша ақпаратты стандартты тәртіпке келтіру кітапхана, ақпарат және компьютерлік ғылымда.
Assembly of written information into a standard order
collation in library, information, and computer science
Жазбаша ақпаратты стандартты тәртіпке келтіру – бұл мәліметтерді белгілі бір ретпен жинақтау процесі. Көптеген жүйелер сандық немесе әліпбилік реттілікке, немесе олардың кеңейтілімдері мен комбинацияларына негізделген. Реттеу – көптеген кеңселік файлдар жүйелерінің, кітапхана каталогтарының және анықтамалық кітаптардың маңызды бөлігі. Реттеу, сыныптаудан өзгешелігі, сыныптардың өзі міндетті түрде реттелмеуі мүмкін. Дегенмен, егер сыныптардың реті маңызды болмаса да, сыныптардың идентификаторлары реттелген жиынның құрамында болуы мүмкін, бұл сұрыптау алгоритміне элементтерді сынып бойынша реттеуге мүмкіндік береді. Формальды түрде, реттеу әдісі мүмкін болатын идентификаторлар жиынтығында, яғни сұрыптау кілттерінде жалпы ретті анықтайды, нәтижесінде ақпарат элементтері жиынтығында жалпы алдын ала рет орнатылады (бірдей идентификаторлары бар элементтер ешқандай анықталған тәртіппен орналастырылмайды). Мысалы, Unicode реттеу алгоритмі сияқты реттеу алгоритмі екі берілген таңба тізбегін салыстыру арқылы және қайсысы бірінші болып келуі керек екенін анықтау арқылы ретті анықтайды. Рет осылайша анықталғаннан кейін, сұрыптау алгоритмін кез келген мөлшердегі элементтер тізімін сол ретке келтіру үшін қолдануға болады. Реттеудің басты артықшылығы – ол пайдаланушыға тізімдегі элементті жылдам және оңай табуға, немесе оның тізімде жоқ екенін растауға мүмкіндік береді. Автоматтандырылған жүйелерде бұл екілік іздеу немесе интерполяциялық іздеу алгоритмдерін пайдалану арқылы жүзеге асырылуы мүмкін, ал қолмен іздеу шамамен ұқсас процедураны қолдану арқылы орындалуы мүмкін, бірақ көбінесе бұл беймәлім түрде жасалады. Басқа артықшылықтарына тізімдегі бірінші немесе соңғы элементтерді (әсіресе сандық реттелген деректер үшін пайдалы) немесе белгілі бір диапазон ішіндегі элементтерді (сандық деректер үшін де, әліпбилік реттелген деректер үшін де пайдалы) оңай табу мүмкіндігі жатады, егер ізделіп отырған элементтің немесе элементтердің алғашқы бірнеше әріпі ғана белгілі болса да.
Collation is the assembly of written information into a standard order. Many systems of collation are based on numerical order or alphabetical order, or extensions and combinations thereof. Collation is a fundamental element of most office filing systems, library catalogs, and reference books. Collation differs from classification in that the classes themselves are not necessarily ordered. However, even if the order of the classes is irrelevant, the identifiers of the classes may be members of an ordered set, allowing a sorting algorithm to arrange the items by class. Formally speaking, a collation method typically defines a total order on a set of possible identifiers, called sort keys, which consequently produces a total preorder on the set of items of information (items with the same identifier are not placed in any defined order). A collation algorithm such as the Unicode collation algorithm defines an order through the process of comparing two given character strings and deciding which should come before the other. When an order has been defined in this way, a sorting algorithm can be used to put a list of any number of items into that order. The main advantage of collation is that it makes it fast and easy for a user to find an element in the list, or to confirm that it is absent from the list. In automatic systems this can be done using a binary search algorithm or interpolation search; manual searching may be performed using a roughly similar procedure, though this will often be done unconsciously. Other advantages are that one can easily find the first or last elements on the list (most likely to be useful in the case of numerically sorted data), or elements in a given range (useful again in the case of numerical data, and also with alphabetically ordered data when one may be sure of only the first few letters of the sought item or items).
Сандық және хронологиялық
Сандарды білдіретін тізбектер, олар көрсететін сандардың мәніне қарай сұрыпталуы мүмкін. Мысалы, "−4", "2.5", "10", "89", "30,000". Мұндай әдісті ғана қолдану тізбектердің толық ретін қамтамасыз етпеуі мүмкін, себебі әртүрлі тізбектер бірдей санды көрсете алады (мысалы, "2" және "2.0" немесе ғылыми нотация қолданылғанда "2e3" және "2000"). Осыған ұқсас тәсілді күндерді немесе хронологиялық немесе басқа да табиғи тәртіпте реттелетін басқа да элементтерді көрсететін тізбектерге де қолдануға болады.
Strings representing numbers may be sorted based on the values of the numbers that they represent. For example, "−4", "2.5", "10", "89", "30,000". Pure application of this method may provide only a partial ordering on the strings, since different strings can represent the same number (as with "2" and "2.0" or, when scientific notation is used, "2e3" and "2000"). A similar approach may be taken with strings representing dates or other items that can be ordered chronologically or in some other natural fashion.
Сандармен байланысты мәселелер
Кейде мәтінді ішкі сандармен дұрыс сандық тәртіпте реттеу қажет болады. Мысалы, "7b суреті" "11a суретінен" бұрын келеді, тіпті "7" Юникодта "1"ден кейін келсе де. Бұл римдік сандарға да қатысты. Бұл әрекетті жүзеге асыру тек толық сандар сұрыпталса, аса қиын емес, бірақ ол сұрыптауды айтарлықтай баяулатуы мүмкін. Мысалы, Microsoft Windows файлдарды атайтын кезінде осылай істейді. Ондық сандарды дұрыс сұрыптау сәл қиын, себебі әртүрлі аймақтар ондық нүктені белгілеу үшін әртүрлі символдарды қолданады, ал кейде ондық нүкте ретінде қолданылатын символ бөліш ретінде де қолданылады, мысалы "3.2.5 бөлімі". Мұндай жолдарды қалай сұрыптауға қатысты жалпы жауап жоқ; кез келген ереже қолданысқа байланысты.
Sometimes, it is desired to order text with embedded numbers using proper numerical order. For example, "Figure 7b" goes before "Figure 11a", even though '7' comes after '1' in Unicode. This can be extended to Roman numerals. This behavior is not particularly difficult to produce as long as only integers are to be sorted, although it can slow down sorting significantly. For example, Microsoft Windows does this when sorting file names. Sorting decimals properly is a bit more difficult, because different locales use different symbols for a decimal point, and sometimes the same character used as a decimal point is also used as a separator, for example "Section 3.2.5". There is no universal answer for how to sort such strings; any rules are application dependent.
Тапсырылған өнімдерді таңбалау
Кейбір жағдайларда сандар мен әріптер реттілік белгілеу үшін негіз ретінде емес, бұрыннан реттелген заттарды таңбалау құралы ретінде қолданылады. Мысалы, беттер, бөлімдер, тараулар сияқты және тізімдердегі элементтер көбінесе осылай "нөмірленеді". Таңбалау үшін қолданылатын тізбектерге қарапайым араб сандары (1, 2, 3, …), рим сандары (I, II, III немесе i, ii, iii, …) немесе әріптер (A, B, C немесе a, b, c, …) жатады. (Тізімдегі элементтерді нөмірлемей көрсетудің тағы бір жолы – тізімге белгілер қою.) Әліпби әріптері санау мақсатында қолданылғанда, қай әріптер қолданылатынына қатысты тілдік ережелер бар. Мысалы, орыс тіліндегі Ъ және Ь әріптері (жазуда тек алдыңғы дауыссызды өзгерту үшін қолданылады), сондай-ақ әдетте Ы, Й және Ё әріптері де қолданылмайды. Сонымен қатар, латын әліпбиін қолданатын көптеген тілдерде өзгертілген әріптер көбінесе санауда қолданылмайды.
In some contexts, numbers and letters are used not so much as a basis for establishing an ordering, but as a means of labeling items that are already ordered. For example, pages, sections, chapters, and the like, as well as the items of lists, are frequently "numbered" in this way. Labeling series that may be used include ordinary Arabic numerals (1, 2, 3, ), Roman numerals (I, II, III, or i, ii, iii, ), or letters (A, B, C, or a, b, c, ). (An alternative method for indicating list items, without numbering them, is to use a bulleted list.) When letters of an alphabet are used for this purpose of enumeration, there are certain language specific conventions as to which letters are used. For example, the Russian letters Ъ and Ь (which in writing are only used for modifying the preceding consonant), and usually also Ы, Й, and Ё, are omitted. Also in many languages that use extended Latin script, the modified letters are often not used in enumeration.