Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Linux-основанный, с открытым исходным кодом, набор переносимого программного обеспечения.
Linux based, open sourced, toolkit of portable software
Многомерный иерархический инструментарий, или Многомерный и Иерархический (MDH) инструментарий баз данных – это набор переносимого программного обеспечения на основе Linux, с открытым исходным кодом, обеспечивающий высокоскоростное, гибкое, многомерное и иерархическое хранение, извлечение и обработку информации в базах данных объемом до 256 терабайт. Пакет написан на языках C и C++ и доступен в виде исходного кода под лицензиями GNU GPL/LGPL/Free Documentation. В комплект поставки входят демонстрационные реализации сетевых интерактивных инструментов для извлечения текста и последовательностей, работающих с очень большими геномными базами данных и демонстрирующих возможности инструментария для обработки огромных массивов геномных данных.
The Multidimensional hierarchical toolkit or Multi Dimensional and Hierarchical (MDH) Database Toolkit is a Linux based, open sourced, toolkit of portable software that supports very fast, flexible, multi dimensional and hierarchical storage, retrieval and manipulation of information in databases ranging in size up to 256 terabytes. The package is written in C and C++ and is available under the GNU GPL/LGPL/Free Documentation licenses in source code form. The distribution kit contains demonstration implementations of network capable, interactive text and sequence retrieval tools that function with very large genomic data bases and illustrate the toolkit's capability to manipulate massive data sets of genomic information.
Распространение
Инструментарий распространяется вместе с компилятором Mumps. Доступны версии для Linux, Cygwin и Windows XP.
The toolkit is distributed as part of the Mumps Compiler. Versions exist for Linux, Cygwin, and Windows XP.
Происхождение
Инструментарий представляет собой решение проблемы обработки очень больших, многомерных, разреженных матриц, индексированных строками символов. Он основан на MUMPS (также известном как M), языке программирования общего назначения, разработанном в середине 60-х годов в Массачусетской общей больнице.
The toolkit is a solution to the problem of manipulating very large, character string indexed, multi dimensional, sparse matrices. It is based on MUMPS (also referred to as M), a general purpose programming language that originated in the mid 60's at the Massachusetts General Hospital.
Основные особенности
Основной функцией базы данных в этом проекте является глобальный массив, обеспечивающий прямой и эффективный доступ к многомерным массивам практически неограниченного размера. Глобальный массив – это постоянная, разреженная, неявная, многомерная структура данных, индексируемая строками и хранящаяся на диске. Глобальный массив может использоваться везде, где допустима обычная ссылка на массив, а данные могут храниться как в конечных, так и в промежуточных узлах структуры базы данных. Количество индексов в ссылке на массив ограничено только общей длиной этой ссылки, при этом все индексы преобразуются в строковые значения. Пакет инструментов включает несколько функций для обхода базы данных и манипулирования массивами. Пакет инструментов предоставляет базу данных и набор функций в виде классов C++ и также позволяет интерпретировать устаревшие скрипты Mumps. Для использования пакета инструментов необходимо установить дистрибутив MDH и Mumps, а также сопутствующий код.
The principal database feature in this project is the global array which permits direct, efficient manipulation of multi dimensional arrays of effectively unlimited size. A global array is a persistent, sparse, undeclared, multi dimensional, string indexed data disk based structure. A global array may appear anywhere an ordinary array reference is permitted and data may be stored at leaf nodes as well as intermediate nodes in the data base array. The number of subscripts in an array reference is limited only by the total length of the array reference with all subscripts expanded to their string values. The toolkit includes several functions to traverse the data base and manipulate the arrays. The toolkit makes the data base and function set available as C++ classes and also permits interpretive execution of legacy Mumps scripts. To use the toolkit, you install the MDH and Mumps distribution kit and related code.
Реализованные функции
Инструментарий реализует устаревшие функции Mumps: $ascii, $extract, $find, $length, $name, $justify, $order, $piece и $test, а также векторные и матричные операции, функции алгоритма поиска строк Бойера — Мура — Госпера, функцию алгоритма Смита — Ватермана, операции реляционной алгебры и доступ к библиотеке Perl Compatible Regular Expressions (PCRE).
The toolkit implements the legacy Mumps functions: $ascii , $extract , $find , , $length , $name , $justify , $order , $piece , and $test as well as vector and matrix operations, Boyer–Moore–Gosper string search algorithm functions, a Smith–Waterman algorithm function, relational algebra operations and access to the Perl Compatible Regular Expression library (PCRE).