Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Гетерогенная система баз данных – это автоматизированная (или полуавтоматизированная) система для интеграции разнородных, несвязанных систем управления базами данных, предоставляющая пользователю единый, унифицированный интерфейс запросов. Гетерогенные системы баз данных (HDB) – это вычислительные модели и программные реализации, обеспечивающие интеграцию гетерогенных баз данных.
A heterogeneous database system is an automated (or semi automated) system for the integration of heterogeneous, disparate database management systems to present a user with a single, unified query interface. Heterogeneous database systems (HDBs) are computational models and software implementations that provide heterogeneous database integration.
Проблемы интеграции гетерогенных баз данных
В этой статье не приводятся подробности об распределенных системах управления базами данных (иногда называемых федеративными системами баз данных).
This article does not contain details of distributed database management systems (sometimes known as federated database systems).
Техническая неоднородность
Различные форматы файлов, протоколы доступа, языки запросов и т.д. Часто это называют синтаксической неоднородностью с точки зрения данных.
Different file formats, access protocols, query languages etc. Often called syntactic heterogeneity from the point of view of data.
Гетерогенность модели данных
Различные способы представления и хранения одних и тех же данных. Разложения таблиц могут различаться, названия столбцов (метки данных) могут быть разными (но иметь одинаковую семантику), схемы кодирования данных могут различаться (например, следует ли явно включать масштаб измерения в поле или он должен подразумеваться в другом месте). Также известна как схематическая неоднородность.
Different ways of representing and storing the same data. Table decompositions may vary, column names (data labels) may be different (but have the same semantics), data encoding schemes may vary (i. e., should a measurement scale be explicitly included in a field or should it be implied elsewhere). Also referred as schematic heterogeneity.
Семантическая гетерогенность
Данные в составляющих базах данных могут быть связаны, но различны. Например, система баз данных может нуждаться в интеграции геномных и протеомных данных. Они связаны — ген может иметь несколько белковых продуктов, — но сами данные различны (нуклеотидные и аминокислотные последовательности, или гидрофильные и гидрофобные аминокислоты, или аминокислоты с положительным и отрицательным зарядом). Существует множество способов интерпретации семантически схожих, но различных наборов данных. Система также может быть призвана предоставлять пользователю "новые" знания. Связи между данными могут выводиться на основе правил, определенных в доменных онтологиях.
Data across constituent databases may be related but different. Perhaps a database system must be able to integrate genomic and proteomic data. They are related—a gene may have several protein products—but the data are different (nucleotide sequences and amino acid sequences, or hydrophilic or phobic amino acid sequence and positively or negatively charged amino acids). There may be many ways of looking at semantically similar, but distinct, datasets. The system may also be required to present "new" knowledge to the user. Relationships may be inferred between data according to rules specified in domain ontologies.