Распределённые базы данных: архитектура и методы обновления данных
Distributed database
Распределённая база данных: хранение данных в разных физических местах. Преимущества, архитектура и отличия от параллельных систем. Оптимизация данных.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
База данных, в которой данные хранятся в различных физических местоположениях. Распределенная база данных – это база данных, в которой данные хранятся в различных физических местоположениях. Она может храниться на нескольких компьютерах, расположенных в одном физическом месте (например, в центре обработки данных), или может быть распределена по сети взаимосвязанных компьютеров. В отличие от параллельных систем, где процессоры тесно связаны и образуют единую систему баз данных, распределенная система баз данных состоит из слабо связанных узлов, не имеющих общих физических компонентов. Системные администраторы могут распределять коллекции данных (например, в базе данных) по нескольким физическим местоположениям. Распределенная база данных может размещаться на организованных сетевых серверах или децентрализованных независимых компьютерах в Интернете, корпоративных интрасетях или экстрасетях, или в других организационных сетях. Поскольку распределенные базы данных хранят данные на нескольких компьютерах, они могут повысить производительность на рабочих местах конечных пользователей, позволяя обрабатывать транзакции на множестве машин, а не ограничиваясь одной. Два процесса обеспечивают актуальность и согласованность распределенных баз данных: репликация и дублирование. Репликация предполагает использование специализированного программного обеспечения, которое отслеживает изменения в распределенной базе данных. После обнаружения изменений процесс репликации приводит все базы данных к одинаковому состоянию. Процесс репликации может быть сложным и ресурсоемким, в зависимости от размера и количества распределенных баз данных. Он также может требовать значительного времени и вычислительных ресурсов. Дублирование, напротив, менее сложно. Оно определяет одну базу данных как основную и затем дублирует ее. Процесс дублирования обычно выполняется в определенное время в нерабочее время, чтобы обеспечить одинаковые данные во всех распределенных местоположениях. В процессе дублирования пользователи могут изменять только основную базу данных, что предотвращает перезапись локальных данных. И репликация, и дублирование позволяют поддерживать актуальность данных во всех распределенных местоположениях. Oracle предлагает более ориентированный на язык подход, в котором распределенные запросы и распределенные транзакции являются частью распределенного SQL.
A database in which data is stored across different physical locations. A distributed database is a database in which data is stored across different physical locations. It may be stored in multiple computers located in the same physical location (e. g. a data centre); or maybe dispersed over a network of interconnected computers. Unlike parallel systems, in which the processors are tightly coupled and constitute a single database system, a distributed database system consists of loosely coupled sites that share no physical components. System administrators can distribute collections of data (e. g. in a database) across multiple physical locations. A distributed database can reside on organised network servers or decentralised independent computers on the Internet, on corporate intranets or extranets, or on other organisation networks. Because distributed databases store data across multiple computers, distributed databases may improve performance at end user worksites by allowing transactions to be processed on many machines, instead of being limited to one. Two processes ensure that the distributed databases remain up to date and current: replication and duplication. Replication involves using specialized software that looks for changes in the distributive database. Once the changes have been identified, the replication process makes all the databases look the same. The replication process can be complex and time consuming, depending on the size and number of the distributed databases. This process can also require much time and computer resources. Duplication, on the other hand, has less complexity. It identifies one database as a master and then duplicates that database. The duplication process is normally done at a set time after hours. This is to ensure that each distributed location has the same data. In the duplication process, users may change only the master database. This ensures that local data will not be overwritten. Both replication and duplication can keep the data current in all distributive locations. Oracle provides a more language centric view in which distributed queries and distributed transactions form part of distributed SQL.