Введение

Сохранение или восстановление жизненно важной инфраструктуры информационных технологий, планирование обеспечения непрерывности бизнеса.

Восстановление ИТ-инфраструктуры после аварий – это процесс поддержания или восстановления жизненно важной инфраструктуры и систем после стихийного или техногенного бедствия, такого как шторм или боевые действия. Этот процесс включает в себя разработку политик, использование инструментов и процедур. Восстановление ИТ-инфраструктуры после аварий фокусируется на информационных технологиях (ИТ) или технологических системах, поддерживающих критически важные бизнес-функции, в отличие от обеспечения непрерывности бизнеса. Обеспечение непрерывности бизнеса подразумевает поддержание функционирования всех существенных аспектов деятельности компании, несмотря на значительные сбои, и, таким образом, может рассматриваться как более широкое понятие, включающее в себя восстановление ИТ-инфраструктуры после аварий. Восстановление ИТ-инфраструктуры после аварий предполагает, что основной объект не может быть оперативно восстановлен, и обеспечивает восстановление данных и сервисов на резервном объекте.

Непрерывность услуг ИТ

IT Service Continuity (ITSC) — это часть планирования непрерывности бизнеса (BCP), ориентированная на целевую точку восстановления (RPO) и целевое время восстановления (RTO). Она охватывает планирование восстановления ИТ после аварий и более широкое планирование устойчивости ИТ. Также в неё входит ИТ-инфраструктура и сервисы, связанные со средствами связи, такие как телефония и передача данных.

Принципы резервных копий

Планирование включает в себя организацию резервных площадок, будь то "горячие" (функционирующие до наступления аварии), "теплые" (подготовленные к запуску) или "холодные" (требующие существенных работ для начала функционирования), а также резервные площадки с необходимым оборудованием для обеспечения непрерывности деятельности. В 2008 году Британский институт стандартов разработал специальный стандарт, поддерживающий стандарт обеспечения непрерывности бизнеса BS 25999, под названием BS25777, специально для согласования обеспечения непрерывности ИТ с обеспечением непрерывности бизнеса. Этот стандарт был отозван после публикации в марте 2011 года ISO/IEC 27031, "Техники безопасности. Руководство по готовности информационных и коммуникационных технологий к обеспечению непрерывности деятельности". ITIL определил некоторые из этих терминов.

Цель времени восстановления

Цель времени восстановления (RTO) – это целевая продолжительность и уровень обслуживания, в пределах которых бизнес-процесс должен быть восстановлен после сбоя, чтобы избежать прерывания бизнес-непрерывности. В соответствии с методологией планирования обеспечения бизнес-непрерывности, RTO определяется в ходе анализа влияния на бизнес (BIA) владельцем (владельцами) процесса, включая определение временных рамок для альтернативных или ручных способов обхода. RTO дополняет RPO. Пределы допустимой или "приемлемой" производительности ИТ-инфраструктуры измеряются RTO и RPO с точки зрения времени простоя бизнес-процессов и объема данных, потерянных или не сохраненных в резервную копию за этот период.

Время восстановления

Реальное время восстановления (RTA) — ключевой показатель обеспечения непрерывности бизнеса и аварийного восстановления.

Цель точки восстановления

Цель точки восстановления (RPO) — это максимальный допустимый период времени, в течение которого могут быть потеряны транзакционные данные ИТ-сервиса.

Отношение к цели времени восстановления

Восстановление, которое не является мгновенным, восстанавливает данные транзакций за определенный промежуток времени, не приводя к значительным рискам или потерям, после завершения резервного копирования. Оно приостанавливает обработку обновлений на время выполнения копирования с диска на диск. Резервная копия отражает состояние данных на момент начала операции копирования, а не на момент копирования на ленту или передачи в другое место.

Конструкция системы

RTO и RPO должны быть сбалансированы с учетом бизнес-рисков и других критериев проектирования системы. RPO определяется временем создания резервных копий вне основной площадки. Отправка синхронных копий на удаленное зеркало позволяет справиться с большинством непредвиденных ситуаций. Распространенным является использование физической транспортировки лент (или других сменных носителей). Восстановление может быть инициировано на заранее определенной площадке. Совместное использование удаленной площадки и оборудования дополняет решение. Для больших объемов ценных транзакционных данных оборудование может быть распределено между несколькими площадками.

История

Планирование восстановления после аварий и информационных технологий (ИТ) начало развиваться в середине-конце 1970-х годов, когда менеджеры компьютерных центров осознали зависимость своих организаций от компьютерных систем. В то время большинство систем представляли собой мейнфреймы, работающие в пакетном режиме. В случае аварии на основном объекте, мейнфрейм на резервном площадке мог быть загружен с резервных лент до восстановления основного объекта; время простоя считалось относительно некритичным. Индустрия восстановления после аварий развивалась, чтобы предоставлять резервные компьютерные центры. Sungard Availability Services был одним из первых таких центров, расположенным в Шри-Ланке (1978). В 1980-х и 1990-х годах вычислительные мощности росли экспоненциально, включая внутренние корпоративные системы разделения времени, онлайн-ввод данных и обработку в реальном времени. Доступность ИТ-систем становилась все более важной. Регулирующие органы начали участвовать в этом процессе; часто предписывались целевые показатели доступности в 2, 3, 4 или 5 девяти (99,999%), и искались решения высокой доступности для площадок типа "горячего резерва". Непрерывность ИТ-услуг стала неотъемлемой частью управления непрерывностью бизнеса (BCM) и управления информационной безопасностью (ICM), как это определено в стандартах ISO/IEC 27001 и ISO 22301 соответственно. Развитие облачных вычислений с 2010 года открыло новые возможности для повышения устойчивости систем. Поставщики услуг взяли на себя ответственность за поддержание высокого уровня обслуживания, включая доступность и надежность, и предлагали высокоустойчивые сетевые архитектуры. Услуга восстановления как сервис (RaaS) широко доступна и продвигается Cloud Security Alliance.

Классификация

Катастрофы могут быть вызваны тремя основными категориями угроз и опасностей. Природные опасности включают в себя стихийные бедствия, такие как наводнения, ураганы, торнадо, землетрясения и эпидемии. Технологические опасности включают аварии или отказы систем и сооружений, такие как взрывы трубопроводов, транспортные происшествия, перебои в работе коммунальных служб, разрушение плотин и случайные выбросы опасных веществ. Угрозы, создаваемые человеком, включают преднамеренные действия, такие как нападения вооруженных злоумышленников, химические или биологические атаки, кибератаки на данные или инфраструктуру, саботаж и войны. Меры готовности ко всем категориям и типам катастроф охватывают пять функциональных областей: предотвращение, защита, снижение последствий, реагирование и восстановление.

Меры контроля

Меры контроля – это шаги или механизмы, которые могут снизить или устранить угрозы. Выбор этих механизмов отражается в плане аварийного восстановления (ПАВ). Меры контроля можно классифицировать как средства предотвращения возникновения события, средства обнаружения или выявления нежелательных событий, и средства исправления или восстановления системы после аварии или события. Эти средства документируются и регулярно проверяются посредством так называемых "DR-тестов".

Восстановление после стихийных бедствий как услуга

Восстановление после аварий как услуга (DRaaS) — это соглашение с внешним поставщиком услуг о выполнении части или всех функций аварийного восстановления в сценариях, таких как отключения электроэнергии, сбои оборудования, кибератаки и природные катастрофы.