Введение

Автоматическое переключение с неисправной компьютерной системы на резервные компьютеры. Переключение на резервный компьютерный сервер, систему, аппаратный компонент или сеть происходит при сбое или аварийном завершении ранее активного приложения, сервера, системы, аппаратного компонента или сети в компьютерной сети. Переключение при отказе (failover) и переключение (switchover) по сути являются одной и той же операцией, за исключением того, что переключение при отказе происходит автоматически и обычно без предупреждения, в то время как переключение требует вмешательства человека. Разработчики систем обычно предусматривают возможность переключения при отказе в серверах, системах или сетях, требующих почти непрерывной доступности и высокой степени надежности. На уровне сервера автоматизация переключения при отказе обычно использует систему "контрольных сигналов" (heartbeat), соединяющую два сервера либо через отдельный кабель (например, последовательные порты/кабель RS 232), либо через сетевое соединение. В наиболее распространенной конфигурации, пока между основным и вторым серверами регулярно поступают "сигналы" или "контрольные сигналы", второй сервер не активирует свои системы. Однако некоторые системы активно используют все серверы и могут перенаправлять свою работу на оставшиеся серверы после сбоя. Также может существовать третий сервер "запасных частей" с резервными компонентами для "горячей" замены, чтобы предотвратить простои. Второй сервер берет на себя работу первого, как только обнаруживает изменение в "контрольных сигналах" первой машины. Некоторые системы способны отправлять уведомление о переключении при отказе. Определенные системы намеренно не переключаются полностью автоматически, а требуют вмешательства человека. Эта конфигурация "автоматизированная с ручным подтверждением" запускается автоматически после одобрения переключения при отказе человеком. Восстановление (Failback) – это процесс возвращения системы, компонента или сервиса, ранее находившегося в состоянии отказа, в исходное рабочее состояние, и перевод резервной системы из рабочего состояния обратно в режим ожидания. Использование программного обеспечения виртуализации позволило снизить зависимость практик переключения при отказе от физического оборудования благодаря процессу, называемому миграцией, при котором работающая виртуальная машина перемещается с одного физического хоста на другой с минимальным или полным отсутствием прерывания обслуживания. Технологии Failover и Failback также регулярно используются в базе данных Microsoft SQL Server, где экземпляр кластера отказоустойчивости SQL Server (FCI) устанавливается/конфигурируется поверх кластера отказоустойчивости Windows Server (WSFC). Группы и ресурсы SQL Server, работающие на WSFC, могут быть вручную переключены на второй узел для планового обслуживания на первом узле или автоматически переключены на второй узел в случае возникновения проблем на первом узле. Аналогично, операция восстановления может быть выполнена на первый узел после устранения проблемы или завершения обслуживания.

История

Термин "переключение при отказе", хотя, вероятно, использовался инженерами гораздо раньше, встречается в рассекреченном отчете NASA 1962 года. Термин "переключение" (switchover) можно найти в 1950-х годах при описании "горячих" и "холодных" систем резервирования, с текущим значением немедленного переключения на работающую систему (горячую) и отложенного переключения на систему, требующую запуска (холодную). Материалы конференции 1957 года описывают компьютерные системы с аварийным переключением (то есть переключением при отказе) и плановым переключением при отказе (для технического обслуживания).