Введение
Автоматическое переключение с неисправной компьютерной системы на резервные компьютеры. Переключение на резервный компьютерный сервер, систему, аппаратный компонент или сеть происходит при сбое или аварийном завершении ранее активного приложения, сервера, системы, аппаратного компонента или сети в компьютерной сети. Переключение при отказе (failover) и переключение (switchover) по сути являются одной и той же операцией, за исключением того, что переключение при отказе происходит автоматически и обычно без предупреждения, в то время как переключение требует вмешательства человека. Разработчики систем обычно предусматривают возможность переключения при отказе в серверах, системах или сетях, требующих почти непрерывной доступности и высокой степени надежности. На уровне сервера автоматизация переключения при отказе обычно использует систему "контрольных сигналов" (heartbeat), соединяющую два сервера либо через отдельный кабель (например, последовательные порты/кабель RS 232), либо через сетевое соединение. В наиболее распространенной конфигурации, пока между основным и вторым серверами регулярно поступают "сигналы" или "контрольные сигналы", второй сервер не активирует свои системы. Однако некоторые системы активно используют все серверы и могут перенаправлять свою работу на оставшиеся серверы после сбоя. Также может существовать третий сервер "запасных частей" с резервными компонентами для "горячей" замены, чтобы предотвратить простои. Второй сервер берет на себя работу первого, как только обнаруживает изменение в "контрольных сигналах" первой машины. Некоторые системы способны отправлять уведомление о переключении при отказе. Определенные системы намеренно не переключаются полностью автоматически, а требуют вмешательства человека. Эта конфигурация "автоматизированная с ручным подтверждением" запускается автоматически после одобрения переключения при отказе человеком. Восстановление (Failback) – это процесс возвращения системы, компонента или сервиса, ранее находившегося в состоянии отказа, в исходное рабочее состояние, и перевод резервной системы из рабочего состояния обратно в режим ожидания. Использование программного обеспечения виртуализации позволило снизить зависимость практик переключения при отказе от физического оборудования благодаря процессу, называемому миграцией, при котором работающая виртуальная машина перемещается с одного физического хоста на другой с минимальным или полным отсутствием прерывания обслуживания. Технологии Failover и Failback также регулярно используются в базе данных Microsoft SQL Server, где экземпляр кластера отказоустойчивости SQL Server (FCI) устанавливается/конфигурируется поверх кластера отказоустойчивости Windows Server (WSFC). Группы и ресурсы SQL Server, работающие на WSFC, могут быть вручную переключены на второй узел для планового обслуживания на первом узле или автоматически переключены на второй узел в случае возникновения проблем на первом узле. Аналогично, операция восстановления может быть выполнена на первый узел после устранения проблемы или завершения обслуживания.
Failover is switching to a redundant or standby computer server, system, hardware component or network upon the failure or abnormal termination of the previously active application, server, system, hardware component, or network in a computer network. Failover and switchover are essentially the same operation, except that failover is automatic and usually operates without warning, while switchover requires human intervention. Systems designers usually provide failover capability in servers, systems or networks requiring near continuous availability and a high degree of reliability. At the server level, failover automation usually uses a "heartbeat" system that connects two servers, either through using a separate cable (for example, RS 232 serial ports/cable) or a network connection. In the most common design, as long as a regular "pulse" or "heartbeat" continues between the main server and the second server, the second server will not bring its systems online; however a few systems actively use all servers and can failover their work to remaining servers after a failure. There may also be a third "spare parts" server that has running spare components for "hot" switching to prevent downtime. The second server takes over the work of the first as soon as it detects an alteration in the "heartbeat" of the first machine. Some systems have the ability to send a notification of failover. Certain systems, intentionally, do not failover entirely automatically, but require human intervention. This "automated with manual approval" configuration runs automatically once a human has approved the failover. Failback is the process of restoring a system, component, or service previously in a state of failure back to its original, working state, and having the standby system go from functioning back to standby. The use of virtualization software has allowed failover practices to become less reliant on physical hardware through the process referred to as migration in which a running virtual machine is moved from one physical host to another, with little or no disruption in service. Failover and Failback technology are also regularly used in the Microsoft SQL Server database, in which SQL Server Failover Cluster Instance (FCI) is installed/configured on top of the Windows Server failover Cluster (WSFC). The SQL Server groups and resources running on WSFC can manually be failover to the second node for any planned maintenance on the first node OR automatically failover to the second node in case of any issues on the first node. In the same way, a failback operation can be performed to the first node once the issue is resolved or maintenance is done on it.
История
Термин "переключение при отказе", хотя, вероятно, использовался инженерами гораздо раньше, встречается в рассекреченном отчете NASA 1962 года. Термин "переключение" (switchover) можно найти в 1950-х годах при описании "горячих" и "холодных" систем резервирования, с текущим значением немедленного переключения на работающую систему (горячую) и отложенного переключения на систему, требующую запуска (холодную). Материалы конференции 1957 года описывают компьютерные системы с аварийным переключением (то есть переключением при отказе) и плановым переключением при отказе (для технического обслуживания).