Управление неисправностями в телекоммуникационных сетях.
Fault management
Управление неисправностями в сетях: обнаружение, изоляция и устранение сбоев, анализ журналов ошибок, SNMP-уведомления и активные списки аварий. RFC 3877.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
В управлении сетью, управление неисправностями – это набор функций, предназначенных для обнаружения, изоляции и устранения сбоев в телекоммуникационной сети, компенсации изменений в окружающей среде, а также ведения и анализа журналов ошибок, обработки уведомлений об обнаруженных ошибках, трассировки и идентификации неисправностей, выполнения последовательностей диагностических тестов, исправления ошибок, сообщения об ошибках и локализации и отслеживания неисправностей путем анализа и обработки информации в базе данных. Когда возникает сбой или событие, сетевой компонент часто отправляет уведомление оператору сети, используя протокол, такой как SNMP. Сигнал тревоги – это постоянный индикатор неисправности, который исчезает только после устранения причины, его вызвавшей. Актуальный список текущих проблем сетевого компонента часто хранится в виде списка активных сигналов тревоги, как определено в RFC 3877, Alarm MIB. Большинство систем управления сетью также ведут список устраненных неисправностей. Системы управления неисправностями могут использовать сложные системы фильтрации для присвоения уровня серьезности сигналам тревоги. Уровень серьезности может варьироваться от отладочного до критического, как в протоколе syslog. Альтернативно, можно использовать поле воспринимаемой серьезности Функции оповещения тревоги ITU X.733, которое принимает значения: "устраненная", "неопределенная", "критическая", "основная", "второстепенная" или "предупреждение". Следует отметить, что последняя версия разрабатываемого в IETF проекта протокола syslog включает в себя соответствие между этими двумя наборами уровней серьезности. Считается хорошей практикой отправлять уведомление не только при возникновении проблемы, но и после ее устранения. Последнее уведомление будет иметь статус "устранена". Консоль управления неисправностями позволяет сетевому администратору или системному оператору отслеживать события из нескольких систем и выполнять действия на основе этой информации. В идеале, система управления неисправностями должна корректно идентифицировать события и автоматически принимать меры, например, запускать программу или скрипт для исправления ситуации, или активировать систему уведомлений, позволяющую человеку принять необходимые меры (например, отправить электронное письмо или SMS-сообщение на мобильный телефон). Некоторые системы уведомлений также имеют правила эскалации, которые уведомляют цепочку ответственных лиц в зависимости от их доступности и серьезности тревоги.
In network management, fault management is the set of functions that detect, isolate, and correct malfunctions in a telecommunications network, compensate for environmental changes, and include maintaining and examining error logs, accepting and acting on error detection notifications, tracing and identifying faults, carrying out sequences of diagnostics tests, correcting faults, reporting error conditions, and localizing and tracing faults by examining and manipulating database information. When a fault or event occurs, a network component will often send a notification to the network operator using a protocol such as SNMP. An alarm is a persistent indication of a fault that clears only when the triggering condition has been resolved. A current list of problems occurring on the network component is often kept in the form of an active alarm list such as is defined in RFC 3877, the Alarm MIB. A list of cleared faults is also maintained by most network management systems. Fault management systems may use complex filtering systems to assign alarms to severity levels. These can range in severity from debug to emergency, as in the syslog protocol. Alternatively, they could use the ITU X.733 Alarm Reporting Function's perceived severity field. This takes on values of cleared, indeterminate, critical, major, minor or warning. Note that the latest version of the syslog protocol draft under development within the IETF includes a mapping between these two different sets of severities. It is considered good practice to send a notification not only when a problem has occurred, but also when it has been resolved. The latter notification would have a severity of clear. A fault management console allows a network administrator or system operator to monitor events from multiple systems and perform actions based on this information. Ideally, a fault management system should be able to correctly identify events and automatically take action, either launching a program or script to take corrective action, or activating notification software that allows a human to take proper intervention (i. e. send e mail or SMS text to a mobile phone). Some notification systems also have escalation rules that will notify a chain of individuals based on availability and severity of alarm.
Типы
Существует два основных способа управления неисправностями: активный и пассивный. Пассивное управление неисправностями осуществляется путем сбора аварийных сообщений от устройств (обычно через SNMP-трапы) при возникновении событий в этих устройствах. В этом режиме система управления неисправностями знает только, способно ли контролируемое устройство генерировать сообщение об ошибке и отправлять его в систему управления. Однако, если контролируемое устройство полностью выходит из строя или зависает, оно не отправит аварийное сообщение, и проблема останется незамеченной. Активное управление неисправностями решает эту проблему, осуществляя активный мониторинг устройств с помощью инструментов, таких как ping, для определения их работоспособности и отклика. Если устройство перестает отвечать, активный мониторинг сгенерирует аварийное сообщение, указывающее на недоступность устройства, и позволит оперативно устранить проблему. Управление неисправностями включает в себя любые инструменты или процедуры для тестирования, диагностики или восстановления сети при возникновении сбоев.
There are two primary ways to perform fault management these are active and passive. Passive fault management is done by collecting alarms from devices (normally via SNMP traps) when something happens in the devices. In this mode, the fault management system only knows if a device it is monitoring is intelligent enough to generate an error and report it to the management tool. However, if the device being monitored fails completely or locks up, it won't throw an alarm and the problem will not be detected. Active fault management addresses this issue by actively monitoring devices via tools such as ping to determine if the device is active and responding. If the device stops responding, active monitoring will throw an alarm showing the device as unavailable and allows for the proactive correction of the problem. Fault management includes any tools or procedure for testing, diagnosing or repairing the network when a failure occurs.