Желі басқарудағы ақаулықтарды басқару: телекоммуникациялық желідегі бұзылуларды анықтау, түзету, диагностикалау және қателерді жою туралы маңызды ақпарат.
Ағылшыншамен салыстырыңыз: абзацты басыңыз — түпнұсқа терезеде ашылады. Абзац астындағы EN түймесі оны мәтін ішінде көрсетеді.
Кіріспе
Желілік басқаруда ақауларды басқару – телекоммуникациялық желідегі іркілістерді анықтау, оқшаулау және түзету, қоршаған ортаның өзгерістерін өтеу, қателік журналдарын сақтау және тексеру, қателіктерді анықтау туралы хабарламаларды қабылдау және оларға ден қою, ақауларды із кесу және анықтау, диагностикалық тесттер тізбесін орындау, ақауларды жою, қателік жағдайларын хабарлау және деректер базасы ақпаратын қарастыру және өңдеу арқылы ақауларды із кесу және анықтау жиынтығы болып табылады. Ақау немесе оқиға туғанда, желілік компонент SNMP сияқты хаттаманы пайдалана отырып, желі операторына хабарлама жібереді. Дабыл – ақаудың тұрақты белгісі, ол ақау тудырған жағдай шешілгенде ғана жойылады. Желілік компонентте туындаған проблемалардың ағымдағы тізімі RFC 3877, Alarm MIB-де сипатталғандай, белсенді дабыл тізімі түрінде сақталады. Көптеген желілік басқару жүйелері жойылған ақаулардың тізімін де сақтайды. Ақауларды басқару жүйелері күрделі сүзгілеу жүйелерін пайдаланып, дабылдарды ауырлық деңгейлеріне жіктеуі мүмкін. Бұл деңгейлер syslog хаттамасындағыдай, жөндеуден бастап төтенше жағдайға дейін ауысуы мүмкін. Сонымен қатар, олар ITU X.733 Ақаулық туралы хабарлау функциясының қабылданатын ауырлық өрісін де пайдалана алады. Бұл өріс "қолданылған", "белгісіз", "критикалық", "маңызды", "ұсақ" немесе "ескерту" мәндерін қабылдайды. IETF аясында әзірленіп жатқан syslog хаттамасының соңғы нұсқасында осы екі түрлі ауырлық деңгейлері арасындағы сәйкестік бар екеніне назар аударыңыз. Мәселе туғанда ғана емес, оны шешкенде де хабарлама жіберу дұрыс тәжірибе саналады. Соңғы хабарламаның ауырлығы "қолданылған" болады. Ақауларды басқару консолі желі әкімшісіне немесе жүйе операторына бірнеше жүйеден келетін оқиғаларды бақылауға және осы ақпарат негізінде әрекеттер орындауға мүмкіндік береді. Идеалды жағдайда, ақауларды басқару жүйесі оқиғаларды дұрыс анықтап, автоматты түрде әрекет етуі керек, яғни түзету шараларын қолдану үшін бағдарламаны немесе сценарийді іске қосу, немесе адамның тиісті араласуын қамтамасыз ететін хабарлама бағдарламасын іске қосу (мысалы, электрондық пошта немесе ұялы телефонға SMS-хабарлама жіберу). Кейбір хабарлама жүйелерінде эскалация ережелері де бар, ол дабылдың ауырлығы мен қолжетімділігіне байланысты жеке тұлғалар тізбегіне хабарлайды.
In network management, fault management is the set of functions that detect, isolate, and correct malfunctions in a telecommunications network, compensate for environmental changes, and include maintaining and examining error logs, accepting and acting on error detection notifications, tracing and identifying faults, carrying out sequences of diagnostics tests, correcting faults, reporting error conditions, and localizing and tracing faults by examining and manipulating database information. When a fault or event occurs, a network component will often send a notification to the network operator using a protocol such as SNMP. An alarm is a persistent indication of a fault that clears only when the triggering condition has been resolved. A current list of problems occurring on the network component is often kept in the form of an active alarm list such as is defined in RFC 3877, the Alarm MIB. A list of cleared faults is also maintained by most network management systems. Fault management systems may use complex filtering systems to assign alarms to severity levels. These can range in severity from debug to emergency, as in the syslog protocol. Alternatively, they could use the ITU X.733 Alarm Reporting Function's perceived severity field. This takes on values of cleared, indeterminate, critical, major, minor or warning. Note that the latest version of the syslog protocol draft under development within the IETF includes a mapping between these two different sets of severities. It is considered good practice to send a notification not only when a problem has occurred, but also when it has been resolved. The latter notification would have a severity of clear. A fault management console allows a network administrator or system operator to monitor events from multiple systems and perform actions based on this information. Ideally, a fault management system should be able to correctly identify events and automatically take action, either launching a program or script to take corrective action, or activating notification software that allows a human to take proper intervention (i. e. send e mail or SMS text to a mobile phone). Some notification systems also have escalation rules that will notify a chain of individuals based on availability and severity of alarm.
Түрлері
Қателерді басқарудың екі негізгі тәсілі бар: белсенді және пассивті. Пассивті қателерді басқару құрылғыларда бірдеңе орын алған кезде құрылғылардан (әдетте SNMP тұзақтары арқылы) дабылдарды жинау арқылы іске асырылады. Бұл режимде қателерді басқару жүйесі тек қана бақылап отырған құрылғының қателіктерді анықтап, басқару құралына хабарлауға қабілетті екенін біледі. Дегенмен, егер бақылаудағы құрылғы толығымен істен шығып немесе тоқтап қалса, ол дабыл жібермейді және мәселе анықталмайды. Белсенді қателерді басқару бұл мәселені құрылғылардың жұмыс істеп тұрғанын және жауап беретінін анықтау үшін пинг сияқты құралдарды пайдаланып, белсенді түрде бақылау арқылы шешеді. Егер құрылғы жауап беруін тоқтатса, белсенді бақылау құрылғының қолжетімсіз екенін көрсететін дабыл шығарады және мәселені алдын ала түзетуге мүмкіндік береді. Қателерді басқару желіде ақау туған кезде оны тексеру, диагностикалау немесе жөндеу үшін қолданылатын кез келген құралдар мен процедураларды қамтиды.
There are two primary ways to perform fault management these are active and passive. Passive fault management is done by collecting alarms from devices (normally via SNMP traps) when something happens in the devices. In this mode, the fault management system only knows if a device it is monitoring is intelligent enough to generate an error and report it to the management tool. However, if the device being monitored fails completely or locks up, it won't throw an alarm and the problem will not be detected. Active fault management addresses this issue by actively monitoring devices via tools such as ping to determine if the device is active and responding. If the device stops responding, active monitoring will throw an alarm showing the device as unavailable and allows for the proactive correction of the problem. Fault management includes any tools or procedure for testing, diagnosing or repairing the network when a failure occurs.