Введение

Меры по устранению внезапных сбоев и предотвращению повторных случаев
Теория управления инцидентами

Инцидент – это событие, которое может привести к потере или нарушению деятельности, услуг или функций организации. Управление инцидентами (IcM) – это совокупность действий организации, направленных на выявление, анализ и устранение угроз с целью предотвращения повторения подобных случаев. В структурированных организациях подобные инциденты обычно рассматриваются командой реагирования на инциденты (IRT), командой управления инцидентами (IMT) или системой управления инцидентами (ICS). Без эффективного управления инцидентами инцидент может привести к сбоям в бизнес-процессах, нарушению информационной безопасности, проблемам в работе ИТ-систем, повлиять на сотрудников, клиентов или другие критически важные бизнес-функции.

Описание

Инцидент – это событие, которое может привести к потере или сбоям в деятельности, услугах или функциях организации. Управление инцидентами (IcM) – это термин, описывающий деятельность организации по выявлению, анализу и устранению угроз для предотвращения их повторного возникновения. Если инцидент не будет управляться, он может перерасти в чрезвычайную ситуацию, кризис или катастрофу. Управление инцидентами – это процесс ограничения потенциальных сбоев, вызванных таким событием, с последующим возвращением к нормальной работе. Без эффективного управления инцидентами инцидент может нарушить бизнес-операции, информационную безопасность, ИТ-системы, работу сотрудников, взаимодействие с клиентами или другие критически важные бизнес-функции. Управление физическими инцидентами – это реагирование в режиме реального времени, которое может длиться часы, дни или дольше. Кабинет министров Соединенного Королевства разработал Национальное руководство по восстановлению (NRG), предназначенное для местных служб реагирования в рамках реализации Закона о гражданской обороне от 2004 года (CCA). В нем реагирование определяется следующим образом: "Реагирование охватывает действия, предпринимаемые для устранения непосредственных последствий чрезвычайной ситуации. Во многих сценариях оно, вероятно, будет относительно кратковременным и продлится несколько часов или дней – поэтому жизненно важно быстро внедрить механизмы для сотрудничества, координации и коммуникации. Реагирование включает в себя усилия не только по устранению прямых последствий самой чрезвычайной ситуации (например, тушение пожаров, спасение людей), но и косвенных последствий (например, сбои, интерес СМИ)". Международная организация по стандартизации (ISO), являющаяся крупнейшим в мире разработчиком международных стандартов, также подчеркивает в своем документе ISO 31000:2009, посвященном управлению рисками, принципам и рекомендациям, что "Использование ISO 31000 может помочь организациям повысить вероятность достижения целей, улучшить выявление возможностей и угроз, а также эффективно распределять и использовать ресурсы для обработки рисков". Это еще раз демонстрирует важность не только грамотного планирования, но и эффективного распределения ресурсов для снижения рисков.

Управление инцидентами в области компьютерной безопасности

Сегодня важную роль играет команда реагирования на инциденты компьютерной безопасности (CSIRT) в связи с ростом интернет-преступности, и это распространенный пример инцидента, с которым сталкиваются компании в развитых странах по всему миру. Например, если организация обнаруживает, что злоумышленник получил несанкционированный доступ к компьютерной системе, CSIRT анализирует ситуацию, определяет масштаб компрометации и принимает корректирующие меры. В настоящее время более половины всех попыток взлома транснациональных корпораций (ТНК) в мире приходится на Северную Америку (57%). 23% попыток совершаются в Европе. Наличие хорошо подготовленной команды реагирования на инциденты компьютерной безопасности необходимо для обеспечения безопасной среды для любой организации и становится критически важной частью общей структуры многих современных сетевых команд.

Роли

Инциденты в структурированной организации обычно рассматриваются либо командой реагирования на инциденты (IRT), либо командой управления инцидентами (IMT). Эти команды часто назначаются заранее или в ходе самого инцидента и берут на себя управление организацией на время его устранения, чтобы восстановить нормальное функционирование. Руководитель инцидента управляет реагированием на инцидент безопасности и координирует действия членов команды (команд) реагирования на инциденты в соответствии с процедурами, определенными Системой управления инцидентами (ICS). Как правило, в рамках общего процесса управления в частных организациях, за управлением инцидентом следует пост-инцидентный анализ, в ходе которого выясняется, почему инцидент произошел, несмотря на принятые меры предосторожности и средства контроля. Этот анализ обычно курируется руководством организации с целью предотвращения повторения подобных инцидентов посредством дополнительных мер предосторожности и, зачастую, изменений в политике. Полученная информация используется для дальнейшего совершенствования политики безопасности и/или ее практической реализации. В Соединенных Штатах Национальная система управления инцидентами, разработанная Министерством внутренней безопасности, объединяет эффективные практики управления чрезвычайными ситуациями в единую общенациональную структуру. Это часто приводит к повышению уровня планирования на случай непредвиденных обстоятельств, проведения учений и обучения, а также к оценке эффективности управления инцидентом.

Человеческие факторы

При анализе первопричин необходимо учитывать человеческий фактор. Джеймс Рейсон провёл исследование для понимания негативного влияния человеческого фактора. Исследование показало, что расследования крупных инцидентов, таких как Piper Alpha и пожар на станции метро Kings Cross, чётко продемонстрировали, что причины аварий были широко распространены как внутри, так и вне организации. Существуют два типа событий: активные ошибки – действия, имеющие немедленные последствия и высокую вероятность вызвать аварию, и скрытые или латентные ошибки – события, эффект от которых может проявиться спустя годы и обычно сочетаются с триггерными факторами, которые затем и приводят к аварии. Латентные ошибки возникают в результате решений, принимаемых на высшем уровне организации. Их разрушительные последствия могут долгое время оставаться незамеченными, проявляясь лишь при сочетании с локальными триггерными факторами (например, высоким приливом, сложностями при погрузке в порту Зеебрюгге и т.п.), которые приводят к пробою защитных барьеров системы. Решения, принимаемые на высшем уровне организации, могут повысить вероятность аварии: планирование, составление графиков, прогнозирование, проектирование, разработка политики и т.д. могут оказывать постепенное негативное воздействие. Непосредственно небезопасный акт, спровоцировавший аварию, можно проследить через всю организацию, и последующие сбои могут быть выявлены, демонстрируя накопление латентных ошибок во всей системе, что увеличивало вероятность аварии и в конечном итоге привело к её возникновению. Применение более эффективных корректирующих мер позволит снизить вероятность повторения подобного события.