Введение
Метод выявления первопричин неисправностей или проблем
В науке и технике анализ первопричин (RCA) — это метод решения проблем, используемый для выявления коренных причин неисправностей или проблем. Он широко применяется в ИТ-операциях, производстве, телекоммуникациях, управлении промышленными процессами, анализе аварий (например, в авиации, железнодорожном транспорте или на атомных электростанциях), медицине (для медицинской диагностики), здравоохранении (например, для эпидемиологии) и т. д. Анализ первопричин представляет собой форму индуктивного (сначала формирование теории [корень] на основе эмпирических данных [причины]) и дедуктивного (проверка теории [базовые причинно-следственные механизмы] с использованием эмпирических данных) вывода. RCA можно разложить на четыре этапа:
1. Четко определить и описать проблему.
2. Установить хронологию событий от нормального состояния до возникновения проблемы.
3. Различать коренную причину и другие факторы, способствующие возникновению проблемы (например, с помощью корреляции событий).
4. Построить причинно-следственную диаграмму, связывающую коренную причину и проблему.
Identify and describe the problem clearly
Establish a timeline from the normal situation until the problem occurs
Distinguish between the root cause and other causal factors (e. g., using event correlation)
Establish a causal graph between the root cause and the problem
RCA обычно служит основой для процесса устранения последствий, в рамках которого принимаются корректирующие меры для предотвращения повторного возникновения проблемы. Наименование этого процесса может варьироваться в зависимости от области применения. Согласно ISO/IEC 31010, RCA может включать такие методы, как «Пять почему», анализ видов и последствий отказов (FMEA), анализ дерева неисправностей, диаграмма Исикавы и анализ Парето.
Определения
Существуют, по сути, два способа устранения неисправностей и решения проблем в науке и инженерии.
Реактивное управление
Реактивное управление заключается в быстром реагировании после возникновения проблемы, устраняя её проявления. Этот тип управления реализуется реактивными системами, самоадаптирующимися системами, самоорганизующимися системами и сложными адаптивными системами. Цель здесь – оперативно реагировать и как можно быстрее смягчить последствия проблемы.
Проактивное управление
Проактивное управление, наоборот, заключается в предотвращении возникновения проблем. Для этого можно использовать множество методов, начиная от лучших практик в проектировании и заканчивая детальным анализом уже произошедших проблем и принятием мер, чтобы гарантировать их неповторение. Здесь скорость не так важна, как точность и аккуратность диагностики. Основное внимание уделяется устранению истинной причины проблемы, а не её последствий. Анализ первопричин часто используется в проактивном управлении для выявления корневой причины проблемы, то есть фактора, который был ведущей причиной. Принято говорить о "корневой причине" в единственном числе, но один или несколько факторов могут составлять корневую причину (или причины) рассматриваемой проблемы. Фактор считается "корневой причиной" проблемы, если его устранение предотвращает повторное возникновение проблемы. В то же время, "причинный фактор" – это сопутствующее действие, которое влияет на исход инцидента/события, но не является корневой причиной. Хотя устранение причинного фактора может положительно сказаться на результате, оно не гарантирует предотвращения повторения события. Наглядный способ понять взаимосвязь между проактивным и реактивным подходами – рассмотреть модель оценки рисков "Bowtie" (бабочка). В центре модели находится событие или авария. Слева – предполагаемые опасности и линия защиты, предназначенная для предотвращения возникновения этих опасностей. Линия защиты включает в себя нормативные требования, применимые процедуры, физические и кибернетические барьеры, которые используются для управления операциями и предотвращения событий. Эффективный способ применения анализа первопричин – проактивно оценивать эффективность этих защитных мер, сравнивая фактические результаты с применимыми требованиями, выявляя недостатки и затем устраняя их для усиления защиты. Если событие произошло, мы оказываемся на правой стороне модели, на реактивной стороне, где основное внимание уделяется выявлению корневых причин и минимизации ущерба.
Пример
Представьте себе расследование неисправности машины, которая остановилась из-за перегрузки и сгоревшего предохранителя. Расследование показывает, что перегрузка произошла из-за недостаточной смазки подшипника. Дальнейшее расследование выявляет, что автоматический механизм смазки имел насос, который недостаточно подавал смазку, что и привело к её недостатку. Исследование насоса показывает, что его вал изношен. Расследование причины износа вала показывает, что отсутствует адекватный механизм для предотвращения попадания металлического мусора в насос. Это позволило мусору попасть внутрь и повредить его. Очевидная первопричина проблемы – попадание металлического мусора в систему смазки. Устранение этой проблемы должно предотвратить повторение всей последовательности событий. Истинная первопричина может быть связана с конструктивным недостатком, если в системе отсутствует фильтр для предотвращения попадания металлического мусора. Или, если фильтр заблокирован из-за отсутствия регулярных проверок, то истинная первопричина – проблема с техническим обслуживанием. Сравните это с расследованием, которое не выявляет первопричину: замена предохранителя, подшипника или смазочного насоса, вероятно, позволит машине снова заработать на некоторое время. Но существует риск, что проблема просто повторится, пока не будет устранена её первопричина. Вышесказанное не включает анализ затрат и выгод: превышают ли затраты на замену одной или нескольких машин затраты на простой до замены предохранителя? Такую ситуацию иногда называют "лечение хуже болезни". В качестве несвязанного примера выводов, которые можно сделать при отсутствии анализа затрат и выгод, рассмотрим компромисс между некоторыми предполагаемыми преимуществами сокращения численности населения: в краткосрочной перспективе уменьшится число плательщиков в пенсионные системы; в то время как остановка роста населения потребует повышения налогов для покрытия затрат на строительство новых школ. Это может помочь объяснить проблему, когда "лечение хуже болезни". Затраты, которые следует учитывать, выходят за рамки финансовых, когда речь идет о персонале, обслуживающем оборудование. В конечном счете, цель состоит в том, чтобы предотвратить простои, но еще важнее – предотвратить серьезные травмы. Профилактика начинается с проактивных действий.
Переход к корректирующим мерам
Целью RCA является выявление первопричины проблемы с намерением остановить ее повторное возникновение или ухудшение. Следующим шагом является инициирование долгосрочных корректирующих действий для устранения первопричины, выявленной в ходе RCA, и обеспечение того, чтобы проблема не повторилась. Исправление проблемы формально не входит в RCA, однако это отдельные этапы процесса решения проблем, известного как управление инцидентами в ИТ и телекоммуникациях, ремонт в инженерии, устранение последствий в авиации, восстановление окружающей среды в экологии, терапия в медицине и т.д.
Контроль производственных и промышленных процессов
Приведенный выше пример иллюстрирует, как анализ первопричин (RCA) может применяться в производстве. Анализ первопричин (RCA) также регулярно используется в управлении промышленными процессами, например, для контроля производства химических веществ (контроль качества). Анализ первопричин (RCA) также применяется для анализа отказов в инженерии и техническом обслуживании.
ИТ и телекоммуникации
Анализ первопричин часто используется в ИТ и телекоммуникациях для выявления коренных причин серьезных проблем. Например, в рамках системы управления услугами ITIL, целью управления инцидентами является как можно более быстрое восстановление неисправной ИТ-услуги (реактивное управление), в то время как управление проблемами направлено на окончательное решение повторяющихся проблем путем устранения их коренных причин (проактивное управление). Другой пример – процесс управления инцидентами информационной безопасности, где анализ первопричин часто применяется для расследования утечек данных. RCA также используется совместно с мониторингом бизнес-активности и обработкой сложных событий для анализа ошибок в бизнес-процессах. Его применение в ИТ-индустрии не всегда сопоставимо с его использованием в отраслях, критичных к безопасности, поскольку в нормальных условиях использование RCA в ИТ не подкрепляется заранее созданными деревьями неисправностей или другими проектными спецификациями. Вместо этого анализ обычно поддерживается сочетанием отладки, обнаружения событий и систем мониторинга (где сервисы моделируются по отдельности). Обучающие материалы и вспомогательные инструменты, такие как моделирование или подробные инструкции для всех ожидаемых сценариев, как правило, отсутствуют и создаются уже после возникновения проблем, признанных "значимыми". В результате анализ часто ограничивается теми аспектами, для которых доступны интерфейсы мониторинга и наблюдения, а не фактической запланированной функциональностью, с акцентом на проверку входных и выходных данных. В связи с этим в ИТ-индустрии распространилось мнение, что "первопричины не существует".
Здоровье и безопасность
В области здравоохранения и безопасности анализ первопричин (RCA) регулярно применяется в медицине (диагностике) и эпидемиологии (например, для определения источника инфекционного заболевания), где методы причинно-следственного анализа часто требуют сочетания клинического опыта и статистических знаний для понимания сложности происходящих процессов. RCA используется в науках об окружающей среде (например, при анализе экологических катастроф), анализе происшествий (в авиационной и железнодорожной отраслях), а также в сфере охраны труда и промышленной безопасности. При производстве медицинских устройств, фармацевтических препаратов, продуктов питания и биологически активных добавок анализ первопричин является обязательным требованием регулирующих органов.
Анализ систем
RCA также используется в управлении изменениями, управлении рисками и системном анализе.
Вызовы
Не вдаваясь в особенности конкретных проблем, несколько общих условий могут сделать анализ первопричин (АПП) более сложным, чем кажется на первый взгляд. Во-первых, важная информация часто отсутствует, поскольку на практике обычно невозможно отслеживать всё и хранить все данные мониторинга в течение длительного времени. Во-вторых, сбор данных и доказательств, а также их классификация по временной шкале событий, ведущих к возникшей проблеме, может быть непростой задачей. Например, в телекоммуникациях распределенные системы мониторинга обычно обрабатывают от миллиона до миллиарда событий в день. Поиск нескольких релевантных событий в таком объеме неважной информации – это все равно что искать иголку в стоге сена. В-третьих, для данной проблемы может быть несколько первопричин, и это множественность может существенно затруднить построение причинно-следственной диаграммы. В-четвертых, причинно-следственные диаграммы часто имеют множество уровней, и анализ первопричин завершается на том уровне, который исследователь считает "корнем" проблемы. Вернемся к примеру выше, касающемуся промышленного контроля процессов: более глубокое исследование может показать, что процедуры технического обслуживания на предприятии предусматривали периодическую проверку подсистемы смазки каждые два года, в то время как продукт текущего поставщика подсистемы смазки указывал на шестимесячный период. Смена поставщика могла быть вызвана стремлением руководства к экономии средств и отсутствием консультаций с инженерным персоналом относительно последствий изменения процедур технического обслуживания. Таким образом, хотя указанная выше "первопричина" могла предотвратить повторение конкретного инцидента, она не смогла бы предотвратить другие, возможно, более серьезные сбои, затрагивающие другое оборудование.