Темы

Системы отказоустойчивости

Fault Tolerance Systems · 30 статей

  1. Управление неисправностями в телекоммуникационных сетях.

    Управление неисправностями в сетях: обнаружение, изоляция и устранение сбоев, анализ журналов ошибок, SNMP-уведомления и активные списки аварий. RFC 3877.

    #9685 · 2 мин чтения

  2. Недоступность: определение, расчет и применение в различных отраслях.

    Недоступность в математике: определение, формула (1 - доступность). Удобный способ измерения надёжности систем, где доступность выражается длинными числами.

    #9840 · 2 мин чтения

  3. Среднее время наработки на отказ (MTBF): определение и применение.

    Среднее время наработки на отказ (MTBF): расчет, определение и отличие от MTTF. Важный показатель надежности систем и оборудования.

    #14840 · 3 мин чтения

  4. Tandem Computers: Надёжные вычисления для критически важных систем

    Tandem Computers: отказоустойчивые системы для банков, бирж и критической инфраструктуры. Надежность, бесперебойность, защита данных. История и развитие.

    #58473 · 26 мин чтения

  5. Время безотказной работы системы

    Время безотказной работы системы: что это такое? Узнайте, как измеряется надежность компьютеров и серверов, и почему важен баланс между uptime и обновлениями.

    #71840 · 2 мин чтения

  6. Каскадные отказы в системах: причины и предотвращение

    Каскадные отказы систем: причины, последствия и примеры в энергетике, финансах, транспорте и биологии. Как избежать цепной реакции сбоев?

    #74198 · 8 мин чтения

  7. Среднее время восстановления после отказа (MTTR)

    Среднее время восстановления (MTTR): что это такое? Узнайте, как MTTR влияет на стоимость обслуживания и ремонту оборудования. Оптимизация контрактов!

    #97337 · 1 мин чтения

  8. OpenSSI: Система кластеризации для Linux

    OpenSSI: кластерная система для Linux, разработанная Compaq в 2001 году. Объединяет компьютеры в единую систему с общим доступом к ресурсам. Open Source.

    #125610 · 6 мин чтения

  9. Ориентированные на восстановление вычисления: надежность интернет-сервисов.

    Восстановление после сбоев (ROC): надежные интернет-сервисы от Stanford & Berkeley. Устойчивость к ошибкам, избыточность, финансирование NSF.

    #130034 · 3 мин чтения

  10. Надежность в системной инженерии: атрибуты, угрозы и средства повышения.

    Надежность в системной инженерии: доступность, ремонтопригодность, безопасность. Стандарты IEC и исследования IFIP для оценки и управления надежностью систем.

    #131005 · 2 мин чтения

  11. Автоматическое переключение на резервные системы при сбое

    Автоматическое переключение на резервный сервер при сбое. Failover обеспечивает высокую надежность и доступность систем, используя "heartbeat" для мгновенного восстановления.

    #146050 · 2 мин чтения

  12. Непрерывные вычисления: История и архитектура систем NonStop

    Непрерывные вычисления: серверы NonStop от HPE (ранее Tandem). Высокая надежность, отказоустойчивость и самовосстановление. История и ОС NonStop.

    #149495 · 3 мин чтения

  13. Византийская ошибка: непоследовательные сбои в компьютерных системах.

    Византийская ошибка: сбои в распределенных системах, когда компоненты выдают противоречивые данные. Обеспечение отказоустойчивости (BFT) и консенсус.

    #165767 · 5 мин чтения

  14. Частота отказов и наработка на отказ в технике

    Частота отказов: определение, расчет (λ - лямбда) и зависимость от времени в надежности инженерных систем и компонентов. Примеры из практики.

    #207158 · 4 мин чтения

  15. TACL: Язык скриптов для надежных вычислений HPE NonStop

    TACL: язык скриптов для надежных систем NonStop. Используется в банках, казино и биржах. Обеспечивает отказоустойчивость и бесперебойную работу.

    #228640 · 3 мин чтения

  16. Службы балансировки сетевой нагрузки в Windows Server: особенности и применение.

    Кластеризация и балансировка нагрузки NLBS от Microsoft: высокая доступность, масштабируемость для веб, FTP, VPN серверов. Отказоустойчивость!

    #234642 · 1 мин чтения

  17. Системы с синхронным шагом: принципы работы и применение.

    Системы с синхронным шагом (lockstep) – отказоустойчивые компьютеры, работающие параллельно. Обеспечивают обнаружение и коррекцию ошибок благодаря резервированию и голосованию большинства.

    #240703 · 3 мин чтения

  18. Окно технического обслуживания в IT-системах

    Окно обслуживания: планируемые перерывы в IT для тех. работ. Обеспечивают высокую доступность сервисов, минимизируя сбои для клиентов. SLA и график работ.

    #249219 · 2 мин чтения

  19. Кластерное решение высокой доступности на основе свободного ПО

    Кластеризация Linux для высокой доступности: Heartbeat – бесплатное ПО для надежных и отказоустойчивых систем. Мониторинг, fencing, GUI.

    #259342 · 2 мин чтения

  20. Резервирование для повышения надежности систем

    Резервирование в системах: повышение надежности за счет дублирования критически важных компонентов. Тройное модульное резервирование (TMR) и снижение рисков отказов.

    #267430 · 5 мин чтения

  21. Отказоустойчивость систем: принципы и реализация

    Отказоустойчивость систем: обеспечение непрерывной работы при сбоях компонентов. Грациозная деградация, высокая доступность, критически важные системы.

    #280046 · 12 мин чтения

  22. Кластеры высокой доступности: Обеспечение бесперебойной работы приложений

    Кластеры высокой доступности (HA) обеспечивают бесперебойную работу приложений при сбоях серверов. Автоматический перезапуск и отказоустойчивость!

    #313628 · 5 мин чтения

  23. Oracle Solaris Cluster: Высокая доступность и отказоустойчивость

    Oracle Solaris Cluster: ПО для высокой доступности сервисов (базы данных, веб-сайты и др.). Обеспечивает отказоустойчивость и непрерывность работы приложений.

    #313833 · 2 мин чтения

  24. Суперстабилизация в распределенных вычислениях: Быстрая устойчивость к изменениям топологии

    Суперстабилизация в распределённых вычислениях: устойчивость к сбоям, быстрая адаптация к изменениям топологии сети. Алгоритмы, самовосстановление.

    #316464 · 1 мин чтения

  25. Clustered web hosting

    #319259 · 1 мин чтения

  26. Горячее резервирование: Обеспечение надежности систем.

    Резервное копирование и отказоустойчивость систем: горячий резерв, горячая замена. Обеспечьте непрерывность работы с помощью активных запасных компонентов!

    #370175 · 5 мин чтения

  27. Высокая доступность систем: принципы и обеспечение бесперебойной работы

    Высокая доступность (HA) систем: обеспечение бесперебойной работы и отказоустойчивости для критически важных сервисов, таких как больницы и дата-центры.

    #408552 · 10 мин чтения

  28. Распределённая реплицированная система хранения данных DRBD для Linux

    DRBD: распределенная система хранения данных для Linux. Репликация, высокая доступность (HA), облачные решения. Бесплатное ПО под GPLv2.

    #408602 · 4 мин чтения

  29. Oracle Real Application Clusters: Архитектура и преимущества

    Oracle RAC: кластеризация баз данных Oracle для высокой доступности и производительности. Доступно в Enterprise Edition с Oracle Clusterware.

    #414593 · 6 мин чтения

  30. Неисправности: типы, причины и последствия

    Неисправность в инженерии: определение, причины и виды дефектов в системах и оборудовании. Соответствие ISO 10303. Сбои и неисправные функции.

    #456077 · 2 мин чтения