Системы отказоустойчивости
-
Управление неисправностями в телекоммуникационных сетях.
Управление неисправностями в сетях: обнаружение, изоляция и устранение сбоев, анализ журналов ошибок, SNMP-уведомления и активные списки аварий. RFC 3877.
-
Недоступность: определение, расчет и применение в различных отраслях.
Недоступность в математике: определение, формула (1 - доступность). Удобный способ измерения надёжности систем, где доступность выражается длинными числами.
-
Среднее время наработки на отказ (MTBF): определение и применение.
Среднее время наработки на отказ (MTBF): расчет, определение и отличие от MTTF. Важный показатель надежности систем и оборудования.
-
Tandem Computers: Надёжные вычисления для критически важных систем
Tandem Computers: отказоустойчивые системы для банков, бирж и критической инфраструктуры. Надежность, бесперебойность, защита данных. История и развитие.
-
Время безотказной работы системы
Время безотказной работы системы: что это такое? Узнайте, как измеряется надежность компьютеров и серверов, и почему важен баланс между uptime и обновлениями.
-
Каскадные отказы в системах: причины и предотвращение
Каскадные отказы систем: причины, последствия и примеры в энергетике, финансах, транспорте и биологии. Как избежать цепной реакции сбоев?
-
Среднее время восстановления после отказа (MTTR)
Среднее время восстановления (MTTR): что это такое? Узнайте, как MTTR влияет на стоимость обслуживания и ремонту оборудования. Оптимизация контрактов!
-
OpenSSI: Система кластеризации для Linux
OpenSSI: кластерная система для Linux, разработанная Compaq в 2001 году. Объединяет компьютеры в единую систему с общим доступом к ресурсам. Open Source.
-
Ориентированные на восстановление вычисления: надежность интернет-сервисов.
Восстановление после сбоев (ROC): надежные интернет-сервисы от Stanford & Berkeley. Устойчивость к ошибкам, избыточность, финансирование NSF.
-
Надежность в системной инженерии: атрибуты, угрозы и средства повышения.
Надежность в системной инженерии: доступность, ремонтопригодность, безопасность. Стандарты IEC и исследования IFIP для оценки и управления надежностью систем.
-
Автоматическое переключение на резервные системы при сбое
Автоматическое переключение на резервный сервер при сбое. Failover обеспечивает высокую надежность и доступность систем, используя "heartbeat" для мгновенного восстановления.
-
Непрерывные вычисления: История и архитектура систем NonStop
Непрерывные вычисления: серверы NonStop от HPE (ранее Tandem). Высокая надежность, отказоустойчивость и самовосстановление. История и ОС NonStop.
-
Византийская ошибка: непоследовательные сбои в компьютерных системах.
Византийская ошибка: сбои в распределенных системах, когда компоненты выдают противоречивые данные. Обеспечение отказоустойчивости (BFT) и консенсус.
-
Частота отказов и наработка на отказ в технике
Частота отказов: определение, расчет (λ - лямбда) и зависимость от времени в надежности инженерных систем и компонентов. Примеры из практики.
-
TACL: Язык скриптов для надежных вычислений HPE NonStop
TACL: язык скриптов для надежных систем NonStop. Используется в банках, казино и биржах. Обеспечивает отказоустойчивость и бесперебойную работу.
-
Службы балансировки сетевой нагрузки в Windows Server: особенности и применение.
Кластеризация и балансировка нагрузки NLBS от Microsoft: высокая доступность, масштабируемость для веб, FTP, VPN серверов. Отказоустойчивость!
-
Системы с синхронным шагом: принципы работы и применение.
Системы с синхронным шагом (lockstep) – отказоустойчивые компьютеры, работающие параллельно. Обеспечивают обнаружение и коррекцию ошибок благодаря резервированию и голосованию большинства.
-
Окно технического обслуживания в IT-системах
Окно обслуживания: планируемые перерывы в IT для тех. работ. Обеспечивают высокую доступность сервисов, минимизируя сбои для клиентов. SLA и график работ.
-
Кластерное решение высокой доступности на основе свободного ПО
Кластеризация Linux для высокой доступности: Heartbeat – бесплатное ПО для надежных и отказоустойчивых систем. Мониторинг, fencing, GUI.
-
Резервирование для повышения надежности систем
Резервирование в системах: повышение надежности за счет дублирования критически важных компонентов. Тройное модульное резервирование (TMR) и снижение рисков отказов.
-
Отказоустойчивость систем: принципы и реализация
Отказоустойчивость систем: обеспечение непрерывной работы при сбоях компонентов. Грациозная деградация, высокая доступность, критически важные системы.
-
Кластеры высокой доступности: Обеспечение бесперебойной работы приложений
Кластеры высокой доступности (HA) обеспечивают бесперебойную работу приложений при сбоях серверов. Автоматический перезапуск и отказоустойчивость!
-
Oracle Solaris Cluster: Высокая доступность и отказоустойчивость
Oracle Solaris Cluster: ПО для высокой доступности сервисов (базы данных, веб-сайты и др.). Обеспечивает отказоустойчивость и непрерывность работы приложений.
-
Суперстабилизация в распределенных вычислениях: Быстрая устойчивость к изменениям топологии
Суперстабилизация в распределённых вычислениях: устойчивость к сбоям, быстрая адаптация к изменениям топологии сети. Алгоритмы, самовосстановление.
-
Clustered web hosting
-
Горячее резервирование: Обеспечение надежности систем.
Резервное копирование и отказоустойчивость систем: горячий резерв, горячая замена. Обеспечьте непрерывность работы с помощью активных запасных компонентов!
-
Высокая доступность систем: принципы и обеспечение бесперебойной работы
Высокая доступность (HA) систем: обеспечение бесперебойной работы и отказоустойчивости для критически важных сервисов, таких как больницы и дата-центры.
-
Распределённая реплицированная система хранения данных DRBD для Linux
DRBD: распределенная система хранения данных для Linux. Репликация, высокая доступность (HA), облачные решения. Бесплатное ПО под GPLv2.
-
Oracle Real Application Clusters: Архитектура и преимущества
Oracle RAC: кластеризация баз данных Oracle для высокой доступности и производительности. Доступно в Enterprise Edition с Oracle Clusterware.
-
Неисправности: типы, причины и последствия
Неисправность в инженерии: определение, причины и виды дефектов в системах и оборудовании. Соответствие ISO 10303. Сбои и неисправные функции.